NAR + RL: как независимый разработчик предсказал идею Jev на год раньше
Как не-авторегрессионные модели решений на базе RL были построены независимым исследователем до запуска Jev от TypeSafe AI — разбор архитектуры и идей.
Когда идея опережает своё время
В сентябре 2026 года стартап TypeSafe AI вышел из стелс-режима с моделью Jev — и сразу стал главной темой в AI-твиттере. Но среди комментариев выделился один: независимый исследователь написал, что год назад строил ровно то же самое — не-авторегрессионные модели решений под управлением обучения с подкреплением. Без венчурных денег, без пресс-релизов, без шумихи.
Эта история — не просто курьёз. Она обнажает глубокий технический сдвиг в том, как мы думаем об AI-агентах: нужно ли модели генерировать текст, чтобы принимать решения? И почему классический авторегрессионный подход начинает проигрывать в задачах реального времени?
Разберём всё по порядку: что такое NAR-модели решений, почему RL здесь ключевой элемент, как работает Jev — и почему независимые исследователи нередко приходят к тем же выводам, что и хорошо финансируемые лаборатории.
Авторегрессия: удобная, но медленная парадигма
Почти все современные языковые модели — GPT-4, Claude, Llama — работают по одной схеме: генерируют токен за токеном, каждый следующий зависит от всех предыдущих. ChatGPT использует авторегрессионный подход для генерации текста: он предсказывает следующее слово на основе всех предыдущих, производя каждое слово по одному.
Для чата это идеально. Но что, если задача — не «объясни мне квантовую физику», а «маршрутизируй этот тикет» или «какое действие предпринять агенту прямо сейчас»? Тут авторегрессия превращается в дорогостоящий оверхед.
Не-авторегрессионные (NAR) модели решают эту проблему принципиально иначе: NAR-сети используют параллелизм при инференсе для повышения скорости, хотя исторически уступали авторегрессионным подходам по качеству решений.
Ключевое слово — «исторически». Именно здесь в игру вступает обучение с подкреплением.
Что такое NAR-модели решений с RL: техническая суть
Традиционный Decision Transformer (DT) — популярный подход к офлайн-RL — работает именно авторегрессионно. DT — это каузальная трансформер-модель, обусловленная на желаемый возврат, прошлые состояния и действия, которая генерирует будущие действия в авторегрессионной манере.
Но есть фундаментальная альтернатива: убрать авторегрессию вовсе и научить модель выдавать решение за один проход, используя RL для оптимизации не следующего токена, а итогового результата.
Архитектура независимой разработки, о которой пишет исследователь на DEV Community, выглядела так:
Ранняя модель использовала PPO над представлениями последовательностей для вывода пошаговых траекторий конверсии (вероятности от 0.0 до 1.0) в вертикальных sales-разговорах.
Главный принцип: управляющий мозг системы — всегда обучение с подкреплением, а не просто embedding-модель или авторегрессионный LLM.
Архитектура NAR-решателя
graph TD
A[Входное состояние / контекст] --> B[Энкодер]
B --> C[Параллельный семплер]
C --> D1[Решение 1: вероятность]
C --> D2[Решение 2: вероятность]
C --> D3[Решение N: вероятность]
D1 --> E[Confidence Score]
D2 --> E
D3 --> E
E --> F[Финальный ответ + уверенность]
G[RL-сигнал / награда] --> B
style G fill:#f9a825,color:#000
style F fill:#43a047,color:#fff
Вместо того чтобы генерировать токены, такая модель:
- Кодирует состояние среды / входной контекст
- Параллельно оценивает все возможные решения
- Возвращает распределение вероятностей по вариантам
- Обучается через RL — оптимизируя качество решений, а не вероятность следующего токена
Для обучения NAR-моделей с RL существует несколько подходов: можно использовать пошаговую максимизацию наград (stepwise reward) и эпизодическую максимизацию наград (episodic reward). Каждый из них имеет свои плюсы в зависимости от горизонта задачи.
Как Jev реализовал ту же идею в сентябре 2026
15 сентября 2026 года TypeSafe AI — стартап, основанный Диогу Алмейдой, соавтором статьи InstructGPT — работы, которая сделала ChatGPT похожим на ассистента, — выпустил модель Jev.
Вместо того чтобы генерировать текст слово за словом, как типичная LLM, Jev — это «System 1» модель: она выдаёт решения напрямую в виде вероятностей и confidence scores, а не авторегрессивно предсказывает следующий токен.
TypeSafe построил новый стек: новую архитектуру, параллельный семплер для максимальной эффективности и метод обучения под названием Reinforcement Learning for Calibrated Decisions (RLCD).
«Думайте о Jev как о вызове функции с интеллектом фронтир-модели: неструктурированное состояние на входе — типизированные вероятностные решения на выходе.» — TypeSafe AI
Что принципиально важно в RLCD: RLHF оптимизирует под предпочтения людей, RLVR — под верифицируемую корректность. RLCD оптимизирует под калибровку: модель, которая говорит «я уверена на 70%», должна быть права примерно в 70% случаев.
Вместо оценок от людей RLCD использует верифицируемые данные и proper scoring rules — например, Brier score — для вычисления наград.
Практические параметры Jev
| Характеристика | Jev (TypeSafe AI) | Классический LLM |
|---|---|---|
| Архитектура | Не-авторегрессионная, параллельный семплер | Авторегрессионная, токен за токеном |
| Тип вывода | Типизированные решения + вероятности | Свободный текст |
| Метод обучения | RLCD | RLHF / RLVR / SFT |
| Скорость | До 100× быстрее LLM | Базовая |
| Стоимость вывода | ~$42 за млрд входных токенов, вывод бесплатен | $0.20–$10 за млрд токенов |
| Галлюцинации | Невозможны (нет генерации текста) | Возможны |
| Открытые веса | Нет, только API | Зависит от модели |
Вывод бесплатен по механической причине, а не маркетинговой: нет авторегрессионного декодирования — нечего тарифицировать.
Независимая разработка: почему это важно
Когда в сентябре 2026 года TypeSafe представила Jev как «прорыв», исследователь под ником Nandakishor опубликовал на DEV Community развёрнутый пост с неудобными вопросами.
В сентябре 2025 года он опубликовал вторую статью (arXiv:2510.01237), в которой изложил точный фреймворк для принятия решений на основе схем под управлением обучения с подкреплением.
А в сентябре 2026 года хорошо финансируемая лаборатория TypeSafe AI (основанная Диогу Алмейдой, соизобретателем ChatGPT в OpenAI) представила Jev — предложив ровно ту же концепцию не-авторегрессионных решений как будто это был совершенно новый научный прорыв.
При этом запуск прошёл без технических статей, без открытых весов и без открытых обучающих датасетов.
Это не единичный случай. В AI-исследованиях параллельные открытия — норма, а не исключение. История науки полна примерами, когда одна идея приходила к разным людям в похожие периоды — потому что время пришло. Вопрос не в том, кто первый, а в том, кто может донести идею до масштаба.
При этом важно отметить объективное: по состоянию на 15 сентября 2026 года TypeSafe описала, что RLCD должен делать, не публикуя ничего достаточного для оценки алгоритма. Функция наград, архитектура, процедура обучения и методология калибровки — всё не раскрыто. Нет опубликованных кривых калибровки и воспроизводимой статьи.
Где применимы NAR-модели решений: практика
Вот где NAR + RL действительно выигрывает у классических LLM:
# Псевдокод: вызов NAR decision model
response = jev.decide(
state="Customer complained about late delivery. Tier: Premium.",
questions={
"priority": Choice(["urgent", "high", "normal", "low"]),
"escalate": YesNo(),
"refund_eligible": Score(min=0, max=1)
}
)
# Ответ приходит мгновенно, без генерации текста:
# {
# "priority": {"value": "urgent", "confidence": 0.91},
# "escalate": {"value": true, "confidence": 0.87},
# "refund_eligible": {"value": 0.82, "confidence": 0.79}
# }
Jev создан для работы внутри циклов реального времени — в играх, роботах и симуляциях, где скорость и надёжность важнее разговорных нюансов.
Сферы применения NAR-моделей решений:
- AI-агенты: маршрутизация задач, выбор инструмента, приоритизация без генерации CoT
- Финтех: классификация транзакций, оценка риска в реальном времени
- Игры и симуляции: принятие решений NPC за миллисекунды
- Поддержка пользователей: эскалация тикетов, определение тональности, выбор ответного сценария
- Робототехника: выбор действия в управляющем контуре
Когда такие решения множатся на длинных агентных циклах, стоимость накапливается, задержка накапливается, а свободная генерация создаёт всё больше точек отказа.
Открытые альтернативы и дорожная карта
Интересно, что сама экосистема уже реагирует на появление Jev. Проекты SemIf, Bespoke Nimble, OpenJev и Decider воспроизводят части подхода Jev с использованием существующих моделей, файн-тюнинга, ограниченного инференса или пост-тренировочной калибровки.
Для тех, кто хочет строить NAR-системы решений самостоятельно, исследовательская база уже существует:
| Подход | Описание | Статус |
|---|---|---|
| Levenshtein Transformer + RL | Edit-based NAR с RL для NMT | arXiv:2405.01280 |
| NAR4TSP | NAR-решатель для задачи коммивояжёра с RL | arXiv:2308.00560 |
| Multi-agent RL for NAR | Оптимизация sentence-level в NAR через MARL | arXiv:2101.09698 |
| RLCD (TypeSafe/Jev) | Калибровочный RL для NAR-решений | Закрытый API |
Применение RL к edit-based NAR-моделям на основе самогенерированных данных позволяет существенно улучшить их качество.
Выводы: парадигма принятия решений меняется
История с Jev и независимым исследователем — это зеркало, в котором отражается более широкий тренд. Авторегрессия была удобным инструментом, когда нам нужно было заставить модели «говорить». Но для принятия структурированных решений — классификации, маршрутизации, оценки вероятностей — генерация текста никогда не была оптимальным интерфейсом.
НАР + RL — это не отрицание LLM. Это специализация: нужная модель для нужной задачи.
Когда следующая волна AI-агентов потребует принятия тысяч решений в секунду, побеждать будут не те, кто генерирует самый умный текст, а те, кто выдаёт самые быстрые и калиброванные ответы.
Независимые исследователи, которые строят такие системы сегодня — без венчурных денег, только с arXiv и GitHub — задают направление. Иногда на год раньше, чем это становится «прорывом» в пресс-релизе.
Источники
- I Built Non-Autoregressive Decision Models a Year Ago — DEV Community
- Jev Explained: Typesafe AI's Non-Autoregressive System-1 Model
- Introducing System One Models & Jev — TypeSafe AI Blog
- Jev: TypeSafe's System One Model That Never Hallucinates
- Reinforcement Learning for Edit-Based Non-Autoregressive NMT