Когда идея опережает своё время

В сентябре 2026 года стартап TypeSafe AI вышел из стелс-режима с моделью Jev — и сразу стал главной темой в AI-твиттере. Но среди комментариев выделился один: независимый исследователь написал, что год назад строил ровно то же самое — не-авторегрессионные модели решений под управлением обучения с подкреплением. Без венчурных денег, без пресс-релизов, без шумихи.

Эта история — не просто курьёз. Она обнажает глубокий технический сдвиг в том, как мы думаем об AI-агентах: нужно ли модели генерировать текст, чтобы принимать решения? И почему классический авторегрессионный подход начинает проигрывать в задачах реального времени?

Разберём всё по порядку: что такое NAR-модели решений, почему RL здесь ключевой элемент, как работает Jev — и почему независимые исследователи нередко приходят к тем же выводам, что и хорошо финансируемые лаборатории.


Авторегрессия: удобная, но медленная парадигма

Почти все современные языковые модели — GPT-4, Claude, Llama — работают по одной схеме: генерируют токен за токеном, каждый следующий зависит от всех предыдущих. ChatGPT использует авторегрессионный подход для генерации текста: он предсказывает следующее слово на основе всех предыдущих, производя каждое слово по одному.

Для чата это идеально. Но что, если задача — не «объясни мне квантовую физику», а «маршрутизируй этот тикет» или «какое действие предпринять агенту прямо сейчас»? Тут авторегрессия превращается в дорогостоящий оверхед.

⚠ Проблема авторегрессии в агентах
Каждый вызов LLM в агентном цикле генерирует десятки-сотни токенов, прежде чем вернуть ответ. В задачах маршрутизации, классификации или бинарных решений 99% этих токенов — лишние вычисления.

Не-авторегрессионные (NAR) модели решают эту проблему принципиально иначе: NAR-сети используют параллелизм при инференсе для повышения скорости, хотя исторически уступали авторегрессионным подходам по качеству решений.

Ключевое слово — «исторически». Именно здесь в игру вступает обучение с подкреплением.


Что такое NAR-модели решений с RL: техническая суть

Традиционный Decision Transformer (DT) — популярный подход к офлайн-RL — работает именно авторегрессионно. DT — это каузальная трансформер-модель, обусловленная на желаемый возврат, прошлые состояния и действия, которая генерирует будущие действия в авторегрессионной манере.

Но есть фундаментальная альтернатива: убрать авторегрессию вовсе и научить модель выдавать решение за один проход, используя RL для оптимизации не следующего токена, а итогового результата.

ℹ Что такое RL в контексте принятия решений
Обучение с подкреплением (RL) — парадигма, где агент учится принимать решения через взаимодействие со средой. Агент получает награды за хорошие действия и штрафы за плохие — и постепенно улучшает политику без необходимости токен-за-токеном генерировать «объяснение».

Архитектура независимой разработки, о которой пишет исследователь на DEV Community, выглядела так:

Ранняя модель использовала PPO над представлениями последовательностей для вывода пошаговых траекторий конверсии (вероятности от 0.0 до 1.0) в вертикальных sales-разговорах.

Главный принцип: управляющий мозг системы — всегда обучение с подкреплением, а не просто embedding-модель или авторегрессионный LLM.

Архитектура NAR-решателя


graph TD
    A[Входное состояние / контекст] --> B[Энкодер]
    B --> C[Параллельный семплер]
    C --> D1[Решение 1: вероятность]
    C --> D2[Решение 2: вероятность]
    C --> D3[Решение N: вероятность]
    D1 --> E[Confidence Score]
    D2 --> E
    D3 --> E
    E --> F[Финальный ответ + уверенность]
    G[RL-сигнал / награда] --> B
    style G fill:#f9a825,color:#000
    style F fill:#43a047,color:#fff

Вместо того чтобы генерировать токены, такая модель:

  1. Кодирует состояние среды / входной контекст
  2. Параллельно оценивает все возможные решения
  3. Возвращает распределение вероятностей по вариантам
  4. Обучается через RL — оптимизируя качество решений, а не вероятность следующего токена

Для обучения NAR-моделей с RL существует несколько подходов: можно использовать пошаговую максимизацию наград (stepwise reward) и эпизодическую максимизацию наград (episodic reward). Каждый из них имеет свои плюсы в зависимости от горизонта задачи.


Как Jev реализовал ту же идею в сентябре 2026

15 сентября 2026 года TypeSafe AI — стартап, основанный Диогу Алмейдой, соавтором статьи InstructGPT — работы, которая сделала ChatGPT похожим на ассистента, — выпустил модель Jev.

Вместо того чтобы генерировать текст слово за словом, как типичная LLM, Jev — это «System 1» модель: она выдаёт решения напрямую в виде вероятностей и confidence scores, а не авторегрессивно предсказывает следующий токен.

TypeSafe построил новый стек: новую архитектуру, параллельный семплер для максимальной эффективности и метод обучения под названием Reinforcement Learning for Calibrated Decisions (RLCD).

«Думайте о Jev как о вызове функции с интеллектом фронтир-модели: неструктурированное состояние на входе — типизированные вероятностные решения на выходе.» — TypeSafe AI

Что принципиально важно в RLCD: RLHF оптимизирует под предпочтения людей, RLVR — под верифицируемую корректность. RLCD оптимизирует под калибровку: модель, которая говорит «я уверена на 70%», должна быть права примерно в 70% случаев.

Вместо оценок от людей RLCD использует верифицируемые данные и proper scoring rules — например, Brier score — для вычисления наград.

Практические параметры Jev

ХарактеристикаJev (TypeSafe AI)Классический LLM
АрхитектураНе-авторегрессионная, параллельный семплерАвторегрессионная, токен за токеном
Тип выводаТипизированные решения + вероятностиСвободный текст
Метод обученияRLCDRLHF / RLVR / SFT
СкоростьДо 100× быстрее LLMБазовая
Стоимость вывода~$42 за млрд входных токенов, вывод бесплатен$0.20–$10 за млрд токенов
ГаллюцинацииНевозможны (нет генерации текста)Возможны
Открытые весаНет, только APIЗависит от модели

Вывод бесплатен по механической причине, а не маркетинговой: нет авторегрессионного декодирования — нечего тарифицировать.


Независимая разработка: почему это важно

Когда в сентябре 2026 года TypeSafe представила Jev как «прорыв», исследователь под ником Nandakishor опубликовал на DEV Community развёрнутый пост с неудобными вопросами.

В сентябре 2025 года он опубликовал вторую статью (arXiv:2510.01237), в которой изложил точный фреймворк для принятия решений на основе схем под управлением обучения с подкреплением.

А в сентябре 2026 года хорошо финансируемая лаборатория TypeSafe AI (основанная Диогу Алмейдой, соизобретателем ChatGPT в OpenAI) представила Jev — предложив ровно ту же концепцию не-авторегрессионных решений как будто это был совершенно новый научный прорыв.

При этом запуск прошёл без технических статей, без открытых весов и без открытых обучающих датасетов.

Это не единичный случай. В AI-исследованиях параллельные открытия — норма, а не исключение. История науки полна примерами, когда одна идея приходила к разным людям в похожие периоды — потому что время пришло. Вопрос не в том, кто первый, а в том, кто может донести идею до масштаба.

💡 Урок для независимых исследователей
Если вы строите что-то нестандартное — публикуйте на arXiv, пишите технические посты, создавайте открытые реализации. Временной штамп на статье — ваш лучший аргумент в будущих дискуссиях об авторстве идеи.

При этом важно отметить объективное: по состоянию на 15 сентября 2026 года TypeSafe описала, что RLCD должен делать, не публикуя ничего достаточного для оценки алгоритма. Функция наград, архитектура, процедура обучения и методология калибровки — всё не раскрыто. Нет опубликованных кривых калибровки и воспроизводимой статьи.


Где применимы NAR-модели решений: практика

Вот где NAR + RL действительно выигрывает у классических LLM:

# Псевдокод: вызов NAR decision model
response = jev.decide(
    state="Customer complained about late delivery. Tier: Premium.",
    questions={
        "priority": Choice(["urgent", "high", "normal", "low"]),
        "escalate": YesNo(),
        "refund_eligible": Score(min=0, max=1)
    }
)

# Ответ приходит мгновенно, без генерации текста:
# {
#   "priority": {"value": "urgent", "confidence": 0.91},
#   "escalate": {"value": true, "confidence": 0.87},
#   "refund_eligible": {"value": 0.82, "confidence": 0.79}
# }

Jev создан для работы внутри циклов реального времени — в играх, роботах и симуляциях, где скорость и надёжность важнее разговорных нюансов.

Сферы применения NAR-моделей решений:

  • AI-агенты: маршрутизация задач, выбор инструмента, приоритизация без генерации CoT
  • Финтех: классификация транзакций, оценка риска в реальном времени
  • Игры и симуляции: принятие решений NPC за миллисекунды
  • Поддержка пользователей: эскалация тикетов, определение тональности, выбор ответного сценария
  • Робототехника: выбор действия в управляющем контуре
📝 Пример: агентный пайплайн с NAR
Вместо вызова GPT-4 с промптом «Определи приоритет тикета и реши, нужна ли эскалация» — NAR-модель получает структурированное состояние и возвращает типизированный ответ с confidence. Задержка: 10 мс вместо 2–5 секунд. Стоимость: в 100× меньше.

Когда такие решения множатся на длинных агентных циклах, стоимость накапливается, задержка накапливается, а свободная генерация создаёт всё больше точек отказа.


Открытые альтернативы и дорожная карта

Интересно, что сама экосистема уже реагирует на появление Jev. Проекты SemIf, Bespoke Nimble, OpenJev и Decider воспроизводят части подхода Jev с использованием существующих моделей, файн-тюнинга, ограниченного инференса или пост-тренировочной калибровки.

Для тех, кто хочет строить NAR-системы решений самостоятельно, исследовательская база уже существует:

ПодходОписаниеСтатус
Levenshtein Transformer + RLEdit-based NAR с RL для NMTarXiv:2405.01280
NAR4TSPNAR-решатель для задачи коммивояжёра с RLarXiv:2308.00560
Multi-agent RL for NARОптимизация sentence-level в NAR через MARLarXiv:2101.09698
RLCD (TypeSafe/Jev)Калибровочный RL для NAR-решенийЗакрытый API

Применение RL к edit-based NAR-моделям на основе самогенерированных данных позволяет существенно улучшить их качество.


Выводы: парадигма принятия решений меняется

История с Jev и независимым исследователем — это зеркало, в котором отражается более широкий тренд. Авторегрессия была удобным инструментом, когда нам нужно было заставить модели «говорить». Но для принятия структурированных решений — классификации, маршрутизации, оценки вероятностей — генерация текста никогда не была оптимальным интерфейсом.

НАР + RL — это не отрицание LLM. Это специализация: нужная модель для нужной задачи.

Когда следующая волна AI-агентов потребует принятия тысяч решений в секунду, побеждать будут не те, кто генерирует самый умный текст, а те, кто выдаёт самые быстрые и калиброванные ответы.

Независимые исследователи, которые строят такие системы сегодня — без венчурных денег, только с arXiv и GitHub — задают направление. Иногда на год раньше, чем это становится «прорывом» в пресс-релизе.

💡 С чего начать
Если хотите поэкспериментировать с NAR-решателями и RL: начните с библиотеки Stable-Baselines3 для PPO, добавьте энкодер на базе BERT или небольшого трансформера, обучите политику на структурированных decision traces. Это рабочая основа независимой системы уже сегодня.