ИИ-агенты вместо исследователей: Карпати переосмыслил ML-разработку

7 марта 2026 года Андрей Карпати анонсировал в Twitter самодостаточный минималистичный репозиторий, который сводит ядро обучения nanochat LLM к реализации на одном GPU в одном файле примерно из 630 строк кода. Проект называется autoresearch и реализует радикальную идею: дать ИИ-агенту небольшую, но реальную установку для обучения LLM и позволить ему самостоятельно экспериментировать в течение ночи — он изменяет код, обучает модель 5 минут, проверяет, улучшился ли результат, оставляет или откатывает изменения и повторяет цикл снова.

«Когда-то фронтирные AI-исследования проводились мясными компьютерами в перерывах между едой, сном и синхронизацией через звуковой интерфейс на ритуале под названием “групповое совещание”. Та эра давно позади.» — @karpathy, март 2026


Как работает autoresearch

Идея: дать ИИ-агенту небольшую, но реальную установку для обучения LLM и позволить ему экспериментировать автономно. Он модифицирует код, обучает 5 минут, проверяет результат, оставляет или выбрасывает изменения — и повторяет. Утром вы просыпаетесь к логу экспериментов и (в идеале) лучшей модели.

Человек при этом не трогает Python-файлы. Вместо этого он программирует program.md — Markdown-файл с инструкциями, который задаёт «устав» автономной исследовательской организации. Агент же работает с единственным редактируемым файлом — train.py.

ℹ Ключевые файлы репозитория
  • prepare.py — одноразовая подготовка данных, загрузка датасета, обучение BPE-токенизатора. Не изменяется.
  • train.py — модель GPT, оптимизатор (Muon + AdamW), цикл обучения. Редактируется агентом.
  • program.md — инструкции и контекст для агента. Редактируется человеком.

Цикл автономного исследования


graph TD
    A[Человек настраивает program.md] --> B[Запуск ИИ-агента]
    B --> C[Агент редактирует train.py]
    C --> D[Обучение: ровно 5 минут]
    D --> E{val_bpb улучшился?}
    E -->|Да| F[Изменения сохранены]
    E -->|Нет| G[Откат изменений]
    F --> C
    G --> C
    C --> H[~12 экспериментов/час]
    H --> I[~100 экспериментов за ночь]


Ключевые архитектурные решения

Фиксированный бюджет времени

Каждый эксперимент длится ровно 5 минут реального времени (wall clock, без учёта компиляции). Это делает эксперименты напрямую сопоставимыми вне зависимости от того, что агент изменил — размер модели, batch size, архитектуру и т.д. Кроме того, autoresearch найдёт наиболее оптимальную модель именно для вашей платформы в рамках этого бюджета.

Метрика качества — val_bpb (validation bits per byte, валидационные биты на байт): чем ниже — тем лучше. Она не зависит от размера словаря, что делает архитектурные изменения честно сопоставимыми.

Минимализм и самодостаточность

Никаких внешних зависимостей, кроме PyTorch и нескольких небольших пакетов. Никакого распределённого обучения, никаких сложных конфигов. Один GPU, один файл, одна метрика.

💡 Быстрый старт
# 1. Установить менеджер пакетов uv
curl -LsSf https://astral.sh/uv/install.sh | sh

# 2. Установить зависимости
uv sync

# 3. Подготовить данные (один раз, ~2 мин)
uv run prepare.py

# 4. Запустить тестовый эксперимент (~5 мин)
uv run train.py

После этого можно запустить агента (Claude/Codex) и направить его на program.md.


Результаты: что дают агенты на практике

ИИ-агенты внесли 110 изменений в код за 12 часов, улучшив validation loss без замедления обучения. Карпати пошёл дальше и экспериментировал с мультиагентными организациями — он настроил 8 агентов (4 Claude, 4 Codex), каждый с отдельным GPU, и протестировал две конфигурации: 8 независимых исследователей параллельно и иерархическую структуру с 1 «главным учёным», координирующим 8 младших.

ПараметрЗначение
Строк кода (train.py)~630
Время одного эксперимента5 минут
Экспериментов в час~12
Экспериментов за ночь~100
Требуемое железо1× NVIDIA GPU (тест на H100)
Метрикаval_bpb (ниже = лучше)
ЛицензияMIT

Поддержка других платформ и форки

На текущий момент код требует наличия одного NVIDIA GPU. В принципе, возможна поддержка CPU, MPS и других платформ, но это раздует кодовую базу. Сообщество уже создало несколько активных форков:

ФоркПлатформа
miolini/autoresearch-macosmacOS
trevin-creator/autoresearch-mlxmacOS (MLX)
jsegov/autoresearch-win-rtxWindows
andyluo7/autoresearchAMD GPU
⚠ Для слабого железа
Если вы запускаете autoresearch на MacBook или другом маломощном устройстве, используйте форки выше. Дополнительно рекомендуется: датасет TinyStories (меньше энтропии), уменьшенный vocab_size (до 1024–2048), сокращённый MAX_SEQ_LEN (до 256), DEPTH снизить до 4, использовать WINDOW_PATTERN = "L".

Контекст и значение для отрасли

Выход autoresearch — значимый шаг в демократизации обучения больших языковых моделей, делающий его доступным для отдельных разработчиков и небольших команд без необходимости в огромных вычислительных ресурсах.

По словам Карпати, это создаёт операционный рычаг для оркестрации обучения моделей, открывая краткосрочные бизнес-возможности в автоматизированной оптимизации гиперпараметров, агентном MLOps для пайплайнов обучения и инструментах снижения затрат на предобучение и файнтюнинг фундаментальных моделей.

autoresearch — это не просто утилита. Это манифест нового подхода к ML-исследованиям: человек задаёт направление через program.md, агент итерирует код, а результат накапливается пока вы спите. Репозиторий уже цитируется в академических работах по автономным агентам и hyperparameter optimization.

📝 Попробовать самому
Репозиторий доступен на GitHub: github.com/karpathy/autoresearch. Лицензия MIT — можно использовать и форкать свободно.