Karpathy запустил autoresearch: ИИ исследует сам себя
Андрей Карпати опубликовал autoresearch — систему, где ИИ-агенты автономно улучшают обучение языковых моделей на одном GPU, пока человек спит.
ИИ-агенты вместо исследователей: Карпати переосмыслил ML-разработку
7 марта 2026 года Андрей Карпати анонсировал в Twitter самодостаточный минималистичный репозиторий, который сводит ядро обучения nanochat LLM к реализации на одном GPU в одном файле примерно из 630 строк кода. Проект называется autoresearch и реализует радикальную идею: дать ИИ-агенту небольшую, но реальную установку для обучения LLM и позволить ему самостоятельно экспериментировать в течение ночи — он изменяет код, обучает модель 5 минут, проверяет, улучшился ли результат, оставляет или откатывает изменения и повторяет цикл снова.
«Когда-то фронтирные AI-исследования проводились мясными компьютерами в перерывах между едой, сном и синхронизацией через звуковой интерфейс на ритуале под названием “групповое совещание”. Та эра давно позади.» — @karpathy, март 2026
Как работает autoresearch
Идея: дать ИИ-агенту небольшую, но реальную установку для обучения LLM и позволить ему экспериментировать автономно. Он модифицирует код, обучает 5 минут, проверяет результат, оставляет или выбрасывает изменения — и повторяет. Утром вы просыпаетесь к логу экспериментов и (в идеале) лучшей модели.
Человек при этом не трогает Python-файлы. Вместо этого он программирует program.md — Markdown-файл с инструкциями, который задаёт «устав» автономной исследовательской организации. Агент же работает с единственным редактируемым файлом — train.py.
prepare.py— одноразовая подготовка данных, загрузка датасета, обучение BPE-токенизатора. Не изменяется.train.py— модель GPT, оптимизатор (Muon + AdamW), цикл обучения. Редактируется агентом.program.md— инструкции и контекст для агента. Редактируется человеком.
Цикл автономного исследования
graph TD
A[Человек настраивает program.md] --> B[Запуск ИИ-агента]
B --> C[Агент редактирует train.py]
C --> D[Обучение: ровно 5 минут]
D --> E{val_bpb улучшился?}
E -->|Да| F[Изменения сохранены]
E -->|Нет| G[Откат изменений]
F --> C
G --> C
C --> H[~12 экспериментов/час]
H --> I[~100 экспериментов за ночь]
Ключевые архитектурные решения
Фиксированный бюджет времени
Каждый эксперимент длится ровно 5 минут реального времени (wall clock, без учёта компиляции). Это делает эксперименты напрямую сопоставимыми вне зависимости от того, что агент изменил — размер модели, batch size, архитектуру и т.д. Кроме того, autoresearch найдёт наиболее оптимальную модель именно для вашей платформы в рамках этого бюджета.
Метрика качества — val_bpb (validation bits per byte, валидационные биты на байт): чем ниже — тем лучше. Она не зависит от размера словаря, что делает архитектурные изменения честно сопоставимыми.
Минимализм и самодостаточность
Никаких внешних зависимостей, кроме PyTorch и нескольких небольших пакетов. Никакого распределённого обучения, никаких сложных конфигов. Один GPU, один файл, одна метрика.
# 1. Установить менеджер пакетов uv
curl -LsSf https://astral.sh/uv/install.sh | sh
# 2. Установить зависимости
uv sync
# 3. Подготовить данные (один раз, ~2 мин)
uv run prepare.py
# 4. Запустить тестовый эксперимент (~5 мин)
uv run train.py
После этого можно запустить агента (Claude/Codex) и направить его на program.md.
Результаты: что дают агенты на практике
ИИ-агенты внесли 110 изменений в код за 12 часов, улучшив validation loss без замедления обучения. Карпати пошёл дальше и экспериментировал с мультиагентными организациями — он настроил 8 агентов (4 Claude, 4 Codex), каждый с отдельным GPU, и протестировал две конфигурации: 8 независимых исследователей параллельно и иерархическую структуру с 1 «главным учёным», координирующим 8 младших.
| Параметр | Значение |
|---|---|
| Строк кода (train.py) | ~630 |
| Время одного эксперимента | 5 минут |
| Экспериментов в час | ~12 |
| Экспериментов за ночь | ~100 |
| Требуемое железо | 1× NVIDIA GPU (тест на H100) |
| Метрика | val_bpb (ниже = лучше) |
| Лицензия | MIT |
Поддержка других платформ и форки
На текущий момент код требует наличия одного NVIDIA GPU. В принципе, возможна поддержка CPU, MPS и других платформ, но это раздует кодовую базу. Сообщество уже создало несколько активных форков:
| Форк | Платформа |
|---|---|
miolini/autoresearch-macos | macOS |
trevin-creator/autoresearch-mlx | macOS (MLX) |
jsegov/autoresearch-win-rtx | Windows |
andyluo7/autoresearch | AMD GPU |
vocab_size (до 1024–2048), сокращённый MAX_SEQ_LEN (до 256), DEPTH снизить до 4, использовать WINDOW_PATTERN = "L".Контекст и значение для отрасли
Выход autoresearch — значимый шаг в демократизации обучения больших языковых моделей, делающий его доступным для отдельных разработчиков и небольших команд без необходимости в огромных вычислительных ресурсах.
По словам Карпати, это создаёт операционный рычаг для оркестрации обучения моделей, открывая краткосрочные бизнес-возможности в автоматизированной оптимизации гиперпараметров, агентном MLOps для пайплайнов обучения и инструментах снижения затрат на предобучение и файнтюнинг фундаментальных моделей.
autoresearch — это не просто утилита. Это манифест нового подхода к ML-исследованиям: человек задаёт направление через program.md, агент итерирует код, а результат накапливается пока вы спите. Репозиторий уже цитируется в академических работах по автономным агентам и hyperparameter optimization.