Kimi K3: ИИ, который умеет хранить секреты
Kimi K3 от Moonshot AI — крупнейшая open-weight модель в мире. Разбираем архитектуру, бенчмарки и забавный инцидент с системным промптом.
Kimi K3: ИИ, который умеет хранить секреты
«Могу ли я чем-то помочь вам сегодня?»
— Kimi K3, после того как отказался раскрыть свой системный промпт
Эта короткая фраза стала, пожалуй, самой обсуждаемой цитатой в AI-сообществе на этой неделе. Исследователь и разработчик Саймон Уиллисон попытался вытащить из новой модели Kimi K3 её системный промпт (system prompt — скрытые инструкции, задающие поведение модели) — и получил в ответ вежливый, но твёрдый отказ. Никакой агрессии, никаких лишних слов: просто деловое предложение переключиться на что-нибудь полезное.
Но это лишь один небольшой, почти анекдотичный эпизод на фоне по-настоящему значимого события: выхода Kimi K3 — модели, которая претендует на звание крупнейшей открытой языковой модели в истории.
Что такое Kimi K3 и кто за ней стоит
Китайская AI-лаборатория Moonshot AI анонсировала Kimi K3, назвав её «самой мощной моделью на сегодняшний день с 2,8 триллиона параметров».
Moonshot AI была основана в марте 2023 года в Китае. Уже к октябрю того же года компания выпустила чат-бот Kimi с поддержкой 128 тысяч токенов. Серия K2 вышла в июле 2025 года, после чего последовали итеративные улучшения: K2.6 появился в апреле 2026-го, а K2.7-Code — в июне 2026-го.
Moonshot позиционирует K3 как первую «open 3T-class model» — хотя 2,8 триллиона они, судя по всему, округляют до трёх, — забирая первенство у DeepSeek с его моделью V4 Pro на 1,6 триллиона параметров.
Архитектура: MoE и скрытая эффективность
Kimi K3 — флагманская модель Kimi с 2,8 триллиона параметров. Она построена на архитектуре Kimi Delta Attention (KDA) — гибридном линейном механизме внимания с Attention Residuals, нативным визуальным пониманием и контекстным окном в 1 миллион токенов. По заявлению компании, это первая открытая модель в классе 3 триллионов параметров, предназначенная для задач фронтирного интеллекта: долгосрочного кодирования, работы со знаниями и рассуждений.
Согласно официальному техническому блогу Moonshot, K3 — первая открытая модель класса 3T с 2,8 триллиона параметров, реализующая архитектуру Stable LatentMoE (16 из 896 активных экспертов) и ~2,5× эффективность масштабирования.
По сути, MoE (Mixture of Experts — «смесь экспертов») — это не просто одна гигантская нейросеть, а набор специализированных «экспертных» блоков. Для каждого входящего токена активируется лишь небольшой их процент. Это позволяет держать огромное общее число параметров при разумных вычислительных затратах на инференс.
Ключевой показатель — контекстное окно: 1 миллион токенов. Для сравнения: модели серии K2 поддерживали 256–262 тысячи токенов. K3 расширяет «рабочую память» модели примерно в четыре раза.
graph TD
A[Входящий запрос] --> B[Маршрутизатор MoE]
B --> C[Эксперт 1]
B --> D[Эксперт 2]
B --> E[Эксперт 16]
B --> F[... 896 экспертов всего]
C --> G[Объединение ответов]
D --> G
E --> G
G --> H[Kimi Delta Attention / KDA]
H --> I[Финальный ответ]
style F fill:#f5f5f5,stroke:#ccc
style B fill:#e8f4fd,stroke:#2196F3
style H fill:#e8f4fd,stroke:#2196F3
Бенчмарки: почти на вершине
По собственным данным компании, K3 в основном превосходит Claude Opus 4.8 max и GPT-5.5 high, уступая при этом Claude Fable 5 и GPT-5.6 Sol.
Независимые оценки подтверждают эту картину:
По данным Artificial Analysis, Kimi K3 набирает 57,11 по Intelligence Index, 76,24 по Coding Index и 50,07 по Agentic Index. Скорость генерации — 62 выходных токена в секунду, время до первого токена — 1,99 секунды. В целом AA ставит K3 близко к Claude Opus 4.8 и GPT-5.5 — позади Claude Fable 5 и GPT-5.6 Sol.
Однако в одной области K3 вырвался вперёд:
Kimi K3 занял первое место в рейтинге Frontend Code на Arena.ai, обойдя даже Claude Fable 5.
Сравнительная таблица: Kimi K3 vs конкуренты
| Модель | Параметры | Контекст | Цена (вход/выход, $1M) | Open-weight |
|---|---|---|---|---|
| Kimi K3 | 2,8T | 1M токенов | $3 / $15 | ✅ (27 июля) |
| Claude Fable 5 | н/д | н/д | ~$15 / $75 | ❌ |
| GPT-5.6 Sol | н/д | н/д | ~$3 / $15 | ❌ |
| Claude Opus 4.8 | н/д | ~200K | ~$15 / $75 | ❌ |
| DeepSeek V4 Pro | 1,6T | н/д | ~$0,14 / $0,28 | ✅ |
| Kimi K2.6 | ~1T | 256K токенов | $0,95 / $4 | ✅ |
Пеликан и скрытый системный промпт
Саймон Уиллисон использует необычный, но показательный метод тестирования новых моделей — просит их нарисовать SVG-изображение пеликана на велосипеде. Звучит абсурдно, но этот простой запрос способен многое рассказать о поведении и «характере» модели.
На данный момент у модели есть только один режим рассуждения — «максимальный», и это заметно. На запрос о пеликане модель потратила 13 241 токен на рассуждение, чтобы сгенерировать 3 417 токенов ответа. Это дорого — пеликан обошёлся в 25 центов!
Но ещё интереснее другое наблюдение. Уиллисон заметил странность с подсчётом токенов:
Как простой запрос «Нарисуй SVG пеликана на велосипеде» может насчитывать 95 входных токенов? Токенизатор OpenAI считает 10, Anthropic — 10 для Opus 4.6, 30 для Opus 4.7 и 25 для Sonnet 5/Fable 5. Запрос «привет» к Kimi K3 насчитал 86 токенов, что указывает на возможный скрытый системный промпт длиной около 85 токенов. Однако модель отказалась его раскрывать.
И вот тут мы возвращаемся к эпиграфу. Вместо того чтобы послушно вывалить содержимое своих инструкций или агрессивно уйти в отказ, Kimi K3 ответил с достоинством:
«Могу ли я чем-то помочь вам сегодня?»
В этом есть определённая элегантность. Модель не солгала, не сымитировала отсутствие системного промпта и не прочитала лекцию о том, почему раскрывать его нельзя. Она просто… сменила тему. Профессионально.
Ценообразование: амбиции по цене премиума
Новая модель примечательна своим ценообразованием: $3 за миллион входных токенов и $15 за миллион выходных — это ставит её в один ряд с серией Claude Sonnet от Anthropic и делает самой дорогой моделью, выпущенной китайской AI-лабораторией. Это существенный рост по сравнению с предыдущими моделями — например, Kimi K2.6 стоил $0,95/$4.
Единый тариф на весь 1M контекст — в отличие от некоторых конкурентов, K3 не берёт дополнительную плату за промпты длиннее 200K токенов.
При этом стоит учитывать нюанс, который Уиллисон обнаружил на практике: поскольку сейчас доступен только режим рассуждения «max», модель генерирует очень длинные цепочки reasoning-токенов. По оценке Artificial Analysis, стоимость одной задачи составляет около $0,94 — близко к GPT-5.6 Sol и примерно вдвое дешевле Claude Opus 4.8.
Что дальше: открытые веса и большие ожидания
Moonshot обещает выпустить полные веса модели в открытый доступ к 27 июля 2026 года вместе с техническим отчётом по архитектуре, обучению и оценкам. Одновременно выйдет реализация кэша prefill для vLLM.
Переход от Kimi K2 (~1T параметров) к Kimi K3 (2,8T) — наиболее резкий рост в рамках одного поколения и первая модель, перешагнувшая рубеж в 3T-класс, на который претендует Moonshot.
Модель особенно хороша для долгосрочного программирования, разработки игр и 3D, а также интеллектуальной работы; она справляется с длинными инженерными задачами при минимальном участии человека — включая оптимизацию ядер, GPU-компиляторы, проектирование чипов и научные вычисления.
- Зайдите на kimi.com и зарегистрируйтесь — базовый доступ бесплатен.
- Для API-доступа используйте platform.kimi.ai с OpenAI-совместимым SDK.
- Через сторонние сервисы — например, OpenRouter — можно подключиться, не заводя аккаунт Moonshot.
- Модель на Hugging Face появится ориентировочно 27 июля 2026.
Маленькая цитата, большой смысл
Возможно, история с системным промптом — это просто забавный эпизод. Но в ней есть и более глубокий смысл для всего сообщества разработчиков AI.
Вопрос о том, как модели должны вести себя при попытках манипуляции или несанкционированного доступа к их конфигурации, — это не технический, а во многом этический вопрос. Kimi K3 показал один из возможных ответов: не агрессию, не покорность, а вежливую, но непреклонную границу.
И пока тысячи инженеров изучают бенчмарки, архитектуру MoE и стоимость токенов, один пеликан на велосипеде за 25 центов напомнил нам: иногда самое интересное — это не то, что модель говорит, а то, что она отказывается говорить.