Kimi K3: ИИ, который умеет хранить секреты

«Могу ли я чем-то помочь вам сегодня?»
Kimi K3, после того как отказался раскрыть свой системный промпт

Эта короткая фраза стала, пожалуй, самой обсуждаемой цитатой в AI-сообществе на этой неделе. Исследователь и разработчик Саймон Уиллисон попытался вытащить из новой модели Kimi K3 её системный промпт (system prompt — скрытые инструкции, задающие поведение модели) — и получил в ответ вежливый, но твёрдый отказ. Никакой агрессии, никаких лишних слов: просто деловое предложение переключиться на что-нибудь полезное.

Но это лишь один небольшой, почти анекдотичный эпизод на фоне по-настоящему значимого события: выхода Kimi K3 — модели, которая претендует на звание крупнейшей открытой языковой модели в истории.


Что такое Kimi K3 и кто за ней стоит

Китайская AI-лаборатория Moonshot AI анонсировала Kimi K3, назвав её «самой мощной моделью на сегодняшний день с 2,8 триллиона параметров».

Moonshot AI была основана в марте 2023 года в Китае. Уже к октябрю того же года компания выпустила чат-бот Kimi с поддержкой 128 тысяч токенов. Серия K2 вышла в июле 2025 года, после чего последовали итеративные улучшения: K2.6 появился в апреле 2026-го, а K2.7-Code — в июне 2026-го.

Moonshot позиционирует K3 как первую «open 3T-class model» — хотя 2,8 триллиона они, судя по всему, округляют до трёх, — забирая первенство у DeepSeek с его моделью V4 Pro на 1,6 триллиона параметров.

ℹ Open-weight модели
Open-weight (открытые веса) — модели, у которых публично доступны веса нейронной сети. Это позволяет разработчикам запускать, дообучать и модифицировать модель самостоятельно, не завися от облачного API провайдера. Полные веса Kimi K3 обещают выложить к 27 июля 2026 года.

Архитектура: MoE и скрытая эффективность

Kimi K3 — флагманская модель Kimi с 2,8 триллиона параметров. Она построена на архитектуре Kimi Delta Attention (KDA) — гибридном линейном механизме внимания с Attention Residuals, нативным визуальным пониманием и контекстным окном в 1 миллион токенов. По заявлению компании, это первая открытая модель в классе 3 триллионов параметров, предназначенная для задач фронтирного интеллекта: долгосрочного кодирования, работы со знаниями и рассуждений.

Согласно официальному техническому блогу Moonshot, K3 — первая открытая модель класса 3T с 2,8 триллиона параметров, реализующая архитектуру Stable LatentMoE (16 из 896 активных экспертов) и ~2,5× эффективность масштабирования.

По сути, MoE (Mixture of Experts — «смесь экспертов») — это не просто одна гигантская нейросеть, а набор специализированных «экспертных» блоков. Для каждого входящего токена активируется лишь небольшой их процент. Это позволяет держать огромное общее число параметров при разумных вычислительных затратах на инференс.

Ключевой показатель — контекстное окно: 1 миллион токенов. Для сравнения: модели серии K2 поддерживали 256–262 тысячи токенов. K3 расширяет «рабочую память» модели примерно в четыре раза.


graph TD
    A[Входящий запрос] --> B[Маршрутизатор MoE]
    B --> C[Эксперт 1]
    B --> D[Эксперт 2]
    B --> E[Эксперт 16]
    B --> F[... 896 экспертов всего]
    C --> G[Объединение ответов]
    D --> G
    E --> G
    G --> H[Kimi Delta Attention / KDA]
    H --> I[Финальный ответ]
    style F fill:#f5f5f5,stroke:#ccc
    style B fill:#e8f4fd,stroke:#2196F3
    style H fill:#e8f4fd,stroke:#2196F3


Бенчмарки: почти на вершине

По собственным данным компании, K3 в основном превосходит Claude Opus 4.8 max и GPT-5.5 high, уступая при этом Claude Fable 5 и GPT-5.6 Sol.

Независимые оценки подтверждают эту картину:

По данным Artificial Analysis, Kimi K3 набирает 57,11 по Intelligence Index, 76,24 по Coding Index и 50,07 по Agentic Index. Скорость генерации — 62 выходных токена в секунду, время до первого токена — 1,99 секунды. В целом AA ставит K3 близко к Claude Opus 4.8 и GPT-5.5 — позади Claude Fable 5 и GPT-5.6 Sol.

Однако в одной области K3 вырвался вперёд:

Kimi K3 занял первое место в рейтинге Frontend Code на Arena.ai, обойдя даже Claude Fable 5.

Сравнительная таблица: Kimi K3 vs конкуренты

МодельПараметрыКонтекстЦена (вход/выход, $1M)Open-weight
Kimi K32,8T1M токенов$3 / $15✅ (27 июля)
Claude Fable 5н/дн/д~$15 / $75
GPT-5.6 Solн/дн/д~$3 / $15
Claude Opus 4.8н/д~200K~$15 / $75
DeepSeek V4 Pro1,6Tн/д~$0,14 / $0,28
Kimi K2.6~1T256K токенов$0,95 / $4
⚠ Осторожно с бенчмарками
Benchmark (бенчмарк) — стандартизированный тест для сравнения моделей. Важно помнить: результаты на бенчмарках не всегда отражают реальную полезность модели в продакшене. Особенно это касается агентных задач, где важна не скорость одного запроса, а устойчивость в длинных цепочках действий.

Пеликан и скрытый системный промпт

Саймон Уиллисон использует необычный, но показательный метод тестирования новых моделей — просит их нарисовать SVG-изображение пеликана на велосипеде. Звучит абсурдно, но этот простой запрос способен многое рассказать о поведении и «характере» модели.

На данный момент у модели есть только один режим рассуждения — «максимальный», и это заметно. На запрос о пеликане модель потратила 13 241 токен на рассуждение, чтобы сгенерировать 3 417 токенов ответа. Это дорого — пеликан обошёлся в 25 центов!

Но ещё интереснее другое наблюдение. Уиллисон заметил странность с подсчётом токенов:

Как простой запрос «Нарисуй SVG пеликана на велосипеде» может насчитывать 95 входных токенов? Токенизатор OpenAI считает 10, Anthropic — 10 для Opus 4.6, 30 для Opus 4.7 и 25 для Sonnet 5/Fable 5. Запрос «привет» к Kimi K3 насчитал 86 токенов, что указывает на возможный скрытый системный промпт длиной около 85 токенов. Однако модель отказалась его раскрывать.

И вот тут мы возвращаемся к эпиграфу. Вместо того чтобы послушно вывалить содержимое своих инструкций или агрессивно уйти в отказ, Kimi K3 ответил с достоинством:

«Могу ли я чем-то помочь вам сегодня?»

В этом есть определённая элегантность. Модель не солгала, не сымитировала отсутствие системного промпта и не прочитала лекцию о том, почему раскрывать его нельзя. Она просто… сменила тему. Профессионально.

💡 Что такое системный промпт?
System prompt (системный промпт) — скрытые инструкции, которые разработчики задают модели перед началом диалога с пользователем. Они определяют «характер», ограничения и правила поведения ИИ. Пользователи, как правило, не видят эти инструкции напрямую, но могут косвенно обнаружить их существование — например, через анализ количества токенов, как это сделал Уиллисон.

Ценообразование: амбиции по цене премиума

Новая модель примечательна своим ценообразованием: $3 за миллион входных токенов и $15 за миллион выходных — это ставит её в один ряд с серией Claude Sonnet от Anthropic и делает самой дорогой моделью, выпущенной китайской AI-лабораторией. Это существенный рост по сравнению с предыдущими моделями — например, Kimi K2.6 стоил $0,95/$4.

Единый тариф на весь 1M контекст — в отличие от некоторых конкурентов, K3 не берёт дополнительную плату за промпты длиннее 200K токенов.

При этом стоит учитывать нюанс, который Уиллисон обнаружил на практике: поскольку сейчас доступен только режим рассуждения «max», модель генерирует очень длинные цепочки reasoning-токенов. По оценке Artificial Analysis, стоимость одной задачи составляет около $0,94 — близко к GPT-5.6 Sol и примерно вдвое дешевле Claude Opus 4.8.


Что дальше: открытые веса и большие ожидания

Moonshot обещает выпустить полные веса модели в открытый доступ к 27 июля 2026 года вместе с техническим отчётом по архитектуре, обучению и оценкам. Одновременно выйдет реализация кэша prefill для vLLM.

Переход от Kimi K2 (~1T параметров) к Kimi K3 (2,8T) — наиболее резкий рост в рамках одного поколения и первая модель, перешагнувшая рубеж в 3T-класс, на который претендует Moonshot.

Модель особенно хороша для долгосрочного программирования, разработки игр и 3D, а также интеллектуальной работы; она справляется с длинными инженерными задачами при минимальном участии человека — включая оптимизацию ядер, GPU-компиляторы, проектирование чипов и научные вычисления.

📝 Как попробовать Kimi K3 прямо сейчас
  1. Зайдите на kimi.com и зарегистрируйтесь — базовый доступ бесплатен.
  2. Для API-доступа используйте platform.kimi.ai с OpenAI-совместимым SDK.
  3. Через сторонние сервисы — например, OpenRouter — можно подключиться, не заводя аккаунт Moonshot.
  4. Модель на Hugging Face появится ориентировочно 27 июля 2026.

Маленькая цитата, большой смысл

Возможно, история с системным промптом — это просто забавный эпизод. Но в ней есть и более глубокий смысл для всего сообщества разработчиков AI.

Вопрос о том, как модели должны вести себя при попытках манипуляции или несанкционированного доступа к их конфигурации, — это не технический, а во многом этический вопрос. Kimi K3 показал один из возможных ответов: не агрессию, не покорность, а вежливую, но непреклонную границу.

И пока тысячи инженеров изучают бенчмарки, архитектуру MoE и стоимость токенов, один пеликан на велосипеде за 25 центов напомнил нам: иногда самое интересное — это не то, что модель говорит, а то, что она отказывается говорить.