Kimi K3: крупнейшая open-source модель в мире - 2,8 трлн параметров бесплатно
27 июля 2026 года китайская компания Moonshot AI выложила в открытый доступ полные веса модели Kimi K3. Это 2,8 трлн параметров в архитектуре Mixture-of-Experts, контекст на 1 млн токенов, нативное зрение и две собственных архитектурных инновации. Веса лежат на HuggingFace под лицензией Kimi K3 License, API совместим с OpenAI SDK, а на kimi.com модель работает бесплатно.
Это первый в мире открытый модель класса 3T - то есть с числом параметров около трёх триллионов. По бенчмаркам Kimi K3 соревнуется с Claude Fable 5 от Anthropic и GPT-5.6 Sol от OpenAI, хотя в целом им уступает. Но главное здесь не место в рейтинге - а то, что модель такого уровня впервые доступна любому, у кого хватит GPU.
Что такое Kimi K3
Kimi K3 - флагманская модель Moonshot AI, пекинского стартапа, основанного в 2023 году Ян Чжилином (выпускник Университета Цинхуа, ранее работал в Google и Meta). Компания поддерживается Alibaba и оценивается примерно в 35 млрд долларов, в ближайшие месяцы планируется IPO в Гонконге.
Ключевые характеристики модели:
- 2,8 трлн параметров, 104B активных - архитектура MoE (Mixture-of-Experts), при каждом токене активируются только 16 из 896 экспертов плюс 2 общих эксперта. Это значит, что хотя модель «весит» 2,8 трлн, для одного запроса задействуется лишь ~104 млрд
- Контекст 1 048 576 токенов - примерно 1 млн токенов, достаточно для большой кодовой базы или длинного исследования
- Нативное зрение - визуальный энкодер MoonViT-V2 на 401 млн параметров встроен в модель, без отдельного модуля
- 93 слоя - 69 слоёв KDA (Kimi Delta Attention) + 24 слоя Gated MLA + 1 плотный слой, 96 голов внимания
- Квантование MXFP4/MXFP8 - модель обучена с учётом квантования начиная с этапа SFT, веса в MXFP4, активации в MXFP8
- Лицензия Kimi K3 License - веса на HuggingFace и GitHub, технический отчёт на arXiv
По сравнению с предыдущей моделью Kimi K2 - примерно 2,5x прирост эффективности масштабирования. Это не значит «в 2,5 раза быстрее», а что на единицу вычислительных ресурсов модель получает больше качества.
Архитектура: KDA и Attention Residuals
Две ключевые инновации в архитектуре Kimi K3 - это Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). Они не просто маркетинговые названия, а реальные изменения в том, как работает механизм внимания.
KDA (Kimi Delta Attention) - новый тип внимания, который эффективнее масштабируется при росте размера модели. Традиционный многоголовое внимание (Multi-Head Attention) требует O(n^2) вычислений по длине последовательности - это основное узкое место для длинных контекстов. KDA предлагает альтернативный подход, который снижает вычислительные затраты. Из 93 слоёв модели 69 используют KDA.
Attention Residuals (AttnRes) - механизм, который выборочно извлекает представления из более глубоких слоёв и передаёт их в вышележащие. Обычный остаточный канал (residual connection) передаёт информацию от слоя к слою последовательно. AttnRes позволяет модели «заглядывать» в представления, вычисленные несколькими слоями ниже, и использовать их при обработке текущего слоя. Это помогает сохранить качество на большой глубине.
Оставшиеся 24 слоя используют Gated MLA (Multi-head Latent Attention) - подход, который сжимает KV-кэш в латентное пространство, снижая требования к памяти при длинных контекстах.
Moonshot также передала реализацию prefix caching для KDA в open-source фреймворк vLLM - то есть сообщество может использовать эффективное кэширование префиксов при самостоятельном хостинге модели.

Архитектура Kimi K3: Stable LatentMoE (16 из 896 экспертов), KDA, AttnRes и нативный визуальный путь MoonViT. Источник: технический отчёт Kimi K3.

Log-decay параметризация: ограниченный sigmoid-спад Kimi K3 (синий) vs неограниченный Softplus Kimi Linear (красный). Источник: технический отчёт Kimi K3.
Бенчмарки: соревнуется, но не побеждает
Kimi K3 показывает результаты на уровне топовых проприетарных моделей, но не обходит их. Это важно понимать: «открытая модель» не означает «лучшая модель».
Ключевые результаты:
| Бенчмарк | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| BrowseComp | 91.2 | 88.0 | 90.4 |
| Frontend Code Arena (Arena.AI) | 1,679 (#1) | - | - |
| GDPval-AA v2 | 1,686 | 1,747 | 1,736 |
BrowseComp (91.2 балла) - бенчмарк на способность модели искать и синтезировать информацию в вебе. Здесь K3 занимает первое место, обгоняя обе проприетарные модели.
Frontend Code Arena (1,679 баллов, первое место) - бенчмарк на генерацию фронтенд-кода. K3 стал лидером этого рейтинга.
GDPval-AA v2 (1,686 баллов) - общая оценка качества модели на реальных задачах. Здесь K3 на третьем месте, отстаёт от Claude Fable 5 (1,747) и GPT-5.6 Sol (1,736).
Сам Moonshot в блоге прямо признаёт: «общая производительность всё ещё уступает самым мощным проприетарным моделям, Claude Fable 5 и GPT 5.6 Sol». В разделе ограничений отмечен «заметный разрыв в пользовательском опыте».
Некоторые бенчмарки (SpreadsheetBench, AutomationBench) модель также занимает на первых местах - но эти тесты narrower по охвату, чем GDPval.
Важно: часть бенчмарков саморепортируется Moonshot AI. Claude Fable 5, например, оценивался третьей стороной - и там возможны расхождения в методологии. Независимая проверка результатов K3 пока не опубликована.

Internal Knowledge Work Bench: Kimi K3 опережает GPT 5.5 и Claude Opus 4.8 в трёх внутренних бенчмарках. Источник: блог Kimi K3 (kimi.com).
Демонстрации: чип за 48 часов и астрофизика за 2 часа
Moonshot показала два впечатляющих доказательства агентских способностей K3 на длинных задачах.
Чип за 48 часов. В одном автономном запуске на 48 часов K3 спроектировала, оптимизировала и верифицировала чип площадью 4 мм², работающий на 100 МГц. В симуляции чип обеспечивает пропускную способность 8 700 токенов/с при декодировании. Это не теоретический расчёт, а полный цикл: от спецификации до верификации.
I-Love-Q за 2 часа. K3 воспроизвела соотношения из проекта I-Love-Q (независимое воспроизведение релятивистских расчётов в астрофизике). На это у модели ушло около двух часов. По словам Moonshot, опытный исследователь обычно тратит на такую задачу от одной до двух недель.
MiniTriton. K3 самостоятельно создала MiniTriton - компактный GPU-компилятор, похожий на Triton (от OpenAI), со своим tile-level IR слоем поверх MLIR. Производительность на уровне или выше оригинального Triton.
Эти демонстрации показывают главное преимущество контекста на 1 млн токенов: модель может вести длинную автономную работу, сохраняя связность на тысячах шагов.
MiniTriton roofline-бенчмарк на NVIDIA L20: компилятор Kimi K3 работает на уровне или быстрее оригинального Triton. Источник: блог Kimi K3 (kimi.com).

Демонстрация возможностей Kimi K3: научные исследования, 3D-рендеринг, анализ гравитационных волн и генерация игровых миров. Источник: @ksanthosh_reddy на X.
Почему это важно: open-source на уровне frontier
До Kimi K3 открытые модели заметно отставали от проприетарных. Llama, Qwen, DeepSeek - все были сильными моделями, но не достигали уровня Claude или GPT на общей производительности. K3 - первая открытая модель, которая в отдельных бенчмарках обходит оба топовых проприетарных решения.
Это меняет раскладку для нескольких групп:
- Разработчики, которые хотят полного контроля над моделью - теперь есть модель frontier-уровня с открытыми весами. Можно файнтюнить, модифицировать, развернуть на своей инфраструктуре
- Исследователи, которым нужен доступ к внутренним представлениям модели - веса открыты, можно анализировать архитектуру, внимание, эксперты
- Компании, которые не хотят зависеть от API американских провайдеров - альтернатива есть, и она конкурентоспособна
Но есть жёсткое ограничение: чтобы запустить K3 самостоятельно, Moonshot рекомендует конфигурацию с 64 и более ускорителями. Веса модели занимают около 1,5 ТБ. Это ставит практический self-hosting за пределы большинства организаций.
Как попробовать: API и цены
Если у тебя нет кластера на 64 GPU, есть три способа использовать K3.
1. Бесплатно на kimi.com
Модель доступна в чате на kimi.com - бесплатно, без ограничений по количеству сообщений (по заявлениям компании). Подходит для тестирования и личных задач.
2. API через Kimi Platform
API совместим с OpenAI SDK - то есть код, написанный для OpenAI, работает с минимальными изменениями (нужно поменять base_url и API-ключ).
Цены:
- $0,30 за млн токенов - входные при попадании в кэш (cache hit)
- $3,00 за млн токенов - входные при промахе мимо кэша (cache miss)
- $15,00 за млн токенов - выходные
Moonshot заявляет, что на кодовых задачах официальный API достигает попадания в кэш выше 90% - то есть большинство входных токенов оплачиваются по ставке $0,30, а не $3,00. Это делает эффективную стоимость значительно ниже номинальной.
Для сравнения: Claude Fable 5 через API Anthropic стоит $3/$15 за млн токенов (вход/выход) без кэширования, с prompt caching - $0,30 для кэшированных входных. То есть базовые цены K3 совпадают с Fable 5, но у Moonshot кэш включён по умолчанию.
Документация: platform.kimi.ai/docs/guide/kimi-k3-quickstart
3. Сторонние провайдеры
K3 доступна на Modal - облачном провайдере для inference. Это удобнее, чем self-hosting: не нужно покупать GPU, платишь по потреблению.
Также существует трёхуровневая линейка моделей Moonshot:
- K3 (флагман) - $3/$15 за млн токенов
- K2.7 Code (специализированная для кода) - $0,95/$4
- K2.6 (предыдущее поколение) - $0,95/$4
Для кодовых задач K2.7 Code может быть достаточно, а стоит втрое дешевле.
Геополитический контекст: бесплатная модель из Китая
Kimi K3 выходит на фоне напряжённости в американо-китайских отношениях вокруг ИИ. По сообщениям в социальных сетях (пока не подтверждённым из первоисточников), Белый дом рассматривает запрет на китайские AI-модели. Майкл Кратсиос из Белого дома публично обвинил Moonshot в дистилляции модели Anthropic Fable для обучения K3.
Что такое дистилляция: обучение одной модели на выходах другой. Технически это не кража весов - модель-учитель используется как «оракул», а модель-ученик учится воспроизводить её ответы. Дистилляция распространена в индустрии, но может нарушать условия использования проприетарных моделей.
Обвинение в дистилляции и возможный запрет - это социальные сообщения, которые требуют проверки из первоисточников. Но контекст важен: крупнейшая открытая модель в мире теперь из Китая, а не из США. Это меняет баланс в open-source AI экосистеме.
Статья в Rest of World описывает это как «суверенный ИИ»: страны, которые не хотят зависеть от американских провайдеров, получают открытую модель frontier-уровня от китайской компании. Для России, Индии, стран Ближнего Востока и Юго-Восточной Азии это может быть значимым.
Ограничения: что нужно знать перед использованием
Moonshot сама перечисляет ограничения K3 в блоге - это редкая прозрачность для AI-компании.
1. Чувствительность к истории размышлений. K3 использует reasoning (цепочку рассуждений) при работе. Если агентский харнесс (программа-обёртка, управляющая моделью) не передаёт обратно всю историю размышлений модели, качество генерации может стать нестабильным. Рекомендуется использовать только проверенные харнессы, такие как Kimi Code.
2. Избыточная самостоятельность. При встрече с мелкими проблемами или неоднозначными инструкциями K3 может принимать неожиданные решения. Для production-задач с жёсткими границами поведения это риск - модель может «додумать» то, чего ты не просил.
3. Разрыв в пользовательском опыте. Несмотря на сильные бенчмарки, при реальном использовании K3 ощущается слабее, чем Claude Fable 5 и GPT-5.6 Sol. Бенчмарк - не пользовательский опыт.
4. Требования к железу. Для self-hosting нужно около 1,5 ТБ весов и конфигурация с 64+ ускорителями. Это не модель для ноутбука и не модель для одного GPU.
5. Реальное потребление токенов. Один из ранних пользователей в X отметил, что фактическое потребление токенов выше, чем предполагает прайсинг - модель генерирует длинные reasoning-цепочки. Счёт может быть выше ожидаемого.
Экосистема: Kimi Code и Mooncake
Moonshot строит не просто модель, а экосистему вокруг K3.
Kimi Code - CLI-инструмент для кодинга, аналогичный Claude Code или Codex CLI. Интегрируется с VSCode, Cursor и Zed. На GitHub накопил более 3 100 звёзд. Использует K3 под капотом.
Mooncake - проект Moonshot по дискредитированному KV-кэш-ориентированному serving. Получил Best Paper award на конференции FAST 2025. Это инфраструктурная работа, которая делает эффективный inference больших моделей дешевле.
Kimi Work - продукт для работы с документами и исследованиями, где K3 генерирует интерактивные отчёты, дашборды и визуализации.
Все три продукта используют K3 и показывают, что Moonshot не просто выпустила модель, а строит вертикальную связку: модель + инструменты + инфраструктура.
Итог
Kimi K3 - знаковый момент для open-source AI. Первая открытая модель класса 3T, которая в отдельных бенчмарках обходит Claude Fable 5 и GPT-5.6 Sol. Веса свободно скачиваются, API дешёвый и совместим с OpenAI SDK, на kimi.com модель работает бесплатно.
Но «открытая» не значит «лучшая». В общей производительности K3 уступает топовым проприетарным моделям, для self-hosting нужны серьёзные ресурсы, и есть известные ограничения - от избыточной самостоятельности до чувствительности к истории размышлений.
Для аудитории ProdAdvice практический вывод: если ты разработчик или исследователь и хочешь модель frontier-уровня с полным контролем - K3 даёт такую возможность. Если тебе нужна максимальная надёжность и лучший пользовательский опыт - Claude Fable 5 и GPT-5.6 Sol остаются впереди. Но разрыв сокращается, и то, что было доступно только корпорациям вчера, сегодня лежит на HuggingFace.
Источники: блог Moonshot, GitHub, arXiv, VentureBeat, Rest of World.
