Kimi K3: крупнейшая open-source модель в мире - 2,8 трлн параметров бесплатно

27 июля 2026 года китайская компания Moonshot AI выложила в открытый доступ полные веса модели Kimi K3. Это 2,8 трлн параметров в архитектуре Mixture-of-Experts, контекст на 1 млн токенов, нативное зрение и две собственных архитектурных инновации. Веса лежат на HuggingFace под лицензией Kimi K3 License, API совместим с OpenAI SDK, а на kimi.com модель работает бесплатно.

Это первый в мире открытый модель класса 3T - то есть с числом параметров около трёх триллионов. По бенчмаркам Kimi K3 соревнуется с Claude Fable 5 от Anthropic и GPT-5.6 Sol от OpenAI, хотя в целом им уступает. Но главное здесь не место в рейтинге - а то, что модель такого уровня впервые доступна любому, у кого хватит GPU.


Что такое Kimi K3

Kimi K3 - флагманская модель Moonshot AI, пекинского стартапа, основанного в 2023 году Ян Чжилином (выпускник Университета Цинхуа, ранее работал в Google и Meta). Компания поддерживается Alibaba и оценивается примерно в 35 млрд долларов, в ближайшие месяцы планируется IPO в Гонконге.

Ключевые характеристики модели:

  • 2,8 трлн параметров, 104B активных - архитектура MoE (Mixture-of-Experts), при каждом токене активируются только 16 из 896 экспертов плюс 2 общих эксперта. Это значит, что хотя модель «весит» 2,8 трлн, для одного запроса задействуется лишь ~104 млрд
  • Контекст 1 048 576 токенов - примерно 1 млн токенов, достаточно для большой кодовой базы или длинного исследования
  • Нативное зрение - визуальный энкодер MoonViT-V2 на 401 млн параметров встроен в модель, без отдельного модуля
  • 93 слоя - 69 слоёв KDA (Kimi Delta Attention) + 24 слоя Gated MLA + 1 плотный слой, 96 голов внимания
  • Квантование MXFP4/MXFP8 - модель обучена с учётом квантования начиная с этапа SFT, веса в MXFP4, активации в MXFP8
  • Лицензия Kimi K3 License - веса на HuggingFace и GitHub, технический отчёт на arXiv

По сравнению с предыдущей моделью Kimi K2 - примерно 2,5x прирост эффективности масштабирования. Это не значит «в 2,5 раза быстрее», а что на единицу вычислительных ресурсов модель получает больше качества.


Архитектура: KDA и Attention Residuals

Две ключевые инновации в архитектуре Kimi K3 - это Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). Они не просто маркетинговые названия, а реальные изменения в том, как работает механизм внимания.

KDA (Kimi Delta Attention) - новый тип внимания, который эффективнее масштабируется при росте размера модели. Традиционный многоголовое внимание (Multi-Head Attention) требует O(n^2) вычислений по длине последовательности - это основное узкое место для длинных контекстов. KDA предлагает альтернативный подход, который снижает вычислительные затраты. Из 93 слоёв модели 69 используют KDA.

Attention Residuals (AttnRes) - механизм, который выборочно извлекает представления из более глубоких слоёв и передаёт их в вышележащие. Обычный остаточный канал (residual connection) передаёт информацию от слоя к слою последовательно. AttnRes позволяет модели «заглядывать» в представления, вычисленные несколькими слоями ниже, и использовать их при обработке текущего слоя. Это помогает сохранить качество на большой глубине.

Оставшиеся 24 слоя используют Gated MLA (Multi-head Latent Attention) - подход, который сжимает KV-кэш в латентное пространство, снижая требования к памяти при длинных контекстах.

Moonshot также передала реализацию prefix caching для KDA в open-source фреймворк vLLM - то есть сообщество может использовать эффективное кэширование префиксов при самостоятельном хостинге модели.

Kimi K3 architecture diagram showing KDA layers, Stable LatentMoE with 16 of 896 experts, Gated MLA, Attention Residuals, and MoonViT vision pathway

Архитектура Kimi K3: Stable LatentMoE (16 из 896 экспертов), KDA, AttnRes и нативный визуальный путь MoonViT. Источник: технический отчёт Kimi K3.

Figure 3 from Kimi K3 technical report showing log-decay parameterization curves and diagonal-tile computation patterns comparing Kimi Linear and Kimi K3

Log-decay параметризация: ограниченный sigmoid-спад Kimi K3 (синий) vs неограниченный Softplus Kimi Linear (красный). Источник: технический отчёт Kimi K3.

Бенчмарки: соревнуется, но не побеждает

Kimi K3 показывает результаты на уровне топовых проприетарных моделей, но не обходит их. Это важно понимать: «открытая модель» не означает «лучшая модель».

Ключевые результаты:

Бенчмарк Kimi K3 Claude Fable 5 GPT-5.6 Sol
BrowseComp 91.2 88.0 90.4
Frontend Code Arena (Arena.AI) 1,679 (#1) - -
GDPval-AA v2 1,686 1,747 1,736

BrowseComp (91.2 балла) - бенчмарк на способность модели искать и синтезировать информацию в вебе. Здесь K3 занимает первое место, обгоняя обе проприетарные модели.

Frontend Code Arena (1,679 баллов, первое место) - бенчмарк на генерацию фронтенд-кода. K3 стал лидером этого рейтинга.

GDPval-AA v2 (1,686 баллов) - общая оценка качества модели на реальных задачах. Здесь K3 на третьем месте, отстаёт от Claude Fable 5 (1,747) и GPT-5.6 Sol (1,736).

Сам Moonshot в блоге прямо признаёт: «общая производительность всё ещё уступает самым мощным проприетарным моделям, Claude Fable 5 и GPT 5.6 Sol». В разделе ограничений отмечен «заметный разрыв в пользовательском опыте».

Некоторые бенчмарки (SpreadsheetBench, AutomationBench) модель также занимает на первых местах - но эти тесты narrower по охвату, чем GDPval.

Важно: часть бенчмарков саморепортируется Moonshot AI. Claude Fable 5, например, оценивался третьей стороной - и там возможны расхождения в методологии. Независимая проверка результатов K3 пока не опубликована.

Bar chart comparing Kimi K3, GPT 5.5, and Claude Opus 4.8 on internal knowledge work benchmarks - Kimi K3 leads all three categories

Internal Knowledge Work Bench: Kimi K3 опережает GPT 5.5 и Claude Opus 4.8 в трёх внутренних бенчмарках. Источник: блог Kimi K3 (kimi.com).

Демонстрации: чип за 48 часов и астрофизика за 2 часа

Moonshot показала два впечатляющих доказательства агентских способностей K3 на длинных задачах.

Чип за 48 часов. В одном автономном запуске на 48 часов K3 спроектировала, оптимизировала и верифицировала чип площадью 4 мм², работающий на 100 МГц. В симуляции чип обеспечивает пропускную способность 8 700 токенов/с при декодировании. Это не теоретический расчёт, а полный цикл: от спецификации до верификации.

I-Love-Q за 2 часа. K3 воспроизвела соотношения из проекта I-Love-Q (независимое воспроизведение релятивистских расчётов в астрофизике). На это у модели ушло около двух часов. По словам Moonshot, опытный исследователь обычно тратит на такую задачу от одной до двух недель.

MiniTriton. K3 самостоятельно создала MiniTriton - компактный GPU-компилятор, похожий на Triton (от OpenAI), со своим tile-level IR слоем поверх MLIR. Производительность на уровне или выше оригинального Triton.

Эти демонстрации показывают главное преимущество контекста на 1 млн токенов: модель может вести длинную автономную работу, сохраняя связность на тысячах шагов.

MiniTriton CUDA-core roofline chart showing Kimi K3 compiler performance vs Triton and torch.compile on NVIDIA L20

MiniTriton roofline-бенчмарк на NVIDIA L20: компилятор Kimi K3 работает на уровне или быстрее оригинального Triton. Источник: блог Kimi K3 (kimi.com).

Collage showcasing Kimi K3 multimodal capabilities across scientific research, 3D rendering, game development, and data analysis

Демонстрация возможностей Kimi K3: научные исследования, 3D-рендеринг, анализ гравитационных волн и генерация игровых миров. Источник: @ksanthosh_reddy на X.

Почему это важно: open-source на уровне frontier

До Kimi K3 открытые модели заметно отставали от проприетарных. Llama, Qwen, DeepSeek - все были сильными моделями, но не достигали уровня Claude или GPT на общей производительности. K3 - первая открытая модель, которая в отдельных бенчмарках обходит оба топовых проприетарных решения.

Это меняет раскладку для нескольких групп:

  • Разработчики, которые хотят полного контроля над моделью - теперь есть модель frontier-уровня с открытыми весами. Можно файнтюнить, модифицировать, развернуть на своей инфраструктуре
  • Исследователи, которым нужен доступ к внутренним представлениям модели - веса открыты, можно анализировать архитектуру, внимание, эксперты
  • Компании, которые не хотят зависеть от API американских провайдеров - альтернатива есть, и она конкурентоспособна

Но есть жёсткое ограничение: чтобы запустить K3 самостоятельно, Moonshot рекомендует конфигурацию с 64 и более ускорителями. Веса модели занимают около 1,5 ТБ. Это ставит практический self-hosting за пределы большинства организаций.


Как попробовать: API и цены

Если у тебя нет кластера на 64 GPU, есть три способа использовать K3.

1. Бесплатно на kimi.com

Модель доступна в чате на kimi.com - бесплатно, без ограничений по количеству сообщений (по заявлениям компании). Подходит для тестирования и личных задач.

2. API через Kimi Platform

API совместим с OpenAI SDK - то есть код, написанный для OpenAI, работает с минимальными изменениями (нужно поменять base_url и API-ключ).

Цены:

  • $0,30 за млн токенов - входные при попадании в кэш (cache hit)
  • $3,00 за млн токенов - входные при промахе мимо кэша (cache miss)
  • $15,00 за млн токенов - выходные

Moonshot заявляет, что на кодовых задачах официальный API достигает попадания в кэш выше 90% - то есть большинство входных токенов оплачиваются по ставке $0,30, а не $3,00. Это делает эффективную стоимость значительно ниже номинальной.

Для сравнения: Claude Fable 5 через API Anthropic стоит $3/$15 за млн токенов (вход/выход) без кэширования, с prompt caching - $0,30 для кэшированных входных. То есть базовые цены K3 совпадают с Fable 5, но у Moonshot кэш включён по умолчанию.

Документация: platform.kimi.ai/docs/guide/kimi-k3-quickstart

3. Сторонние провайдеры

K3 доступна на Modal - облачном провайдере для inference. Это удобнее, чем self-hosting: не нужно покупать GPU, платишь по потреблению.

Также существует трёхуровневая линейка моделей Moonshot:

  • K3 (флагман) - $3/$15 за млн токенов
  • K2.7 Code (специализированная для кода) - $0,95/$4
  • K2.6 (предыдущее поколение) - $0,95/$4

Для кодовых задач K2.7 Code может быть достаточно, а стоит втрое дешевле.


Геополитический контекст: бесплатная модель из Китая

Kimi K3 выходит на фоне напряжённости в американо-китайских отношениях вокруг ИИ. По сообщениям в социальных сетях (пока не подтверждённым из первоисточников), Белый дом рассматривает запрет на китайские AI-модели. Майкл Кратсиос из Белого дома публично обвинил Moonshot в дистилляции модели Anthropic Fable для обучения K3.

Что такое дистилляция: обучение одной модели на выходах другой. Технически это не кража весов - модель-учитель используется как «оракул», а модель-ученик учится воспроизводить её ответы. Дистилляция распространена в индустрии, но может нарушать условия использования проприетарных моделей.

Обвинение в дистилляции и возможный запрет - это социальные сообщения, которые требуют проверки из первоисточников. Но контекст важен: крупнейшая открытая модель в мире теперь из Китая, а не из США. Это меняет баланс в open-source AI экосистеме.

Статья в Rest of World описывает это как «суверенный ИИ»: страны, которые не хотят зависеть от американских провайдеров, получают открытую модель frontier-уровня от китайской компании. Для России, Индии, стран Ближнего Востока и Юго-Восточной Азии это может быть значимым.


Ограничения: что нужно знать перед использованием

Moonshot сама перечисляет ограничения K3 в блоге - это редкая прозрачность для AI-компании.

1. Чувствительность к истории размышлений. K3 использует reasoning (цепочку рассуждений) при работе. Если агентский харнесс (программа-обёртка, управляющая моделью) не передаёт обратно всю историю размышлений модели, качество генерации может стать нестабильным. Рекомендуется использовать только проверенные харнессы, такие как Kimi Code.

2. Избыточная самостоятельность. При встрече с мелкими проблемами или неоднозначными инструкциями K3 может принимать неожиданные решения. Для production-задач с жёсткими границами поведения это риск - модель может «додумать» то, чего ты не просил.

3. Разрыв в пользовательском опыте. Несмотря на сильные бенчмарки, при реальном использовании K3 ощущается слабее, чем Claude Fable 5 и GPT-5.6 Sol. Бенчмарк - не пользовательский опыт.

4. Требования к железу. Для self-hosting нужно около 1,5 ТБ весов и конфигурация с 64+ ускорителями. Это не модель для ноутбука и не модель для одного GPU.

5. Реальное потребление токенов. Один из ранних пользователей в X отметил, что фактическое потребление токенов выше, чем предполагает прайсинг - модель генерирует длинные reasoning-цепочки. Счёт может быть выше ожидаемого.


Экосистема: Kimi Code и Mooncake

Moonshot строит не просто модель, а экосистему вокруг K3.

Kimi Code - CLI-инструмент для кодинга, аналогичный Claude Code или Codex CLI. Интегрируется с VSCode, Cursor и Zed. На GitHub накопил более 3 100 звёзд. Использует K3 под капотом.

Mooncake - проект Moonshot по дискредитированному KV-кэш-ориентированному serving. Получил Best Paper award на конференции FAST 2025. Это инфраструктурная работа, которая делает эффективный inference больших моделей дешевле.

Kimi Work - продукт для работы с документами и исследованиями, где K3 генерирует интерактивные отчёты, дашборды и визуализации.

Все три продукта используют K3 и показывают, что Moonshot не просто выпустила модель, а строит вертикальную связку: модель + инструменты + инфраструктура.


Итог

Kimi K3 - знаковый момент для open-source AI. Первая открытая модель класса 3T, которая в отдельных бенчмарках обходит Claude Fable 5 и GPT-5.6 Sol. Веса свободно скачиваются, API дешёвый и совместим с OpenAI SDK, на kimi.com модель работает бесплатно.

Но «открытая» не значит «лучшая». В общей производительности K3 уступает топовым проприетарным моделям, для self-hosting нужны серьёзные ресурсы, и есть известные ограничения - от избыточной самостоятельности до чувствительности к истории размышлений.

Для аудитории ProdAdvice практический вывод: если ты разработчик или исследователь и хочешь модель frontier-уровня с полным контролем - K3 даёт такую возможность. Если тебе нужна максимальная надёжность и лучший пользовательский опыт - Claude Fable 5 и GPT-5.6 Sol остаются впереди. Но разрыв сокращается, и то, что было доступно только корпорациям вчера, сегодня лежит на HuggingFace.

Источники: блог Moonshot, GitHub, arXiv, VentureBeat, Rest of World.