6 октября Mistral выпустила Mistral Large 4 (ML4) в публичном превью — свою крупнейшую и самую способную на сегодня модель. Внутри команды её прозвали Le Chonk: отсылка к 1 трлн параметров, из которых на каждый запрос активны 52 млрд. Это нативно мультимодальная гибридная instruct-and-reasoning MoE-модель (mixture-of-experts — архитектура, где работает лишь часть параметров): на входе текст и изображения, на выходе текст, контекстное окно — 512 тыс. токенов. Превью доступно через API в Mistral Studio, а открытые веса Mistral обещает до конца октября — после завершения red-teaming-проверок, которые сейчас идут с участием внешних партнёров.
По подсчётам Artificial Analysis, превью набирает 38 баллов на агрегированном Intelligence Index — на уровне GPT-6 Luna в максимальном режиме (38) и чуть позади DeepSeek V4.1 Flash (39). Это самая интеллектуальная модель вне США и Китая, впереди разработок Южной Кореи и ОАЭ, — и она вернула Франции третье место среди стран после США (Claude Opus 5.5 в максимальном режиме, 58) и Китая (MiMo-V2.6-Pro, 46). Сама Mistral формулирует амбиции шире: ML4 конкурентоспособна с сильнейшими открытыми моделями мира, заметно обходит любые open-weight модели, созданные в США или Европе, а среди открытых не имеет равных на критичных для бизнеса задачах — в кибербезопасности, финансах и праве.

Кибербезопасность — главная заявка превью. На Cyber Index от Artificial Analysis ML4 набирает 50 баллов: на уровне GLM-5.3-Flash и позади MiMo-V2.6-Pro (56); по данным Mistral, модель входит в пятёрку сильнейших в мире и с большим отрывом лидирует среди open-weight моделей, созданных вне Китая. Самый яркий результат — 82% на CyberGym-E2E, где модель должна воспроизвести реальную уязвимость в open-source-коде и затем закрыть её: выше нет ни у кого. Claude Opus 5.5 и GPT-6 Astra на этом тесте получают почти ноль — они отказываются выполнять такую задачу. Во внутренних проверках ML4, по данным Mistral, пригодилась для анализа вредоносного ПО, приоритизации уязвимостей и написания правил детектирования.

Отсюда и аргумент за открытые веса: отказы провайдера могут заблокировать легитимное исследование уязвимостей и реагирование на инциденты, а потеря нужной возможности посреди инцидента сама по себе становится риском безопасности. Открытая модель позволяет организациям вести защиту под собственными политиками — в том числе на европейском деплойменте, который Mistral обслуживает сквозным образом, независимо от других цифровых провайдеров и по европейскому праву.
При этом на вредоносные кибер-промпты из JailbreakBench, StrongREJECT и AgentHarm ML4 отвечает отказом чаще, чем любая открытая модель; по устойчивости к непрямым prompt-инъекциям она, по данным Mistral, достигла потолка внутренних бенчмарков компании, а на публичном B3 AI Security Benchmark от Lakera отражает 93,3% атак — более высоких результатов среди конкурентов компания не видит. До релиза весов к ML4 с ослабленной модерацией и расширенными кибер-возможностями допущены лидеры отрасли кибербезопасности, проверенные партнёры и государства: цель, по словам вице-президента по науке Пьера Стока, — добиться, чтобы открытые веса можно было использовать для защиты, а не для атак. До тех пор модель публично доступна только через endpoint с защитными фильтрами.
В кодинге картина сильная, но не безусловная. По данным Mistral, полученным при закрытой оценке на стенде Artificial Analysis, ML4 набирает 61,7% на DeepSWE v1.1 — примерно на уровне GLM-5.3 (61%) и позади Kimi K3 (68%). По комбинированному Coding Agent Index модель впереди DeepSeek V4 Pro 0813 и Qwen3.8 Max, а на AutomationBench с 657 бизнес-воркфлоу в Gmail, Google Sheets, Slack и Salesforce — впереди Kimi K3, MiMo-V2.6-Pro и DeepSeek V4 Pro. В слепой оценке качества кодинга с профессиональными аннотаторами Surge AI превью заняло второе место из пяти, уступив только Claude Opus 5.

В понимании изображений Mistral называет ML4 резким скачком для своих моделей: на визуальном заземлении (visual grounding — умение находить объекты и области на изображении) модель, по данным компании, обходит даже закрытые frontier-модели — например, GPT-6 Astra на Dense 200. API теперь принимает до 100 изображений на запрос против 8 у предыдущих моделей Mistral. Независимые оценщики vals.ai ставят ML4 выше GPT-6 Astra на репрезентативных задачах и в финансах, и в праве; на юридическом агентном бенчмарке Harvey модель обходит все открытые аналоги. В науке ML4 — сильнейшая среди open-weight моделей на SciCode-Verified (реализация сложных научных задач в коде) и, по словам Mistral, в один запрос генерирует полную симуляцию Хартри–Фока — многоступенчатую задачу из химии.
Обучали ML4 с нуля на 3800 ускорителях NVIDIA Grace Blackwell в собственных дата-центрах Mistral в Европе; как рассказал Гийом Лампль, кластер размещается в Брюер-ле-Шатель и построен ещё на деньги серии B. Превью обслуживается на той же инфраструктуре. Сток подчёркивает: это в два-три раза меньше GPU, чем у китайских конкурентов, и заметно меньше, чем у закрытых лабораторий. Значительная часть обучающих данных была многоязычной — более 160 языков, включая все официальные языки ЕС. RL-прогон, на котором готовится превью, всё ещё продолжается и не показывает признаков насыщения: на текущем масштабе около трёх тысяч GPU один тренировочный прогон даёт примерно 33 млрд токенов в день, из которых около 16 млрд после фильтрации остаются обучаемыми.
Превью стоит $1,36 за миллион инпут-токенов и $4,18 за миллион аутпут-токенов, кэшированный инпут — $0,14; первые две недели действует скидка 50%. Одна задача Intelligence Index обходится в $1,13 — по подсчётам Artificial Analysis, это более чем вчетверо дороже открытых моделей сопоставимого интеллекта: GLM-5.3-Flash ($0,25) и DeepSeek V4.1 Flash ($0,27). Скорость аутпута — около 116 токенов в секунду.
За релизом стоит амбиция вернуть Mistral статус frontier-лаборатории: после того как компания начала хостить китайские модели, её упрекали в превращении в обычного инференс-провайдера — с Le Chonk она рассчитывает закрыть этот вопрос, пишет TechCrunch. Модель стала первой вехой дорожной карты, финансируемой серией D на €3 млрд — крупнейшим раундом в истории европейских технологических компаний: его вёл Samsung при оценке €21 млрд, а серию C — ASML. Среди оптимизированных сценариев ML4, помимо кибербезопасности и финансов, — проектирование чипов, важное для обоих инвесторов; кластеры серий C и D вот-вот заработают. До конца октября вместе с весами Mistral обещает детали архитектуры и методологию пост-тренинга, а сама модель станет основой нового поколения специализированных моделей компании.
Источники
- Introducing Mistral Large 4 | Mistral
- Mistral's new 1T model aims to leapfrog closed and open rivals | TechCrunch
- Mistral Large 4 Preview — Intelligence, Performance & Price Analysis | Artificial Analysis
- Artificial Analysis: оценка Mistral Large 4 (X)
- Artificial Analysis: Франция — третья по интеллекту frontier-моделей (X)
- Artificial Analysis: стоимость Mistral Large 4 Preview (X)
- Artificial Analysis: кибер-результаты Mistral Large 4 (X)
- Artificial Analysis: полные бенчмарки Mistral Large 4 (X)
- Artificial Analysis: ссылка на подробный разбор (X)
- Анонс Mistral Large 4 в аккаунте Mistral AI (X)
- Пост Mistral AI со ссылкой на подробности анонса (X)
- @kimmonismus о выходе Mistral Large 4 (X)
- @kimmonismus о результатах ML4 в кодинге и кибербезопасности (X)
- Гийом Лампль, посты 1/n–2/n треда о Mistral Large 4 (X)
- Гийом Лампль, пост 3/n треда — кибербезопасность (X)
- Гийом Лампль, пост 4/n треда — кодинг и агентные задачи (X)
- Гийом Лампль, пост 5/n треда — человеческая оценка (X)
- Гийом Лампль, пост n/n треда — команда и найм (X)