Le Chonk: Тщательное тестирование Mistral Large 4
Обзор Mistral Large 4 («Le Chonk»): тесты на генерацию кода, ИИ-рассуждение, безопасность и многоязычность. Узнайте о сильных и слабых сторонах новой модели!
Компания Mistral представила свою новую модель Mistral Large 4, неофициально называемую ML4, а также получившую прозвище "Le Chunk". Это название отражает её внушительные размеры: около триллиона параметров, из которых примерно 50 миллиардов активны одновременно. Модель была обучена в собственных европейских дата-центрах Mistral. В настоящее время доступен публичный предварительный просмотр через API на Mistral Studio, а открытые веса ожидаются к концу текущего месяца.
Тестирование генерации HTML по изображению
Первый тест включал запрос на создание единого HTML-файла на основе предоставленного изображения. В качестве входных данных было использовано фото вертикального гриля с вращающимся мясом и огнем. Модель успешно сгенерировала HTML-файл, в котором мясные слои выглядят убедительно, присутствуют поддон для сбора жира, металлический стержень и мотор сверху. Однако, изображение огня было признано слабым местом: пламя оказалось небольшим и скрытым за мясом, в отличие от яркого огня на исходном фото. Несмотря на это, результат был оценен как "неплохой".
Тест на научное рассуждение
Следующий этап тестирования был посвящен проверке способности модели к научному рассуждению. Была предложена задача, основанная на правилах, изображенных на картинке: четыре человека касаются горячих и нейтральных проводов, находясь либо на изолирующих подставках, либо на земле. Модель должна была определить, кто из персонажей получит удар током.
В ходе выполнения этого теста были также представлены результаты бенчмаркинга модели.
- Deep Seek: Тестирует способность модели решать реальные задачи программной инженерии. ML4 превосходит большинство представленных открытых моделей, уступая лишь Kimiko 3.
- Terminal Bench: Оценивает работу модели с командами в командной строке. ML4 показывает хорошие результаты по сравнению с большинством конкурентов, но GLM 5.3 демонстрирует более высокие показатели. Отмечается честность бенчмаркинга и превосходство китайских моделей над Mistral и ML4 в данном тесте.
- Cyber Index: Измеряет эффективность модели в поиске и устранении уязвимостей безопасности в реальном программном обеспечении. ML4 занимает лидирующую позицию, разделяя её с GLM 5.3 Flash.
- Business Workflows: Тестирует способность модели выполнять бизнес-процессы, включая работу с электронной почтой, электронными таблицами и мессенджерами. ML4 находится позади самых мощных открытых моделей, уступая GLM 5.3.
- Finance Agent: Оценивает работу модели в области исследования и анализа финансовой отчетности компаний. ML4 располагается в верхней части списка, немного уступая GLM и незначительно опережая GPT-6 Astra.
После завершения теста на научное рассуждение модель предоставила ответ, согласно которому удар током получат персонажи A и D. A касается горячего провода, подключенного к земле, а D касается одновременно горячего и нейтрального проводов. Модель корректно определила, что персонажи B и C находятся в безопасных условиях (B изолирован, C имеет тот же потенциал, что и пол). ML4 продемонстрировала способность читать правила с изображения, проводить пошаговые рассуждения и обрабатывать сложные случаи.
Тестирование на поиск уязвимостей в коде
Еще одно заявленное преимущество модели — её способность находить уязвимости в коде. В качестве примера был представлен Flask-клиентский портал с базой данных SQLite, содержащий информацию о пользователях и их счетах. При попытке доступа к конечной точке, пользователь Alice запросила счет 102, принадлежащий Bob. Система вернула полную информацию о счете Bob, что является ошибкой нарушения контроля доступа (broken access control), так как Alice не должна иметь доступа к данным других пользователей.
Модель ML4, работая в связке с агентом Hermes, была поставлена задача найти эту уязвимость и предложить исправления. Модель быстро идентифицировала уязвимость IDOR (Insecure Direct Object Reference), отметив, что конечная точка удаления проверяет права собственности, в то время как конечная точка получения — нет. Кроме того, ML4 обнаружила и другие уязвимости: пароли в открытом виде, жестко закодированный ключ сессии и файл cookie с активным токеном сессии. Модель предоставила корректный код для исправления и предложила применить эти исправления.
Тест на "чтение между строк"
Для проверки способности модели к интерпретации неявной информации был использован скриншот переписки в WhatsApp. В сообщении сотрудник общается с начальником, при этом временные метки сообщений не соответствуют контексту. Задача модели заключалась в том, чтобы понять, что на самом деле происходит. Этот тест проверяет способность к рассуждению в социальных ситуациях, а не только к чтению текста.
ML4 успешно справилась с этим заданием, правильно интерпретировав сообщения как "триггер", поняв рабочий сленг ("left me hanging") и предположив, что жена начальника неверно истолковала сообщение как романтическое. Модель построила четкую цепочку рассуждений от неоднозначного текста к паническому ответу начальника, что полностью соответствовало цели теста. Результат был оценен как "10 из 10".
Тест на многоязычность
Финальный тест включал фронтальную страницу тамильской газеты. Модель должна была прочитать заголовок, перевести его на 75 языков и скриптов, включая мандаринский, арабский, эсперанто и вымышленные языки. Этот тест проверяет способность модели работать с текстами на различных скриптах, а не только с основными языками, для которых модели обычно оптимизированы.
Модель успешно перевела заголовок на около 25 языков, включая корректное использование скриптов для тамильского, арабского, японского и тайского языков. Однако, при работе с низкоресурсными языками, такими как гуджарати, модель начала допускать ошибки, и дальнейшие переводы были неточными. Таким образом, многоязычность, особенно для низкоресурсных языков, не является сильной стороной ML4.
Представление Mistral Large 4 («Le Chonk»)
Представление модели Mistral Large 4, неофициально названной «Le Chonk». Упоминание о её размере (триллион параметров) и доступности (публичный превью API, открытые веса ожидаются).
- Модель Mistral Large 4 неофициально названа «Le Chonk».
- Общее количество параметров — около триллиона.
- Примерно 50 миллиардов активных параметров.
- Обучена в европейских дата-центрах Mistral.
- Доступна в публичном превью через API Mistral Studio.
- Открытые веса ожидаются к концу месяца.
Тест 1: Генерация HTML по изображению
Тест на генерацию HTML-файла по изображению донера и текстовому описанию. Модель успешно создала HTML, но с некоторыми недочетами в изображении огня.
- Тест: создание HTML-файла по изображению и промпту.
- Использовано изображение вертикального гриля с мясом.
- Модель сгенерировала HTML-файл.
- Изображение мяса и деталей гриля получилось убедительным.
- Отмечены слабые места: недостаточно реалистичный огонь.
Тест 2: Научное рассуждение
Тест на научное рассуждение: определение, кто получит удар током при контакте с проводами. Модель правильно определила пострадавших (A и D) и объяснила причины.
- Тест: научное рассуждение на основе правил из изображения.
- Задача: определить, кто получит удар током от горячих/нейтральных проводов.
- Модель правильно определила, что A и D получат удар.
- Объяснение: A заземлен, D касается обоих проводов.
- Модель учла изоляцию B и одинаковый потенциал C с полом.
Бенчмаркинг производительности
Анализ результатов бенчмаркинга Mistral Large 4 по различным задачам: Deep Seek (инженерия ПО), Terminal Bench (терминал), Cyber Index (безопасность), Business Workflows (бизнес-процессы), Finance Agent (финансы).
- Deep Seek: ML4 превосходит большинство открытых моделей, уступая Kimiko 3.
- Terminal Bench: ML4 хорошо справляется, но GLM 5.3 впереди.
- Cyber Index: ML4 на вершине, наравне с GLM 5.3 Flash.
- Business Workflows: ML4 позади самых сильных открытых моделей, уступая GLM 5.3.
- Finance Agent: ML4 немного отстает от GLM и опережает GPT-6 Astra.
Тест 3: Поиск уязвимостей в коде
Тест на поиск уязвимостей в коде. Модель обнаружила уязвимость Broken Access Control (IDOR), а также проблемы с паролями в открытом виде и сессионными токенами.
- Тест: поиск уязвимостей в коде Flask-приложения.
- Обнаружена уязвимость IDOR (Insecure Direct Object Reference).
- Уязвимость: конечная точка
getне проверяет владение данными. - Дополнительно найдены: пароли в открытом виде, захардкоженный ключ сессии, файл cookie с токеном.
- Модель предложила исправления кода.
Тест 4: Чтение между строк (социальное рассуждение)
Тест на понимание социального контекста по скриншоту WhatsApp. Модель правильно интерпретировала неявные сообщения, сарказм и реакцию босса.
- Тест: анализ социального взаимодействия по скриншоту WhatsApp.
- Задача: понять скрытый смысл сообщений между сотрудником и боссом.
- Модель правильно поняла сарказм («left me hanging»).
- Модель верно интерпретировала реакцию босса как паническую.
- Оценка: 10 из 10 за социальное рассуждение.
Тест 5: Многоязычность
Тест на многоязычность: перевод заголовка газеты на 75 языков. Модель успешно справилась с основными языками и скриптами, но показала слабость в низкоресурсных языках.
- Тест: перевод заголовка тамильской газеты на множество языков.
- Цель: проверка обработки текстов на разных скриптах и языках.
- Успешно переведены около 25 языков, включая основные (арабский, японский, тайский).
- Проблемы возникли с низкоресурсными языками (например, гуджарати).
- Вывод: многоязычность — не самая сильная сторона модели для низкоресурсных языков.
