~3m13:42Xiaomi Launches MiMo-V2.6-Pro as Top Open AI Model: Let's Verify
22 сент. 2026 г.
Read: ~3m · You save: 11 min
Xiaomi представляет MiMo-V2.6-Pro: проверка флагманской ИИ-модели
Xiaomi MiMo-V2.6-Pro: флагман ИИ с 1 трлн параметров! Исправляет баги, пишет код, создает игры. Сравнение с GPT-6 Astra и Claude Opus 5. Стоит ли оно того?
В настоящее время в Китае наблюдается активное развитие ИИ-моделей, начиная от сервисов доставки еды и заканчивая гигантами вроде Alibaba и Baidu. Компания Xiaomi также вносит свой вклад в эту область, представляя новые версии своих моделей семейства MiMo. Последней разработкой стала модель V2.6 Pro, основанная на обучении с подкреплением (RL) и предлагающая различные конфигурации.
Архитектура и возможности MiMo-V2.6-Pro
MiMo-V2.6-Pro позиционируется как флагманская модель с 1,02 триллиона параметров в архитектуре "смесь экспертов" (Mixture of Experts), при этом активно используется лишь 42 миллиарда параметров. Основная цель модели — масштабирование обучения с подкреплением для самосовершенствования. Она объединяет задачи кодирования, работы с агентами, визуальные задачи и кибербезопасность в рамках одного цикла обучения с подкреплением, вместо раздельной тренировки по каждому направлению. Это позволяет осуществлять перенос навыков между различными доменами.
Модель способна обрабатывать текст, изображения, видео и аудио в рамках одной архитектуры, обладая контекстным окном в 1 миллион токенов, что обеспечивает поддержку длительных сессий работы агентов.
Тестирование на примере реального приложения
Для демонстрации возможностей модели была поставлена задача исправить ошибку в работающем приложении "Nusantara Ferry Lines" — интерактивной панели мониторинга загруженности паромов между островами Индонезии. На панели отображались некорректные данные о заполненности паромов. Например, маршрут Мерак — Бакаухени показывал 5% заполненности при наличии 114 свободных мест, тогда как фактически на паром было забронировано 92 места, и оставалось всего 28. Причина ошибки заключалась в том, что система подсчитывала количество бронирований, а не количество пассажиров в каждом бронировании. Это приводило к занижению реальной загруженности и потенциальному риску перебронирования и нарушения безопасности.
После интеграции с агентом Hermes, модели была поставлена цель исправить ошибку без указания на ее конкретную природу.
Сравнительные характеристики и бенчмарки
Согласно представленным данным, MiMo-V2.6-Pro демонстрирует результаты, сопоставимые с моделями Claude Opus 5 и GPT-6 Astra. Модель превосходит обе на реальных задачах кодирования, таких как Deep Sue, и занимает лидирующие позиции в бенчмарке Job Bench. Отмечается, что модель не выигрывает во всех категориях, а Opus 5 является устаревшей моделью. Тем не менее, для модели такого размера конкуренция с GPT-6 Astra оценивается как значительное достижение. Результаты по другим бенчмаркам не столь впечатляющи, но сопоставимы с моделью Fable 5.1.
Процесс исправления ошибки в Nusantara Ferry Lines
В ходе выполнения задачи по исправлению ошибки в приложении "Nusantara Ferry Lines", модель MiMo-V2.6-Pro продемонстрировала способность находить и устранять проблемы. Несмотря на то, что процесс занял более 25 минут и потребовал значительного количества токенов, модель успешно завершила поставленную цель. После обновления страницы, показатель забронированных мест изменился с 6 до 92, что соответствует реальному положению дел и устраняет риск перебронирования. Отмечается, что ошибка была тонкой и сложной для обнаружения.
Тестирование генерации веб-страницы для кофейни
В рамках следующего теста модели была поставлена задача создать дизайн посадочной страницы для мельбурнской кофейни, следуя детальному брифу: использование смелых цветов, редакционного макета и выраженной индивидуальности, избегая шаблонных решений. Модель должна была продемонстрировать "вкус" к фронтенд-разработке, как заявлено в блоге компании.
Модель успешно справилась с задачей, сгенерировав HTML-файл и запустив локальный Python-сервер. Созданная страница, названная "Duck Board", включала разделы "Меню", "История" и "Найти нас", которые корректно функционировали. Дизайн страницы был оценен как стильный и современный, с креативным текстом и детальной информацией для посетителей.
Тестирование визуальных возможностей и создания игры
Далее была проведена проверка визуальных способностей модели путем предоставления изображения и задания на создание концепции интерактивной 3D-игры на его основе. Модель точно идентифицировала все объекты на изображении, включая мячи, мышей, башни из постельного белья и пончики, и сопоставила их с конкретными интерактивными механиками.
Затем модели было предложено создать простой игровой прототип в одном HTML-файле. Результатом стала рабочая игра, где персонаж мог прыгать (с помощью пробела). Однако, клавиши WASD для управления движением не работали. Модель была проинформирована об ошибке и предоставлен код ошибки. После повторного исправления, клавиши управления движением по-прежнему не функционировали, хотя прыжок работал корректно. Тестирование в другом браузере (Microsoft Edge) также не выявило исправления проблемы с управлением. Тем не менее, способность модели к пониманию изображений и созданию на их основе симуляций или 3D-анимаций была оценена положительно.
Заключение
Xiaomi MiMo-V2.6-Pro демонстрирует значительные возможности в области обработки мультимодальных данных, решения сложных задач кодирования и генерации контента. Несмотря на некоторые замечания по скорости и эффективности использования токенов в определенных сценариях, модель показывает высокий потенциал, особенно в задачах, требующих креативности и понимания контекста. В ближайшее время планируется рассмотрение дистиллированной версии модели Coin.
Представление MiMo-V2.6-Pro
Представлена новая модель Xiaomi MiMo-V2.6-Pro, флагманская модель с 1.02 трлн параметров, обученная на смешанных задачах (кодирование, агенты, визуализация, кибербезопасность) в одном цикле обучения с подкреплением. Модель поддерживает текст, изображения, видео и аудио с контекстным окном в 1 млн токенов.
- Xiaomi выпустила новую ИИ-модель MiMo-V2.6-Pro.
- Модель имеет 1.02 трлн параметров, из которых 42 млрд активны.
- Обучена на смешанных задачах (кодирование, агенты, визуализация, кибербезопасность) в одном цикле RL.
- Поддерживает обработку текста, изображений, видео и аудио.
- Имеет контекстное окно в 1 млн токенов.
Тестирование на приложении Nusantara Ferry Lines
Продемонстрирована способность модели исправлять ошибки в реальном приложении Nusantara Ferry Lines. Модель успешно выявила и исправила ошибку в расчете занятости паромов, которая приводила к занижению данных и потенциальным рискам перебронирования.
- Модель протестирована на приложении Nusantara Ferry Lines для расчета занятости паромов.
- Обнаружена ошибка: система считала количество бронирований, а не пассажиров, что приводило к неверным данным.
- MiMo-V2.6-Pro успешно исправила ошибку, обеспечив корректное отображение занятости.
- Исправление ошибки предотвращает риски перебронирования и повышает безопасность.
Сравнение производительности и бенчмарки
Сравнение производительности MiMo-V2.6-Pro с конкурентами, такими как Claude Opus 5 и GPT-6 Astra. Модель показывает сильные результаты в задачах кодирования (Deep Sue, Job Bench), хотя и не превосходит всех конкурентов во всех областях.
- MiMo-V2.6-Pro сопоставима по производительности с Claude Opus 5 и GPT-6 Astra.
- Превосходит конкурентов в задачах реального кодирования (Deep Sue).
- Занимает лидирующие позиции в Job Bench.
- Отмечается, что Opus 5 является устаревшей моделью.
Процесс обучения и улучшения модели
Подробно описан процесс обучения модели с использованием смешанного RL и масштабирования сигнала вознаграждения. Модель прошла 30 шагов RL за 6 дней, улучшив показатель Deep Sue с 58.4 до 72.57, демонстрируя генерализацию за пределы обучающей задачи.
- Модель обучалась в смешанном цикле RL для кодирования, агентов, визуализации и кибербезопасности.
- Использовался масштабируемый сигнал вознаграждения и AI-оценщик для самосовершенствования.
- За 6 дней модель прошла 30 шагов RL, обработав ~750 тыс. траекторий.
- Стоимость обучения составила около 2.62 млн долларов США.
- Показатель Deep Sue улучшился на 14 пунктов (с 58.4 до 72.57).
Генерация веб-сайта для кофейни
Демонстрация генерации веб-сайта для кофейни в Мельбурне. Модель успешно создала лендинг с уникальным дизайном, соответствующим запросу на «смелые цвета» и «реальную индивидуальность», включая работающие разделы меню, истории и контактов.
- Модель получила задание создать лендинг для кофейни в Мельбурне с акцентом на дизайн и индивидуальность.
- Сгенерирован сайт с разделами: меню, история, контакты.
- Дизайн сайта оценен как «шикарный» и «довольно современный».
- Модель самостоятельно создала исполняемый Python-сервер для сайта.
Создание 3D-игры на основе изображения
Тестирование способности модели к созданию 3D-игры на основе изображения. Модель точно идентифицировала объекты на изображении и предложила интерактивные механики. Затем она сгенерировала прототип игры в одном HTML-файле, который успешно воспроизводил базовую механику.
- Модель протестирована на создание 3D-игры по изображению.
- Идентифицированы объекты: мячи, мыши, башни, кровать-пончик.
- Предложены интерактивные механики для каждого объекта.
- Сгенерирован играбельный 3D-прототип в одном HTML-файле.
- Базовая механика (прыжок) работает, но управление WASD не функционировало.
Исправление ошибки в 3D-игре
Модель успешно исправила ошибку в управлении 3D-игрой после получения сообщения об ошибке. Несмотря на первоначальные трудности с воспроизведением ошибки в другом браузере, модель продемонстрировала способность к отладке и исправлению кода.
- Обнаружена ошибка: клавиши WASD не работали в 3D-игре.
- Модель получила описание ошибки и исправила ее.
- После исправления клавиши управления по-прежнему не работали в Chrome и Edge.
- Модель продемонстрировала способность к пониманию и исправлению ошибок, хотя и не всегда успешно с первого раза.