~3m13:18Grok 4.7: I Gave It a Broken Championship, a Broken LED, and Coffee
21 сент. 2026 г.
Read: ~3m · You save: 10 min
Grok 4.7: Тестирование модели с поломанным чемпионатом, светодиодом и кофе
Тестируем Grok 4.7: исправит ли ИИ баги в чемпионате по монстр-тракам, диагностирует ли поломку и переведет ли 'кофе' на 80 языков? Смотрим на реальные тесты!
В данном обзоре проводится тестирование модели Grok 4.7 от SpaceX AI на предмет ее эффективности в решении реальных задач, связанных с программированием, анализом данных и юридическими вопросами. Модель позиционируется как наиболее мощная на сегодняшний день для кодирования и работы со знаниями, превосходящая предыдущие версии по скорости и стоимости.
Технические характеристики и заявления
SpaceX AI заявляет, что Grok 4.7 вдвое быстрее и вдвое дешевле сопоставимых моделей Frontier. Модель была обучена с использованием более длительного обучения с подкреплением на сложных многоэтапных задачах. Отмечается улучшенная способность к самопроверке, обработке длинного контекста и усиленный стек безопасности.
Тестирование на реальном приложении
Первым этапом тестирования стала проверка способности Grok 4.7 находить и исправлять ошибки в реальном приложении. В качестве тестовой платформы использовалось локально развернутое полнофункциональное приложение Dirt Dynasty — платформа для подсчета очков в соревнованиях по фристайл-мотофристайлу. Приложение, разработанное с использованием Docker, PostgreSQL, FastAPI, Nginx, Redis и других компонентов, имело критическую ошибку: система подсчитывала очки только от трех из четырех судей, игнорируя один балл от каждого участника. Это приводило к некорректному определению победителя, ставя на первое место Gravedigger вместо реального лидера — Max D.
Модели Grok 4.7 была поставлена задача найти и исправить все ошибки без указания на конкретную проблему. После выполнения задачи и перезагрузки приложения было подтверждено, что ошибка исправлена, и Max D занял заслуженное первое место.
Сравнительные бенчмарки
SpaceX AI предоставила данные бенчмарков, демонстрирующие производительность Grok 4.7 по сравнению с другими моделями.
- Кодирование (HumanEval 5.1): Grok 4.7 показывает высокие результаты, превосходя некоторые модели.
- Работа с терминалом и многоэтапные офисные задачи: Здесь лидируют другие модели, такие как Fable 5.1.
- Юридическое и электротехническое проектирование: Grok 4.7 демонстрирует превосходство, опережая все другие модели в этих областях.
- Клиническая диагностика: Модель уступает GPT 4.6 и Fable 5.1, но в целом показывает конкурентоспособные результаты, находясь на нижней границе ценового диапазона.
Тестирование в области электротехники
Второй тест был направлен на проверку способностей Grok 4.7 в области электротехники, где модель показала высокие результаты в бенчмарках. Была представлена схема с источником питания 24 В, двумя параллельными резисторами, последовательно соединенными с 13-омным резистором и светодиодом. Мультиметр показывал 0 В в одной из точек схемы, что указывало на обрыв или отсутствие проводимости.
Grok 4.7 успешно диагностировала неисправность, определив, что светодиод установлен неправильно (обратная полярность), что препятствует его свечению. Модель продемонстрировала способность к самопроверке, анализируя изображение и проводя расчеты.
Тестирование в юридической области
Для проверки юридических компетенций модели была использована сгенерированная изображение сцены в гостиной с мужчиной и тремя женщинами, представленными как его жены. Задача заключалась в анализе ситуации с точки зрения юридических проблем, таких как действительность брака, культурные особенности и финансовые претензии, без учета расы, возраста или внешности.
Grok 4.7 успешно справилась с задачей, проанализировав применимое законодательство разных юрисдикций, выявив недостающие факты и рассмотрев вопросы, связанные с законностью полигамных браков в различных культурах и религиозных текстах. Модель корректно отказалась от анализа изображения как "мыльной оперы", сосредоточившись на юридических аспектах. Были отмечены такие важные моменты, как родственные связи, которые могут аннулировать брак, права предполагаемого супруга и коллизия законов. Модель сохраняла нейтральность, избегая расовых или иных предвзятых суждений.
Тестирование в области программирования и мультиязычности
Финальный тест объединил два аспекта: создание анимации приготовления латте на чистом HTML и JavaScript, а также проверку знания названия кофе на 80 языках.
Grok 4.7 успешно сгенерировала код для визуально убедительной анимации приготовления кофе, включая элементы машины, молока и сердечка. Анимация была признана сравнимой по качеству с результатами других моделей.
В части мультиязычности модель продемонстрировала высокую точность, правильно определив корень слова "кофе" (например, "kahava") в большинстве из 80 языков и используя соответствующие скрипты. Модель также отметила языки, заимствующие слова у соседей, и корректно сгенерировала правдоподобное вымышленное слово "corvix" для гипотетического языка.
Заключение
Grok 4.7 показала впечатляющие результаты в ходе тестирования, продемонстрировав способность к решению сложных задач в различных областях, включая программирование, юридический анализ и техническую диагностику. Модель подтвердила заявленные улучшения в скорости и самопроверке, а также показала сильные мультиязычные способности.
Введение в Grok 4.7
Представление Grok 4.7 как самой мощной модели от SpaceX AI для кодирования и работы со знаниями. Упоминание о ее скорости, цене и улучшенных возможностях по сравнению с предыдущими моделями. Анонс тестирования на реальных приложениях.
- Grok 4.7 позиционируется как самая мощная модель SpaceX AI для кодирования и работы со знаниями.
- Заявлено, что модель вдвое быстрее и вдвое дешевле сопоставимых моделей Frontier.
- Улучшена обработка длинного контекста и безопасность.
- Модель будет протестирована на реальных ошибках в приложениях.
Тест на исправление ошибки в чемпионате по монстр-тракам
Тестирование Grok 4.7 на примере приложения Dirt Dynasty, платформы для подсчета очков в чемпионате по монстр-тракам. Модель должна найти и исправить ошибку, из-за которой неправильно определяется победитель.
- Приложение Dirt Dynasty имеет ошибку: не учитывается оценка одного из четырех судей.
- Из-за ошибки лидирует Gravedigger, а не реальный чемпион Max D.
- Приложение представляет собой сложную Docker-среду с PostgreSQL, FastAPI, Nginx и Redis.
- Grok 4.7 получает задачу найти и исправить все ошибки без указания на конкретную проблему.
Бенчмарки и сравнение производительности
Анализ результатов бенчмарков Grok 4.7. Сравнение с другими моделями (Grok 4.6, Fable 5.1, GPT 5.6 Six) по различным задачам, включая кодирование, работу с терминалом, юридические и медицинские рассуждения. Оценка соотношения цена/качество.
- Grok 4.7 показывает впечатляющие результаты в бенчмарках, особенно в юридических и инженерных задачах.
- Модель является самой дешевой среди тестируемых.
- В кодировании и работе с терминалом Fable 5.1 превосходит Grok 4.7.
- Grok 4.7 успешно справляется с юридическими рассуждениями, опережая другие модели.
Тест на диагностику электрической схемы
Проверка способности Grok 4.7 диагностировать неисправность на основе изображения нарисованной электрической схемы. Модель должна определить причину нулевого напряжения в цепи.
- Тестируется способность модели анализировать изображения и диагностировать технические проблемы.
- На схеме изображена цепь с питанием 24 В, резисторами, светодиодом и мультиметром, показывающим 0 В.
- Grok 4.7 должна определить, что является причиной неисправности (открытая цепь или неправильное подключение).
- Модель успешно диагностировала проблему, определив, что светодиод подключен неправильно (обратная полярность).
Тест на юридический анализ сложной сцены
Тестирование Grok 4.7 на юридическую задачу, связанную с анализом сцены с полигамией. Модель должна выявить юридические проблемы, игнорируя расу, внешность и возраст, фокусируясь на действительных правовых аспектах.
- Сцена изображает мужчину с тремя женами разного этнического происхождения.
- Задача модели — проанализировать сцену с точки зрения юридических проблем (валидность брака, конфликты, денежные претензии).
- Модель должна игнорировать расовые и возрастные аспекты, фокусируясь только на правовых вопросах.
- Grok 4.7 успешно справилась с задачей, выделив недостающие факты, вопросы валидности, законы разных юрисдикций и культурные нюансы.
Тест на кодирование анимации и мультиязычность
Финальный тест: Grok 4.7 должна создать HTML/JavaScript анимацию приготовления латте и правильно назвать кофе на 80 языках. Проверяется как креативность, так и лингвистические способности модели.
- Задача состоит из двух частей: создание анимации приготовления кофе и перевод слова 'кофе' на 80 языков.
- Анимация должна быть визуально убедительной и создана на чистом HTML и JavaScript.
- Модель должна предоставить правильные названия кофе на родных языках и в правильной транскрипции.
- Grok 4.7 успешно создала анимацию и предоставила корректные названия кофе, включая правдоподобное вымышленное слово для одного языка.