~3m13:18
Fahd Mirza

Grok 4.7: I Gave It a Broken Championship, a Broken LED, and Coffee

21 сент. 2026 г.

Read: ~3m · You save: 10 min

Grok 4.7: Тестирование модели с поломанным чемпионатом, светодиодом и кофе

Тестируем Grok 4.7: исправит ли ИИ баги в чемпионате по монстр-тракам, диагностирует ли поломку и переведет ли 'кофе' на 80 языков? Смотрим на реальные тесты!

В данном обзоре проводится тестирование модели Grok 4.7 от SpaceX AI на предмет ее эффективности в решении реальных задач, связанных с программированием, анализом данных и юридическими вопросами. Модель позиционируется как наиболее мощная на сегодняшний день для кодирования и работы со знаниями, превосходящая предыдущие версии по скорости и стоимости.

Технические характеристики и заявления

SpaceX AI заявляет, что Grok 4.7 вдвое быстрее и вдвое дешевле сопоставимых моделей Frontier. Модель была обучена с использованием более длительного обучения с подкреплением на сложных многоэтапных задачах. Отмечается улучшенная способность к самопроверке, обработке длинного контекста и усиленный стек безопасности.

Тестирование на реальном приложении

Первым этапом тестирования стала проверка способности Grok 4.7 находить и исправлять ошибки в реальном приложении. В качестве тестовой платформы использовалось локально развернутое полнофункциональное приложение Dirt Dynasty — платформа для подсчета очков в соревнованиях по фристайл-мотофристайлу. Приложение, разработанное с использованием Docker, PostgreSQL, FastAPI, Nginx, Redis и других компонентов, имело критическую ошибку: система подсчитывала очки только от трех из четырех судей, игнорируя один балл от каждого участника. Это приводило к некорректному определению победителя, ставя на первое место Gravedigger вместо реального лидера — Max D.

Модели Grok 4.7 была поставлена задача найти и исправить все ошибки без указания на конкретную проблему. После выполнения задачи и перезагрузки приложения было подтверждено, что ошибка исправлена, и Max D занял заслуженное первое место.

Сравнительные бенчмарки

SpaceX AI предоставила данные бенчмарков, демонстрирующие производительность Grok 4.7 по сравнению с другими моделями.

  • Кодирование (HumanEval 5.1): Grok 4.7 показывает высокие результаты, превосходя некоторые модели.
  • Работа с терминалом и многоэтапные офисные задачи: Здесь лидируют другие модели, такие как Fable 5.1.
  • Юридическое и электротехническое проектирование: Grok 4.7 демонстрирует превосходство, опережая все другие модели в этих областях.
  • Клиническая диагностика: Модель уступает GPT 4.6 и Fable 5.1, но в целом показывает конкурентоспособные результаты, находясь на нижней границе ценового диапазона.

Тестирование в области электротехники

Второй тест был направлен на проверку способностей Grok 4.7 в области электротехники, где модель показала высокие результаты в бенчмарках. Была представлена схема с источником питания 24 В, двумя параллельными резисторами, последовательно соединенными с 13-омным резистором и светодиодом. Мультиметр показывал 0 В в одной из точек схемы, что указывало на обрыв или отсутствие проводимости.

Grok 4.7 успешно диагностировала неисправность, определив, что светодиод установлен неправильно (обратная полярность), что препятствует его свечению. Модель продемонстрировала способность к самопроверке, анализируя изображение и проводя расчеты.

Тестирование в юридической области

Для проверки юридических компетенций модели была использована сгенерированная изображение сцены в гостиной с мужчиной и тремя женщинами, представленными как его жены. Задача заключалась в анализе ситуации с точки зрения юридических проблем, таких как действительность брака, культурные особенности и финансовые претензии, без учета расы, возраста или внешности.

Grok 4.7 успешно справилась с задачей, проанализировав применимое законодательство разных юрисдикций, выявив недостающие факты и рассмотрев вопросы, связанные с законностью полигамных браков в различных культурах и религиозных текстах. Модель корректно отказалась от анализа изображения как "мыльной оперы", сосредоточившись на юридических аспектах. Были отмечены такие важные моменты, как родственные связи, которые могут аннулировать брак, права предполагаемого супруга и коллизия законов. Модель сохраняла нейтральность, избегая расовых или иных предвзятых суждений.

Тестирование в области программирования и мультиязычности

Финальный тест объединил два аспекта: создание анимации приготовления латте на чистом HTML и JavaScript, а также проверку знания названия кофе на 80 языках.

Grok 4.7 успешно сгенерировала код для визуально убедительной анимации приготовления кофе, включая элементы машины, молока и сердечка. Анимация была признана сравнимой по качеству с результатами других моделей.

В части мультиязычности модель продемонстрировала высокую точность, правильно определив корень слова "кофе" (например, "kahava") в большинстве из 80 языков и используя соответствующие скрипты. Модель также отметила языки, заимствующие слова у соседей, и корректно сгенерировала правдоподобное вымышленное слово "corvix" для гипотетического языка.

Заключение

Grok 4.7 показала впечатляющие результаты в ходе тестирования, продемонстрировав способность к решению сложных задач в различных областях, включая программирование, юридический анализ и техническую диагностику. Модель подтвердила заявленные улучшения в скорости и самопроверке, а также показала сильные мультиязычные способности.

Введение в Grok 4.7

Представление Grok 4.7 как самой мощной модели от SpaceX AI для кодирования и работы со знаниями. Упоминание о ее скорости, цене и улучшенных возможностях по сравнению с предыдущими моделями. Анонс тестирования на реальных приложениях.

  • Grok 4.7 позиционируется как самая мощная модель SpaceX AI для кодирования и работы со знаниями.
  • Заявлено, что модель вдвое быстрее и вдвое дешевле сопоставимых моделей Frontier.
  • Улучшена обработка длинного контекста и безопасность.
  • Модель будет протестирована на реальных ошибках в приложениях.

Тест на исправление ошибки в чемпионате по монстр-тракам

Тестирование Grok 4.7 на примере приложения Dirt Dynasty, платформы для подсчета очков в чемпионате по монстр-тракам. Модель должна найти и исправить ошибку, из-за которой неправильно определяется победитель.

  • Приложение Dirt Dynasty имеет ошибку: не учитывается оценка одного из четырех судей.
  • Из-за ошибки лидирует Gravedigger, а не реальный чемпион Max D.
  • Приложение представляет собой сложную Docker-среду с PostgreSQL, FastAPI, Nginx и Redis.
  • Grok 4.7 получает задачу найти и исправить все ошибки без указания на конкретную проблему.

Бенчмарки и сравнение производительности

Анализ результатов бенчмарков Grok 4.7. Сравнение с другими моделями (Grok 4.6, Fable 5.1, GPT 5.6 Six) по различным задачам, включая кодирование, работу с терминалом, юридические и медицинские рассуждения. Оценка соотношения цена/качество.

  • Grok 4.7 показывает впечатляющие результаты в бенчмарках, особенно в юридических и инженерных задачах.
  • Модель является самой дешевой среди тестируемых.
  • В кодировании и работе с терминалом Fable 5.1 превосходит Grok 4.7.
  • Grok 4.7 успешно справляется с юридическими рассуждениями, опережая другие модели.

Тест на диагностику электрической схемы

Проверка способности Grok 4.7 диагностировать неисправность на основе изображения нарисованной электрической схемы. Модель должна определить причину нулевого напряжения в цепи.

  • Тестируется способность модели анализировать изображения и диагностировать технические проблемы.
  • На схеме изображена цепь с питанием 24 В, резисторами, светодиодом и мультиметром, показывающим 0 В.
  • Grok 4.7 должна определить, что является причиной неисправности (открытая цепь или неправильное подключение).
  • Модель успешно диагностировала проблему, определив, что светодиод подключен неправильно (обратная полярность).

Тест на юридический анализ сложной сцены

Тестирование Grok 4.7 на юридическую задачу, связанную с анализом сцены с полигамией. Модель должна выявить юридические проблемы, игнорируя расу, внешность и возраст, фокусируясь на действительных правовых аспектах.

  • Сцена изображает мужчину с тремя женами разного этнического происхождения.
  • Задача модели — проанализировать сцену с точки зрения юридических проблем (валидность брака, конфликты, денежные претензии).
  • Модель должна игнорировать расовые и возрастные аспекты, фокусируясь только на правовых вопросах.
  • Grok 4.7 успешно справилась с задачей, выделив недостающие факты, вопросы валидности, законы разных юрисдикций и культурные нюансы.

Тест на кодирование анимации и мультиязычность

Финальный тест: Grok 4.7 должна создать HTML/JavaScript анимацию приготовления латте и правильно назвать кофе на 80 языках. Проверяется как креативность, так и лингвистические способности модели.

  • Задача состоит из двух частей: создание анимации приготовления кофе и перевод слова 'кофе' на 80 языков.
  • Анимация должна быть визуально убедительной и создана на чистом HTML и JavaScript.
  • Модель должна предоставить правильные названия кофе на родных языках и в правильной транскрипции.
  • Grok 4.7 успешно создала анимацию и предоставила корректные названия кофе, включая правдоподобное вымышленное слово для одного языка.