AI12 августа в 20:31 · 5 мин

Вышел Grok 4.6: Как SpaceXAI достигла паритета с лидерами рынка удешевив вычислительную мощь

Компания SpaceXAI официально представила модель Grok 4.6, которая, согласно независимым замерам, демонстрирует интеллектуальный уровень, сопоставимый с топовыми решениями GPT-5.6 и Claude Fable 5 Max. Ключевым отличием нового релиза стала агрессивная политика ценообразования: стоимость работы с моделью снизилась вдвое по сравнению с конкурентами, не уступая в качестве выполнения офисных и аналитических задач. Релиз ознаменовался не увеличением числа параметров, а революционным подходом к обучению с подкреплением, где предыдущая версия Grok 4.5 сама генерировала обучающие данные для своего преемника.

# Grok 4.6: Цена падает, интеллект растет — разбор новой версии от SpaceXAI

В мире искусственного интеллекта часто возникает иллюзия, что рост умственных способностей моделей неизбежно ведет к росту их стоимости и сложности архитектуры. Однако компания SpaceXAI выбрала иной путь. 12 августа, всего через четыре дня после релиза Grok 4.5, была выпущена новая версия — Grok 4.6. Если верить заявлениям разработчиков и данным независимых аналитических платформ, модель не просто улучшилась, а заняла позицию на так называемом «фронтире интеллекта», опередив ключевых конкурентов в ряде критически важных бенчмарков.

Экономика эффективности: как $2 превзошли $30

Самым ярким показателем успеха Grok 4.6 стала её цена. SpaceXAI объявила о стоимости использования в $2 за миллион входных токенов и $6 за миллион выходных. Для сравнения: аналогичные услуги Claude Opus 5 и GPT-5.6 Sol стоят значительно дороже — примерно в три раза. При этом, согласно расчетам аналитической платформы Artificial Analysis, задача, требующая высокой интеллектуальной нагрузки, обходится пользователю в $0,84. Это позволяет модельм занять позицию на парето-фронте, где соотношение «интеллект против цены» является оптимальным.

*«Экономика при этом осталась от Grok 4.5, но качество выполнения задач выросло настолько, что модель стала наиболее выгодной для сложных агентных сценариев»*, — отмечают эксперты.

Такая экономическая модель делает использование мощных языковых моделей доступным для малого бизнеса и индивидуальных разработчиков, ранее вынужденных выбирать между дешевыми, но тупыми инструментами и дорогими корпоративными решениями.

От параметров к процессу: секрет роста без «раздувания»

Обычно увеличение мощностей ИИ связано с масштабированием базы параметров. Однако Grok 4.6 построена на той же архитектуре в 1,5 триллиона параметров, что и её предшественница. Секрет успеха кроется в методологии обучения.

Компания провела дополнительный, более длительный цикл обучения с использованием курированных синтетических данных. Уникальность подхода заключается в том, что этапы обучения с подкреплением (RL) и тонкой настройки (SFT) были перестроены так, что предыдущая версия модели, Grok 4.5, сама участвовала в создании обучающей выборки для Grok 4.6. Модель проверяла собственные ответы, отфильтровывая проблемные примеры и генерируя сложные инженерные и логические задачи для следующего шага эволюции.

Помимо этого, в RL-задачи входили разнообразные реальные сценарии: от оптимизации вычислительных ядер до веб-разработки и создания проектов в CAD. Также была внедрена улучшенная система самопроверки: при выполнении длинных траекториях Grok 4.6 тестирует свои решения перед финальным выводом, что значительно повышает надежность.

Как это работает?

Для тех, кто не знаком с терминологией:

* SFT (Supervised Fine-Tuning) — обучение с учителем, где модель показывает правильные ответы на примеры вопросов. В случае с Grok 4.6 примеры генерировались самой моделью. * RL (Reinforcement Learning) — обучение с подкреплением, где модель получает «награду» за успешное выполнение задачи и учится на своих ошибках. * Токены — единицы измерения текста, на которые опираются нейросети. Входные токены — это данные, которые вы отправляете модели, выходных — её ответ.

Сильные и слабые стороны: где модель лидирует

Результаты независимых тестов на платформе Artificial Analysis показывают сбалансированный профиль модели. Общий интегральный показатель Intelligence Index составляет 61 балл, что равно показателю GPT-5.6 Sol на максимальном режиме рассуждений и лишь на один балл ниже, чем у Claude Fable 5 Max.

Где Grok 4.6 показывает лидерство: * Работа с документами: На бенчмарках офисных задач (GDPVal-AA v2 и AA-Briefcase) модель демонстрирует результаты выше, чем у конкурентов. В юридических задачах (Harvey LAB) Grok 4.6 показала 15,8%, значительно превзойдя GPT-5.6 Sol, который упал до 2,5%. * Терминал и код: На предыдущих версиях бенчмарка Terminal-Bench v2.1 Grok 4.6 показал результат 88,4%, опередив большинство аналогов. Хотя на новой усложненной версии v3.0 модель отстает от лидеров, её уровень все равно остается высоким. * Токен-эффективность: На бенчмарке AA-Briefcase модель закрывает задачу в среднем за 53 хода и полмиллиарда входных токенов, в то время как Claude Opus 5 требует более 100 ходов и двух миллиардов токенов.

Где есть зоны роста: * Сложный код: На бенчмарках глубокой разработки программного обеспечения (DeepSWE, FrontierCode) Grok 4.6 уступает конкурентам, достигая лишь 73% в DeepSWE против 70-73% у других.

Что это значит для пользователей?

Гrok 4.6 уже доступна в экосистеме SpaceXAI: агент Grok Build, IDE Cursor, бот Grok Bot и через API. Интересно, что компания Cursor, ставшая частью SpaceXAI, уже адаптировалась под новую модель: Grok 4.6 с первого раза строит структуру приложений по описанию, а её способность к самокоррекции позволяет использовать её для создания сложных программных продуктов без постоянного вмешательства человека.

В первые неделю использования в Cursor и Grok Build пользователи получат двойной лимит на бесплатные запросы. Впереди также обещана модель Grok 4.7 с увеличенным объемом параметров до 2,1 триллиона, но пока Grok 4.6 уже доказала, что путь к превосходству не лежит только через бесконечное наращивание размеров нейросети.

В этом кроется главная философия SpaceXAI: вместо того чтобы строить все более массивные и дорогие модели, компании удается оптимизировать процесс обучения, делая интеллект более доступным и практичным. В мире, где стоимость вычислений растет экспоненциально, этот подход может стать стандартом для следующего этапа развития ИИ.

Первоисточники

Habr AI
← Вернуться в эфир