Grok 4.6: экономичный агент для длинных задач с контекстом в 500 тыс. токенов
12 августа компания SpaceXAI обновила семейство Grok, представив модель Grok 4.6. Главной особенностью обновления стал контекст до 500 000 токенов и четыре режима логического рассуждения, ориентированные на сложные многошаговые задачи. В тестировании агент показал высокую эффективность при низкой стоимости, хотя цена обработки длинного контекста существенно возрастает после преодоления порога в 200 000 токенов.
# Grok 4.6: баланс между мощью и стоимостью агентной работы
Компания SpaceXAI представила обновление Grok 4.6, позиционируя его как инструмент для работы с большими кодовыми базами и длительными последовательностями действий. Модель получила возможность обрабатывать контекст объемом до 500 тысяч токенов и предлагает четыре уровня глубины логического анализа.
Технические возможности и архитектура обновлений
Основным сдвигом в архитектуре Grok 4.6 стала поддержка огромного контекстного окна. Это позволяет модели работать с репозиториями кода, содержащими миллионы строк, не забывая о начале истории проекта. В модели внедрены четыре режима рассуждения: низкий, средний, высокий и сверхвысокий. По умолчанию активирован режим «высокий», что предполагает активный поиск решения перед выдачей результата. Разработчики подтвердили, что данные об обучении на модели актуальны на 1 февраля 2026 года.
Поддержка инструментов для работы агентов включает веб-поиск, поиск внутри платформы X и выполнение пользовательского кода. Доступ к модели возможен через API, а также через интегрированные редакторы кода, такие как Cursor, и платформы вроде OpenRouter и Vercel.
*Уточнение:* В тексте источника указано, что модель дообучалась на задачах программирования, оптимизации ядер и веб-разработки. Официальные заявления компании подчеркивают, что на длинных прогонах модель чаще проверяет собственную работу, однако независимых подтверждений этой характеристики на текущий момент нет.
Результаты независимого и прикладного тестирования
Первые результаты тестирования демонстрируют прогресс по сравнению с предыдущей версией Grok 4.5. Индекс Artificial Analysis показал рост показателей с 56 до 61 баллов, став равным лидеру GPT-5.6 Sol. В специализированных тестах модель значительно улучшила показатели:
* DeepSWE: результат вырос с 54% до 65,9%. * Terminal-Bench: показатель увеличился с 15,7% до 26%. * APEX-Agents: результат повысился с 47,1% до 57,5%.
В тесте CursorBench 3.2, который фокусируется на решении реальных многофайловых задач, Grok 4.6 показал результат 70,8%. Для сравнения, модель Fable 5 Max набрала 70,5%, а GPT-5.6 Sol — 69,8%. Таким образом, Grok 4.6 занял лидерство в этой метрике, превзойдя конкурентов с отрывом менее 1%.
В задачах по поиску уязвимостей в коде модель также показала прирост эффективности, сократив время поиска с 13,2 до 10,3 секунд.
Экономическая эффективность агентов
В условиях высокой стоимости токенов при работе с агентами, экономия становится критическим фактором. Grok 4.6 предлагает базовый тариф стоимостью 0,5 цента за 1K токенов, что на 16% дешевле базового тарифа конкурента Grok 4.5 (0,6 цента). При этом модель способна обрабатывать более сложные запросы за меньшее количество «кругов» попыток.
Для оценки экономической эффективности разработчики предлагают отслеживать четыре показателя: 1. Долю завершенных задач. 2. Среднюю стоимость одного прогона (посессии). 3. Число необходимых вмешательств человека. 4. Время до получения принятого результата.
Особое внимание следует уделить накоплению контекста. После пересечения порога в 200 тысяч токенов стоимость обработки резко возрастает, и модель может начать «терять» историю решений. Удачная стратегия подразумевает использование кэширования промптов и своевременное сжатие истории контекста.
Рекомендации по внедрению и выбор стратегии
Модель Grok 4.6 целесообразно использовать командам, которые уже работают с большими репозиториями или строят собственных агентов через API. Для простых чат-ботов, где важна скорость и качество текста, переход на новую модель пока не является критически необходимым.
*Рекомендация:* Для первой серии тестов достаточно среднего режима рассуждения. Для самых сложных задач с длинной цепочкой проверок следует включать сверхвысокий уровень, чтобы увидеть реальную разницу в качестве решения.
Ключевые выводы * Мощь и экономичность: Grok 4.6 сочетает в себе высокую точность на сложных задачах (CursorBench, APEX-Agents) с низкой базовой стоимостью токенов. * Контекст: Поддержка 500K токенов открывает возможности для работы с огромными кодовыми базами, но требует внимания к оптимизации контекста для избежания роста счетов. * Конкурентная борьба: Модель уперлась в тесный задел с лидером GPT-5.6 Sol в общем зачете, но обошла его в специализированных тестах агентов и рефакторинга.
Грока 4.6 стоит рассматривать как одного из самых экономичных сильных агентов внутри экосистемы Cursor для задач, требующих глубокого анализа и многошаговых операций.
Теги: grok 4.6, spacexai, xai, ии-агенты, агентное программирование, искусственный интеллект, языковые модели, стоимость токенов
---
::%16777216 — странный артефакт в логах RDP: история одного расследования
В логах RDP-подключений иногда встречается запись, которая выглядит как ::%16777216 — и это вместо привычного IP-адреса. Про такой артефакт пишут в отраслевых отчетах уже несколько лет. Он всплывает в описаниях атак с туннелированием RDP, и практически всегда авторы упоминают утилиту ngrok. Но при этом почти никто не объясняет, что это за значение, какова его природа и почему оно записано именно так.
*Константин Грищенко, Positive Technologies:* «В ноябре 2024 года в одном из докладов на конференции SOC Forum я в очередной раз увидел упоминание этого артефакта и решил все-таки попробовать разобраться в том, что это такое». Публикация была скрыта или удалена.
Публикация: 13 августа 2026 Охват за 30 дней: 44K Комментарии: 0