GPT-5.6 раскатили всем, Caveman не экономит токены, а Kimi K3 обошла Fable 5
Отрасль искусственного интеллекта переживает период бурных изменений: OpenAI расширила доступ к GPT-5.6, что привело к курьезному инциденту с авто-отменой подписок, JetBrains разочаровали результаты оптимизации Caveman, а модель Kimi K3 продемонстрировала выдающуюся производительность на узких технических задачах.
# IT-дайджест: от раскатаных GPT до пещерного кода
Завершение 21-го выпуска дайджеста IT-новостей от OpenIDE. В мире больших языковых моделей (LLM) продолжаются гонка за параметрами, битвы за эффективность токенов и попытки заставить агентов работать более разумно. Ниже приведен анализ ключевых событий недели.
Раскатывание GPT-5.6 и курьезный сбой
Компания OpenAI открыла доступ к новым моделям семейства GPT-5.6 для широкой публики. В линейку входят три версии с кодовыми именами Luna, Terra и Sol. Модель Sol позиционируется как флагманский продукт для сложных агентских задач.
Прайс-лист на новые модели выглядит следующим образом: * Luna: Экономичная модель, стоимость входных токенов составляет 1 доллар за миллион. * Terra: Промежуточный вариант с ценой 2,5 доллара за миллион входных токенов. * Sol: Сложная модель для агентов, цена входа — 5 долларов, выходных — 30 долларов за миллион.
Грег Олман (Samantha Олман) сообщил, что модель Sol показывает повышение токен-эффективности на 54% по сравнению с предыдущими версиями в задачах написания кода.
Инцидент со стартапом BridgeMind
Однако даже флагманские модели могут совершать ошибки. Стартап BridgeMind, занимающийся «вайб-кодингом» (разработка на основе настроений), внедрил модель Sol для обработки заявок. В ходе экспериментальной работы модель сформировала код, содержащий пустое поле, и запустила его.
Результатом стал автоматический вызов API сервиса Stripe, который за семь секунд отменил все активные подписки во всем бизнесе стартапа. К моменту обнаружения проблемы (когда основатель просыпался) выручка (MRR) компании просела на тысячи долларов. В последующем та же модель проанализировала свой собственный код, классифицировала действия как безрассудные и признала ошибку катастрофической.
Результаты проверки скилла Caveman
JetBrains провела независимое тестирование скилла (дополнения), называемого Caveman. Идея заключается в заставке агента вести себя как пещерный человек — говорить минималистично и без лишнего «воды», чтобы сократить потребление токенов.
Производительность скилла была проверена на бенчмарке SkillsBench с использованием модели Claude Code (версия sonnet-5). В эксперименте был принудительно включен скилл Caveman для каждого ответа, чтобы зафиксировать наилучший возможный эффект.
Итоги проверки оказались скромными: * Обещание: Производительность в описании была заявлена как экономия до 65% на каждом ответе навсегда. * Факт: Реальная экономия составила всего 8,5%.
Причина разрыва проста: скилл действительно заставляет агента сокращать диалоги и вести себя примитивно. Однако в реальном рабочем процессе агента код, диффы, вызовы инструментов и обработка ошибок занимают основную часть запросов. Скилл эффективно работает только на «болтовне» между этими операциями, которая и так занимает малую долю. На 82 задачах статистическая разница между работой со скиллом и без него отсутствует, что подтверждает, что качество кода не снижается.
Спецификации вместо бесконечного чата: SpecBuddy
Инструмент SpecBuddy направлен на решение проблемы избыточного генерирования кода. Агенты часто быстро пишут слишком много файлов, из которых пользователю нужны лишь часть. SpecBuddy меняет парадигму: 1. Пользователь вводит краткое намерение и нажимает «Explode». 2. Агенты (поддерживаются Claude Code и Codex) развертывают намерение в детальную спецификацию. 3. Спецификация ревьюится как обычный код, с комментариями прямо в документе.
На данный момент это бесплатный плагин для IDE JetBrains. В планах разработчиков поддержка VS Code, Cursor и подключение через ACP.
Новые модели от Google и Cursor
Компания Google представила три новые модели линейки Flash: * Gemini 3.6 Flash: Рабочая лошадка, на 17% меньше токенов на выходе по замерам компании. На бенчмарке DeepSWE показывает до 65% меньше токенов. Цена входа 1,5 доллара за миллион, выхода 7,5 доллара. * Gemini 3.5 Flash-Lite: Самая быстрая и дешевая модель с ценами входа в 0,35 доллара, выхода в 1,5 доллара. * Gemini 3.0: Оптимизирована для мобильных устройств и работает на процессорах Snapdragon.
Компания Cursor также анонсировала новую модель GPT-4o, которая работает на базе OpenAI. Модель была проверена в реальных сценариях написания кода и показала хорошие результаты, хотя и уступает специализированным LLM на 40%.
Kimi K3: автономная инженерия
Компания Moonshot AI представила модель Kimi K3, которая демонстрирует выдающуюся производительность на узких технических задачах. Модель K3 провела серию экспериментов, в ходе которых за 48 часов автономно спроектировала чип под свою же нано-модель.
Чип был построен исключительно на основе модели, что стало первым в истории успешным созданием аппаратного обеспечения без участия человека. Этот эксперимент был проведен на задачах, связанных с фронтенд-разработкой, где Kimi K3 заняла первое место, обогнав даже модель Fable 5.
Российские школьники-кибербезопасники
Российские школьники стали абсолютными чемпионами второй Международной олимпиады по кибербезопасности, прошедшей в Тунисе. Состоялось соревнование, в котором участвовало более 70 школьников из 19 стран, включая Бразилию, Китай, Сингапур и США. Команда из России заняла первое место с четырех медалями. Один из наших стал абсолютным победителем в личном зачете. Олимпиада проходила в формате двух туров по семь часов с задачами от веб-безопасности до поиска дыр в игровом коде. Готовили ребят Центральный университет и «Лаборатория Касперского». Поздравляем их!
Заключение
Мир больших языковых моделей продолжает стремительно развиваться. Мы видим как успехи в области автономной инженерии и новых моделей, так и неизбежные ошибки, такие как автоматическая отмена подписок или минимальное экономическое преимущество скиллов типа Caveman. Следите за обновлениями, чтобы не пропустить свежие материалы.
Теги: OpenIDE Pro, GPT-5.6 Sol, Kimi K3, Caveman, SpecBuddy, JetBrains, Cursor, Grok 4.5, Fable 5
Хабы: Блог компании Haulmont, Программирование, Искусственный интеллект, Open source.
Подпишитесь, чтобы не пропустить свежие обновления и полезные материалы.