Тесты бенчмарка v2: Claude Opus 5 остается эталоном кодинга, но GPT 5.6 Sol выигрывает по эффективности с MCP
Независимый бенчмарк, разработанный экспертом комьюнити 1С, обновил рейтинги языковых моделей для разработки на платформе «1С:Предприятие». В новой версии v2 исследователи оценили способность нейросетей решать задачи от алгоритмических тестов до построения целых подсистем. Результаты показывают, что современные модели, даже без глубокой интеграции, способны генерировать рабочий код, однако ключевой фактор успеха остается правильная настройка контекста и использование специальных серверов (MCP). Лидерство удерживает Claude Opus 5, но модель GPT 5.6 Sol демонстрирует лучшие показатели по соблюдению инструкций при работе с инструментами.
# Лучшие модели для разработки на 1С: итоги масштабного бенчмарка v2
В экосистеме искусственного интеллекта выбор основы всегда критичен. Если harness, правила и серверы инструментов (MCP) важны, то именно качество фундаментальной модели определяет верхний предел возможностей разработчика. В мае 2025 года независимый исследователь запустил первый масштабный бенчмарк, а теперь представлена его обновленная версия v2. Эксперимент охватил десятки моделей: от Claude Opus 5 и GPT 5.6 Sol до менее известных решений вроде Kimi K3 и MiniMax M2.7.
*«Сам бенчмарк регулярно обновляется, добавляются новые модели и оценки. Вся информация о задачах публична, и при необходимости можно перепроверить результаты»*, — отмечает автор тестов. В отличие от предыдущих версий, где фокус был на простых задачах вроде «сортим пузырьком», теперь тесты включают хитрые запросы, генерацию последовательностей и разработку полных подсистем с обновлением базы данных.
Методология и условия сравнения
Сравнение проводилось с использованием собственных сред вендоров: Claude Code для моделей семейства Claude, Codex для GPT, Cursor для Grok и Composer. Это решение было обусловлено тем, что производители часто понимают, какой системный промпт (system prompt) лучше всего раскрыть потенциал их модели. Вариант тестирования «без MCP» и «с MCP» позволял оценить реальную пригодность моделей для работы в 1С, где без специальных правил нейросети обычно работают хуже из-за специфики платформы.
Особенности подхода: * Разделение задач: тесты покрывают алгоритмы, архитектуру, механизмы платформы, производительность, работу с метаданными и разработку форм. * Прозрачность метрик: учитываются потраченные токены (input и output), исключается кэш. * Реалистичный подход: для «новых» моделей использовался максимальный уровень reasoning effort. * Человеческий фактор: автономный агент Hermes с моделью GPT 5.6 Sol управлял процессом, но финальные оценки, особенно касающиеся удобства сгенерированных форм, корректировались автором, чтобы минимизировать субъективизм.
Кто победил и как работает лидерство
Результаты тестов показывают значительный рост возможностей современных нейросетей. Даже без использования специализированных скиллов модели способны собирать внешние обработки и отчеты. Однако есть важный нюанс: некоторые современные модели с активным reasoning (GPT 5.6 Sol, Kimi K3, Qwen 3.8, Claude Fable 5) склонны выполнять задачи «до победного», тратя множество итераций и токенов, что увеличивает время выполнения, которое пока не является критерием в текущей версии бенчмарка.
Ключевые выводы по моделям:
* Claude Opus 5: безоговорочный лидер в части чистого кодинга и архитектуры. Однако модель может испытывать сложности с точным следованием инструкциям, что приводит к игнорированию части правил в сценариях с MCP. * GPT 5.6 Sol: лучшая модель для работы с инструментами (MCP) и строгим соблюдением инструкций. При использовании связки с MCP она расходует токены значительно эффективнее, чем Claude, что снижает итоговую стоимость разработки. * Kimi K3: демонстрирует результаты на уровне топовых платных решений, потенциально превосходя их, однако пока уступает в скорости обработки запросов. * Grok 4.5 и Composer 2.5: хорошие решения, особенно при работе с правилами, но уступают лидерам в чистых задачах кодинга. * DeepSeek v4 и GLM 5.2: актуальны только в условиях строгой бюджетной оптимизации и обязательного использования MCP. * Qwen 3.8, Sonnet 5, Mimo 2.5, Minimax M2.7: пока не рекомендуются для разработки на 1С в текущем бенчмарке.
Что выбрать для работы
Для профессиональной разработки на «1С:Предприятие» рекомендуется следующая стратегия:
1. Архитектура и уникальные задачи: Claude Opus (внутри среды Cursor) подходит для планирования архитектуры и оркестрации сложных агентов. Но следует внимательно проверять соблюдение инструкций. 2. Ежедневная разработка (рабочие лошадки): GPT 5.6 или Grok/Composer с активным использованием MCP и правил. Это обеспечивает меньший расход токенов и более предсказуемое поведение. 3. Экономический выбор: если бюджет ограничен и используются специализированные правила, модели DeepSeek и GLM могут стать альтернативой, однако их доля в стеке технологий сужается.
Автор бенчмарка подчеркивает, что даже опытный разработчик уровня senior может решить лишь часть задач предложенного теста без должной подготовки модели. Средняя модель справляется со всеми задачами бенчмарка за 3–4 часа. Главное — не писать код вручную, а грамотно настроить окружение, где ИИ выступает как мощный ассистент, способный генерировать артефакты и проверять логику обновления БД.
Более детально о том, как автономный агент запускал и мониторил другие агенты в течение пяти суток, автор расскажет в своем видео. Обновления бенчмарка и новые задачи будут публиковаться в специализированном канале.