Claude Fable 5 · GPT-5.6 Sol · Epoch AI · MirrorCode · Искусственный интеллект · Машинное обучение · Reinforcement Learning from Human Feedback (RLHF) · Программирование3 августа в 23:31 · 5 мин

Claude Fable 5 обошел GPT-5.6 в задаче реверс-инжиниринга: надежность побеждает интеллект

Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив данные о новых флагманах от Anthropic и OpenAI. В задаче переписывания программ с нуля на основе черного ящика Claude Fable 5 достиг отметки в 64%, тогда как GPT-5.6 Sol показал лишь 20%. Эксперты полагают, что такой разрыв обусловлен устойчивостью модели к сложным сценариям, а не просто наличием знаний.

# Claude Fable 5 обошел GPT-5.6 в переписывании программ с нуля

Новый отчет от исследовательской группы Epoch AI, созданной в партнерстве с лабораторией METR, демонстрирует существенный разрыв между лидерами рынка в специфической задаче программного инжиниринга. Бенчмарк MirrorCode поставил перед моделями задачу, максимально приближенную к реальным условиям работы разработчика, но лишенную прямого доступа к исходному коду. Результаты тестирования новых версий GPT-5.6 и Claude Fable 5 показали, что в условиях жестких ограничений выигрывает не столько теоретический интеллект, сколько стабильность и способность доводить сложные процессы до конца.

Методология бенчмарка MirrorCode

В основе теста MirrorCode лежит концепция «черного ящика». Модель получает в распоряжение только исполняемый файл программы (бинарный код), документацию и набор тестовых случаев. Задача состоит в том, чтобы написать новую программу на выбранном языке программирования, которая полностью дублирует поведение исходной, но не имеет доступа к ее внутреннему коду. Интернет-доступ отключен, а интернет-поиск запрещен, чтобы исключить возможность поиска готовых решений.

Требования к тестированию крайне жестки. Чтобы результат засчитывался, новая реализация должна проходить 100% тестов, включая скрытые тесты, которые модель не видит во время процесса обучения или генерации. Это исключает возможность «подгонки» под известные примеры. Каждая из 15 программ в выборке реализовывалась на двух языках, с бюджетом в 10 миллиардов токенов и сроком автономной работы до 7 дней. Один из самых длительных прогонов занял 19 дней и стоил 2600 долларов.

*Простое объяснение термина:* Черный ящик в программировании — это устройство или программа, внутреннее устройство и алгоритмы работы которого неизвестны пользователю. Он может только вводить данные, получать результаты и знать общую цель работы, но не видеть, как именно достигаются результаты.

Разбор результатов: Fable против Sol

Обнародованные цифры демонстрируют аномалию: на большинстве общедоступных бенчмарков модели Anthropic и OpenAI конкурируют на равных, но здесь разрыв составляет втрое. Claude Fable 5 решил 64% задач, в то время как GPT-5.6 Sol справился лишь с 20%.

Анализ тепловой карты результатов по отдельным задачам позволяет понять природу этого разрыва. Выяснилось, что GPT-5.6 Sol способен решать многие задачи из бенчмарка, но его результаты нестабильны. Статистика показывает частые попытки с успехом лишь 50%, 33% или 17%. В таких условиях, когда одна неудачная попытка может длиться дни и включать тысячи шагов генерации, единственный провал последнего сценария сводит общий результат на нет.

В отличие от этого, Claude Fable 5 демонстрирует высокую надежность. Те же задачи, где GPT-5.6 показывал разброс результатов, Fable решает с частотой 100% и 83%. Эксперты приходят к выводу, что в конкурсах на длительную автономную работу решающим фактором становится не способность к разовым вспышкам гениальности, а способность доводить задачу до идеального завершения в каждой итерации.

Устойчивость на редком языке Ada

Вторым критическим фактором, объясняющим превосходство Fable, стала задача написания кода на языке Ada. Согласно правилам лидераборда, половину реализаций необходимо выполнить именно на этом языке. Ada — это редкая система программирования, которая в 2026 году используется преимущественно в авионике и военных системах.

Результаты на Ada ярко демонстрируют разницу в подходах. Claude Fable 5 показал почти одинаковую эффективность на разных языках: 64% на Go и 61% на Ada. Для сравнения, результаты GPT-5.6 Sol упали катастрофически: с 24% на Go до 19% на Ada. Другие версии GPT-5 (5.4 и 5.5) потеряли еще больше эффективности при переходе на этот язык.

Этот момент важен для оценки качества обучения. Основная претензия к большинству современных бенчмарков — контаминация (загрязнение) обучающих данных. Поскольку многие программы в тесте имеют открытый исходный код, модели могли их увидеть при обучении и просто запомнить, а не выучить логику.

Однако реализации программ на языке Ada в природе практически не встречаются. Модели не могли их заучить по памяти; им пришлось воссоздать логику с нуля. Устойчивый результат Claude Fable на Ada говорит скорее о глубоком понимании принципов программирования, чем о случайном совпадении с данными в базе.

Ограничения и выводы

Несмотря на впечатляющие цифры, автор статьи отмечает важные ограничения. Во-первых, MirrorCode проверяет работу по идеально точной спецификации, где эталонная программа и тесты однозначно определяют выход. В реальной разработке требования часто размыты, а «чёрный ящик» может вести себя некорректно в нестандартных ситуациях, что не проверяется в текущем тесте.

Во-вторых, сама группа Epoch признает наличие признаков запоминания. Проверка выявила совпадения с обучающими данными у 17 из 25 программ. Хотя модели успешно решали и незапомненные задачи, а некоторые «запомненные» программы проваливались, полностью исключить вклад памяти невозможно.

Таким образом, текущий лидерборд показывает, что для задач, требующих длительной автономной работы и адаптации к редким условиям, важна не только скорость генерации кода, но и способность модели сохранять качество на протяжении всего процесса.

*P.S. Если тема искусственного интеллекта вам интересна, подписка на канал "сбежавшая нейросеть" поможет следить за творческим осмыслением технологий.*

Первоисточники

Habr AI
← Вернуться в эфир