Решён ли ARC-AGI-3: Почему 100% в бенчмарке не означает искусственный общий интеллект
Фонд ARC Prize запустил бенчмарк ARC-AGI-3 для оценки способности ИИ к обучению в непредсказуемых условиях. Несмотря на заявления о достижении 100% показателей рядом проектов, критики указывают, что текущие результаты отражают эффективность инженерной обвязки и распознавание знакомых паттернов, а не настоящий интеллект в духе общей теории Шолле.

# Бенчмарк на AGI. Если ARC-AGI-3 решён, есть ли у нас AGI?
Бенчмарки существуют, чтобы помочь инженерам проверить свои проекты, а исследователям — сравнить их работы с конкурентами. Каждый из них имеет свою цель. ARC-AGI-3, созданный фондом ARC Prize Foundation под руководством основателя Франсуа Шолле, призван измерить не просто наличие навыка, а эффективность его приобретения. Иначе говоря, это тест на способность искусственного интеллекта учиться.
Задачи в этом бенчмарке представляют собой сложные интерактивные игры в стиле «Атари». Их цель — проверить, сможет ли ИИ-агент исследовать незнакомый мир, понять правила непосредственно в процессе игры, планировать действия и адаптироваться к изменениям. Если модель умеет только перебирать варианты, она проиграет. Если же она действительно выводит правила из наблюдений, она должна достичь эталонного уровня человека, играющего впервые, потратив минимальное количество действий.
Некоторые проекты уже заявили о результатах в 100%. Это звучит как победа, но является ли она реальной? В данной статье разбирается, почему достижение высоких показателей в этом тесте сегодня не свидетельствует о появлении искусственного общего интеллекта (AGI).
Как решают бенчмарк: от перебора к обвязке
Существует три основных подхода к решению задач ARC-AGI-3 нейросетями: прямое взаимодействие, обучение с подкреплением и использование агентной обвязки. Именно последний подход демонстрирует наилучшие результаты.
В случае с прямой интеграцией модель получает состояние игры и выдает действие, часто теряя нить рассуждений и совершая галлюцинации. Обучение с подкреплением теоретически применимо, но объем данных, необходимый для такого типа задач, часто недосягаем для генерации датасета.
Самым эффективным оказался подход с агентной обвязкой. Здесь модель работает в цикле, имея доступ к инструкции, памяти, файловой системе и исполняемому коду. Ярким примером является проект инженера Сергея Родионова из SingularityNET. Его система использует Codex с доступом к окружению Linux и Python. Алгоритмический контроллер отправляет промпты, а агент наблюдает за состоянием, строит гипотезу о мире, действует, проверяет результат и корректирует свои выводы.
Схема работы следующая: модель формирует гипотезу, симулирует её в Python (или рассуждает текстом), проверяет вывод и, при расхождении с реальностью, отбрасывает старую гипотезу и строит новую. Однако, при глубоком анализе работ Родионова стало ясно, что выделенная исполняемая модель мира не является обязательным условием успеха. Текстовое рассуждение в контексте, дополненное генерацией идей и сжатием описания (принцип минимальной длины описания), показывает результаты до 99% по метрике RHAE.
Почему LLM побеждают в «детерминированных мирах»
Почему современные большие языковые модели (LLM) показывают отличные результаты в задачах, которые должны были стать ловушкой для простых алгоритмов перебора? Причин две.
Во-первых, игры ARC-AGI-3 разрабатываются небольшой командой, тогда как обучающие данные LLM включают в себя десятилетия работы тысяч геймдизайнеров. Модели содержат в себе скрытые знания о механиках игр: что нельзя трогать, как обычно строится уровень, где искать выход. Фактически, LLM переводит визуальный сигнал в текст, ищет знакомые паттерны из своей внутренней «библиотеки» человеческого опыта и применяет их. Это не открытие нового правила с нуля, а распознавание того, что уже существует в глобальном датасете человеческих знаний.
Во-вторых, это вопрос архитектуры мышления. Когнитивист Даниэль Канеман различал быстрое мышление (Система 1) и медленное (Система 2). LLM, работающая на текстовых паттернах, действует как сверхмощная Система 1, мгновенно настраивая контекст. Попытка вынести симуляцию мира в отдельный Python-код (Система 2) часто оказывается избыточной. Текстовое описание мира является для LLM нативной формой абстракции. Пиксель, уничтожаемый при касании, для модели — это просто слово «охотник» в потоке гипотез. Это позволяет ей обрабатывать информацию эффективнее, чем точная детерминированная симуляция.
Структурная проблема: правило или суррогат?
Ключевая проблема ARC-AGI-3 заключается в метрике. Бенчмарк измеряет только результат: сколько уровней пройдено и сколько действий затрачено. Он не имеет доступа к внутреннему процессу получения этого результата. Перебор вариантов и истинное понимание поведения модели в данном случае неразличимы.
Хотя штраф за количество действий теоретически должен наказывать за долгий перебор, он считается только за действия внутри игровой системы. Агент может проводить бесконечное количество расчетов, симуляций или рассуждений «на бумаге» (в контексте LLM или Python-симуляторе) и лишь затем выдавать верное решение. Размер, скорость и вычислительная мощность выигрывают у понимания.
Проблема глубже. Возьмем простую задачу для нейросети: определить, отсортирована ли последовательность чисел. Микросеть может научиться решать её с точностью в единицы ошибок для длин от 3 до 10. Но если подать последовательность длиной 14–20, сеть ошибается, даже если решение (проверка разницы между соседними числами — «дельта») элементарно простое и содержится в данных.
Машинное обучение методом обратного распространения ошибки (бэкпроп) оптимизирует функцию потерь (Loss), меняя значения параметров внутри заранее заданной архитектуры. Оно не может изменить само пространство представлений. Сеть ищет решение в рамках того, что ей уже дано, а не ищет способ описать задачу в более простом виде. Поиску нового математического представления (как это сделал Гальван для электричества или Ньютон для движения), где решение становится очевидным, бэкпроп помочь не может.
Вывод
ARC-AGI-3 по духу задумывался как тест на понимание, но на практике он стал измерением того, насколько хорошо кодовый агент, вооруженный чужим опытом, справляется с детерминированным низкоразмерным миром.
Результат 100% в текущем бенчмарке не означает наличие AGI. Это победа мощной системы распознавания паттернов и качественной инженерной обвязки. Настоящий интеллект, возможно, заключается не в поиске решения внутри существующего пространства представлений, а в способности создавать новое пространство, где решение станет достижимым и простым. Пока что ИИ отлично читает уже написанные книги человечества, но поиск новых страниц в книге вселенной всё ещё остается за пределами их возможностей.
*Примечание редактора: автор выражает надежду, что в будущем поиск нового пространства представлений сможет быть организован с помощью самих языковых моделей, использующих свой связный язык для описания концепций, которых ранее не было в данных.*