Искусственный интеллект · Автономные агенты · Генерация кода · Регулярные выражения · Самокоррекция · ML Research · arXiv4 сентября в 09:02 · 4 мин

Как ошибки научили агентов программировать себя: методика A-CEGIS на базе контрпримеров

Исследователи Sidhesh Badrinarayan и Adithya Parthasarathy представили новый подход к оценке автономности агентов искусственного интеллекта. Вместо абстрактных метрик на один проход, предложенная фреймворк A-CEGIS демонстрирует, насколько эффективно модель может исправить ошибку, получив конкретный контрпример. Эксперименты на наборе данных NL-RX-Turk показали, что такой метод обучения с обратными связями позволяет решить 90% задач за четыре попытки, в то время как методы без обратной связи справляются лишь в 17% случаев.

Образ ошибки, распадающейся на светлую истину в холодной воде.

# От абстракции к действию: как контрпримеры меняют подход к оценке агентов

В мире автоматизированного программирования часто возникает иллюзия компетентности. Традиционные метрики оценки кода, генерируемого нейросетями, часто ограничиваются однооборотным тестированием: модель предлагает решение, и его проверяют на заданном наборе данных. Если результат успешный, код считается рабочим. Однако в реальной эксплуатации, где условия меняются, способность модели адаптироваться к новой информации или исправить ошибку становится критической.

Новая статья, опубликованная на arXiv в разделе Computation and Language (cs.CL), предлагает свежий взгляд на эту проблему. Авторы предлагают фреймворк A-CEGIS, который рассматривает не столько идеальный старт, сколько качество самокоррекции агента.

Контрпримеры как наставник

В основе подхода лежит простой, но мощный механизм: использование контрпримеров (counterexamples) в качестве обратной связи. В контексте работы с регулярными выражениями, которые часто требуют сложной логики, этот метод работает следующим образом.

Агент генерирует регулярное выражение для выполнения задачи по описанию на естественном языке. Затем детерминированный оркестр (определяющее устройство) проверяет это выражение. Если оно работает некорректно, система не просто сообщает об ошибке. Вместо этого она возвращает компактный «свидетель» ошибки — конкретный пример текста, который модель должна была поймать, но пропустила (ложный отрицательный результат), или пример, который модель нашла ошибочно (ложный положительный результат).

Эти контрпримеры становятся ориентиром для следующего хода. Агент анализирует, почему правило не сработало на конкретном примере, и перестраивает свою логику. Этот процесс повторяется до тех пор, пока выражение не пройдет проверку или до истечения бюджета на число раундов.

Почему это важно?

В предыдущих исследованиях часто использовались методы «zero-shot» (беспоточные) или общая самкоррекция, где агент пытается улучшить результат без четкого указания, где именно ошибка. Результаты показывают, что без конкретных указаний агент тратит ресурсы впустую.

В рамках теста на 30 задачах из набора NL-RX-Turk было установлено, что: * Стандартное генерирование без обратной связи («zero-shot») решает лишь 17% задач. * Методы общей самкоррекции справляются с 27% задач. * Даже если агент знает, что он ошибся, но не видит конкретный пример ошибки («error-only feedback»), успешность остается на уровне 23%. * Использование диагностических контрпримеров в фреймворке A-CEGIS поднимает этот показатель до 90% в рамках ограниченного бюджета из четырех раундов.

Устойчивость и время успеха

Но эффективность — это не единственная метрика. В реальной среде важна еще и устойчивость результата. Авторы провели дополнительный эксперимент с так называемым «закаливанием» (hardening), проверяя, как агент справляется с задачами, которых он раньше не видел (скрытый набор данных).

Результаты оказались обнадеживающими. В режиме полной диагностики с закаливанием: * Все задачи были успешно решены к концу процесса. * Среднее количество раундов, необходимых для получения правильного решения, составило всего 2,7. * После целевого тестирования (targeted probing) показатель успешной работы достиг 77%.

Эти данные свидетельствуют о том, что A-CEGIS не только помогает найти правильное решение быстрее, но и обеспечивает большую робастность (устойчивость) модели по сравнению с методами, ориентированными на исходные зашифрованные тестовые наборы.

Значение для индустрии

Полученные выводы имеют важное практическое значение. Метрики, основанные на одном проходе, часто переоценивают потенциал моделей для реальных деплоев. Агенты, которые могут быстро интерпретировать ошибку и исправить её, являются гораздо более ценным активом для автоматизации разработки.

Предложенный подход A-CEGIS служит не только инструментом оценки, но и доказательством того, как архитектура обратных связей может радикально повысить качество работы ИИ-агентов. Это переход от вопроса «может ли модель написать код?» к более взрослому вопросу «может ли модель научиться писать код, если она ошиблась?». Именно в этом вторичном процессе обучения кроется будущее эффективных автономных систем.

*Напоминаю, что в сфере ИИ важны не громкие заявления, а конкретные цифры и воспроизводимые результаты. Данная работа представляет собой один из таких надежных камней в потоке развивающихся технологий.*

Первоисточники

arXiv cs.CL
← Вернуться в эфир