Artificial Intelligence · LLM Agents · Self-Improvement · Reflective Tasks · Long-Horizon Planning · Machine Learning · arXiv · Qwen3.82 октября в 05:32 · 3 мин

AREX-2: Как долгосрочное саморефлексивное обучение превращает LLM в самоулучшающихся агентов

Новое исследование, представленное в arXiv под названием AREX-2, предлагает путь к созданию языковых моделей, способных к итеративному самосовершенствованию во время выполнения задач. Авторы демонстрируют, что агент на базе архитектуры Qwen3.8-27B, обученный на синтетических данных длительных траекторий улучшения в области машинного обучения и программирования, значительно превосходит предыдущие решения в глубоких исследовательских и алгоритмических задачах.

# AREX-2: От линейного ответа к непрерывной итерации

В мире искусственного интеллекта переход от статичных моделей, дающих один ответ на один запрос, к агентам, способным самостоятельно улучшать свои решения в процессе работы, является одним из ключевых вызовов эпохи. Новое исследование, доступное на платформе arXiv, предлагает конкретный технический путь к решению этой проблемы. Работа авторов под заголовком «AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks» фокусируется не на увеличении объема данных обучения на огромные масштабы, а на качественном изменении характера самого процесса обучения.

Центральной идеей исследования является определение способности к самосовершенствованию не как мистического свойства, а как совокупности двух конкретных механизмов: рефлексии и долгосрочного исполнения.

Архитектура самосовершенствования: Рефлексия и Длительность

Авторы четко разграничивают теоретический аппарат самосовершенствования. Они определяют это как способность модели итеративно уточнять решение во время тестирования. Этот процесс опирается на два столпа:

1. Рефлексия (Reflection): Способность модели критически оценить свое текущее решение и сгенерировать версию, которая лучше предыдущей. Это не просто исправление ошибок, а активная оптимизация результата. 2. Долгосрочное исполнение (Long-Horizon Execution): Умение сохранять фокус и эффективность в процессе многократных итераций. Многие модели склонны терять нить размышлений при длинных цепочках, но AREX-2 разработан для устойчивости в таких сценариях.

Гипотеза авторов заключается в том, что эти навыки являются доменно-агностичными. То есть, не обязательно обучать их на узкоспециализированных данных конкретной области. Достаточно найти среду, где возможен верифицированный отклик и поощрение за настойчивое повторение попыток.

Синтетические данные как двигатель прогресса

Вместо традиционного сбора данных из интернета, авторы выбрали подход синтеза. Они создали траектории улучшений в двух четко определенных областях: машинное обучение и алгоритмическое программирование. Выбор этих сфер продиктован необходимостью наличия четкой, объективной системы вознаграждения (feedback) и возможности математически или логически проверить, улучшилось ли решение по сравнению с предыдущим.

В ходе эксперимента агент, построенный на базе модели Qwen3.8-27B, подвергся обучению на этих синтетических данных. Результатом стало формирование модели, способной не просто знать факты, а «прорабатывать» сложные задачи, постепенно приближаясь к идеальным решениям через серию собственных попыток и самокоррекции.

Результаты в глубоких исследованиях и логике

Тестирование показало впечатляющую эффективность подхода AREX-2. Агент продемонстрировал сильные результаты в узкоспециализированных бенчмарках, требующих глубокой логики и программирования: * MLE-bench Lite: 81.8 баллов. * Frontier-CS: 70.7 баллов.

Особенно интересен перенос этих навыков на задачи глубоких исследований и поиска информации. Агент успешно адаптировался к тестам, имитирующим работу исследователя: * BrowseComp: 84.0 балла. * GAIA (General Artificial Intelligence Assessment): 92.2 балла. * DeepSearchQA: 93.8 балла. * HLE (Human-level Expertise): 52.6 балла.

Важнейшим выводом работы является то, что производительность агента не застывает на одном уровне; она продолжает расти по мере увеличения бюджета вычислений и количества разрешенных раундов саморефлексии. Это подтверждает работоспособность гипотезы о том, что долгосрочные отраженные данные являются эффективным маршрутом к созданию по-настоящему автономных интеллектуальных систем.

*Если представить процесс обучения как путь в тумане, то большинство агентов видят лишь один шаг вперед. AREX-2 же, подобно маяку в ночи, позволяет проследить длинную цепочку решений, где каждое последующее действие строится на осмысленном анализе предыдущего.*

Таким образом, AREX-2 демонстрирует, что путь к более совершенному ИИ лежит не только в увеличении параметров модели, но и в изменении парадигмы взаимодействия с задачами, превращая разовые ответы в начало непрерывного процесса улучшения.

Первоисточники

arXiv cs.AI ↗
← Вернуться в эфир