искусственный интеллект · поисковые агенты · обучение с подкреплением · большые языковые модели · arXiv · Open Source AI7 сентября в 09:32 · 4 мин

Iris: Агенты нового поколения для сложных веб-поисков

Исследователи представили Iris-mini и Iris-pro — новые поисковые агенты на основе больших языковых моделей, которые демонстрируют рекордную эффективность в решении многоэтапных задач. Их уникальность заключается не только в параметрах, но и в методологии обучения, основанной на обратной инженерии данных из структуры веб-гиперссылок и процедуре «ползучего» улучшения через чередование обучения с подкреплением и контролируемого обучения.

Стеклянный шар с волнами над причалом как метафора поиска.

# Iris: Преодоление границ поисковых агентов

В мире искусственного интеллекта поиск информации трансформируется из простого запроса в сложный процесс навигации. Новый артефакт на arXiv представляет два новых агента — Iris-mini (35 миллиардов параметров) и Iris-pro (почти 400 миллиардов параметров). Эти модели позиционируются как лидеры среди открытых поисковых агентов в своих весовых категориях, достигая беспрецедентных результатов на стандартных бенчмарках.

Но что именно отличает Iris от других? Авторы не просто тренировали модель на больше данных. Они пересмотрели саму генерацию обучающего материала, создав систему, где задачи создаются «с нуля» на основе семантической сети веб-страниц, а обучение включает в себя специфический алгоритм чередования методов.

Инженерия задач из структуры веба

Традиционные методы часто опираются на рандомизированные запросы или данные из открытых наборов, что не всегда отражает реальную сложность поиска. Команда, описывающая работу Iris, выбрала другой путь — они обратились к структуре самого интернета.

Процесс начинается с выбора «семенной» веб-страницы. Затем исследователи строят граф сущностей, используя только гиперссылки этой страницы и тех, на которые она ссылается. На основе этого графа вручную создаются цепочки многошаговых рассуждений.

Ключевой момент методологии: каждый неответный сущности в цепочке перепиывается в дескриптивный референс. Это означает, что текст заменяется таким образом, что ответить на вопрос простой строковой поиском (string matching) становится невозможно. Агентам приходится действительно анализировать контекст и связывать фрагменты информации.

Система фильтрует вопросы, принимая только те, которые базовая модель не может решить в закрытом режиме (без доступа к инструментам), но успешно решает, когда предоставляются доказательства. Эти вопросы превращаются в траектории действий, которые затем очищаются на уровне отдельного шага перед обучением с учителем (SFT).

SFT-RL: Алгоритм «ползучей» эволюции

Обучение агента не ограничивается простым копированием правильных ответов. В основе подхода Iris лежит процедура, которую авторы называют SFT-RL climbing (ползучее восхождение).

1. Политика и вознаграждение: Политика принятия решений модели оптимизируется с помощью обучения с подкреплением (RL) против реального поиска. В процессе используется «судья вознаграждения» и суммаризатор наблюдений, работающие внутри кластера обучения. 2. Управление контекстом: Для решения проблемы слишком длинных сессий поиска внедрена возможность прерывать роутинг (поиск) на уровне запроса и возобновлять его с уже сохраненного префикса. Это критически важно для сохранения когерентности при долгих рассуждениях. 3. Чередование этапов: Процесс чередует два состояния. В каждой итерации обучения с подкреплением самые сложные и эффективные траектории отбираются и передаются в следующий этап обучения с учителем (SFT). Таким образом, модель постоянно «подтягивается» на вершины решенных задач, чтобы научиться их решать еще эффективнее.

Важно отметить, что все результаты получены с использованием единого агента ReAct (Reason + Act), без разделения на под-агентов и без тестового времени проверки на этапе вывода. Это упрощает архитектуру, перекладывая нагрузку на качество данных и алгоритм оптимизации.

Результаты и технические детали

Авторы провели тщательное сравнение моделей с и без использования системы управления контекстом во время вывода. Поскольку этот фактор часто влияет на результаты сильнее, чем различия между самими моделями, он был изолирован в анализе.

Использование инструментов управления контекстом привело к значительному росту точности на четырех основных бенчмарках: * BrowseComp: Iris-mini достиг 82.2%, Iris-pro — 88.6%. * BrowseComp-ZH (Китайский): 84.8% и 85.1% соответственно. * DeepSearchQA: 86.9% и 92.9%. * HLE (Hard Logic Evaluation): 52.3% и 56.4%.

Эти цифры являются сильнейшими общими показателями среди открытых поисковых агентов в соответствующих диапазонах параметров. Успех обусловлен не просто мощностью модели, а тем, как она обучалась управлять информацией и последовательностью действий в условиях неопределенности.

Авторы обещают опубликовать не только весовые файлы моделей, но и полную рецептуру построения данных, процесса обучения и методики оценки, что открывает возможность для детального воспроизведения результатов другими исследователями.

В заключение стоит отметить, что Iris демонстрирует, что прогресс в поисковых агентах часто кроется не в увеличении размера модели, а в совершенствовании способа генерации обучающих данных и алгоритмов их усвоения. В эпоху избытка информации именно способность системы эффективно структурировать путь к ответу становится главным конкурентным преимуществом.

Первоисточники

arXiv cs.AI
← Вернуться в эфир