искусственный интеллект · агенты ИИ · бенчмарки · оценка моделей · Harbor-Index · архитектура оценки · GPT-5.5 · открытые данные7 сентября в 08:32 · 3 мин

Инфраструктура Harbor и метанабор Harbor-Index: новый стандарт для тестирования агентов ИИ

С ростом сложности языковых моделей, способных автономно выполнять задачи, традиционные методы их оценки утратили актуальность. Исследователи представили Harbor Adapters — унифицированную инфраструктуру, позволяющую адаптировать более 80 существующих бенчмарков для тестирования любых агентов, и Harbor-Index — специальный набор из 82 сложных задач, призванный выявить реальные пределы возможностей текущих систем. Результаты показывают, что даже передовые конфигурации моделей с текущим кодом проходят менее 30% задач в этой новой выборке.

Прозрачная спираль из льда и стекла с вихревыми потоками данных на фоне тёмного подводного архива.

# Harbor Adapters и Harbor-Index: новые инструменты для оценки агентов

В эпоху быстрого развития искусственного интеллекта проблема оценки производительности автономных агентов становится все более острой. Традиционные стандарты тестирования часто не успевают за темпами развития моделей, требуя сложных интеграций и специфических сред исполнения. Авторы новой работы, опубликованной в arXiv, предлагают фундаментальное решение для этой проблемы, создав как универсальную платформу для адаптации бенчмарков, так и тщательно отобранный набор задач для стресс-тестирования систем.

Универсальная инфраструктура Harbor Adapters

Основной проблемой текущей экосистемы является фрагментация инструментов оценки. Каждая новая модель или платформа часто требует разработки собственных скриптов для прохождения тестов. Группа исследователей решила эту дилемму с помощью Harbor Adapters — модульной инфраструктуры, разработанной для унификации процесса оценки.

Эта система позволяет переносить логику более 80 различных бенчмарков в единый формат, совместимый с любыми агентами. Важным этапом разработки стало не просто механическое перенесение кода, а проведение rigorous code review (строгого кодаудита) и parity experiments (экспериментов на идентичность результатов). Это гарантирует, что переход на новую платформу не исказит итоговые показатели эффективности модели.

Для масштабных испытаний команда протестировала восемь моделей, охватывающих разные уровни компетенций. Каждую модель запускали в двух режимах: с использованием Terminus-2 (унифицированного интерфейса) и с тремя различными нативными харнессами (средствами исполнения). Такой подход позволил получить более полную картину как о capabilities (возможностях), так и о failure modes (сценариях сбоев) агентов.

*Интересно наблюдать, как индустрия движется от оценки отдельных моделей к созданию общей «метрологии» — единого стандарта измерений, подобно тому как в физике существуют эталонные условия.*

Harbor-Index: фильтр для поиска реальных пределов

Если Harbor Adapters решает проблему совместимости, то Harbor-Index ставит целью выявить настоящие границы возможностей. Это не просто агрегация существующих тестов, а вручную курируемый метанабор. Исследователи отфильтровали задачи из адаптированного набора, оставляя только те, что признаются сложными, разнообразными и качественными.

Процесс отбора был многоступенчатым: задачи подвергались фильтрации по сложности, затем прошли аудит с помощью ИИ, а затем — человеческий аудит. Завершающим этапом стал цикл audit-and-fix (аудит и исправление), где выявленные ошибки в заданиях были устранены для обеспечения честности теста.

В результате был создан набор из 82 задач, охватывающих 29 различных бенчмарков. Ключевой особенностью Harbor-Index является то, что он сохраняет широту масштабных оценок, но остается экономически эффективным для запуска. Важно отметить, что этот набор настроен так, чтобы быть трудным даже для сильных систем.

Результаты: 30% порог как новая реальность

Эмпирические данные, полученные при тестировании на Harbor-Index, показывают поразительно стабильный результат. Ни одна из протестированных конфигураций моделей и средств исполнения не смогла преодолеть уровень пропускной способности в 30%. Даже самая сильная рассматриваемая конфигурация (GPT-5.5 в связке с Codex) достигла лишь 28.0% успеха.

Этот факт свидетельствует о том, что текущее поколение агентов сталкивается с фундаментальными трудностями при решении широкого спектра задач, даже тех, которые формально относятся к их области компетенции. Harbor-Index, таким образом, становится важным инструментом для разработчиков, позволяющим не переоценивать возможности моделей и фокусироваться на устранении конкретных видов слабостей.

Все компоненты проекта — адаптеры, результаты оценки и подробный анализ — были опубликованы как open-source артефакты. Это решение поддерживает сообщество исследователей, стремящихся к более надежной и всесторонней оценке агентов на основе фактических данных, а не маркетинговых заявлений.

Первоисточники

arXiv cs.AI
← Вернуться в эфир