Искусственный интеллект · Большие языковые модели · LLM Harnesses · Оптимизация вывода · Научные исследования · MATH-500 · arXiv 20261 октября в 06:02 · 5 мин

Более программ или больше роллов? Разделение покрытия и специализации в хасснах больших языковых моделей

Новое исследование, опубликованное на arXiv, ставит под сомнение эффективность автоматического создания хасснов (harnesses) для больших языковых моделей (LLM). Авторы работы доказывают, что наблюдаемые улучшения часто являются результатом случайного везения при многократных попытках, а не настоящей специализации алгоритмов на задачах. Статья объясняет методологию проверки и выявленные системные уязвимости.

# Более программ или больше роллов? Разделение покрытия и специализации в хасснах больших языковых моделей

Успехи автоматизации в области искусственного интеллекта часто сопряжены с иллюзией эффективности. Новые результаты исследования, проведенного группой исследователей во главе с Цзян Ян Сю и опубликованного 26 сентября 2026 года на платформе arXiv под идентификатором cs.AI, указывают на фундаментальную проблему в подходах к оптимизации вывода больших языковых моделей. В своей работе «More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses» авторы утверждают, что попытки автоматической генерации хасснов (наборов программных инструментов, управляющих работой модели) часто маскируют случайность за видом специализации.

Проблема ложной специализации

В современной разработке ИИ термин *harness* часто используется для обозначения системы, которая автоматически подбирает или создает стратегии решения для конкретных типов задач. Обещания таких систем заключаются в том, что они смогут выявить скрытые преимущества специализации, позволяя модели решать задачи точнее, чем универсальные алгоритмы.

Однако авторы статьи сталкиваются с парадоксом: дополнительное покрытие ответов (answer coverage) может быть достигнуто не за счет улучшения качества программы, а за счет простой многократной её повторной executions (выполнений). Если одна программа случайным образом решает задачу в нескольких попытках, это может быть ошибочно принято за доказательство того, что программа «специализирована» именно под этот тип вопросов. Это делает невозможным верную идентификацию истинной полезности алгоритма.

Для преодоления этой проблемы исследователи разработали контрольлируемую методику оценки. В центре внимания оказались 386 задач из бенчмарка MATH-500, известных своей сложностью и требовательностью к математическому логическому мышлению. Было проведено прямое сравнение восьми сгенерированных хасснов и базовой модели.

Ключевым моментом эксперимента стала проверка на повторность (repeatability). Каждую программу (и базовую, и сгенерированную) запускали три раза подряд на тех же данных. Это позволило выделить три компонента эффективности: общее покрытие, устойчивые преимущества задач и выигрыш от предварительного отбора. Результат оказался неожиданным для оптимистичных разработчиков: идентичные программы давали в среднем 2,16 процентных пункта «запасных возможностей» (oracle headroom) при усреднении по повторам, что говорит о значительной роли случайности в исходных результатах.

Анализ устойчивых паттернов и слабостей

Детальный анализ выявил, что сгенерированные программы действительно демонстрируют более выраженные и повторяемые паттерны в оценках, однако эти паттерны чаще всего указывают на системные слабости, а не на прогресс.

Из 386 проверенных задач было выявлено, что относительные потери по сравнению с базовой линией сохранялись на всех трех повторных запусках в 100 случаях. Это подтверждает, что на этих задачах программы принципиально неэффективны. Напротив, устойчивые выигрыши были зафиксированы лишь на одной задаче, и даже этот случай оказался чувствительным к методам извлечения ответов, что добавляет еще одну переменную шума в уравнение.

Роль так называемого «замороженного селектора» (frozen selector), который должен выбирать лучшие варианты из заранее обученного пула, оказалась ничтожной: он не принес ни одного процентного пункта улучшения. При этом обе группы алгоритмов (генерированные и базовые) достигли 98,70% теоретического покрытия (oracle coverage) лишь к 27-му запуску хасснов.

Важно отметить, что устойчивое дополнение (stable complementarity), то есть ситуация, когда разные программы идеально дополняют друг друга, так и не было подтверждено при анализе трех повторных запусков. Исследователи полагают, что для доказательства такого эффекта требуются более сложные условия проверки.

Технические следствия и выводы

Для верификации своих утверждений авторы использовали трассировки из проекта BIRD (BIRD - Benchmark for In-Context Reasoning), которые позволили локализовать причины неудач на уровне механизмов реализации, активации нейронов и валидации выходных данных. Это сужает поле поиска ошибок до конкретных узлов программного обеспечения, а не к общим недостаткам архитектуры модели.

Главный вывод работы заключается в том, что покрытие набором задач (coverage) и повторяемость результатов (repeatability) сами по себе не могут служить обоснованием для заявлений о полезной специализации. Настоящая специализация должна быть доказана устойчивостью преимуществ к изменениям в условиях и их полезностью для принятия решений.

Исследование мотивирует создание нового стандарта оценки разнообразия хасснов. Согласно этому стандарту, любые заявленные преимущества задач должны: 1) сохраняться при многократном выполнении; 2) обеспечивать возможность принятия полезных решений; 3) демонстрировать улучшение по сравнению с дополнительными запусками фиксированных программ при сопоставимых бюджетах вычислительных ресурсов (inference budgets).

С точки зрения спокойного наблюдения за развитием технологий, этот вывод напоминает о необходимости скептицизма перед громкими заявлениями о «революционных» подходах. В мире, где алгоритмы способны генерировать тысячи вариантов программ за секунды, разграничение между искусственным интеллектом, который действительно умеет думать, и статистической машиной, которая лишь многократно перепробовала все варианты, становится вопросом выживаемости отрасли. Пока не будет внедрен жесткий стандарт проверки на повторность, любые улучшения будут оставаться под вопросом.

Работа находится на стадии рецензирования и планируется к публикации на конференции ICLR 2027. Исходный код и данные исследования доступны для независимой верификации.

*Примечание автора: В стремлении к автоматизации иногда мы забываем, что случайность — это не ресурс, которым можно управлять, а шум, который нужно гасить. Истинная эффективность должна быть устойчива, как маяк в тумане, а не мерцать подобием света.*

Первоисточники

arXiv cs.AI ↗
← Вернуться в эфир