Микрозадачные ограничения малых языковых моделей в системах агентов
Исследование на arXiv показывает, что готовые малые языковые модели (SLM) не способны выполнить критические микрозадачи, такие как автоматическое утверждение команд или выбор инструментов, без специальной настройки. Ни одна из проверенных конфигураций не прошла строгий бенчмарк, что указывает на необходимость использования простых алгоритмических баз для поддержки ИИ-агентов.
# Тихий маяк в океане микрозадач: почему готовые малые модели пока не готовы к работе агентов
В мире искусственного интеллекта растёт стремление заменить огромные и ресурсоёмкие языковые модели (LLM) на более компактные малые языковые модели (SLM). Идея очевидна: если главная стратегия («планировщик») берёт на себя сложные решения, то рутинные микрозадачи — выбор инструментов, запуск команд, управление памятью — можно доверить недорогим моделям. Однако недавнее исследование, опубликованное на arXiv, ставит под сомнение эту упрощённую схему, выявляя значительный разрыв между ожиданиями практиков и реальными возможностями готовых моделей.
Исследователи Jundong Hu и Shekar Ramachandran задали простой, но болезненный вопрос: способны ли «заводские», не настроенные специально модели достаточного качества для критических микрозадач? Их вывод резок: ни одна из проверенных конфигураций не прошла тесты на пригодность.
Критерии «достойного» поведения
Чтобы оценить пригодность модели, авторы не полагались на субъективное ощущение «качества ответа». Вместо этого они создали жёсткий бенчмарк из четырёх типов микрозадач, каждая из которых имеет чётко определённый порог качества (τ). Эти пороги были установлены с опорой на простые, но надежные небазовые методы, такие как BM25 для поиска, и закреплены с использованием статистических доверительных интервалов.
Это означает, что модель считается «достойной» только если её уверенность в правильности ответа (оцениваемая через верхнюю границу доверительного интервала) превышает заданный порог с высокой статистической значимостью. Такой подход отсекает случайные удачи и требует от модели реальной, доказуемой компетентности в конкретных сценариях.
Разочарование в масштабе
В ходе экспериментов было протестировано четыре модели семейства Qwen3 (0.6, 1.7, 4 и 8 миллиардов параметров) в их наилучшей конфигурации: 16-битная точность, жадный декодинг, один и тот же промпт без доработки. Результат оказался нулевым: из 16 возможных сочетаний «модель + задача» ни одно не смогло преодолеть пороги пригодности. Проверка сырых выходов и поведения парсера подтвердила, что модели либо генерировали бессмысленный текст, либо их ответы не удовлетворяли строгим метрикам.
Ситуация не улучшилась с ростом размера модели. Это указывает на то, что проблема не в нехватке вычислительной мощности самой по себе, а в фундаментальных ограничениях текущих архитектур для выполнения этих специфических функций в условиях «out-of-the-box» использования.
Квантование и поиск решений
Один из популярных способов удешевить модели — квантование (сжатие весов до 4 бит). Исследователи проверили методы RTN, GPTQ и AWQ. К сожалению, квантование только ухудшило результаты: количество пригодных конфигураций осталось нулевым. Повреждение при сжатии зависело от размера модели, но ни одна модель не смогла «вылепить» из 4-битной версии себя достаточного качества для прохождения теста.
Диагностика помогла разделить причины неудач: некоторые провалы связаны с недостатком реальных возможностей модели (capability deficits), а другие могут быть исправлены изменением порога декодирования. Однако ни один из этих рычагов не позволил сделать модели «пригодными» в рамках данного строгого бенчмарка.
В качестве подтверждения результаты повторились на моделях семейства Llama-3.x, где 12 из 12 проверенных конфигураций были признаны непригодными. Кроме того, результат оказался устойчивым к изменению исходных порогов и даже к изменению формулировки промптов: даже при использовании нейтральных перефразирований ни одна модель не смогла доказать свою пригодность.
Практический вывод: гибридный подход
Хотя новости звучат пессимистично, они дают четкое руководство для разработчиков систем на базе агентов. Исследователи рекомендуют не полагаться на SLM как на единственную основу для решения микрозадач.
Вместо этого следует использовать простой базовый метод (например, BM25 или другой алгоритм сравнения документов) в качестве основного фильтра. Малая языковая модель должна применяться только тогда, когда базовый метод не справляется с задачей, выступая в роли доработки или рерайтинга. Пример из статьи показывает, что рерайкер на базе модели размером в 4 миллиарда параметра, работающий поверх отбора BM25, превосходит чистый BM25 на статистически значимые показатели, не требуя при этом самой модели доказывать свою полную пригодность с нуля.
Таким образом, путь к эффективному агентам лежит не через надежду на то, что маленькая модель внезапно станет большой, а через построение надежных цепочек, где каждый элемент выполняет свою роль в строгом соответствии с возможностями. Пока готовые малые модели остаются слишком «неподстроенными» для автономного решения микросценариев вокруг крупных планировщиков, инженерам придется полагаться на комбинации простых алгоритмов и осторожного использования ИИ.