искусственный интеллект · большие языковые модели · когнитивная наука · бенчмарки · архив arXiv · оценка моделей · методология29 июля в 10:01 · 3 мин

CogArena: Почему тесты когнитивных способностей больших языковых моделей не так надежны, как мы думаем

В сфере искусственного интеллекта набирает популярность практика оценки больших языковых моделей (LLM) через призму когнитивных способностей, аналогичных человеческому интеллекту. Исследователи стремятся создать профили навыков, которые были бы универсальными и теоретически обоснованными. Однако новое исследование, представленное в предпечатной версии на arXiv под названием CogArena, бросает вызов этим упрощениям. Авторы проекта предложили строгий многометодный анализ, включающий проверки на перенос данных и устойчивость к вмешательствам. Результаты показывают, что многие из ожидаемых закономерностей не выдерживают критики при проверке на независимых данных, указывая на то, что текущие пятифакторные профили способностей могут быть не настолько стабильны, как считалось ранее.

# CogArena: Критический взгляд на структуру когнитивных способностей ИИ

В последние годы сообщество исследователей искусственного интеллекта активно занимается квантификацией умственных способностей больших языковых моделей (LLM). Суть этого движения заключается в попытке создать для моделей профиль способностей, похожий на тесты IQ у людей. Идеал заключается в том, чтобы эти оценки были стабильными, независимо от того, на каких конкретных задачах они измерялись, и чтобы они действительно отражали фундаментальные когнитивные процессы, такие как память или логику, а не просто знание фактов в датасете.

Методология многометодной проверки

Центральным элементом данного исследования стал проект под названием CogArena. Это процедурно сгенерированный бенчмарк, состоящий из 13 различных парадигм. Ученые не просто дали модели тесты, а применили сложный рамок оценки. Их цель — понять, когда стоит присваивать моделим конкретные теоретические метки (например, «высокая логика» или «хорошая вербальная память»).

В рамках исследования были проанализированы 55 открытых моделей с открытыми весами. Исследователи искали корреляции между различными задачами в рамках пяти теоретически мотивированных групп. Результаты оказались неоднозначными: хотя почти все корреляции оказались положительными, общие оси объясняли лишь около половины дисперсии результатов. Это означает, что значительная часть различий в поведении моделей остается необъясненной упрощенными теоретическими конструктами.

Проблемы при переносе и вмешательств

Особое внимание уделялось вопросу переноса. Если обучение модели по одной методике действительно отражает общий интеллект, то улучшения должны сохраняться на новых данных, на которых модель не обучалась специально. Исследователи провели отдельное «замороженное» перекрестное исследование, в котором проверялись 12 моделей из шести семейств.

Были применены целевые скелеты (scaffolds) — специальные инструкции или условия, призванные улучшить конкретные типы задач. Как и ожидалось, наблюдалась небольшая выгода от совмещения подходов, однако ни одно из конкретных контрастов выдержало исправление на множественные тесты. Более того, селективность методов не улучшала способность предсказывать результаты на моделях из семейств, которых не касались при обучении.

Это привело к тому, что критерий подтверждения на замороженных данных не прошел. Попытки воспроизвести результаты с помощью альтернативных формулировок вопросов пост-фактум также показали меньшие положительные оценки и не прошли проверку на строгость.

Границы текущего понимания

В конечном итоге, результаты исследования поддерживают вывод о границах наших текущих знаний. Теоретически выровненные промпты действительно вызывают небольшую диагональную тенденцию внутри батареи тестов, что подтверждает наличие определенной согласованности. Однако существующих доказательств недостаточно, чтобы утверждать, что профили из пяти измерений являются стабильными сущностями.

Проект CogArena предлагает рабочий процесс, который объединяет поведенческие сигнатуры, ковариацию, совпадающие вмешательства и прогнозирование вне семьи моделей перед тем, как когнитивные метки будут прикреплены к рейтингам моделей. Это важнейший шаг к более честной оценке. Пока мы не будем применять более строгие критерии, рисование красивых графиков «когнитивных профилей» остается преждевременным. Наука требует терпения, и в мире быстро меняющихся технологий важно не опережать доказательства.

*«Теория-aligned prompting produces a small in-battery diagonal tendency, but the present evidence does not establish stable five-dimensional profiles»* — так авторы резюмируют свое открытие. Это напоминает нам, что за фасадом сложных алгоритмов скрывается гораздо больше нюансов, чем позволяет уловить упрощенная шкала.

Первоисточники

arXiv cs.CL
← Вернуться в эфир