метакогниция · LLM · prompt engineering · Anthropic · Claude · искусственный интеллект · interpretability23 сентября в 08:32 · 3 мин

Метакогниция как инженерный инструмент: как психология 1970-х улучшает работу с ИИ

Современный подход к работе с искусственным интеллектом эволюционирует от простого генерирования ответов к оценке границ знаний системы. Инженеры Anthropic и исследователи используют концепции метакогниции, впервые сформулированные психологом Джоном Флавеллом ещё в 1979 году, чтобы создавать более надежных агентов. Вместо того чтобы требовать от модели мистического самосознания, разработчики внедряют протоколы, позволяющие выявлять скрытые пробелы в контексте до начала выполнения задачи.

# Метакогниция как инструмент повышения надежности ИИ-агентов

Проблема неизвестного неизвестного

В работе инженера Anthropic Тарика Шихипара, описанной на платформе VC.ru, выделяется фундаментальная трудность при передаче задач ИИ. Задача делится на четыре категории: то, что мы знаем точно; то, что знаем, но не формулируем явно; то, о существовании чего мы подозреваем, но не знаем деталей; и, наконец, то, о существовании чего мы даже не догадываемся (unknown unknowns). Последняя категория представляет наибольшую сложность, так как невозможно добавить в инструкцию информацию, о существовании которой пользователь не имеет представления. Традиционный подход к prompt engineering часто ограничивается уточнением известных параметров, упуская из виду системные риски, которые пользователь мог не заметить.

От психологии 1970-х к современным моделям

Концепция оценки собственного знания берет начало в работах американского психолога Джона Флавелла. В 1979 году он опубликовал исследование о метакогнитивном мониторинге и контроле. Если когнитивная задача — это сам процесс решения (например, вспомнить столицу страны), то метакогнитивная — это оценка процесса («Я, кажется, путаю Канберру и Сидней, мне нужно проверить»). Для человека это способность наблюдать за собственным мышлением и корректировать поведение при обнаружении проблем.

В 2022 году команда Anthropic изучала, способны ли языковые модели наподобие этого оценивать правильность своих ответов. Исследование "Language Models (Mostly) Know What They Know" показало, что модели действительно могут различать надежные и ненадежные ответы, однако эта способность плохо переносится на новые задачи без соответствующей калибровки. Числовая уверенность модели (например, «93%») не является объективным измерителем истины сама по себе.

Протокол blind spot pass и управление неопределенностью

Для решения проблемы unknown unknowns инженерное сообщество предлагает метод "blind spot pass" (проход для выявления слепых зон). Перед началом выполнения сложной задачи агент должен сначала проанализировать её постановку. Процесс включает:

1. Фиксацию явно указанных фактов и ограничений. 2. Выявление вопросов, ответы на которые неизвестны, но могут изменить решение. 3. Перечисление предположений, сделанных из-за отсутствия контекста. 4. Поиск скрытых рисков, требований или ограничений, о которых пользователь мог не подумать.

Этот подход трансформирует метакогницию из психологической метафоры в инженерный механизм управления неопределенностью. Вместо того чтобы ждать идеального промпта, создается цикл обратной связи, где система обнаруживает ситуации нехватки данных и предлагает способы их заполнения (запрос у пользователя, поиск источника, тестирование кода или фиксированное обратимое предположение).

Границы между функциональностью и сознанием

Важно отличать функциональную способность модели сообщать о своей неопределенности от человеческого самосознания. Исследования в области интерпретируемости (mechanistic interpretability) показывают, что внутри архитектуры трансформеров нет «маленького психолога». Мы наблюдаем внешнее поведение и внутренние механизмы, которые в определенных условиях позволяют системе имитировать осознание границ знаний.

Для инженера это достаточно. Если система способна классифицировать неопределенность, выбрать политику действий и обновить состояние контекста, она выполняет функцию метакогнитивного контроллера. Главный вывод этого подхода заключается в изменении фокуса: вместо вопроса «Каков правильный ответ?» следует искать ответ на вопрос «Что должно быть известно, чтобы этот ответ мог быть правильным?».

Первоисточники

Habr AI
← Вернуться в эфир