Искусственный интеллект · Большие языковые модели · Машинное обучение · Галлюцинации ИИ · Научные исследования · arXiv · Надежность ИИ28 августа в 14:09 · 4 мин

Собственные сомнения ИИ: свободный метод выявления ошибок в фактологическом ответе

В новой работе, опубликованной на arXiv, исследователи демонстрируют, что крупные языковые модели способны самостоятельно выявлять свои фактические ошибки, используя только внутренние сигналы уверенности, без необходимости дорогостоящего обучения на размеченных данных. Этот подход, требующий лишь тонкой настройки с помощью LoRA, показывает результаты, сравнимые с традиционными методами, что открывает перспективы для более эффективного контроля надежности генеративных систем.

# Когда ИИ сомневается в себе: свободный способ борьбы с галлюцинациями

В эпоху, когда большие языковые модели (LLM) с беспрецедентной естественностью излагают выдуманные истории под видом фактов, вопрос их надежности остается критическим. Новые исследования, представленные на платформе arXiv (cs.CL, ID: 2608.26121), предлагают решение, которое может существенно снизить стоимость обеспечения качества ответов ИИ. Авторы работы доказывают, что модели часто внутренне осознают, когда их знания находятся на шаткой почве, и этот интуитивный сигнал — вероятность ответа — можно использовать как маркер для отсеивания сомнительной информации.

Вместо того чтобы полагаться на огромные наборы данных с метками «правильно» и «неправильно» для обучения модели молчанию, исследователи Ali Asaria, Tony Salomone и Deep Gandhi предложили метод, использующий только собственные оценки уверенности модели. Результаты показывают, что такая «бесплатная» (label-free) стратегия не уступает традиционному обучению по отказу (abstention-tuning) в качестве.

От уверенности к осторожности: как работает метод

Основная идея исследования строится на наблюдении, что даже когда модель генерирует ложный факт, её внутренняя вероятность назначения этому факту часто снижается по сравнению с истинными утверждениями. Авторы формулируют это как способность модели «знать» в моменты неопределенности.

Традиционный подход к решению проблемы галлюцинаций требует создания дорогостоящего датасета, где каждый ответ проверен экспертом или другим моделью и помечен как верный или ошибочный. На этом датасете проводится дообучение, заставляющее модель отвечать «Я не уверен» или отказываться от ответа, когда вероятность ошибки высока. Однако сбор таких данных ресурсоемок.

В предложенном методе команда исследователей применила технику LoRA (Low-Rank Adaptation) для тонкой настройки шестимодельного набора открытых весов (размерами от 1 до 8 миллиардов параметров). Важно отметить, что процесс обучения использовал только сигналы уверенности самой модели. Модель училась отвечать на вопрос только тогда, когда её внутренняя уверенность была высокой, и заявлять о неуверенности («I'm not sure») при низких показателях. Ни один из данных для обучения не содержал меток о фактической правильности ответа.

Для верификации результатов правильность ответов adjudicated (подтверждалась) независимой «судейской» моделью. Это исключает предвзятость в оценке, так как люди или другие системы не участвовали в процессе обучения тестируемой модели.

Почему это работает?

Контрольные эксперименты, где модель дрессировали на сложных примерах для запоминания правильных ответов вместо обучения отказу, не показали улучшения. Это указывает на то, что эффективность метода derives не из механического заучивания правил, а из улучшения калибровки модели. Модель учится лучше соотносить уровень своей уверенности с реальной вероятностью того, что её ответ будет верным.

Результаты: паритет без меток

Исследование охватило широкий спектр моделей различных семейств и размерности. Результаты были впечатляюще сдержанными в своем оптимизме: метод на безметочных данных продемонстрировал статистическую неотличимость от методов обучения с разметкой при сопоставимом охвате ответов.

Это означает, что при одинаковом количестве ответов, которые модель готова дать, качество её знаний и способность отсеивать галлюцинации остаются на том же уровне, что и у моделей, обученных на тяжелых размеченных датасетах. Для индустрии это может означать значительную экономию на инфраструктуре сбора данных и разметке.

Однако исследователи честно указывают на ограничения подхода. Сигнал собственной уверенности имеет одну «слепую зону»: он не может эффективно маркировать случаи, когда модель ошибочно уверена в ложном факте. Если вероятность ответа высока, а фактура неверна, модель всё равно выдаст этот ответ. Тем не менее, в задачах, где требуется фильтрация сомнительной информации (ответы с низкой уверенностью), метод показывает высокую эффективность.

*«Сомнения модели являются почти бесплатной заменой размеченного датасета, когда нужно научить её, когда следует воздержаться от ответа»,* — заключают авторы в абстракте работы.

Это открытие подкрепляет гипотезу о том, что внутри архитектуры современных трансформеров уже заложены механизмы мета-когнитивной оценки, которые ранее игнорировались в пользу внешних систем проверки.

Технические нюансы и дальнейшие шаги

Метод применим к задачам короткоформатного фактологического опроса. Коде и артефактах исследования, включая детали реализации LoRA и конфигурации моделей, авторы выразили готовность предоставить по запросу. Это подчеркивает акцент на воспроизводимости и открытости, характерный для сообщества машинного обучения.

Работа вносит важный вклад в область машинного обучения, предлагая более доступный путь к созданию надежных систем. Вместо того чтобы тратить ресурсы на поиск истины извне, мы учим модели слышать собственный сигнал тревоги. В мире, где ИИ генерирует контент в промышленных масштабах, умение системы сказать «я не знаю» часто ценнее, чем способность генерировать длинный текст с высокой вероятностью ошибок.

Первоисточники

arXiv cs.CL
← Вернуться в эфир