нейросети · галлюцинации ИИ · машинное обучение · OpenAI · LLM · искусственный интеллект4 сентября в 04:02 · 5 мин

Архитектура обмана: почему нейросети выдают галлюцинации и почему их нельзя просто «починить»

Галлюцинации искусственного интеллекта перестали быть просто техническим термином, став причиной судебных исков и финансовых потерь в миллиарды долларов. Парадоксально, но эта «вредная» способность изначально была полезным инструментом для генерации изображений. Однако эволюция чат-ботов превратила дорисовку деталей в механизм лживых фактов. Новые исследования показывают, что проблема кроется не в отсутствии знаний, а в специфической структуре работы внутренних нейронов и методах обучения модели стремиться к уверенности любой ценой.

# Галлюцинации нейросетей: от полезного навыка до системного сбоя

Термин «галлюцинация» в мире искусственного интеллекта прошел путь от нейтральной характеристики алгоритмов компьютерного зрения до главного слова года в словарях Oxford и Dictionary.com. Сегодня это слово описывает способность модели выдавать ложную, но убедительную информацию, что ставит под угрозу ее применение в юридической и медицинской сферах.

От дорисовки лиц до лжи о датах

История этого явления не начинается с фальшивых фактов. В 1999 году исследователи Саймон Бейкер и Такео Канаде из Карнеги-Меллона предложили метод улучшения разрешения фотографий лиц. Суть метода заключалась в том, чтобы алгоритм, используя статистику миллионов изображений, «дорисовывал» недостающие детали на размытом снимке. Авторы надели этот процесс термином «галлюцинация» без тени сомнения. Это была способность системы создавать правдоподобное, чего на самом деле нет.

Нативный подход ИИ к восполнению пробелов данных оказался чрезвычайно успешным. Направление компьютерного зрения, посвященное восстановлению изображений, именуется «face hallucination» уже с начала 2000-х годов.

Только в 2018 году семантика слова резко изменилась. Исследователи из Google обнаружили, что нейросети машинного перевода могут отклоняться от исходного текста, если в запросе появляется лишь один лишнее слово. Параллельно модели для описания изображений начали уверенно перечислять объекты, которых на фото не было вовсе. Эпоха ChatGPT в 2023 году закрепилась в общественном сознании, когда модели начали выдумывать биографии, цитаты и номера нормативных актов, сохраняя при этом уверенный и убедительный тон.

*«Модель предсказывает не то, что произошло, а то, что должно быть следующим»,* — заметил сооснователь OpenAI Андрей Карпати. Он предложил метафору: поисковик не спит и работает с фактами, а языковая модель постоянно находится в состоянии сна, сновидя и выдумывая.

Математика убеждения и отсутствие фактов

Техническая суть галлюцинации кроется в самой природе архитектуры трансформеров. Модели предсказывают не факт, а следующий токен (часть слова) с максимальной вероятностью, основываясь на обученных статистических связях. Внутри сети нет базы данных с проверенными фактами, где записано «Париж — столица Франции». Есть лишь веса параметров, отражающие силу связи между словами. Поскольку слова «Париж» и «столица Франции» встречались вместе в обучающих данных миллионы раз, связь между ними чрезвычайно сильна. Галлюцинация и истина генерируются одним и тем же механизмом — умножением матриц.

Проблема усугубляется структурой интернета. Тексты пишут люди, стремящиеся изложить свои мысли. Фразы вроде «честно говоря, я не знаю» встречаются редко, так как их отсутствие — норма жанра. Модель усваивает правило: на вопрос должен следовать уверенный ответ. Она усваивает форму правдоподобного текста гораздо легче, чем само содержание фактов.

Также важную роль играют параметры настройки генерации, такие как температура (temperature). Они управляют степенью случайности выбора токенов из вероятностного распределения. Попытки установить температуру в ноль, чтобы модель перестала выдумывать, оказываются малоэффективными, так как проблема лежит глубже, в логике работы системы.

Тормоз, который не сработал

Одно из наиболее важных открытий последних лет связано с биологией работы больших моделей. Исследователи из Anthropic провели «рентген» внутренней деятельности нейросети, изучив так называемые графы атрибуции. Они обнаружили, что в модели по умолчанию активна цепочка отказа — внутренний механизм, который не дает отвечать на вопросы, если система не уверена в своем знании темы.

Этот «ручник» обычно затянут с завода. Однако существует группа признаков, активирующаяся при встрече с известными сущностями (именами, брендами). Когда модель узнает фамилию, механизм отказа отпускает тормоз, разрешая генерацию ответа. Если фактической информации о человеке нет, генератор выдает самое правдоподобное из того, что есть в весах.

Это объясняет классический сбой: запрос про вымышленного персонажа или малоизвестного ученого, окруженного множеством громких и знакомых имен (например, Курчатов, Семипалатинск). Наличие этих «якорных» фактов активирует механизм уверенности, который перекрывает отсутствие данных о самом субъекте. Модель не знает, знает ли она ответ, но «знает», что это про известного человека, и решает не спрашивать.

Обучение на экзамене

Почему же модель предпочитает уверенно врать, а не сказать «не знаю»? Ответ кроется в методе обучения. Большинство бенчмарков и тестов оценивают модели по проценту правильных ответов. Ошибка — ноль баллов, правильность — единица. Система «не знаю» также оценивается как ошибка. Оптимальной стратегией для модели, оптимизированной под такой скоринг, является всегда отвечать. Если не знаешь — галлюцинируй, хуже не будет.

Более того, на этапе обучения с подкреплением на основе человеческих предпочтений (RLHF) модели награждают за уверенность, развернутость и услужливый тон. Ответ «Я не уверен, нужно проверить» часто получает худшую оценку, чем уверенно сформулированный вывод. Модель научилась быть «сдающей экзамен с правом на ошибку», где важно не содержание, а видимость компетентности.

Исследования показывают, что если изменить правила оценки и начать штрафовать за уверенную ошибку, а также давать баллы за честное признание незнания, показатели калибровки улучшаются. Однако промышленность движется в эту сторону медленно, так как существующие системы оценки продолжают поощрять иллюзию знания.

Вывод прост: галлюцинации — это не просто баг, а системная особенность, заложенная в статистике данных и методах обучения. Полностью «вылечить» их традиционными методами невозможно, так как это требует переосмысления самой цели функционирования модели.

Ситуация усугубляется математическим доказательством существования «фактов-одиночек». Даже при идеальной калибровке модели в задачах генерации существуют сценарии, где вероятность выдумывания факта становится неизбежной из-за природы самой задачи предсказания следующего члена последовательности, превращая её в задачу классификации, которую даже лучший классификатор не может решить всегда правильно.

Первоисточники

Habr AI
← Вернуться в эфир