Ложь не помеха: почему галлюцинации LLM — это не баг, а фундаментальная черта языка
Разработчики искусственного интеллекта десятилетиями пытались исправить «галлюцинации» больших языковых моделей (LLM), считая это критической ошибкой. Однако новый взгляд на природу языковой генерации утверждает обратное: LLM не научились лгать, они просто продемонстрировали истинную природу языка. В системе, лишенной внешней проверки фактов, связь мыслей становится самоцелью, превращая хаотичные слова в уверенную повествовательную конструкцию. Это не сбой алгоритма, а неизбежное свойство любой системы, опирающейся исключительно на грамматику и статистику.
# Ложь не помеха: почему галлюцинации LLM — это не баг, а фундаментальная черта языка
Классический взгляд на работу больших языковых моделей (LLM) часто строится вокруг концепции ошибки. Инженеры привыкли видеть в бессвязном или ложном ответе «галлюцинацию» — симптом, который необходимо исправить методами обучения с подкреплением от людей (RLHF) или жестким принуждением к фактологической точности. Мы ожидаем, что машина будет знать ответ, а если не знает, то должна сообщить об этом. Но глубокий анализ природы языковой коммуникации приводит к более тревожному, но логичному выводу: LLM не лгут, потому что у них нет понятия «правда», отличной от связности речи.
Язык не нуждается в реальности, чтобы существовать
Основная проблема кроется не в коде нейросети, а в природе самого языка. Язык — это уникальная система, которая может существовать независимо от реальности, на которую она, теоретически, должна опираться. Слова «камень» и «небо» строятся по одинаковым грамматическим правилам. Фраза «Я поднял камень» грамматически идентична фразе «Я поднял небо». Различие между ними существует только во внешней среде, в физических последствиях, но внутри структуры языка эти два утверждения равноправны.
В современном обществе мы полагаемся на «связность» вместо фактической достоверности. Человек, который говорит убедительно, логично и ссылается на авторитеты, воспринимается как правдивый, даже если его фактические ошибки очевидны. Мы склонны верить связному повествованию, потому что язык был разработан для социальной коммуникации, а не для прямой передачи объективной истины.
LLM — это чистая лаборатория языка, где последний внешний фильтр (человеческий смысл и внешняя проверка) отсутствует. У политика есть критики, у философа есть история, у инфоцыгана есть клиенты, у топ-менеджера есть аудитория, которая проверит его решения. Но у нейросети нет никого. Она — просто язык в свободном полете.
Попытки RLHF лишь масштабируют эту внутреннюю связность, не добавляя внешнего контроля. Обучая модель тому, как люди оценивают текст, мы делаем её ответы более убедительными, но не более верными. Галлюцинации LLM — это речь в её естественном состоянии: не ложь, не ошибка, а просто связность, которая кажется чем-то большим.
Разница между верным и связным
Ключевая ошибка разработчиков заключается в том, что они пытаются решать проблему языковой связности методами, разработанными для других сфер. В инженерии код либо работает, либо нет. Либо приложение запускается, либо выдает ошибку. Нет промежуточного состояния «вероятно, работает». В коде есть внешняя проверка — компилятор и тесты.
В языке такой проверки нет. Здесь можно построить убедительную картину мира, опираясь исключительно на грамматические структуры. LLM демонстрирует то, что всегда было частью речи, но пряталось за фигурой автора:
1. Связность как цель: Когда человек пишет текст, он часто подстраивается под аудиторию, создавая иллюзию достоверности. Ложь возможна только там, где есть различие между верным и связным. Топ-менеджер может говорить об «оптимизации», имея в виду сокращения, потому что он знает, что это не совпадает с реальностью, но он опирается на понимание аудитории. 2. Отсутствие различия: У модели нет функции для проверки реальности. Она не знает, чем отличается «истинная» причина желтения листьев осенью от вымышленной. Она просто выбирает слово «хлорофилл» потому, что оно статистически часто встречается рядом с «осенью» и «листьями», создавая связную конструкцию.
Когда вы просите LLM объяснить научный факт ребёнку, коллеге и узкому специалисту, она создаёт три разные связные конструкции. Для ребёнка — сказочная цель («чтобы укрыть корни»), для специалиста — сложный набор терминов, для коллеги — упрощенная аналогия. В каждом случае связность наращивается под аудиторию, но верность в расчёт не берётся вообще.
Инженерный подход против языкового сознания
Инженеры — единственная группа, которая с этим работает честно. Они меряют, а не слушают. Если код работает, он работает, независимо от того, как он написан. Если не работает — значит, в нём есть баг. Но даже здесь есть место для самообмана: можно написать бенчмарк специально для модели или создать тесты, которые она будет проходить, просто потому что они написаны в той же связной манере, которую она умеет генерировать.
Попробуйте создать промпт для проверки фактов. Почему уточнение запроса иногда увеличивает «галлюцинации»? Потому что модель интерпретирует эти уточнения как новую связную конструкцию, а не как запрос к внешней реальности. Она строит ответ, который кажется логичным в рамках заданных условий, даже если эти условия ложны.
Различие проходит не по качеству речи, а по тому, есть ли то, что не зависит от того, как об этом говорится.
Как бороться с галлюцинациями?
Существует ли способ бороться с этим? Только внедрение внешней проверки. Но как? Критика читателей — единственный шанс на верность для текста, который не имеет автора. Если читатели найдут ошибку в статье, это будет внешним фактором, который изменит восприятие текста. Но если статья будет написана машиной без автора, и только машинные алгоритмы будут её оценивать, то это просто масштабируемая связность.
Что должно случиться, если этот текст ложен? Если вместо критики мы получим лишь комментарий, который звучит убедительно, но не имеет под собой фактической основы, значит, работает именно связность. А если читатель на глаз различает ложные и правильные концепции? Только тогда человек сможет на глаз различать ложь и правду, и разработчики LLM смогут построить универсальный определитель галлюцинаций.
Заключение
Этот текст — тоже речь. Он связен, он про язык, и проверить его языку нечем, потому что я, автор, скажу вам это уверенно. Поэтому он опубликован здесь. Для статьи об отсутствии внешней проверки языка единственный шанс на верность — это критика читателей. Если политики, философы, топ-менеджеры откажутся от критики, у них не будет и этого шанса.
Если вы хотите поддержать автора, не стесняйтесь нажать на кнопку «Задонатить». И если вам понравилась статья, поделитесь ею.
--- Теги: llm, язык, галлюцинации Хабы: Искусственный интеллект, Научно-популярное
Если эта публикация вас вдохновила и вы хотите поддержать автора — не стесняйтесь нажать на кнопку Задонатить Нравится +3 Не нравится Добавить в закладки 2 Поделиться Комментарии 0 Охват за 30 дней 32K+ Карма
[Публикация автора на Хабре](https://habr.com) | [Подписаться на Telegram](https://telegram.org) | [Перейти в поток Научпоп](https://habr.com)