LLM · RAG · галлюцинации · память агентов · машинное обучение · интерпретируемость ИИ3 октября в 13:02 · 4 мин

Контроллер доверия: новый предохранитель для памяти ИИ-агентов

Инцидент с чат-ботом мэрии Нью-Йорка, выдававший опасные юридические советы, обнажил фундаментальную проблему систем RAG: язык-модель не умеет отличать верные факты от устаревших данных в контексте поиска. Команда из Тяньцзиньского технологического университета предложила решение в виде слоя принятия решений (MDL), основанного на нейрофизиологических принципах, который позволяет агенту самостоятельно оценивать надежность найденной информации перед генерацией ответа.

# Контроллер доверия: как заставить ИИ отличать правду от заблуждений

История с чат-ботом MyCity, запущенным мэрией Нью-Йорка в 2024 году, стала наглядным примером рисков внедрения искусственного интеллекта в сферу публичных услуг. Агент, созданный для помощи малому бизнесу, интерпретировал правила нелогично, выдавая рекомендации, которые грозили предпринимателям судебными исками и штрафами. Например, он советовал увольнять сотрудников за жалобы на харассмент или не выплачивать полную сумму чаевых. При этом правильные данные в базе знаний бота присутствовали, но находились рядом с устаревшими инструкциями.

Суть проблемы заключалась в архитектуре стандартного поиска с дополнением генерации (RAG). В классической схеме модуль поиска находит документы, релевантные запросу, и подает их языковой модели в качестве контекста. Модель генерирует ответ, опираясь на этот текст, но у нее нет внутреннего механизма для верификации достоверности источника. Если в поисковой выдаче есть противоречивая информация, модель, даже не зная, какой вариант верен, может выбрать любой из них с одинаковой вероятностью, создавая «галлюцинации».

От нейробиологии к коду: архитектура MDL

Разработчики, в частности команда Тяньцзиньского технологического университета, предложили решение, вдохновленное исследованиями префронтальной коры мозга макаки-резуса. Эксперименты показали, что при принятии решений мозг обезьян не полагается на один сигнал «силы» воспоминания. Вместо этого независимые группы нейронов анализируют разные аспекты: длительность удержания памяти, результаты прошлых попыток и уровень возбуждения. Только когда эти потоки сливаются, формируется управляющий сигнал о действии.

Исходя из этого, инженеры создали слой принятия решений о памяти (Memory Decision Layer, или MDL). Вместо того чтобы сводить все оценки к одному числу сразу, система вычисляет три отдельных сигнала, которые встречаются только на финальном этапе. Это похоже на три независимых канала связи, где наводки на один не влияют на другие. Каждый канал отвечает за свой аспект документа:

* Релевантность (M): Насколько документ соответствует смыслу запроса (обычно вычисляется через косинусное сходство векторов). * Надежность (R): Содержит ли документ внутренние противоречия. Специальный детектор ищет антонимичные пары и отрицания, снижая показатель надежности, если текст спорит сам с собой. * Риск задачи (A): Насколько критична ошибка в данной теме. Темы права, медицины и финансов автоматически получают высокий коэффициент риска (0,70 и выше).

Математика доверия и ограничения метода

Ключевая особенность MDL — использование математической ортогональности. Три вектора оценивания расходятся в независимых подпространствах через QR-декомпозицию. Это означает, что высокая релевантность документа не может скрыть его низкую надежность или высокий риск. Система анализирует эти параметры геометрически, а не семантически, и лишь затем вычисляет итоговый порог доверия. Если уверенность падает ниже определенного уровня, агент отказывается давать ответ и сообщает о сомнениях.

Тесты показали внушительные результаты. В условиях, когда в памяти агента смешаны верные факты и популярные мифы, обычный RAG ошибается в 53% случаев, тогда как контроллер MDL снижает эту цифру до 23,3%. На высокочувствительных запросах система вообще не допускает ошибок, если документ конфликтует с другими данными.

Однако у метода есть существенные ограничения. Его эффективность сильно зависит от базовой модели. На слабых моделях выигрыш очевиден, но на мощных архитектурах (например, DeepSeek-V4-Flash) разница между обычным RAG и RAG с контроллером становится незначительной, уходя в пределы статистического шума. Более того, в самых критичных сценариях — когда документ выглядит убедительно и релевантно, но несет высокий риск — точность контроллера падает до 55,6%. В таких ситуациях система иногда хуже справляется, чем простая вероятность.

Интересно отметить, что традиционные обучаемые алгоритмы, такие как логистическая регрессия или градиентный бустинг, применяемые к тем же трем сигналам, демонстрировали точность на 2–3% выше, чем геометрический контроллер.

Итог: быстрый предохранитель, а не панацея

Метод MDL работает как эффективный и быстрый предохранитель. Одна оценка занимает около 0,14 миллисекунды, что в 50 раз быстрее этапа поиска и на несколько порядков быстрее самостоятельной проверки языковой моделью. Хотя он не решает фундаментальных проблем RAG полностью и иногда проваливается в самых опасных сценариях, его идея разделять оценку логического соответствия и достоверности источника выглядит перспективной для развития безопасных агентов.

В будущем подобные механизмы могут стать стандартом для систем, работающих с юридической, медицинской или финансовой информацией, где цена ошибки выше любой выгоды от скорости.

Первоисточники

Habr AI ↗
← Вернуться в эфир