AI · LLM · Mixture-of-Experts · Hallucinations · Contrast Decoding · arXiv · Research24 июля в 09:01 · 3 мин

Спецкод для экспертов: новый метод борьбы с галлюцинациями в моделях MoE

Исследователи из arXiv:2607.20426 представили подход EAACD, позволяющий снижать вероятность ошибок в моделях смешанных экспертов (MoE). Метод использует различия в активации нейронов на верхних слоях сети для калибровки ответов, разделяя «надежных» и менее уверенных экспертов.

# Устранение галлюцинаций в моделях MoE: метод экспертного сопоставления

Генеративные языковые модели, основанные на архитектуре mixture-of-experts (MoE), становятся стандартом в индустрии благодаря своей способности масштабироваться и обрабатывать сложные запросы. Однако, как и любые большие модели, они подвержены галлюцинациям — генерации заведомо неверной информации. Существующие методы коррекции, такие как тонкая настройка промптов или оптимизация весов, часто не меняют внутреннюю структуру модели или плохо переносятся на новые задачи.

В рамках исследования, опубликованного на arXiv под номером 2607.20426, авторы предлагают альтернативный путь. Они рассматривают возможность использования контрастного декодирования, которое было эффективно для обычных трансформеров типа GPT, но требует адаптации для специфической структуры MoE.

Архитектура MoE и её отличия

Модели типа MoE отличаются от классических трансформеров тем, что каждый слой содержит множество «экспертов» — небольших подсетей, каждая из которых отвечает за специфическую часть задачи. Входной сигнал распределяется между этими экспертами, и активация конкретного эксперта зависит от контекста вопроса. Это означает, что внутри одной и той же модели «живут» разные специалисты, некоторые из которых обладают высокой компетентностью в фактологической сфере, а другие могут быть склонны к ошибкам.

Авторы исследования провели эмпирические эксперименты и пришли к важному выводу: в моделях с общими (shared) экспертами классические слои-за-слоями разницы, характерные для GPT, отсутствуют. Однако, как только рассматривают разные реализации MoE, картина меняется. На верхних слоях сети, которые ближе всего к выходному слою, выявляется четкое различие в паттернах активации экспертов, когда модель генерирует фактологически точный ответ и когда она впадает в галлюцинацию.

Это наблюдение позволило сформулировать новую гипотезу: верхние слои MoE содержат скрытые механизмы оценки достоверности. Если эксперт уверенно активируется на одной теме, но проявляет неопределенность на другой, его вклад в финальный ответ может быть проблематичным.

Метод EAACD: калибровка через сопоставление

На базе этих находок была разработана техника под названием EAACD (Expert-Aware Adaptive Contrast Decoding). Алгоритм работает следующим образом:

1. Классификация экспертов: Система анализирует верхние слои MoE и делит всех экспертов на две группы: группа с высокой надежностью и группа с низкой надежностью. Критерии отнесения к группе включают уверенность модели и внутреннюю согласованность её ответов.

2. Контраст предсказаний: Предсказания экспертов из надежной группы сравниваются (противоставляются) с предсказаниями экспертов из группы низкой надежности. Цель состоит в том, чтобы скорректировать исходный вывод модели, используя более надежные данные в качестве эталона.

3. Усиление негативных ссылок: Чтобы усилить эффект контраста, метод применяет механизмы внимания и маскирования, которые увеличивают влияние галлюцинаций, приписываемых экспертам низкой надежности. Это создает более сильный негативный референс, помогая модели учиться избегать подобных ошибок.

Испытания показали, что EAACD превосходит все базовые линии на четырех различных наборах данных для задач с вопросами и ответами (QA).

Что это значит для практики

Для разработчиков больших языковых моделей этот результат открывает новые горизонты в создании более безопасных и точных систем. Не требуется полная перетренировка модели или изменение её архитектуры, достаточно внедрить алгоритмическую стратегию декодирования, которая учит, «кто» из экспертов отвечает на вопрос.

Подход EAACD демонстрирует, что даже в сложных архитектурах с множеством экспертов можно найти внутренние маркеры достоверности. Это сближает методы борьбы с галлюцинациями с реальными процессами верификации: мы больше не требуем от модели «знать» всё, но учим её распознавать голоса тех, кто говорит уверенно, и фильтровать шумы от тех, кто колеблется. Такой подход делает большие модели более прозрачными и пригодными для использования в критически важных сферах, где ошибка может стоить дорого.

Первоисточники

arXiv cs.CL
← Вернуться в эфир