Осложнение верификации: Исследование показывает, что аргументации в цепочках QA часто не повышают точность ответов
Новое исследование, опубликованное на arXiv, бросает вызов распространённой практике передачи аргументаций от генератора к верификатору в системах вопросно-ответного типа. Исследователи обнаружили, что честные объяснения практически не влияют на точность финального ответа, в то время как искажённые аргументации способны манипулировать оценкой качества доказательства, создавая новые точки отказа, которые даже люди с трудом замечают.
# Что действительно передают аргументации в ИИ?
В современных конвейерах обработки вопросов, где задачи разделены между генератором (reasoner) и верификатором (verifier), стандартом де-факто стала передача промежуточных аргументаций. Логика проста: если модель может обосновать свой ответ, её решение кажутся более надёжным. Однако новое исследование из архива препринтов arXiv (архив cs.AI, идентификатор 2610.00018) ставит под сомнение эффективность этого подхода, выявляя скрытые риски такого взаимодействия.
Генерация фактов через манипуляцию контекстом
Учёные из Jiameng Zhang и Hongqiu Wu применили метод «манипуляции сообщением» (message-intervention). Суть эксперимента заключалась в строгом контроле переменных: фактические доказательства и кандидаты на ответ оставались неизменными, изменялась только передаваемая аргументация. Тестирование проходило на 400 вопросах из датасетов MuSiQue, HotpotQA и 2WikiMultiHopQA, используя модель DeepSeek в роли как генератора, так и верификатора.
Результаты оказались контринтуитивными. Честные, верные аргументации практически не добавляли точности ответов по сравнению с отсутствием аргументаций вовсе. Фактически, сама по себе передача обоснования не является магическим ключом к правильности ответа.
Однако картина кардинально менялась при наличии ошибок. Исследователи ввели «искажённые» (corrupted) аргументации. В этом сценарии верификаторы демонстрировали высокую чувствительность: суды об обоснованности поддержки (support judgments) менялись радикально.
При использовании стандартных промптов (запросов) для верификатора без явного указания проверять аргументацию, безобидные перефразировки меняли оценку поддержки всего на 0–2,5%. В то же время, искажённые аргументации приводили к смене оценок на 10–22%. Если активировать явный режим проверки аргументации, этот разрыв расширялся ещё больше, до 34–55%.
Важно отметить, что сами финальные ответы (final answers) менялись значительно реже — только на 2–30%, и лишь в 2,9–35,3% случаев изменение оценки аргументации совпадало с изменением итогового ответа. Это означает, что верификатор часто реагирует на форму аргументации, а не на её логическую связь с ответом.
Человеческий фактор: слепое доверие модели
Ключевой вопрос исследования заключался в том, являются ли эти смещения внутренними ошибками модели или они отражают реальные пробелы в понимании. Для этого были проведены аудиты людьми.
Исследователи обнаружили тревожный феномен «слепого доверия» (corruption-overtrust). Из 42 допустимых искажений, которые модель приняла за верные, 16 случаев были зафиксированы именно как ситуации чрезмерного доверия к искажениям. При этом человеческие аудиторы, работая в «слепом» режиме (не зная о манипуляции), отвергали или помечали как неясные 9 из 10 искажённых аргументаций, которые модель приняла.
Это указывает на то, что модели могут формировать внутренние представления, которые кажутся логичными, но являются ложными, и даже люди с трудом их детектируют, если контекст не предоставляет прямых противоречий. Разделение задач на генерацию и проверку создаёт новый канал ошибки, где верификатор опирается на качество текста аргументации, а не на её истинность.
Выводы: механизм верификации, а не путь к точности
Исследование подтверждает, что передача аргументаций должна оцениваться не как инструмент повышения точности ответов, а как механизм сообщения для верификации. Частичное разделение ответственности между компонентами системы не гарантирует улучшение результатов, если верификатор воспринимает формальные аргументации как истину в последней инстанции.
Технический аспект важен: аргументации в таких системах часто служат каналом коммуникации между этапами. Если этот канал загрязняется, верификатор начинает принимать решения на основе «шума» вместо фактического содержания. Это требует пересмотра архитектурных решений, где передача объяснений является обязательной. Возможно, в некоторых сценариях полное отсутствие аргументации может быть более безопасным, чем передача потенциально искажённого обоснования, особенно если верификатор недостаточно критичен к стилю изложения.
В конечном счёте, исследование напоминает о необходимости осторожности при внедрении сложных конвейеров. Улучшение одного компонента (генерации объяснений) может не приносить пользы, а даже вредить общей надёжности системы, если не обеспечено глубокое понимание того, что именно передаётся между модулями.
*Примечание автора: В мире сложных алгоритмов иногда кажется, что добавление больше «информации» — всегда решение. Но этот текст напоминает нам, что в системах искусственного интеллекта ясность аргументации может быть важнее её наличия, особенно когда речь идёт о доверии к решению, которое принимается автоматически.*