Один вопрос, разные ответы: почему точность моделей не гарантирует надежность
В мире больших языковых моделей (LLM) часто наблюдается парадокс: системы показывают высокие результаты на стандартных тестах, но их решения меняются, если переформулировать вопрос, сохранив его смысл. Исследование, опубликованное в arXiv, демонстрирует, что стандартные метрики точности скрывают существенную нестабильность. Модели часто «забывают» известные факты только потому, что пользователь изменил словесную формулировку вопроса, а не сам вопрос.
# Одинаковый смысл, разные ответы: кризис стабильности в больших языковых моделях
Большинство из нас использует нейросети как инструмент, предполагая, что они работают как калькулятор: заложенные данные выдаются в ответ. Однако новое исследование, опубликованное в мае 2026 года на платформе arXiv под названием "Same Question, Different Answers", бьет по этому убеждению. Работа авторов, включая Kazem Faghih, показывает, что надежность больших языковых моделей (LLM) — понятие гораздо более хрупкое, чем принято считать.
Исследователи проверили 13 различных моделей на четырех бенчмарках (стандартах оценки), охватывающих фактологические вопросы и математические задачи. Результаты оказались тревожными: поведение моделей на уровне отдельных примеров крайне нестабильно. Если задать вопрос одной формулировкой, модель может дать правильный ответ. Немного перефразировать тот же запрос, и модель может начать галлюцинировать или выдавать неверный результат.
Когда точность врет
В центре внимания исследования стоит разрыв между «общей точностью» (accuracy) и реальной «надлежаностью» (reliability). Общая точность — это статистика, усредняющая ответы по тысячам примеров. Даже если модель ошибается на 25% ответов при одной формулировке и на 23% при другой, общая статистика может выглядеть удовлетворительно.
Но проблема кроется в деталях. На уровне отдельных вопросов модели демонстрируют огромную вариативность. Исследование показало, что несоответствия ответов (answer flip rates) достигают более 23%. Это означает, что для значительной части вопросов модель просто выбирает ответ на основе случайности или срабатывания внутренних триггеров, связанных с конкретными словами запроса, а не на основе глубинного понимания сути вопроса.
Ключевая мысль: Наличие знания не гарантирует его доступность. Модель может «знать» ответ, но не уметь извлечь его при определенной подаче вопроса. Это как библиотекарь, который знает, где лежит книга, но не может найти её, если вы описываете её содержание, а не называете название.
Ложное чувство безопасности
Особое внимание уделено вопросу о «правильных ответах». Исследователи сфокусировались на задачах, где модель дала верный ответ на исходной формулировке. Парадокс заключается в том, что именно на таких примерах наблюдалась самая большая нестабильность при перефразировании. Если модель однажды ответила верно, это создает иллюзию надежности. Однако, как только формулировка меняется, надежность падает.
Это явление имеет серьезные последствия для реального использования. Если система принятия решений, медицинский чат-бот или код-ассистент полагается на разовый запрос, пользователь может получить результат, который в следующем миллисекунду изменится при минимальной правке текста. Такой подход к валидации как «достаточно одного правильного ответа» является опасным.
Восстановление знаний
В противовес чисто негативным выводам, исследователи нашли способ улучшить работу моделей. Оказалось, что если модель иногда дает правильный ответ на вопрос, то в большинстве случаев она дает его и на хотя бы одной из альтернативных формулировок. Знание «спрятано» где-то внутри веса модели.
Исследователи предложили простую стратегию: «само-перефразирование». Если на прямой запрос модель отвечает неверно, можно сгенерировать несколько синонимичных вопросов и посмотреть, какая формулировка «вытаскивает» правильный ответ из модели. Это позволяет частично восстановить скрытое (латентное) знание и повысить качество ответа в режиме реального времени.
Таким образом, оценка надежности LLM должна перестать полагаться только на сухую точность. Нужно смотреть на стабильность поведения при вариациях входа. Только так можно понять, насколько по-настоящему умна модель или насколько просто она играет в угадайку слов.