Одинаковое количество, разный ответ: почему модели ИИ терпят неудачу при смене формата чисел
Новые исследования показывают, что современные языковые модели часто дают ошибочные результаты, даже если математическая задача не меняет своей сути, а лишь форму представления числа. Разница между десятичной дробью, процентом или научной нотацией оказывается критической, обнажая глубокую разрыв между декларативной логикой ИИ и фактической способностью к инвариантности.
# Одинаковое количество, разный ответ: почему модели ИИ терпят неудачу при смене формата чисел
В мире алгоритмов, где точность является валютой доверия, даже незначительное изменение формата данных может разрушить всю логику ответа. Новое исследование, опубликованное на arXiv, бросает вызов идее, что современные модели искусственного интеллекта понимают числа как неизменные концепции. Вместо этого данные показывают, что ИИ часто путается, когда одно и то же количество предлагается в виде десятичной дроби, дроби, процента или научной нотации.
Уязвимость перед формой: когда 50% — это не 0,5
Идеальная система должна распознавать, что количество "пятьдесят процентов" идентично "0,5" или "половине". Однако анализ пяти открытых моделей с открытыми весами выявил troubling тенденцию. Исследователи создали набор из 3 600 задач с точно заданными рациональными числами и сгенерировали более 8 600 запросов, применяя пять видов трансформаций, сохраняющих значение числа.
Результаты теста были удивительно пессимистичными в отношении гибкости моделей. Если использовать строгий синтаксический аудит для нормализации ответов (без участия другой языковой модели-судьи), каноническая точность достигала поразительных 0,969–0,996. Это означает, что при условии, что ответ подан в ожидаемом формате, модели работают почти идеально.
Однако ситуация меняется, когда требуется понять эквивалентность разных форматов. Показатели «орбитальной правильности» (орбит correctness) и «орбитальной инвариантности» резко упали до диапазона 0,848–0,981 и 0,851–0,981 соответственно. Это означает, что если ответ правильный по сути, но записан в другом формате, вероятность того, что модель его примет, значительно снижается. При этом количество случаев, когда модель давала инвариантный, но ошибочный ответ, было минимальным (не более 0,003), что указывает на то, что ошибка чаще связана не с пониманием логики, а с проблемой сопоставления форматов.
Технические сбои: проблема научной нотации и единиц измерения
Одна из ключевых находок исследования касается технических ограничений интерпретаторов. Большая часть неудач строгаго парсера (строггого анализатора) связана с тем, что модели научной нотации в форме умножения (например, 2 × 10³) не попадают в реализованную грамматику чисел. Это иллюстрирует, как интерфейсы оценщиков могут маскироваться под сбои в рассуждении модели: модель могла бы понять задачу, но система проверки ответа не умеет распознать формат ввода.
Однако существует и более глубокая семантическая патология. Модель Mistral Small 4 показала особенно низкий результат, получив лишь 0,699 на вводе с конвертированными единицами измерения. В ходе эксперимента были выявлено 265 ошибок, где ответ модели отличался от эталонного значения именно на степени десятки (например, ошибка между 5 миль и 5000 ярдов, где модель путает масштаб). Это свидетельствует о том, что у модели есть проблемы с понятием порядка величин, когда она сталкивается с физическими единицами измерения, а не с голыми цифрами.
Консенсус как миф: сравнение разных стратегий проверки
Исследователи также провели эксперимент, содержащий 9 000 вызовов, распределенных поровну между сравниваемыми методами. Целью было проверить, помогает ли использование нескольких моделей для достижения консенсуса (representation consensus) лучше, чем использование простых синонимичных перефразирований (paraphrase consensus). Результаты были неожиданными: консенсус на основе разных числовых репрезентаций не показал превосходства над консенсусом на основе парфраз на низкоошибочных подмножествах данных. Более того, такой подход породил substantially больше ложных срабатываний (false alarms), что ставит под вопрос эффективность использования "мудрости толпы" для решения задач численной инвариантности.
Возникновение таких системных ошибок говорит о том, что обучение моделей все еще сильно опирается на паттерны, специфичные для конкретных форматов ввода, а не на глубокое семантическое понимание чисел. Это создает риск для приложений, где точность критически важна, например, в финансовой аналитике или научных расчетах.
*Авторские примечания: В этой области исследований граница между техническим сбоем интерпретатора и реальным отсутствием когнитивной способности модели крайне тонка. Пока мы не увидим принципиально новых архитектур, способных к истинной абстракции от формата, такие ошибки будут оставаться неизбежным следствием текущего этапа развития ИИ.*