Голос робота-судьи оказался ложным: как аудиторы нашли и починили ошибки в текстовых SQL-конвейерах
В производственных системах перевода текста в SQL команды часто используют искусственный интеллект для проверки результатов генерации. Однако новое исследование, опубликованное на arXiv, выявило критическую несоответствие между позициями моделей LLM-as-Judge и человеческими экспертами. Изучение показало, что широко используемая модель gpt-4o-mini практически не способна корректно оценивать SQL-запросы, совершая массовые ошибки, которые авторы назвали «гравитационными галлюцинациями» в оценке.
# Когда автоматический судья ошибается: реальные цифры согласия с экспертами
В архитектуре современных корпоративных систем, основанных на базе данных, популярна схема «текст в SQL» (Text-to-SQL). Она позволяет пользователям формулировать запросы естественным языком, а алгоритм преобразует их в команды для СУБД. Для обеспечения качества таких систем часто внедряется этап проверки, где роль арбитра выполняет еще одна нейросеть — LLM-as-Judge. Предполагалось, что такая модель будет более чем надежно согласовывать свои решения с мнением человека.
Реальность, описанная в исследовании Haowei Liu, Hsin-Tai Wu и Yi Fang, оказалась иной. В ходе аудита собственной производственной системы авторы обнаружили, что модель gpt-4o-mini, развернутая как судья, практически не смогла продемонстрировать надежность. На наборе данных, обогащенном случаями споров, коэффициент согласия Кеннона (Cohen's kappa) между моделью и золотыми стандартами, утвержденными двумя авторами, составил всего 0.04. Даже на случайной выборке этот показатель был равен лишь 0.42. Более того, система ошибочно помечала как проблемные более 77.1% случаев, которые человеческие эксперты считали верными (human-FAITHFUL).
Механизм «гравитационных галлюцинаций»
Исследователи выявили корневую причину этих катастрофических сбоев. Большинство ложных срабатываний системного арбитра связано с одним специфическим механизмом, которым они обозначили термин GRADE-HALLUCINATION («гравитационная галлюцинация» или ослепление при оценке).
Этот феномен происходит так: модель-судья анализирует сгенерированный SQL-запрос и верифицирующую схему данных, а затем, пытаясь обосновать свой вердикт, «выдумывает» детали или логические связи, которых на самом деле не существует. Из-за этого внутреннего когнитивного искажения нейросеть начинает уверенно ошибаться, считая верные запросы некорректными или наоборот. Это фундаментальная проблема текущего подхода, когда одну языковую модель доверяют проверять работу другой.
*Техническое пояснение: Коэффициент согласия Кеннона — это статистическая мера, которая показывает, насколько часто две стороны (человек и машина, или два человека) приходят к тому же мнению, учитывая случайные совпадения. Значение близко к нулю означает, что совпадения происходят исключительно на удачу, а не по смыслу.*
Поиски замены и экономический фактор
Поиски более надежного арбитра привели команду к использованию модели Qwen3.6-27B в самохостинге. Результаты проверки были драматически лучше: коэффициент Кеннона вырос до 0.72. Этот уровень сопоставим с показателями эталонной модели Claude Opus 4.7, которая достигла 0.71 в подобных тестах. Прямое сравнение «на голову» в условиях небольшой выборки (96 случаев) статистически недостаточно мощно для окончательного вывода, но для целей принятия решений о развертывании это значимо.
Однако главное преимущество новой конфигурации кроется не столько в точности, сколько в экономике. Стоимость вызова модели Qwen3.6 составляет примерно в 300 раз меньше, чем аналогичные запросы к облачным API. Это делает локальную развертку мощных моделей значительно более привлекательной для производства, даже при наличии собственных серверов.
Консенсус трех голосов
Авторы также исследовали эффективность энсамблирования — объединения прогнозов нескольких моделей для принятия итогового решения. Оказалось, что простое усреднение результатов слабой и сильной моделей не помогает бесплатно: их комбинация лишь снижает уровень согласия. Попытка подкрепить слабую модель сильным арбитром привела к деградации согласованности.
Оптимальным решением оказалось использование трех мощных судей с режимом unanimity routing (маршрутизация по единогласию). Только тогда, когда все три модели приходят к общему выводу, система автоматически принимает решение, покрывая 89.7% всех кейсов. При таком подходе коэффициент Кеннона достигает 0.79. Это подтверждает, что надежность в продакшене достигается не поиском идеальной модели, а архитектурой системы, требующей консенсуса.
Выводы за пределами домена
Интересный результат был получен при тестировании методики аудита вне исходной предметной области. Применяя те же протоколы оценки к финансовой базе данных BIRD-financial, система отметила 25.5% SQL-запросов, созданных экспертами, как потенциально проблемные. Это демонстрирует высокую чувствительность аудиторных алгоритмов: они способны находить даже тонкие неточности в «золотых» стандартах, составленных людьми, что подтверждает ценность внедрения таких проверок.
Код исследования, протоколы предзарегистрации и данные для воспроизведения экспериментов доступны в репозитории GitHub JamesL404. В мире, где автоматизация берет на себя все больше функций, напоминание о необходимости скептичного отношения даже к «сверхразумам» является актуальным призывом к инженерной осторожности.
*В финале можно добавить лишь тихую уверенность: технологии не должны быть ослеплены собственной уверенностью, будь то человек или алгоритм.*