Экономные модели AI догнали лидеров в проверке математических доказательств
Исследование, опубликованное на arXiv, показывает, что открытые модели с малым весом способны проверять математические доказательства так же точно, как и дорогие «передовые» системы, при снижении стоимости вычислений до ста раз.
# Экономные модели AI догнали лидеров в проверке математических доказательств
Оценка естественных языковых доказательств всегда была одной из самых сложных и дорогих задач в развитии систем искусственного интеллекта. Традиционно для этого привлекались флагманские большие языковые модели, чья работа обходится разработчикам в значительные средства. Однако новое исследование, доступное по ссылке arXiv:2608.00004, предлагает радикально иной подход: использовать дешёвые открытые модели в качестве независимых рецензентов.
Авторы работы задали фундаментальный вопрос: могут ли недорогие модели с открытым весом надёжно оценивать качество математических рассуждений, опираясь на кандидатское доказательство, эталонный ответ и критерии оценки, составленные людьми? Ответ, полученный в ходе экспериментов на специальном бенчмарке IMO-GradingBench, оказался неожиданно оптимистичным.
Сравнение с лидерами индустрии
В ходе предварительного тестирования на выборке из 200 экземпляров задачи исследователи применили три экономичные модели: GPT-OSS 120B, DeepSeek-V4 Flash и Gemma-4 31B. Результаты показали, что эти модели согласовывают свои решения «допускать» или «отклонять» доказательство с человеческими экспертами в таких же пропорциях, как и топовые системы вроде Claude Opus 4.7 и Gemini 3.1 Pro.
Статистический анализ подтвердил, что разница между решениями дешёвых моделей и элитных систем не является значимой. При этом финансовое преимущество составило внушительный коэффициент: стоимость проверки с помощью доступных моделей оказалась меньше в до ста раз (до $100 imes$) по сравнению с использованием лидеров рынка. Это открытие имеет решающее значение для масштабирования оценки систем математического_reasoning, где объём проверок может исчисляться десятками тысяч.
Ожидания относительно стратегии голосования
Команда исследователей изначально предположила, что лучшей стратегией для бюджетной оценки будет использование простого большинства голосов (когда любое из трёх решений перевешивает сомнения). Такая логика часто применяется для повышения надёжности за счёт разнообразия источников. Однако эксперименты показали, что простое большинство не дало преимуществ, превзойдя сильные стороны наихудшей из трёх моделей, лишь соответствуя показателям самых мощных систем.
Консенсус как золотой стандарт
На расширенном наборе данных, охватывающем все 1000 экземпляров бенчмарка, исследователи продолжили поиск оптимального способа согласования мнений. Они экспериментировали с различными правилами консенсуса и выявили, что наиболее эффективной стратегией является требование единогласного согласия (all-three-pass).
Согласно этой методике, доказательство считается принятым только тогда, когда все три экономичные модели (GPT-OSS, DeepSeek-V4 Flash и Gemma-4 31B) одновременно дают положительную оценку. Эта стратегия продемонстрировала:
* Максимальный уровень согласия с решениями людей в вопросах допустимости. * Высокую точность (precision). * Минимальную вариативность результатов при повторных запусках (на четырёх репликах эксперимента разброс был наименьшим).
Авторы отмечают, что эта рекомендация была сделана пост-фактум (post-hoc) на основе анализа конкретных данных эксперимента. Хотя результаты многообещающи, сам механизм выбора этой конкретной совокупности моделей и правила единогласия требует независимой проверки в будущих исследованиях, чтобы подтвердить их универсальность.
Понимание технических аспектов
Для контекста важно отметить, что речь идёт о задачах проверки математических доказательств, изложенных на естественном языке. Это отличается от простой проверки вычислительных шагов, так как требует понимания логики, структуры аргументации и соблюдения математических норм записи.
Экономные модели в данном случае выступают не как создатели доказательств, а как рецензенты, сравнивающие предложенное решение с эталоном и рубрикой оценки. Их способность выполнять эту роль на уровне топовых систем свидетельствует о зрелости архитектуры современных open-weight моделей в области логики и математической лингвистики.
Таким образом, парадигма оценки качества математического интеллекта AI меняется: от зависимости от редких и дорогих ресурсов — к доступным, масштабируемым и эффективным решениям на основе консенсусного подхода.