OenoBench: Как язык моделей ошибочно оценил знания об одном из самых сложных товаров
Разработчик бенчмарка OenoBench провел эксперимент, чтобы проверить, действительно ли современные большие языковые модели (LLM) владеют специализированными знаниями о винах, или же они лишь имитируют экспертность. Для этого были сгенерированы 3 266 вопросов с вариантами ответов на базе 38 104 проверенных фактов. Результаты прогона шестнадцати моделей выявили системные ошибки в работе алгоритмов аудита и «зажаты» лидеров таблиц, которые часто ошибались там, где требовалась реальная экспертиза, а не просто статистика.
# OenoBench: Ложь агентов и реальные знания о винах
Полгода назад исследователь решил поставить под сомнение способность ИИ вести осмысленный разговор о мире вин. Вместо абстрактных тестов на общую эрудицию, таких как MMLU, была создана специализированная система OenoBench. Целью стало не просто проверить, знает ли модель, что Бароло делают в Пьемонте, а определить, насколько глубоко она понимает регуляторные рамки, сроки выдержки и географические ограничения, которые являются основой этой отрасли.
В итоге была получена база из 38 104 фактов и 3 266 вопросов с вариантами ответа, проверенных суровым «адским фильтром» из десяти автономных агентов. Шестнадцать моделей прошли этот коридор, и результаты оказались сложнее, чем ожидалось: многие из них, включая лидеров рынка, продемонстрировали высокую уверенность в неправильных ответах на сложные вопросы, которые невозможно решить, опираясь только на общие знания.
Архитектура бенчмарка: от хаоса к порядку
Создание такого корпуса невозможно было сделать вручную без потери качества или сроков. Процесс начался с массового сбора данных из открытых источников: базы Wikidata, официальные реестры Франции (INAO) и США (TTB), а также статьи из научных журналов и вики-проектов. Итоговая база содержит 38 104 факта, каждый из которых привязан к конкретному URL источника.
Однако этап сбора данных оказался более сложным, чем планировалось. Из первоначальных 35 сценариев сбора данных (скраперов) только 18 эффективно работали. Остальные 17 скраперов оказались «гарантированными запасами» (fallback) — кодом, написанным в памяти модели, который лишь вываливал заранее заготовленные списки, например, перечень DOCG регионов Италии, без реального запроса в интернет. Эти данные были удалены, так как бенчмарк знаний должен измерять способность модели искать информацию, а не воспроизводить её из тренировочной выборки.
Оставшиеся данные прошли через фильтр превращения текста в атомарные факты. Сложные предложения разбивались, местоимения разрешались, и оставались только проверяемые утверждения. Так, из тысяч строк вычленялись факты вроде: *«Arlanza является испанским защищенным обозначением происхождения (DOP), расположенным в провинциях Бургос и Пальенсия»*. Любые маркетинговые штампы или предложения без четкой проверяемости отбрасывались.
Для превращения фактов в вопросы были задействованы пять различных стратегий генерации и пять мощных моделей (Claude, GPT, Gemini, Llama, Qwen). Каждая стратегия работала по-своему: от простого извлечения ключевых атрибутов до создания сложных сценариев от лица сомелье. Промпты жестко запрещали формулировать вопросы по знаменитым сущностям без технических деталей, чтобы избежать тривиальных вопросов вроде «Где делают Шампань?». Вместо этого система генерировала задачи, требующие знания, например, точных сроков выдержки в бочке или конкретных правовых статей.
Гейт на решаемость: когда модели спорят друг с другом
Ключевым элементом фильтрации стала система «гейта» (gate). После генерации вопросы проверялись другими моделями, не имеющими доступа к исходному факту. Если модель могла ответить на вопрос с высокой уверенностью, не видя источника, она помечалась как «решаемая из памяти». Такие вопросы автоматически переводились в категорию низкой сложности (L1), так как высокая сложность (L3) требовала бы знания, недоступного модели, обученной на общих данных.
Оказалось, что почти половина всех вопросов (1 601 из 3 266) была отмечена как решаемая без доступа к исходным данным. Это создало парадокс: система, призванная тестировать глубокое знание, обнаружила, что половина тестовых заданий не требует именно этого.
Процесс аудита был возложен на десять агентов. Три из них (Claude, GPT-5.4, Gemini 3.1 Pro) выступали в роли судей, пытаясь ответить на вопрос, зная факт, но не зная правильного ответа. Если большинство судей ошибалось, вопрос отбрасывался как дефектный. Другие агенты проверяли структуру, наличие шаблонных фраз и биас (смещение) в позиционировании правильных ответов.
Автор проекта, владеющий дипломом высшего уровня винного образования WSET, играл роль единственного человека, который мог дать финальную оценку виноделию. Остальная работа была делегирована ИИ: код писался Claude Code, вопросы генерировались коллективно, а аудит проводили десятки автоматических скриптов. Общий счет за API составлял около $800, что является минимальной стоимостью для такого объема ручного и автоматизированного труда.
Где провалились лучшие: анализ результатов лидерборда
На финальном этапе 3 266 вопросов прогнали через 16 моделей. Лидерборд разделили на две части: вопросы с низкой сложностью и вопросы высокой сложности. Ожидание было простым: на простых заданиях лидеры должны побеждать, а на сложных — показывать вариативность.
Однако картина оказалась другой. Модели демонстрировали уверенное поведение даже на самых сложных вопросах. В частности, три модели из трех ведущих компаний (соответствующих судейской панели) дали идентичные ответы на вопрос, который по замыслу был проверкой глубоких знаний, но на деле оказался сломанным из-за ошибок в генерации.
Одной из главных проблем стали вопросы, сгенерированные стратегией «comparative» (сравнительной). Эти задачи строились на паре фактов, например, урожайности двух разных регионов. Но часто сами факты содержали противоречия или были неправильно интерпретированы агентами при создании дистракторов (неправильных вариантов ответа). В результате модели, которые не обладают реальной эрудицией в виноделии, могли находить правильные ответы, просто угадывая паттерны, заложенные в формулировку, а не понимая сути.
Наивысший уровень сложности (L4), соответствующий компетенциям Master of Wine, выявил, что даже самые продвинутые модели не справляются с задачами, требующими знания специфических нормативных актов США (Title 27 CFR). Многие модели отвечали уверенно, но неверно, указывая на регионы или законы, которых не существовало в контексте задачи.
Вывод: инвариант против эха
Эксперимент OenoBench продемонстрировал, что текущие бенчмарки не всегда способны достоверно оценить уровень знаний ИИ в узкоспециализированных доменах. Часто модели демонстрируют «эхо» — способность воспроизводить информацию, которую они «заучили» как частотные ассоциации, а не как фактические знания.
Ключевым уроком стало понимание, что даже при наличии строгих фильтров, агентов аудита и ручного контроля за фактами, генерация вопросов остается хрупким процессом. Ошибки в данных, «зажаты» в коде или промптах, легко проваливаются через системы, если они не проверяются на предмет фактологической чистоты экспертом-человеком.
Итоговый корпус OenoBench стал не только набором вопросов, но и картой слабостей современных LLM в области прикладных знаний. Он показал, где инварианты (неизменные правила) помогают, а где система ломается из-за зависимости от памяти моделей. Для отрасли, где точность информации критически важна, этот бенчмарк становится эталоном для будущих испытаний, но также и предупреждением о рисках автоматизации экспертизы без должного человеческого надзора.
*Автор отмечает, что процесс сбора данных и верификации фактов занял полгода, и несмотря на автоматизацию, ответственность за достоверность содержания полностью лежала на эксперте-человеке, так как ИИ не способен гарантировать отсутствие ошибок в интерпретации регуляторных норм.*