Дизайн оценки меняет выводы: сравнение экспертных и автоматических MeSH в классификаторах
В мире научной медицины стандартная практика использования метаданных MeSH (Medical Subject Headings) для улучшения работы алгоритмов отбора статей не всегда является объективной истиной. Новое исследование, опубликованное в базе arXiv, демонстрирует, что разница в эффективности между ручным индексированием экспертами и автоматическими инструментами критически зависит от того, как именно мы строим тестовую выборку. Утверждение о превосходстве экспертов оказывается хрупким и может быть искажено изменением размера корпуса данных или схемы перекрестной проверки.
# Почему тесты могут врать о преимуществах экспертов
В основе систем автоматического обзора литературы лежит задача фильтрации тысяч публикаций, оставляя лишь те, что действительно релевантны. Для повышения точности таких систем используются метаданные MeSH. Существует давний вопрос: лучше ли работает классификатор, если эти метки проставлены опытными специалистами через недели или месяцы после публикации, или же автоматическими инструментами мгновенно. Исторически считалось, что «золотым стандартом» является ручной труд эксперта, однако новая работа под управлением Самуэля Окое-Менсаха ставит этот миф под сомнение.
Исследование базируется на бенчмарке Cohen et al. (2006), который проверяет способность классификаторов различать лекарства по тематикам, таким как статины, опиоиды и СДВГ. Авторы сравнили две модели: простую модель «мешок слов» (bag-of-words) и более сложную трансформерную сеть BiomedBERT.
Ключевой вывод работы сводится к одной фразе: «Дизайн оценки определяет разрыв между экспертом и автоматикой». То есть, если изменить условия эксперимента, результаты могут радикально поменяться.
Влияние объема данных на завышенные оценки
В классическом сценарии, где используется пятикратная перекрестная проверка (5-fold cross-validation) на всем корпусе данных, модель на основе мешка слов, обученная на данных от экспертов, показывала преимущество перед автоматической версией на величину +0.096 WSS@95% (Weighted Shannon Score). Это выглядит как убедительное подтверждение ценности экспертных усилий.
Однако авторы провели альтернативный эксперимент, подобрав размер корпуса данных под объем более узкой тематики (n = 803). В этом сценарии завышенная оценка экспертов снизилась до +0.033. Статистически значимость этого преимущества потеряла вес, так как 95% доверительный интервал включал нулевую разницу.
Когда же модель мешка слов проверялась по всей выборке в режиме 10-кратной перекрестной проверки, разрыв сократился до +0.021. При этом модель BiomedBERT в стандартных условиях показала результат +0.020, что статистически неотличимо от 10-кратной проверки для базовой модели.
Исследователи провели анализ мощности (power analysis) и пришли к тревожному выводу: если эффект от экспертного труда был бы столь же мал в тематиках опиоидов и СДВГ, как в статинах при 10-кратной проверке, эти различия так и остались бы не обнаруженными. Таким образом, нулевые результаты по другим темам были не информативными, а ограничены дизайном эксперимента.
Технические ограничения трансформеров
Помимо дизайна исследования, авторы выявили существенную техническую асимметрию. Модель BiomedBERT имеет жесткий лимит ввода в 512 токен. Когда к входным данным добавляются термины MeSH от экспертов, более 15.1% входных данных по тематике статинов превышают этот порог.
Это приводит к необходимости обрезки (truncation) входного контекста для модели. Автором отмечается, что эта обрезка может частично объяснять меньший разрыв между моделями, однако на данном этапе исследования невозможно отделить влияние обрезки от фактора объема обучающих данных.
Практические последствия для разработки
В системах скрининга, использующих современные трансформеры или проверенный по схеме 10-fold мешок слов, разрыв в эффективности на протестированных тематиках составляет около 0.02 WSS@95%. Доверительные интервалы таких разрывов часто пересекают нулевую отметку, что говорит об отсутствии стабильного преимущества одного метода над другим.
Более широкий вывод исследования заключается в том, что любые заключения бенчмарков о преимуществах определенных источников признаков (в данном случае экспертных меток) могут кардинально меняться при разумных изменениях процедуры оценки. Это требует от разработчиков и исследователей в области ИИ для медицины более тщательного контроля условий валидации перед публичными заявлениями.