Языковые модели · Аннотация данных · ИИ и обучение · LLM Codebook · Машинное обучение24 сентября в 09:32 · 3 мин

Конфликты моделей как катализатор качества: как расхождения ИИ ускоряют аннотацию данных

Разработка качественных инструкций для искусственного интеллекта традиционно требует месяцев ручного труда специалистов. Исследование, опубликованное на arXiv, демонстрирует, что использование расхождений в ответах нескольких языковых моделей позволяет направлять усилия экспертов только на критические случаи. Этот подход сокращает время подготовки кодобука (инструкций аннотации) с месяцев до дней, сохраняя или даже повышая точность оценки данных по сравнению с традиционными методами.

# Когда модели спорят, истина становится яснее

Масштабная текстовая аннотация данных — фундаментальная задача для обучения нейросетей, требующая привлечения тысяч экспертов. Обычно этот процесс опирается на так называемый «кодобук» — набор правил, которых должны придерживаться ИИ-аннотаторы. Однако создание надежного кодобука занимает у специалистов по несколько месяцев.

Исследователи из проекта с заголовком «Эксперты поднимаются там, где модели не согласны» (Experts Rise Where LLMs Disagree) предлагают радикально иной подход. Они утверждают, что большие языковые модели (LLM) могут не только замедлять работу, но и стать инструментом ускорения, если использовать их внутренние конфликты стратегически.

Стратегия фокусировки внимания

Суть предложенного метода заключается в том, чтобы сначала применить раннюю версию кодобука к большим массивам данных. Затем несколько языковых моделей обрабатывают одни и те же тексты. Там, где модели дают разнородные ответы, возникает сигнал: в этом случае нужна экспертиза человека. В случаях согласия ИИ с самим собой ручное вмешательство откладывается.

Авторы сравнили эффективность трех различных способов взаимодействия человека с этими «конфликтными» случаями:

1. Проверка кодобука (Codebook Verifying): Эксперты редактируют изменения, которые ИИ предложил на основе расхождений, чтобы уточнить правила. 2. Ответы на вопросы (Question Answering): Модели задают вопросы о природе расхождений, а эксперты дают развернутые ответы. 3. Маркировка с аргументацией (Rationale Labeling): Эксперты не просто выбирают правильный ответ, но и формулируют подробное обоснование своего выбора для каждого конфликтного случая.

Результаты на материалах реальных уроков

Для проверки гипотезы исследователи проанализировали тысячи записей сессий репетиторства. Результаты были неожиданными и обнадеживающими для индустрии разметки данных.

Как показывает таблица данных из исследования, метод Rationale Labeling (маркировка с аргументацией) достиг наивысшей точности оценки, когда ИИ пытается классифицировать новые данные с использованием обновленного кодобука. Точность составила 64,9% в соответствии с эталонными экспертными метками.

Этот показатель превзошел результаты, полученные с использованием кодобука, отредактированного традиционными методами (Expert Revised Codebook), точность которого достигла лишь 57,8%.

Хорошие результаты показал и метод Question Answering (ответы на вопросы), достигнув 60,5% точности, что также выше, чем у обычного экспертно-редактируемого кодобука.

*«Наша работа показывает, что языковые модели могут быть использованы для стратегического целевого внимания экспертов»*, — подчеркивают авторы. Вместо того чтобы требовать от человека анализа миллионов документов с нуля, система заставила экспертов сосредоточиться только на тех узлах, где алгоритмы «спотыкаются». Это сократило время разработки кодобука с месяцев до нескольких дней без потери качества итоговой разметки.

Почему аргументация важна?

Способность модели объяснить, *почему* она выбрала тот или иной вариант в условиях неопределенности, оказалась ключевой. Когда эксперт не просто исправляет ошибку, а формулирует правило, объясняющее эту ошибку (аргументацию), ИИ учится более глубоко понимать нюансы контекста, а не просто подбирать шаблонный ответ. Это превращает взаимодействие человека и машины из простого исправления багов в процесс совместного обучения.

Использование неопределенности как сигнала для участия человека — это важный шаг в развитии эффективного использования больших языковых моделей (LLM). Вместо попытки заставить одну модель работать идеально во всех случаях, исследователи предлагают создать систему, где слабость алгоритма становится триггером для интеллекта человека.

Первоисточники

arXiv cs.CL
← Вернуться в эфир