OCR · ИИ · Machine Learning · arXiv · Технологии · База знаний2 октября в 05:02 · 5 мин

Снижение ошибки в машинном чтении: новый метод адаптивной дистилляции для OCR

Модели зрения и языка все чаще подвержены желанию «исправить» текст на изображениях, превращая визуальные артефакты в грамматически правильные, но фактологически неверные строки. Новая методика GAD-RL, описанная в исследовании arXiv:2609.38282, решает эту проблему, заставляя нейросеть учиться у учителя только тогда, когда это действительно необходимо, сохраняя верность исходному изображению.

# Снижение ошибки в машинном чтении: как адаптивная дистилляция борется с домыслами ИИ

В области оптического распознавания символов (OCR) возникает тонкая, но критическая дилемма. Современные модели на основе зрения и языка (vision-language models) часто демонстрируют чрезмерную креативность: сталкиваясь с нечитаемыми или поврежденными участками текста на изображении, они склонны «дорисовывать» пропуски, заменяя визуальные шумы на лингвистически правдоподобные слова. Этот процесс, хотя и делает результат более приятным для чтения, кардинально нарушает *верность транскрипции* (transcription faithfulness), что недопустимо при обработке юридических документов, счетов или научных статей.

Исследование, опубликованное 29 сентября 2026 года в базе arXiv под заголовком "Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation" (Улучшение верности OCR через адаптивную и ослабленную дистилляцию по политике), предлагает алгоритмическое решение этой проблемы. Авторы — Баоде Ванг и его коллеги — вводят метод GAD-RL, который динамически регулирует обучение модели, чтобы предотвратить искажение данных.

Почему учитель становится менее полезен со временем?

Ключевая идея исследования опирается на наблюдение, ранее не до конца изученное сообществом. В процессе тренировки модели (студента) с использованием учителя (teacher), роль последнего меняется. Когда модель начинает работать успешно, постоянные указания от учителя, основанные на фиксированных данных, могут мешать ей идти дальше или закреплять ошибки, если контекст изображения требует нестандартного подхода.

Авторы провели офлайн-анализ и обнаружили, что надзор от фиксированного учителя становится все менее выгодным по мере улучшения студента. Это справедливо как для различных контрольных точек обучения (checkpoints), так и для разных групп ответов, имеющих разный уровень задачи вознаграждения (task reward). Проще говоря: если модель уже хорошо справляется с задачей, насильно подталкивать ее следовать шаблону учителя становится контрпродуктивным. Это нарушает баланс между лингвистической плавностью и точностью воспроизведения.

Механика GAD-RL: адаптивное регулирование

В ответ на эти выводы авторы разработали метод GAD-RL (Gated and Attenuated On-Policy Distillation). Его суть заключается в том, чтобы сделать процесс дистилляции знаний от учителя к ученику зависимым от текущей ситуации и успеваемости модели.

Система работает в несколько этапов:

1. Условное обучение: Замороженная модель-учитель формирует свои рекомендации, опираясь на референсные транскрипции и уже сгенерированные студентом префиксы (начало текста). Это позволяет учителю понимать контекст, в котором находится текущая модель. 2. Ворота отключения (Gating): Если модель генерирует ответ с высоким «наградным» показателем (task reward), достигающим порога в 0.95, процесс дистилляции полностью отключается для этой группы ответов. Система понимает, что модель достигла качественного решения сама, и не требует внешнего вмешательства. 3. Плавное затухание (Attenuation): Для тех случаев, когда успех не полный, но и не идеальный, сила воздействия учителя не бинарна (вкл/выкл), а плавно уменьшается по мере роста среднего показателя вознаграждения в группе. Чем лучше работает студент, тем меньше он опирается на подсказки учителя.

Кроме того, метод учитывает вероятность совпадения токенов. Если вероятность того, что студент выберет предсказанный учителем лучший токен (Top-1), мала, метод ослабляет локальные обновления, чтобы не навязывать сомнительные варианты.

В основе этой работы лежит статья Baode Wang, Zuming Huang, Kexuan Ren, Jun Huang и Wei Chu, доступная по адресу [arXiv:2609.38282](https://arxiv.org/abs/2609.38282).

Результаты на стандартных бенчмарках

Эффективность предложенного подхода была проверена на реальной модели Qwen3.5-2B. Результаты оказались впечатляющими и демонстрируют значительное превосходство над существующими методами, такими как GRPO и GRPO+OPD (версия с фиксированным весом дистилляции).

На бенчмарке CHAOS-Bench, который специально предназначен для оценки способности моделей сохранять верность оригинальному изображению, метод GAD-RL достиг микро-полного извлечения (Micro Recall) на уровне 59.92%.

Для сравнения: * Модель с GRPO показала результат на 8.45 процентных пункта ниже. * Модель с GRPO+OPD уступила на 4.43 процентных пункта.

Более того, на комплексном бенчмарке документов OmniDocBench v1.6, метод GAD-RL набрал общий балл 91.18, что свидетельствует о его универсальности и эффективности в различных сценариях обработки текста. Эти цифры подтверждают, что адаптивное регулирование обучения позволяет найти оптимальный баланс между лингвистической грамотностью модели и ее способностью точно отражать визуальную информацию.

Что означают термины?

Для ясности стоит кратко пояснить несколько технических понятий, используемых в исследовании.

* Дистилляция знаний (Knowledge Distillation): Это процесс обучения, когда небольшая или «ученическая» модель пытается воспроизвести поведение большой, уже обученной «модели-учителя». Обычно это делается для уменьшения размера модели при сохранении ее интеллекта. * Микро-полное извлечение (Micro Recall): Метрика оценки, которая показывает, насколько хорошо модель воспроизвела все слова из исходного текста, включая редкие и специфические. В контексте OCR это критически важно: низкий recall означает, что модель пропустила или исказила значительную часть текста. * Forward KL: Метрика из машинного обучения (Kullback-Leibler divergence), которая используется для измерения расстояния между двумя распределениями вероятностей. В данном контексте она помогает регулировать, насколько сильно студент должен имитировать выбор учителя.

На фоне общего прогресса в области ИИ, работа над сохранением фактологической точности в OCR кажется нам особенно своевременной. В эпоху, когда текстовые модели все чаще используются для автоматизации рутинной работы, риск того, что они «выдумают» важный факт, становится серьезной проблемой. Метод GAD-RL показывает путь, где технологическое совершенствование идет рука об руку с уважением к исходным данным.

Источник исследования: arXiv:2609.38282

Первоисточники

arXiv cs.AI ↗
← Вернуться в эфир