RAG · гибридный поиск · римейкинг · NLP · ИИ · поиск по документам · векторный поиск28 сентября в 06:32 · 4 мин

Российские инженеры оптимизировали поиск по Налоговому кодексу: гибридный RAG и реранкинг

Команда RUVDS провела детальное исследование методов поиска на примере Налогового кодекса РФ. Эксперименты на базе 240 вопросов из FAQs ФНС показали, что простое векторное недостаточно для юридической точности, а комбинация классического и плотного поиска (гибридный RAG) с последующим реранкингом повышает релевантность ответов без необоснованного усложнения архитектуры.

# От «Сю» к «Ха-Ри»: оптимизация RAG на примере Налогового кодекса

В мире искусственного интеллекта и ретриевальных систем часто встречается тенденция к мгновенному переходу к сложным архитектурам, таким как агентов RAG или GraphRAG. Однако эксперты компании RUVDS, опираясь на принцип «Сю» (следование форме) из японских боевых искусств, утверждают, что фундаментальные улучшения качества поиска важнее сложного инструментария. В рамках исследования была проработана база данных на основе Налогового кодекса РФ, чтобы продемонстрировать, как последовательное внедрение улучшений повышает точность систем без лишних затрат ресурсов.

Проблемы базового векторного поиска

Базовый подход к RAG (Retrieval-Augmented Generation) опирается на векторный поиск (dense retrieval). Этот метод эффективен для понимания смысла запроса и синонимов, но сталкивается с двумя ключевыми проблемами в юридической сфере:

1. Потеря точных идентификаторов: Векторные модели могут размывать уникальные маркеры, такие как номера статей законов (например, «статья 107 НК РФ»), в пользу общего юридического контекста. Если номер статьи присутствует в вопросе и документе, плотный поиск может всё равно поднять релевантный фрагмент ниже из-за схожести формулировок с другими документами. 2. Шум в выдаче: Алгоритм может вернуть множество фрагментов, имеющих общий смысл, но не содержащих конкретного ответа на вопрос. Это создает «шум», который может сбить с толку языковую модель при генерации финального ответа.

Гибридный подход: объединение смыслов и букв

Для решения этих проблем исследователи внедрили гибридный поиск. Метод сочетает в себе:

* Dense retrieval: Поиск по смыслу и контексту. * BM25: Классический поиск по совпадению слов и токену, который гарантирует наличие точных идентификаторов (номеров статей).

Объединение двух списков ранжирования осуществляется методом Reciprocal Rank Fusion (RRF). Этот алгоритм не просто суммирует оценки, а пересчитывает позиции документов в обоих списках, выдавая единый результат, где учтены и семантическая близость, и буквальное совпадение терминов. Эксперименты показали, что даже если векторная модель не находит статью по номеру, BM25 может выделить её на второй позиции, если фраза совпадает.

Реранкинг: пересортировка кандидатов

Гибридный поиск значительно расширяет область поиска, но не гарантирует правильного порядка внутри выдачи. Для финальной точности применяется этап реранкинга. В отличие от векторных энкодеров, оценивающих документы отдельно, реранкер (в данном случае модель bge-reranker-v2-m3) анализирует пары «запрос — документ» целиком. Это позволяет пересортировать кандидатов, подняв нужную статью в топ-10 даже если изначально она находилась глубже в выдаче. Однако важно понимать, что реранкер не может вернуть документ, которого нет в исходной выборке, поэтому оптимизация ретриевальной фазы является первостепенной задачей.

Результаты экспериментов

Исследование проводилось на тестовом наборе из 240 вопросов из FAQ ФНС. Использовался корпус из 815 статей Налогового кодекса, разбитый на чанки.

Этап гибридного поиска

* Dense-поиск (BERTA): Нашел нужный фрагмент в первой десятке в 162 из 186 вопросов с конкретными ссылками на статьи. * BM25: Показал результат в 153 из 186 вопросов в первой десятке. * Гибридный RRF: Суммарно улучшил показатели, найдя нужные данные в первой десятке в 163 вопросах и увеличив покрытие в диапазоне до 50 результатов до 182 вопросов. В некоторых случаях гибридный метод исправлял ошибки, когда сильный сигнал одной ветки разбавлялся шумом другой.

Этап реранкинга

При строгих условиях (79 вопросов с однозначно указанными статьями), использование реранкера BGE показало следующие улучшения: * Hit@10: Выявление хотя бы одного нужного пункта в топ-10 выросло с 67 из 79 до 71 из 79 при увеличении числа кандидатов до 50. * nDCG@10: Качество ранжирования (учитывающее порядок) улучшилось с 0,603 до 0,727.

Главный вывод заключается в том, что реранкер эффективен для перестановки уже найденных документов, но не создает новых находок. Также было установлено, что увеличение выборки кандидатов с 20 до 50 не дало значимого прироста качества, зато увеличило время отклика в 2,6 раза. Оптимальный баланс был найден в динамической настройке глубины поиска.

Рекомендации по внедрению

Исследователи не рекомендуют включать гибридный поиск по умолчанию. Вместо этого предлагается использовать пошаговую диагностику:

1. Если документ не найден в системе, следует искать проблемы в чанкинге или стратегии поиска, а не добавлять реранкер. 2. Если документ найден, но находится ниже топ-10, целесообразно внедрить реранкинг. 3. Для запросов с явно известными идентификаторами (например, номерами статей) возможно применение маршрутизации для ускорения обработки.

Таким образом, путь к качественной системе ретrieve-and-generate лежит через тщательную настройку базовых компонентов, а не через имитацию сложных архитектурных решений без необходимости.

Первоисточники

Habr AI ↗
← Вернуться в эфир