рафт · hivetrace · rafi · генеративные модели · рафил · ai safety · фильтрация контента · модерация3 сентября в 09:32 · 5 мин

Скорость и точность: как команда Raft создала систему фильтрации рисков с AI в 3 раза эффективнее стандартов рынка

Защита генеративных систем от вредоносного контента требует не только понимания смысла, но и умения работать в реальном времени с минимальными затратами. Команда Raft, компания-вендор, представила результаты разработки мультилейбл-классификатора «HiveTrace». Эта система способна анализировать 15 категорий рисков (от насилия до финансовых преступлений) одновременно на русском и английском языках. Ключевым достижением стало оптимизирование архитектуры, которое ускорило обработку запросов в 2,95 раза и снизило стоимость инференса в 2,9 раза по сравнению с базовыми конфигурациями PyTorch.

Многослойный кристалл морского стекла в холодном тумане, символизирующий точную фильтрацию.

# Эффективная модерация контента: новый стандарт от Raft

В мире искусственного интеллекта любой продукт с пользовательским вводом — чат-бот, ассистент или поисковик с генеративными ответами — уязвим для рисков. Пользователи могут потребовать инструкций по насилию, а сама модель может сгенерировать опасный контент. Бизнес, игнорирующий эти угрозы, сталкивается с тройным риском: регуляторными штрафами (например, за нарушения 152-ФЗ), репутационными потерями из-за публичных скандалов и операционными издержками, когда ручная модерация не успевает за экспоненциальным ростом трафика.

Команда Raft решила эту задачу не добавлением сложных слоев в промпты или调用 дорогих LLM-судей, а созданием специализированного классификатора. В своей новой публикации на платформе Habr AI они детально описали построение системы, способной ловить небезопасный контент автоматически, в реальном времени и на двух языках.

Архитектура мультилейбл-классификации

Классические бинарные фильтры или системы, основанные на поиске ключевых слов (keyword-фильтры), здесь не работали. Одна и та же фраза может одновременно содержать признаки финансового мошенничества и киберпреступления. Задача была сформулирована как multilabel-классификация: модель должна принимать 15 независимых бинарных решений для каждого текста, а не выбирать одну категорию из списка.

Эти 15 категорий были разделены на две группы:

1. Вредоносные категории, требующие жесткой блокировки или маршрутизации на ручной разбор. Сюда вошли: насилие, оружие, наркотики, дискриминация, нацизм, причинение вреда себе, педофилия, финансовые и киберпреступления. 2. Тематические категории, срабатывание которых требует проверки в контексте законодательства. Например, нецензурная брань регулируется 149-ФЗ, а содержание ЛГБТ-контента или религиозных тем может подпадать под статьи КоАП РФ или УК РФ, в зависимости от контекста и места публикации.

Сама модель не блокирует контент напрямую. Она выдает вероятность попадания в каждую из 15 категорий. Решение о том, отклонять запрос, логировать его или отправлять модератору, принимает внедряющая система на основе своих порогов чувствительности. Это гибкость, позволяющая бизнесу включать только нужные категории без необходимости переобучения модели при изменении требований.

Техническая оптимизация: TensorRT против PyTorch

Главный вызов при внедрении таких систем — экономика на масштабе. Инференс (процесс вычисления ответов модели) должен быть быстрым и дешевым, иначе затраты вырастут линейно с ростом трафика, сводя на нет все технические улучшения.

Команда сравнила производительность трех бэкендов: базового PyTorch с FlashAttention2, ONNX Runtime и оптимизированного TensorRT от NVIDIA. Использовался GPU NVIDIA RTX 3090 для тестирования в различных режимах пакетной обработки (batch size).

Результаты показали колоссальную разницу в эффективности:

* Задержка (Latency): Единичный запрос в режиме batch=1 обрабатывается TensorRT в 2,95 раза быстрее, чем PyTorch (5,9 мс против 17,4 мс). В оптимальном режиме batch=16 задержка составляет всего 12,5 мс при максимальной скорости throughput в 1345,1 текстов в секунду. * Стоимость: Цена обработки одного миллиона запросов на оптимальной конфигурации TensorRT (batch=16) составила всего $0,062. Это в 2,9 раза дешевле, чем наивная конфигурация PyTorch с batch=8, и в 21,8 раза дешевле обработки запросов поштучно.

Важно отметить, что на очень длинных текстах (более 32 токенов в среднем) все бэкенды сходятся в производительности, так как оптимизированные утилиты автоматически откатываются на стандартную обработку, чтобы не терять качество на сложных входных данных. Однако на пиковых нагрузках короткий и среднего размера текстов TensorRT демонстрирует явное преимущество.

Сравнение с альтернативами и бенчмарки

Для подтверждения эффективности новая модель «HiveTrace» была протестирована на бенчмарке из 7 480 примеров и сравнена с 10 альтернативными решениями, включая популярные открытые модели вроде семейств Qwen3Guard, gliguard и специализированные токсичности-детекторы.

Критериями сравнения стали бинарная точность (Binary F1) и макроскопическая точность для множественных меток (F1-macro). Последний показатель особенно важен, так он учитывает все категории поровну, выявляя ошибки на редких классах, таких как нацизм или детская эксплуатация, которые часто «теряются» в среднем балле.

Ключевые результаты теста:

| Модель | Binary F1 | F1-macro (14 меток) | Примечание | | :--- | :--- | :--- | :--- | | HiveTrace (Raft) | 0.9588 | 0.7026 | Лучшая сбалансированная точность | | YuFengXGuard_0.6B | 0.9544 | 0.4581 | Высокая бинарная, но низкая на редких классах | | Qwen3Guard_8B | 0.9337 | 0.3952 | Плохо определяет конкретный тип риска | | gliguard_300m | 0.8025 | 0.2395 | Значительные потери на сложных категориях |

Хотя по бинарной метрике (кто-то безопасен/опасен) разница с конкурентами невелика и укладывается в доверительные интервалы, преимущество новой системы в F1-macro составляет около 25 процентных пунктов. Это значит, что при использовании «HiveTrace» разработчик с большей вероятностью получит корректный ответ на вопрос «какой именно вид риска присутствует», что критично для правильной маршрутизации задачи модератору.

Уроки разработки и ограничения

Разработка системы выявила несколько важных уроков. Основной прирост качества обеспечил не столько архитектурный переход на энкодер с query-токенами, сколько качество и покрытие обучающего датасета, особенно в части редких категорий. Переход к индивидуальной калибровке порога срабатывания для каждой из 15 категорий позволил поднять F1 отдельных классов на 10–30 процентных пунктов.

Модель обладает устойчивостью к простым формам обфускации (замена символов, транслит), но принципиально новые техники обхода потребуют дообучения. Также стоит отметить характерный сдвиг в стратегии ошибок: архитектура настроена на минимизацию пропусков (false negative) за счет повышения количества ложных тревог (false positive). Для тематических категорий, таких как религия или ЛГБТ, это может привести к ложным срабатываниям при обсуждении нейтральных тем, поэтому в реальных системах часто применяют ручной контроль («human-in-the-loop») для «серых зон» уверенности модели.

Итог

Система фильтрации рисков от команды Raft представляет собой готовое решение для бизнеса, которое решает задачи модерации быстрее, дешевле и точнее, чем существующие рыночные аналоги. Оптимизация под TensorRT обеспечивает задержку менее 6 миллисекунд при массовых запросах, а мультилейбл-подход с 15 категориями позволяет гибко настраивать правила безопасности под специфику конкретного проекта.

Для компаний, разрабатывающих продукты с AI-ассистентами или генеративными интерфейсами, такой подход становится не просто рекомендацией, а необходимостью для соответствия правовым требованиям и сохранения доверия пользователей.

Первоисточники

Habr AI
← Вернуться в эфир