AI8 августа в 08:01 · 4 мин

Архитектура SOFROS AI/ML: как гибридные модели и REST API преобразуют нормализацию справочников

Второй этап разбора сервисной экосистемы SOFROS раскрывает «подкапотное» пространство их платформы для автоматизации работы с нормативно-справочной информацией (НСИ). Авторы статьи объясняют, почему полагаться на одни только языковые модели (LLM) недостаточно, и демонстрируют ценность гибридного подхода, сочетающего шаблоны, классическое машинное обучение и нейросети. Ключевым элементом архитектуры становится микросервисное ядро с открытым REST API, обеспечивающее бесшовную интеграцию с корпоративными системами 1С:MDM и SAP.

# Архитектура SOFROS AI/ML: как гибридные модели и REST API преобразуют нормализацию справочников

В предыдущей публикации мы обсудили методологию атрибутивной нормализации и показали, как классические алгоритмы сравнения строк упираются в потолок качества при работе с неструктурированными данными. Теперь же мы заглянем внутрь сервиса SOFROS AI/ML, чтобы понять, какие технические решения стоят за автоматизацией полного цикла обработки информации: от извлечения характеристик до валидации и устранения дублей.

Главный вывод, заложенный в архитектуру сервиса, таков: ни один отдельный инструмент не способен решить задачу в isolation. Для эффективной работы требуется гибридизация подходов.

Гибридная модель: почему LLM — не панацея

При разработке экспертами SOFROS было принято решение не полагаться исключительно на современные большие языковые модели (LLM), которые требуют колоссальных вычислительных ресурсов. Вместо этого применяется комбинация трех уровней сложности:

1. Шаблонные методы: Для быстроты обработки стандартных параметров и нормативов. 2. Классическое машинное обучение: Для решения прикладных задач, основанных на структурированных данных. 3. Языковые модели (LLM): Используются только там, где критически важны контекст и семантика, например, для анализа сложных формулировок.

Такой подход позволяет обрабатывать большие массивы записей с высокой точностью, сохраняя рентабельность вычислений.

Техническое ядро и функциональные компоненты

Архитектура сервиса построена на четырех ключевых уровнях, которые обеспечивают модульность и масштабируемость.

Уровень 1: Ядро сервиса Сердцем системы выступает автономный сервер, разработанный на принципах микросервисной архитектуры с поддержкой как Windows, так и Linux. Для взаимодействия с внешним миром используется открытый интерфейс REST API, документация для тестирования которого доступна через Swagger.

Управление жизненным циклом моделей (обучение, пополнение датасетов, прогнозирование) осуществляется через менеджеры сервисов. Особое внимание уделено интеграции с 1С:MDM (редакция 2.5): здесь реализована бизнес-логика нормализации и специальный SDK для связи с библиотеками AI платформы «Одиссей» (ранее ИТЦ «1С:ИИ»). Примечательно, что разработчики планируют создать автономный клиент для более широкой интеграции, следуя методологии Spec-Driven Development (SDD).

Уровень 2: Модели AI/ML Реализованные на Python классы моделей охватывают весь спектр задач нормализации: * Классификация: Наивный байесовский классификатор определяет категорию объекта (например, «кабель» или «насос»). * Экстракция (NER): Автоматическое выделение атрибутов из текста: тип, сечение, материал, ГОСТ. * Семантический поиск: Модель генерирует выборку похожих записей, сопоставляя, например, «сечение жилы» и «сечения кабеля». * PII-маскировка: Защита персональных данных согласно 152-ФЗ.

Важно отметить, что сервис поддерживает работу как с облачными моделями, так и с локальными LLM, размещенными в закрытом контуре заказчика.

Уровень 3: Интеграция и оркестрация Связующим звеном выступает Интегратор — сервис оркестрации. Он обеспечивает взаимодействие между клиентским приложением, ядром AI и другими системами (1С, SAP). Интегратор выполняет роль единого проводника данных, организуя потоки и контролируя их передачу.

Уровень 4: Инфраструктура и управление данными Управление доступом к ресурсам регулируется отдельным модулем управления правами (Access Control Module), который взаимодействует с базой данных пользователей. Для хранения и анализа метаданных используется PostgreSQL.

Выводы для бизнеса

Применение описанной архитектуры позволяет достигать ощутимого экономического эффекта: * Снижение трудозатрат: Автоматизация снижает ручную работу экспертов НСИ на 70–80%. * Унификация данных: Сокращение ошибок в закупках и планировании за счет единого стандарта. * Безопасность: Возможность работы с конфиденциальными данными в локальной среде благодаря PII-маскировке.

В заключении статьи подчеркивается, что SOFROS AI/ML не заменяет MDM-систему, а выступает её интеллектуальным расширением, снимая рутину с сотрудников.

Что дальше? В следующих публикациях цикла планируется детальное рассмотрение процессов обучения моделей, метрик оценки их качества и тонкостей построения пайплайнов.

Если вы хотите глубже разобраться в теме или обсудить внедрение решения для вашей компании, SOFROS приглашает записаться на бесплатную консультацию и демонстрацию сервиса.

*Автор: Богданов Игорь Юрьевич, Технический директор (CTO) SOFROS.*

Первоисточники

Habr AI
← Вернуться в эфир