автоматизация · искусственный интеллект · корпоративные агенты · LLM · RAG · Авито · архитектура ИИ2 сентября в 12:32 · 5 мин

Как в Авито создают корпоративного агента «Виталик»: от пилотов к реальной автоматизации

Интеграция искусственного интеллекта в бизнес-процессы часто сталкивается с разрывом между демонстрационными версиями и реальной продакшн-готовностью. На примере внутреннего проекта Авито «Виталик» показывается, как система превращает разрозненные знания и регламенты в автономных агентов, способных самостоятельно искать информацию и координировать сложные действия. Проект опирается на архитектурное разделение на четыре слоя: управление сессией, Retrieval-Augmented Generation (RAG), модуль инструментов (MCP Hub) и строгие бенчмарки для оценки качества.

Абстрактная серебристая спираль над темным морем у каменного маяка.

# От LLM-портала к фабрике агентов: внутри проекта «Виталик» на Авито

По данным McKinsey, к концу 2025 года 71% компаний предпринимали попытки интегрировать искусственный интеллект в свои бизнес-процессы. Однако отчеты MIT указывают на то, что лишь около 5% таких пилотов действительно переносятся в продуктивную среду. Основной барьер заключается не в отсутствии технологий, а в неспособности моделей работать с многоуровневыми задачами, требующими выбора релевантной информации из разнородных источников и координации действий.

Старший инженер по данным Авито Никита рассказал, как компания преодолела этот разрыв, создав платформу «Виталик» — экосистему внутренних агентов, которые эволюционируют от простых чат-ботов до полноценных сотрудников, способных завершать сложные процессы.

Эволюция от проекта к агенту

Исходная точка проекта — рутинная задача сотрудника корпоративного центра: найти альтернативу Microsoft Office, сопоставить цены и согласовать закупку. Человеку приходится тратить до 30 минут на сбор данных из Confluence, внутренних чатов, базы знаний поставщиков и проверку регламентов. Процесс включает взаимодействие с хелпдеском и подписание заявок в 1С.

Платформа «Виталик» снижает время решения такой задачи до пары минут. Но механизм этот сложнее, чем просто быстрый ответ. Система предлагает трехуровневую структуру:

1. Обычный чат: Используется для получения базовых определений. Здесь задействована только языковая модель без внешних подключений. 2. Подгрузка артефактов: На уровне более сложных задач (например, составление договора) система автоматически подключает документы и картинки к контексту диалога. 3. Проекты (Агенты): Самый сложный уровень. Это контейнер знаний с правами доступа, инструментами и возможностью коллаборации. Успешные проекты, имеющие владельца, валидационные данные и полный набор инструментов, превращаются в автономных агентов.

Главная идея заключается в том, что «Виталик» становится единой точкой входа. Пользователь получает задачу, а платформа не просто отвечает текстом, а становится исполнительным органом, автоматизируя весь жизненный цикл процесса.

Архитектура: четыре слоя и оркестратор

Чтобы система работала стабильно в корпоративной среде, были выбиты четыре ключевых слоя и внедрен оркестратор. В качестве примера рассматривается процесс закупки программного обеспечения.

PortalManager: мозг системы

Это ядро оркестрации, отвечающее за сборку сцены диалога. Разработчики выбрали подход, разделяющий подготовку сессии и выполнение логики (ReAct-цикл). PortalManager строит агентское дерево, выбирая подходящую модель для планирования (понимающую бизнес-процессы) или узкоспециализированную дистиллированную модель. Оркестратор управляет состоянием диалога, персистентной памятью и потоком данных, предоставляя LLM доступные инструменты, контекст и правила.

Здесь важно различать три типа классификации инструментов: * Workflow-инструменты (n8n, Make): Жесткая детерминированная логика, идеальны для cron-задач, но не справляются с контекстной памятью и гибкой настройкой агентов. * Agent runtime (ADK, LangGraph): Предоставляют инфраструктуру (управление состоянием, колбэки), но требуют глубокой доработки под конкретную задачу. * Coding-агенты: Узкоспециализированы на коде и лишены инфраструктурного слоя для интеграции в широкие бизнес-процессы.

«Виталик» выступает как продуктовый слой, объединяющий возможности всех перечисленных категорий.

RAG: сердце системы

Retrieval-Augmented Generation (RAG) отвечает за поиск релевантной информации. Конвейер обработки данных включает загрузку файлов (PDF, Excel), их препроцессинг (парсинг, дедупликация), индексацию с помощью чанкеров и эмбеддингов в Elasticsearch, а также гибридный поиск с реранкером.

Критическая особенность подхода Авито: модель вызывается только на финальной стадии формирования ответа. Она не участвует в предварительном поиске. Вместо этого система на основе сырых документов создает внутреннюю базу знаний (индекс сущностей, саммари), которую обновляет сама. Это позволяет избежать детерминированного поиска с нуля для каждого запроса и обеспечивает устойчивость ответа при повторных обращениях.

MCP Hub: руки агента

Чтобы не перегружать оркестратор деталями реализации, все инструменты вынесены в отдельный модуль управления (Hub). Агент вызывает нужный сервис через единый контракт, не зная внутренней архитектуры. В кейсе с закупкой это могут быть интеграции с 1С, базы поставщиков или сервисы согласований. Это обеспечивает чистое разделение ответственности и упрощает масштабирование.

Бенчмарки: стандарт качества

Проект становится полноценным агентом только после прохождения строгой валидации. Оценивание происходит по четырем направлениям: * Function calling: Проверка способности модели корректно вызывать инструменты и работать с контекстом. * RAG и поиск: Качество нахождения релевантных документов. * Tools / MCP: Корректность вызовов инструментов и отсутствие ошибок. * Domain agent: Использование эталонных ответов и обратной связи от пользователей (лайки/дизлайки) в качестве судей (LLM-as-a-judge).

Измеряется не только текст, но и весь маршрут решения задачи: выбор инструментов, использованный контекст и обоснованность итогового вывода.

Перспективы развития

Платформа «Виталик» продолжает эволюционировать в направлении увеличения автономности агентов. Основные векторы развития включают:

* Управление длительными процессами: Обучение агентов не просто выдавать советы, а писать код, создавать новые инструменты и доводить цепочки действий до результата. * Внутренняя LLM-вики: Реализация идеи, при которой модель сама ведет и обновляет базу знаний, делая агентов еще быстрее и устойчивее. * Собственные модели: Обучение языковых моделей на русском языке с учетом специфики внутренней документации компании для повышения качества и безопасности. * Модульность экосистемы: Интеграция новых проектов и внешних инструментов как подключаемых возможностей.

Таким образом, «Виталик» демонстрирует путь от абстрактного использования больших языковых моделей к созданию практической фабрики автоматизации, где каждый успешный бизнес-процесс превращается в своего цифрового сотрудника.

Первоисточники

Habr AI
← Вернуться в эфир