ИИ · LLM · ИИ-агенты · RAG · MCP · компьютерное зрение · кейсы внедрения · корпоративный ИИ22 сентября в 22:03 · 6 мин

В продакшене ИИ побеждает не модель, а обвязка: анализ 1352 кейсов в России

Крупнейший каталог внедрений искусственного интеллекта в российских компаниях насчитывает уже более тысячи проектов. Анализ данных от АНО «Цифровые платформы» и авторской статьи на Хабр показывает, что ключ к успеху не в выборе топовой модели, а в создании надёжной инфраструктуры вокруг неё. Искусственный интеллект перестал быть «чёрным ящиком», превратившись в детерминированный инструмент, требующий строгих семантических слоёв, понятных человеку порогов уверенности и разбитых на короткие цепочки задач. Экономический эффект достигается там, где бизнес уже измерял потери.

# Почему в продакшене побеждает не модель, а обвязка

В 2025–2026 годах ландшафт корпоративного ИИ в России претерпел серьёзные изменения. Если раньше фокус был исключительно на поиске «самой умной» модели, то теперь акцент сместился на архитектуру системы. Авторы исследования проанализировали 1352 кейса внедрения ИИ в российских компаниях и госорганах — от антифрода крупных банков до аграрного сектора. Главный вывод, объединяющий все эти истории: качество модели часто не является решающим фактором. Решает обвязка.

Под «обвязкой» понимаются семантический слой (структурирование данных), пороги уверенности (когда решение передаётся человеку), детерминированный код вокруг LLM (большая языковая модель) и человеческий контроль на границе процессов. Ниже представлены шесть ключевых паттернов, выявленных в ходе анализа.

Модель не принимает решение, она его оформляет

Самые устойчивые кейсы строятся по принципу разделения ответственности. LLM не дается прямые доступ к базам данных или файлам. Вместо этого между моделью и информацией стоит семантический слой. Он описывает метрики, измерения и связи, превращая запрос в параметризованный конструктор.

Примеры показывают эффективность такого подхода: * Первая грузоперевозочная компания: ИИ-агент операционной аналитики отвечает логистам, но не пишет SQL-запросы напрямую. Сводка по 150 объектам собирается за минуты вместо часа. * Яндекс: Робот-документатор витрин данных сначала собирает объективный контекст (схемы, глоссарий), и только затем LLM дописывает описание. Результат — 15 000 таблиц за полгода против 500 ранее. * Альфа-Банк и ДОМ.РФ: В этих проектах детерминированный код (на Go или классическом ML) обрабатывает данные, а модель включается только для формирования ответа в свободной форме.

Такое определение корпоративного ИИ-агента становится стандартом: «детерминированный код думает, модель говорит». Это снижает хаос и повышает предсказуемость.

Порог уверенности и человек за ним

Полная автоматизация в крупных кейсах — редкость и часто дорога. Системы, приносящие деньги, используют гибридный подход: на пороговых значениях уверенности решение передаётся человеку.

Система CV-модерации фотоотчётов сети «Иваныч» (X5 Group) проверяет 10 миллионов фотографий в месяц с помощью 26 моделей и 62 типов проверок. На определённых порогах подключается оператор. В результате точность выросла с 79% до 92%, а операционные расходы снизились вдвое, при этом система работает на modestом ресурсе (4 vCPU).

Аналогично в VK Видео: попытка полностью заменить асессоров провалилась. Сработал гибрид, где дообученная модель разметает поток, а человек проверяет только пограничные случаи. Стоимость такой точки разметки упала в 60 раз.

Опыт внедрения защитных механизмов у AGIMA также честен: детектор промпт-инъекций откатывали трижды из-за деградации, прежде чем выйти в продакшен. Ложные блокировки упали с 140 до 1 на 179 безопасных текстов. Пять раундов доработки — это нормальная цена успеха.

Агентная цепочка живёт пять-шесть шагов

Эксперименты показывают жёсткое ограничение на длину цепочек действий агента. Сравнение облачных и локальных моделей (включая Claude Sonnet, Qwen-235B и локальную Qwen-9B) по сценариям различной сложности выявило закономерность: * Двухшаговая задача: успех во всех случаях. * Трёхшаговая: локальные модели дают 100% точности, облачные часто отклоняются от инструкции. * Пятнадцатиступенчатая задача: ни одного полного успеха из 27 попыток. Более того, модели часто рапортовали о завершении, которого на деле не было.

Граница надёжной работы, как показала практика VK Tech, лежит примерно на шести последовательных вызовах инструментов. Это ограничение компенсируется инженерными решениями: создание специализированных профилей для фреймворков, внедрение middleware для предотвращения ошибок (LoopBreaker, ShellSafety) и использование стандарта MCP (Model Context Protocol).

Вместо предоставления агенту «неограниченного доступа к системам» ему выдают 6–7 проверенных инструментов с чёткими контрактами. Именно здесь растёт роль MCP как корпоративного стандарта интеграции.

Узкая задача работает, широкая — нет

Попытки внедрить ИИ как универсального ассистента разработчика дают противоречивые результаты.

Узкие, хорошо описанные задачи приносят разрыв в производительность: * В X5 знание реальной дизайн-системы через MCP позволило вёрстать экраны за 2–3 часа вместо 8. * В КОРУС Консалтинг модель сгенерировала утилиту для работы с метаданными за шесть часов.

Широкие задачи, напротив, пока не дают статистически значимых улучшений метрик. Пилот агентной разработки на 100 инженерах в Авито не выявил изменений в объективных показателях разработки. Объяснение простое: эффект упирается в J-кривую обучения. Окупаемость достигается не при глобальном ускорении команды, а за счёт специфического сокращения времени на рутинные операции (например, ревью или разбор инцидентов).

Деньги там, где метрика была до ИИ

Кейсы с подтверждённым экономическим эффектом группируются вокруг процессов, где потери уже точно считались. ИИ здесь выступает инструментом оптимизации существующих моделей.

* ЕвроХим: Рекомендательная система в одном цехе «Невинномысского Азота» принесла 270 млн рублей, позволив перейти от проверки качества раз в четыре часа к непрерывному контролю. * Нижнекамскнефтехим: Отечественная система управления после ухода западных вендоров дала эффект 61 млн рублей за три месяца. * Банковский сектор: Антифрод-системы Т-Банка и Сбера предотвратили потери на сотни миллионов рублей. * Совкомбанк и Ростелеком: Здесь успех измеряется охватом. Платформы для тысяч сотрудников показывают экономию в миллионы рублей за счёт агрегации мелких улучшений, но не миллиарды от одного крупного прорыва.

Рубль в данном контексте даёт именно цех и конкретный измеримый процесс, а не абстрактная платформа.

Малые модели там, где нужна скорость

Параллельно с гонкой за гигантскими параметрами развивается инженерия компактных моделей. Там, где нужны мгновенный отклик или работа в условиях ограниченных ресурсов, большие модели не подходят.

* Яндекс: Нейросети весом 0,5–1,5 МБ распознают голосовые команды в колонках, снижая ложные срабатывания на 60%. * YADRO и Smart Engines: Используют сети на несколько тысяч параметров для цветокоррекции и детекции документов, получая прирост скорости в 4 раза. * SberDevices и VK Cloud: Экономят токены с помощью кэширования и квантизации, повышают пропускную способность и снижают время отклика.

Экономия вычислительных ресурсов становится отдельной инженерной дисциплиной, критической для масштабируемости.

Заключение

Через год спор о том, чья модель лучше, уйдёт из корпоративных дискуссий. Останется спор об обвязке: чей семантический слой, чьи guardrails (защитные правила) и чей MCP-хаб. Для ИТ-директора правило простое: спрашивать у вендора не о параметрах модели, а о том, что стоит между ней и данными, и где проходит порог, за которым решение передаётся человеку. Для внедренцев — начинать с процессов, где потери уже измерены, и не обещать цепочек длиннее шести шагов. Как писал один из участников анализа: «Скорость разработки кода перестала быть дефицитом. Дефицитом стали денежные идеи».

Первоисточники

Habr AI
← Вернуться в эфир