Искусственный интеллект · Agentic AI · Harness Engineering · Инфраструктура ИИ · Надежность систем31 августа в 19:02 · 6 мин

Почему 40% агентных проектов обанкрутятся к 2027 году: Проблема не в модели, а в обвязке

Исследования показывают, что разброс результатов от конфигурации агента (обвязки) в 8 раз выше, чем от выбора конкретной модели ИИ. Эксперты предупреждают: к 2027 году массово закроются проекты, где критическая логика и безопасность оставались на уровне промптов, а не в коде.

Образ новости как разбитое зеркало на темном берегу

# 40% агентных проектов обанкрутятся к 2027 году: Где кроется истинная проблема?

Спор «какая языковая модель умнее» быстро перестал быть философским вопросом и превратился в измеряемую величину. Последняя работа, опубликованная сообществом Habr AI и поддержанная исследованиями из ведущих университетов, дает шокирующую цифру: разница в производительности зависит не от мозга агента, а от его тела.

Ломка «обвязки» (Harness) — главная причина провалов

Авторы исследования «Хватит сравнивать агентов, не раскрывая обвязку» провели эксперимент, прогнав одинаковые модели через разные системы управления (обвязки). Результат оказался неожиданным: разброс итоговой эффективности, вызванный именно обвязкой, оказался примерно в восемь раз больше, чем разброс от выбора самой модели.

В шести из девяти случаев смена конфигурации меняла сам рейтинг моделей. Та, что считалась лучшей, становилась худшей. Более того, исследователи из Фуданьского и Пекинского университетов позволили системе эволюционировать самостоятельно. Алгоритм на каждой итерации анализировал провалы агента и автоматически правил свои внутренние правила и инструменты. Без изменения самой модели результат вырос с 70% до 77%, тогда как статичная, вручную собранная обвязка остановилась на уровне 72%.

Реальный мир подтверждает лабораторные данные. Пользователи жаловались на снижение качества Claude спустя полтора месяца. Технический разбор выявил не ошибку в модели, а три бага в обвязке: уменьшение вычислительных усилий, поломка очистки истории и ограничения на длину сообщений в промптах. Вывод однозначен: если вы тестируете две модели на одном агенте, но обвязка разная, вы фактически тестируете обвязки, а не модели.

Что такое Harness Engineering?

Термин «harness» (обвязка) обозначает весь код вокруг модели: инструменты, память, лимиты, оркестрация и политики доступа. Модель делает одну вещь — принимает контекст и выдает шаг. Всё, что происходит до и после, — это среда выполнения.

В 2026 году этот подход получил признание благодаря Митчу Хашимото (HashiCorp), который сформулировал ключевой принцип: «Каждый раз, когда агент ошибается, ошибку нужно сделать структурно невозможной». Надежность достигается не инструкциями (промптами), а кодом, который автоматически блокирует неправильные действия, аналогично тому, как линтеры и тесты работают в разработке программного обеспечения.

Четыре инженерных слоя надежности

OpenAI предложила классификацию обвязки на четыре критические функции. Отсутствие любого из них ведет к катастрофическим расходам или потере контроля.

1. Constrain (Ограничить): Физическое ограничение возможностей. Инструкции в промпте («не удаляй ничего») не работают — модель может их игнорировать или цитировать после факта. Реальные ограничения — это токен-бюджеты, права доступа на уровне инфраструктуры, circuit breaker для внешних API и детекторы повторяющихся вызовов. Это защита от «уверенной активности», которая ведет к потере данных. 2. Inform (Сообщить): Промпт как должностная инструкция. Он должен версионироваться и храниться в репозитории. Новые условия не должны конфликтовать со старыми. Любое правило должно быть привязано к конкретному сценарию отладки. 3. Verify (Проверить): Три уровня валидации. На первом уровне — инварианты в коде (например, сумма возврата не может превышать сумму заказа), которые работают мгновенно и не ошибаются. На втором — замеры на эталонных запросах для выявления деградации стиля или логики. Третий уровень — человеческий контроль, который переводит найденные ошибки на уровень второго, а затем первого. Любая проверка, требующая от модели «посудить», не должна быть частью детерминированного слоя. 4. Correct (Исправить): Обработка тихих неудач. Самая опасная ошибка — когда агент отвечает, что действие выполнено, но не сохранило данные. Падение системы заметно, а ложный успех заставляет систему работать дальше на сломанных данных. Инвариант здесь: ответ пользователю невозможен без фиксации действия в базе.

От промптов к циклам

Современная задача разработчика смещается от написания промптов к проектированию циклов. Пример проекта AutoResearch показывает, как агент может сам проводить эксперименты: править код, запускать обучение на фиксированное время и откатывать изменения, если метрика ухудшилась. Это не серия промптов, а автоматизированный процесс с жесткими границами и бюджетом.

Архитектура и наблюдение: почему бэкендерам это знакомо

Полная картина обвязки включает семь слоев: среда исполнения, тулинг, контекст, жизненный цикл, наблюдаемость, верификация и governance. Критически важным является слой наблюдаемости. Без него все остальные слои работают вслепую. Вы узнаете о дефекте, только когда пользователь пожалуется. В продакшене, где агенты могут действовать автономно, отсутствие трассировки и метрик равносильно отсутствию системы.

Эта работа — не новое изобретение, а эволюция навыков SRE и платформенного инжиниринга. Успешные инженеры всегда строили среду, в которой работает код. Теперь этой средой пользуются агенты, которые ошибаются часто и очень уверенно. Обвязка становится активом компании: она накапливает доменные знания и инциденты, переживая сами модели, которые под ней лежат.

Практический пример: Контроль качества контента

В команде маркетингового агентства задача была решена гибридным способом. Для контроля редполитики и технических метрок (UTM-метки, обязательные поля) использовалась детерминированная система на Node.js и Express. Никакой ИИ в этом процессе нет.

* Принцип: Сервер всегда пересчитывает проверку с нуля, даже если клиент утвердил текст. Утверждение клиента — это только воля, а не факт выполнения правила. * Версионирование: Любое изменение сохраняется как снимок. Можно вернуть любую предыдущую версию и точно знать, что изменилось. * Морфология: Для ловли стоп-слов на русском языке был создан специальный словарь с учетом падежей и контекста, что оказалось эффективнее и надежнее, чем пытаться научить модель.

Такой подход показал потолок возможностей ИИ: он не понимает смысла, но отлично работает с правилами. Когда придет время оценивать семантику текста, модель встанет уже внутри надежной обвязки, где её ошибки будут застрахованы.

Заключение

Прогноз Gartner о закрытии 40% агентных проектов к 2027 году описывает последствия отсутствия контроля: неконтролируемые расходы, неясная ценность и риски. Решение строится снизу вверх: сначала создаются слои, которые можно замкнуть в коде (Constrain, Verify), и только затем добавляется вероятностный слой модели.

Если ваш агент может выполнить необратимое действие, пока вы спите, у вас недостаточно слоев обвязки. Если качество оценивается вручную — их тоже не хватает. Истинная инженерия будущего — это не промпт-инжиниринг, а проектирование безопасных сред для автономных исполнителей.

Первоисточники

Habr AI
← Вернуться в эфир