Claude Code · AI-агенты · QA тестирование · автоматизация тестирования · метрики LLM · стоимость разработки · парадигма тестирования22 сентября в 19:03 · 5 мин

Экономика ИИ-тестирования: агент нашел больше багов, но человек контролирует процесс

В результате одиннадцатинедельного эксперимента по автоматизированному тестированию с использованием ИИ-агента Claude Code выяснилось, что искусственный интеллект превосходит человека в объеме обнаруженных дефектов — 77 против 16. Однако эффективность агента напрямую зависит от наличия четких эталонов (макетов, технического задания) для сравнения, а роль специалиста смещается от ручного поиска ошибок к верификации результатов агента.

# Кто нашёл больше багов — агент или человек: реальные цифры за 11 недель

Прямое сравнение скорости и качества работы человека и ИИ-агента в области тестирования программного обеспечения — задача сложная, но измеримая. В рамках длительного эксперимента, продолжавшегося одиннадцать недель, автор исследования вел подробный дневник каждой рабочей сессии с использованием Claude Code в связке с инструментарием paranoid-qa. Целью было отбросить маркетинговые обещания и получить сухие цифры: сколько часов работало агента, сколько присутствовал человек и сколько дефектов реально было подтверждено.

Итоги оказались неожиданными: ИИ-агент обнаружил и подтвердил 77 дефектов, тогда как человеческий специалист нашел только 16. При этом количество часов активной работы агента составило 277, а человека — 213. Таким образом, агент не просто поддержал работу человека, но и значительно расширил горизонт поиска проблем, выявив их там, где человек мог бы их пропустить.

Эволюция метода подсчета: почему первичные данные были неточными

Научная ценность любого эксперимента лежит в качестве сбора метрик. В начале проекта первоначальный подсчет находок показал почти вдвое больший результат. Оказалось, что агент, находясь в активной фазе работы, выдвигал множество «кандидатов» на статус бага, которые в ходе перепроверки или финального аудита человеком оказывались ложными. Только присмотр к финальному вердикту каждой сессии после её завершения дал верную картину.

Для корректного анализа автор использовал транскрипты сессий, хранящиеся в файловой системе проекта. Время работы агента учитывалось как сумма активных интервалов, исключая паузы длительностью более 30 минут. Время человека подсчитывалось аналогичным образом, но с учетом лишь минут, когда пользователь был активен в чате (порог 20 минут).

Важно понимать, что «кандидат в дефект» — это не обязательно баг. У каждого кандидата может быть четыре исхода:

1. Подтвержден: дефект воспроизведен и признан. 2. Передан вопросом: проблема существует, но её разрешение находится в зоне ответственности аналитика, дизайнера или специалиста по безопасности. 3. Снят: кандидат не выдержал проверки. 4. Пропущен: дефект найден, но был потерян по дороге к формированию отчета.

В финальную статистику включаются только подтвержденные находки. Игнорирование промежуточных списков и «ожогов» от ложных срабатываний позволило получить честную картину эффективности.

Специфика находок: где агент, а где человек

Анализ распределения найденных дефектов выявил четкое разделение зон ответственности. ИИ-агент демонстрирует превосходство в задачах, требующих систематического перебора состояний, глубокого анализа кода и проверки невидимых для обычного пользователя сценариев.

Агент успешно выявил проблемы на уровне данных (payload), где кнопки выглядели активны, но запросы отправлялись некорректно, а также нашел расхождения в коде тестового и боевого контуров, которые не проявлялись визуально в браузере. Он быстро строит моки (заглушки) для проверки поведения системы при ошибках сети, что вручную занимает много времени. Кроме того, агент оказался полезен в проверке ссылок (404 ошибок), сравнивая заголовки ответов сервера с реальными переходами.

Человеческий специалист, напротив, оказался незаменим в задачах, требующих физического присутствия в продукте и интуиции. Именно человек заметил ошибки горизонтального скролла, проблемные служебные страницы и «уехавший» контент, возникший при первом клике. Сложные визуальные артефакты, такие как нарушение выравнивания соседних элементов, часто ускользают от автоматического просмотра и ловятся специалистом.

Эффективность агента резко возрастает там, где есть эталон для сравнения. Сравнение реализации с макетом, техническим заданием или упавшим автотестом приносит значительно больше результатов (до 1,36 находок в час), чем свободный поиск. Задачи типа написания тест-дизайна в рамках агента показывают нулевую эффективность по обнаружению дефектов, так как эти часы тратятся на создание тестов, которые затем используются для проверки, но не содержат самих багов продукта.

Экономика работы с ИИ-тестировщиком: мифы и реальность

Маркетинговые обещания о том, что ИИ заменит человека и сделает его работу в десять раз быстрее, в данном случае не оправдались. Агенты не заменяют специалистов, а удваивают их пропускную способность. На каждый час работы агента специалист тратит три четверти своего времени на постановку задач, разбор кандидатов и принятие решений.

Финансовая модель показывает более скромную, но реалистичную экономию. Стоимость часа работы ИИ-агента (по тарифу Max 5x) составляет около 80 рублей. Штатный инженер с зарплатой 200 тысяч рублей обходится компании в среднем 1200 рублей за час работы. Однако, поскольку на каждый час агента уходят 0,77 часа человеческого времени, полная формула экономии выглядит следующим образом:

Экономия: (Человеко-часы × 1200 руб.) - (Человеко-часы × 0,77 × 1200 руб.) - (Агентские часы × 80 руб.)

На тех же задачах выходит экономия около 16%. Главная выгода агента заключается не в замене людей, а в выполнении задач, которые раньше исключались из плана из-за сложности или монотонности: построчная сверка кода, проверка ссылок в разных браузерах, тестирование недоступных сторонних скриптов. Пока агент занимается этими задачами, человек может заниматься поиском новых идей или сложным анализом.

Риски и ограничения: почему человек всё ещё необходим

Работа с агентом несет риски ложных срабатываний и пропусков багов. За одиннадцать недель агент выдвинул около 130 кандидатов, которые были отвергнуты. Среди 6 пропущенных багов автор выделил опасные паттерны: агент проверяет только то, что он сам определил как зону проверки, и часто игнорирует регрессионные изменения при ретесте правок.

Особый класс ошибок связан с моками (заглушками). Агент может ошибочно диагностировать баг в тексте ошибки, который сам же и сгенерировал в моке, вместо того чтобы проверить поведение интерфейса. Для минимизации ошибок автор ввел жесткие правила: любые правки должны проходить полный визуальный проход, а дефекты на моках не могут быть текстом или структурой ответа, заложенными самим тестировщиком.

Вывод

ИИ-агент стал мощным инструментом расширения возможностей тестирования, находя дефекты там, где человек не видит, но его эффективность критически зависит от качества постановки задач и наличия эталонов. Человек остается в контуре для финальной верификации, анализа сложных визуальных артефактов и контроля за качеством работы агента. Комбинация «эталон + агент + верификация человеком» оказалась наиболее эффективной стратегией для современного QA.

Первоисточники

Habr AI
← Вернуться в эфир