Искусственный интеллект · продуктивность разработчиков · METR · программирование · аналитика26 сентября в 12:05 · 4 мин

Исследование о замедлении работы с ИИ оказалось методологически некорректным

Метрики эффективности разработки (METR) опубликовали серию отчётов, опровергающих популярную цифру «минус 19%» в скорости работы программистов с ИИ. Эксперимент столкнулся с оттоком участников, нежеланием работать в «человеческом режиме» и скрытием задач, где нейросети наиболее сильны.

# ИИ не замедляет, но измерить его пользу становится сложнее

В июле 2025 года сообщество разработчиков охотно цитировало исследование компании METR, в котором утверждалось, что использование искусственного интеллекта делает опытных программистов на 19% медленнее. При этом сами участники эксперимента уверенно заявляли, что чувствуют ускорение примерно на 20%. Этот разрыв между фактом и восприятием стал топливом для острых дискуссий о замене людей алгоритмами.

Однако последующие публикации тех же авторов в феврале и мае 2026 года показали, что сама методология сбора данных оказалась сломанной. Цифры больше не отражают реальную картину продуктивности, а лишь фиксируют кризис в попытках изолировать человека от инструментов, которые он теперь считает жизненно необходимыми.

Кризис эксперимента: от 16 до «остатков»

Первоначальное исследование проходило в строгих условиях. 16 опытных разработчиков, владеющих сложными репозиториями с миллионами строк кода, выполняли задачи из двух групп: «с ИИ» и «без ИИ». Инструментами были Cursor Pro и модели Claude 3.5/3.7. Оплата составляла внушительные $150 в час.

Результат был однозначным: время выполнения задач с включенным ИИ увеличилось. Исследователи нашли пять причин этого феномена: * Переоценка пользы: Разработчики слишком хорошо знали свой код и недооценивали вклад ассистента. * Сложность контекста: Большие проекты содержат неявные зависимости, которые модели не всегда улавливают. * Стоимость ошибки: Ненадёжные предложения ИИ требовали времени на валидацию; около 9% рабочего времени уходило на исправление галлюцинаций моделей.

Ключевой вывод авторов заключался в том, что разработчики, полагающиеся на ИИ, переоценивали его эффективность в своих собственных проектах.

Второй раунд эксперимента, начавшийся в августе 2025 года, столкнулся с непреодолимыми трудностями. Группа выросла до 57 человек, но состав стал проблемным. Оплата снизилась до $50 в час. Авторы зафиксировали резкий отток участников.

В отчёте за февраль 2026 года METR честно признает, что эксперимент перестал быть репрезентативным. Три фактора подорвали его валидность: 1. Отказ участвовать: Растущая доля разработчиков категорически отказывается выполнять даже половину задач без помощи ИИ, даже за высокую плату. 2. Скрытая выборка: Участники, согласившиеся на эксперимент, начали сознательно фильтровать задачи. Они оставляют для «человеческого режима» сложные, рутинные или малоценные кейсы, а сложные задачи, где ИИ мог бы помочь, скрывают, чтобы избежать сравнения. 3. Методические сбои: В условиях работы с агентами время становится «прозрачным». Пока агент обрабатывает запрос, человек пишет другое, и трогать часы сложно.

Показатели ускорения во втором раунде составили всего 4–18%, причем доверительные интервалы включали ноль. Авторы делают вывод, что истинное ускорение у сохранившихся участников может быть значительно выше, но их количество слишком мало для статистической значимости.

Спрос против реальности: опрос 2026 года

Поняв, что прямые замеры «снимать» с ИИ невозможно, METR в мае 2026 года провел опрос среди 349 технических специалистов. Результаты оказались пугающе оптимистичными, но и здесь нетрудно найти предвзятость выборки (сильное смещение в сторону активистов ИИ).

* Медианная оценка ускорения работы составила 3 раза. * Рост ценности работы оценивается в 1,4–2 раза. * Респонденты готовы отчислять до 29% своей зарплаты за месячный доступ к таким инструментам.

Однако METR добавляет важную оговорку: такие средние оценки могут быть завышены из-за эмоций и отсутствия глубокого анализа последствий. Также было выявлено, что сотрудники самой компании METR оценили пользу ИИ ниже всех подгрупп, возможно, из-за осознания предыдущих экспериментальных провалов.

Что это значит для индустрии?

Эта история меняет контекст спора о «замене программистов». Вопрос больше не в том, сделает ли ИИ людей медленнее или быстрее в вакууме лабораторных условий.

Фактически, рынок уже сам решил, что «человеческий режим» без ИИ неприемлем для большинства задач. Исчезновение контрольной группы, готовой работать руками, делает любые сравнительные замеры устаревшими. Разработчики не просто хотят ускорения — они боятся работы без нейросетей, сравнивая её с пешей прогулкой через город вместо заказа Uber.

Для руководителей и аналитиков это сигнал: любые заявления о росте продуктивности в разы требуют проверки на методологическую чистоту. Важно понимать разницу между субъективным ощущением «я быстрее» и объективным временем доставки кода в production. В 2026 году объективные метрики становятся всё сложнее, пока субъективные ожидания продолжают расти.

Эксперименты продолжаются, но они уже не выглядят так, чтобы измерить влияние ИИ в одиночку. Будущее измерений, вероятно, будет связано с анализом реальных коммитов в публичных репозиториях и фиксированными бенчмарками, а не с попытками заставить опытных разработчиков писать код «как в начале 2025 года».

Первоисточники

Habr AI ↗
← Вернуться в эфир