ИИ · OpenAI · Microsoft · авторское право · Нью-Йорк Таймс · документы · бизнес · технологии19 сентября в 00:32 · 5 мин

Внутренняя документация OpenAI и Microsoft признает «страшный круговорот» для веб-индустрии

В недавних судебных документах дела «Нью-Йорк Таймс» против ИИ-гигантов были опубликованы внутренние отчеты, где руководители OpenAI и Microsoft прямо указывают на разрушительные последствия своих технологий. Документы, включающие цитаты от Брента Хекта (Microsoft) и Самета Наделлы, содержат тревожное признание: внедрение моделей, потребляющих контент без явного согласия авторов, запустило «doom loop» (страшный круговорот), подрывающий экономические основы всей мировой паутины.

# Когда прибыль идет ценой существования интернета

Ситуация, при которой продукт уничтожает своих поставщиков, кажется парадоксом, но, согласно новым данным, именно к этому пришла ИИ-индустрия. Скрытые до этого внутренние документы, появившиеся в ходе судебного разбирательства между издательским домом «Нью-Йорк Таймс» и корпорациями OpenAI и Microsoft, раскрывают холодный расчет за спиной бешеного роста генеративных моделей.

Эти бумаги не просто фиксируют обвинения в нарушении авторского права; они свидетельствуют о том, что руководство этих компаний было заранее осведомлено о том, что их действия ведут к краху традиционной модели распространения информации. В документах используются слова, которые сложно игнорировать: «крупнейшее хищение труда в истории человечества», «полное издевательство над идеей добросовестного использования» и «существовущая угроза» для издателей.

Признание «страшного круговорота»

Центральным моментом документа является признание того, что стратегии компаний привели к возникновению так называемого «doom loop» (страшного круговорота). Как указано в одной из служебных записей, связанной с Microsoft:

«Наша стратегия контента для ИИ запустила "доу-луп", который одновременно навредит эффективности наших моделей и всей всемирной паутины. Нестандартно, когда конечный продукт угрожает экономическим основаниям своих необходимых поставщиков, но именно такую ситуацию мы создали для нашего бизнеса больших языковых моделей в отношении их цепочки поставщиков контента.»

Этот тезис, согласно документу, был осознан еще на этапе разработки. Компания понимала, что модели, обученные на огромных массивах защищенного авторским правом контента, перестают быть инструментом поиска информации и превращаются в замену самой этой информации. Результатом становится не рост интереса к оригиналам, а снижение трафика к ним.

Масштаб «хищения» и проблема оплаты

В документе подробно описывается методология сбора данных. Брент Хект, директор по прикладной науке в Microsoft, характеризует процесс скрапинга (сбора данных с открытых источников) для обучения моделей как «крупнейшее хищение труда в истории человечества». Он отмечает, что защита компаний от обвинений в нарушении прав строится на искажении концепции «добросовестного использования» (fair use).

Microsoft попыталась дистанцироваться от конкретных формулировок Хекта, заявив через представителя Алекса Хаурека, что это отражает только индивидуальную точку зрения сотрудника и не является юридическим анализом или официальной позицией компании. Однако другие сотрудники, такие как Джайрон Усдан, генеральный директор по стратегии данных, подтверждают, что Хект высказывал академические и футуристические взгляды, которые не всегда совпадали с корпоративной линией, но были признаны руководством.

Самет Наделла, генеральный директор Microsoft, также упоминается в документах с признанием того, что чат-боты фактически заменили традиционный поиск и убрали необходимость перехода по ссылкам к первоисточникам. Это привело к резкому снижению реферального трафика для многих сайтов, в том числе для «Нью-Йорк Таймс». Эксперты внутри OpenAI оценивали падение трафика до 60%.

«Наивысшая степень регургитации»

Одной из главных проблем, поднятых в документе, является способность моделей запоминать контент дословно. Несмотря на то, что предотвращение запоминания считалось важным для минимизации нарушений авторских прав, сотрудники OpenAI признавали, что модель GPT-4 способна «запоминать огромное количество данных».

Как отмечают в бумагах, это делает модель «настолько хорошей в бессмысленном повторении» (insanely good at regurgitation), что она способна воспроизводить целые статьи, написанные журналистами, по запросу пользователя. Представитель OpenAI даже признал, что компания не предпринимала активных усилий по обнаружению или удалению из обучающих данных платного контента, хотя некоторые топ-менеджеры заявляли, что все, что за подпиской, должно лицензироваться. Это противоречие между принципами и действиями создает правовую и этическую уязвимость.

Для понимания термина «регрессия» или «повторение» (regurgitation) в данном контексте важно знать, что модели часто не генерируют информацию с нуля, а комбинируют уже существующие паттерны. Если эти паттерны взяты напрямую из текстов без должной обработки, ИИ начинает выдавать ответы, которые по смыслу и структуре копируют оригинальные статьи. Это и есть та самая «замена труда» — алгоритм выполняет работу, которая раньше требовала часа работы редактора или аналитика.

Поиск «газиллонов» в ущерб культуре

Финансовый мотив прослеживается четко. Сооснователь OpenAI Грег Брокман прямо упоминался в документах с интересом к потенциальной прибыли в размере «газиллонов» долларов. Стремление максимизировать доход привело к игнорированию долгосрочных последствий для экосистемы веб-сайтов. Jack Clark, директор по политике OpenAI, отмечал в своих письмах, что создаются системы, заменяющие труд людей, формирующих культуру общества.

Итоговая картина в документах пессимистична. Microsoft признает, что большие языковые модели (LLM) становятся продуктом, который разрушает свою собственную цепочку поставок данных. OpenAI соглашается с тем, что их технологии убивают реферальный трафик, без которого многие издательства не смогут существовать. При этом компании продолжали развивать проекты, несмотря на знание о том, что это наносит непоправимый ущерб миллионам работников медиаиндустрии.

В мире искусственного интеллекта часто говорят о том, как технологии меняют мир. Эти документы показывают обратную сторону медали: технологии могут изменять мир так, что он перестает существовать в том виде, в котором его понимали люди. «Страшный круговорот» (doom loop) — это не метафора, а описание реального экономического процесса, который, согласно внутренним данным, был запущен намеренно ради краткосрочной выгоды.

*Примечание редактора: ситуация в правовом поле ИИ движется быстро. Пока суды разбирают эти вопросы, рынок уже адаптируется к новым реалиям, где стоимость информации может быть пересмотрена в пользу алгоритмов, а не авторов.*

Первоисточники

The Verge AI
← Вернуться в эфир