Microsoft · OpenAI · AI · авторское право · New York Times · копирайтинг · технологии · суд4 сентября в 19:33 · 4 мин

Microsoft утверждает: Chatbot Copilot практически никогда не копирует тексты статей New York Times

В рамках нового раунда судебных разбирательств с правообладателями, включая The New York Times и авторов книг, компания Microsoft представила масштабный анализ данных. Согласно предоставленным документам, даже при целенаправленном поиске совпадений в десятках миллионов запросов к нейросети Copilot, количество случаев использования текста, способного заменить оригинал, составляет ничтожно малую долю от общей выборки.

Прозрачная матовая стеклянная призма на волнах ночи у каменного маяка, отражающая холодный лунный свет.

# Microsoft представляет данные о незначительном копировании контента в судебных разбирательствах с NYT

Ситуация с использованием искусственного интеллекта и авторских прав продолжает эскалировать в судах США. Microsoft, чья платформа Copilot использует данные из открытых источников для обучения, столкнулась с коллективным иском от издательств и авторов. В ответ на требования защиты прав интеллектуальной собственности компания предоставила детальную статистику, направленную на доказательство того, что ее система работает в рамках принципа «добросовестного использования» (fair use).

В центре внимания находятся технические характеристики взаимодействия пользователей с языковыми моделями и сравнение генерируемого текста с оригинальными материалами.

Масштаб проверки: 8,2 миллиона диалогов

Ключевым элементом новой стратегии защиты стал анализ огромного массива данных. В ходе процессуального производства Microsoft передала экспертам, нанятым истцами, около 8,2 миллиона записей из логи чатов Copilot. Компания подчеркивает, что выборка не была случайной.

«Эти логи были специально отобраны, потому что содержат ключевые слова, implicating использование веб-сайтов истцов по делу о новостях», > — говорится в предоставленных документах.

Смысл данной селекции был очевиден: экспертам предстояло проверить именно те случаи, где вероятность совпадения с публикациями газет и книг была максимальной. Если даже в таком «составном» материале статистика окажется отрицательной для обвинений, это станет сильным аргументом. Согласно отчету Microsoft, из 59 545 текстовых фрагментов, которые содержали хотя бы 16 общих слов с новостным контентом, лишь малая часть представляла бы реальную угрозу для авторских прав издателей.

Статистика совпадений: от предложений к целым абзацам

Основной спор между технологической компанией и издательским сообществом заключается в том, что AI-модели могут просто «выуживать» целые статьи или главы из книг, не добавляя никакой творческой трансформации. Microsoft утверждает, что это происходит крайне редко.

В рамках анализа книги, поданного группой авторов, эксперты обнаружили всего 24 ответа, содержащие хотя бы 30 совпадающих слов с исходным текстом. Из 212 оцененных книг только 10 имели какие-либо соответствия. Это свидетельствует о том, что система не обучена на механическом заучивании и воспроизведении конкретных произведений.

В случае с новостными материалами ситуация выглядит следующим образом. Исследователи из Центра расследовательских репортеров (CIR), работающие вместе с издателями, нашли лишь 51 случай «существенного перекрытия» с их материалами в предоставленной выборке Microsoft.

Для контекста важно понимать, что даже наличие 16 общих слов само по себе не является нарушением, если эти слова не образуют уникальной, цитируемой конструкции, которая могла бы служить заменой оригиналу. Microsoft настаивает на том, что их система редко воспроизводит даже полные предложения, не говоря уже о смысловых блоках, способных подменить исходную статью.

Аргумент трансформации и позиция суда

Суть辩称 Microsoft сводится к тому, что, хотя система и опирается на защищенный авторским правом материал, конечная цель использования кардинально отличается от оригинала. Исходный материал служит для создания данных, тогда как выходные данные Copilot предназначены для ответов на вопросы пользователей.

Фильм, с точки зрения компании, иногда воспроизводящие фрагменты текста, «не подорывает трансформативную цель обучения языковых моделям». Это утверждение является критически важным для стратегии защиты, так как если суд признает действия компании трансформативными, это может означать окончание спора в пользу технологических гигантов без необходимости в судебной экспертизе.

Судья объединил дела издателей и авторов под своим руководством, несмотря на протесты сторон, чтобы ускорить рассмотрение процесса. Microsoft подала свои данные в надежде на получение предварительного судебного решения, которое бы прекратило дело на ранней стадии. Примечательно, что администрация президента США, представляющая интересы Трампа, также выступила в качестве стороны, поддержавшей позицию OpenAI в рамках дела против New York Times.

Судьи и эксперты до сих пор не комментировали результаты анализа Microsoft, который только что был опубликован. Ответ от The New York Times и других участников процесса не поступил своевременно.

Первоисточники

The Verge AI
← Вернуться в эфир