Amazon · Искусственный интеллект · Большие языковые модели · Редкие книги · Этика ИИ · Технологии · LLM training22 августа в 12:34 · 3 мин

Деконструкция наследия: Как Amazon уничтожает редкие книги для обучения ИИ

Масштабируя свои языковые модели, технологический гигант Amazon переходит к радикальной стратегии: компания закупает уникальные печатные издания, обрезает их корешки и сканирует для получения тренировочных данных. Исследование журналистов 404 Media, основанное на размещенном ими шпионском устройстве в редкой книге, подтвердило отправку этих материалов на завод в Лас-Вегасе под кодом VGT3, специализирующийся на переработке бумажного сырья. Эксперты опасаются, что использование текстов, написанных искусственным интеллектом, может привести к деградации качества моделей, известному как 'коллапс модели'.

# Amazon покупает редкие книги, чтобы уничтожить их и обучить ИИ

История основателя Амазон — от книжной лавки до глобального ритейлера — продолжает писатьсь в неожиданных формах. Компания, некогда занимавшаяся продажей бумажных изданий, теперь становится их главным потребителем, но с одной критической оговоркой: эти книги не попадают в библиотеки или магазины. Вместо этого они отправляются на переработку, чтобы извлечь из них цифровые данные для обучения алгоритмов искусственного интеллекта.

Операция по захвату данных

Согласно раскрытой информации от исследовательской группы 404 Media, Amazon активно приобретает огромные партии редких книг. Процесс выглядит как грубое промышленное вмешательство в культурное наследие: сотрудники компании отрезают корешки уникальных изданий, сканируют оставшиеся страницы и уничтожают оригиналы. Цель проста — получить чистый текст высокого качества, который не содержится в общедоступном интернете.

Подтверждением этой деятельности стало устройство слежения, установленное журналистами в одну из редких книг. Трассер показал, что экземпляр был доставлен в промышленное предприятие в Лас-Вегасе, идентифицируемое как объект VGT3. На фасаде этого объекта расположен логотип — силуэт динозавра, сжимающего книгу когтистыми лапами. Компания Amazon официально подтвердила факт покупки книг через коммерческие каналы, заявив, что это делается для улучшения продуктов и сервисов для клиентов.

Проблема загрязнения данных

Технический императив для создателей больших языковых моделей (LLM) понятен: требуется колоссальный объем уникального текста. Современные модели уже «наелись» открытого контента интернета, который переполнен дубликатами, низкокачественным контентом и, что критически важно, текстами, созданными другими нейросетями.

Редкие книги, особенно те, которые вышли из тиража до 2022 года, становятся золотой жилой для разработчиков. До этого периода большинство опубликованных текстов были написаны людьми, а не алгоритмами. Это гарантирует наличие человеческого контекста, стиля и логики, что крайне необходимо для качественного обучения новых версий ИИ.

Тень коллапса модели

Однако использование ИИ-генерируемого текста для обучения несет серьезные риски. Термин «коллапс модели» (model collapse) описывает явление, при котором качество输出的 нейросети необратимо снижается после того, как она начала обучаться на данных, созданных другими ИИ. Если модель «поест» мусор, который она же сама вырастила, её знания начнут деградировать, а способность к решению сложных задач — упрощаться до примитивных шаблонов.

Покупка и уничтожение редких книг является попыткой избежать этой ловушки. Разработчики ищут «чистые» источники, чтобы не допустить замкнутого круга, где ИИ учится на плохом ИИ. Однако ценой этого поиска становится физическое уничтожение уникальных физических артефактов человеческой культуры.

Amazon подчеркивает, что их действия направлены на развитие сервисов для пользователей. Но для многих любителей книг и коллекционеров этот процесс звучит не как развитие технологий, а как систематическая деформация коллекций. В то время как один экземпляр уникальной книги превращается в цифровой шум для сервера в Орегоне, его физическое существование на полке становится второстепенным.

В конце концов, вопрос заключается в том, какой текст имеет большее значение: то, которое когда-то хранилось в кожаном переплете, или то, которое теперь циркулирует в векторе памяти машины, лишённое оригинала. Амазон выбирает后者, продолжая свой путь от продавца книг к их главному потребителю.

Первоисточники

TechCrunch AI
← Вернуться в эфир