Информация как нефть: Как ИИ-гиганты покупают книги, почту и форумы за миллиарды
Развитие больших языковых моделей привело к трансформации информации из бесплатного цифрового следа в дорогой коммерческий актив. Технологические компании, начиная с Reddit и заканчивая Google, готовы выплачивать сотни миллионов долларов за доступ к корпоративным архивам, печатным книгам и платным лицензиям, чтобы обеспечить обучение своих нейросетей качественными данными.
# Миллионы за комментарий: Как ИИ-гиганты превратили информацию в главный ресурс
Мы являемся свидетелями новой промышленной революции, главной движущей силы которой стала искусственная нейросеть. С момента выхода ChatGPT в 2022 году мир столкнулся с технологическим бумом, требующим колоссального количества данных для обучения алгоритмов. Любой наш клик, комментарий или просмотр видео формирует цифровой след, который ранее мог оставаться бесплатным. Однако теперь эта информация стала ценным активом, сравнимым с нефтью или металлом, за который конкурентоспособные компании готовы платить огромные суммы.
От бесплатного API к лицензионным контрактам
Одним из первых сигналов того, что информация перестает быть бесплатным ресурсом, стало изменение политики компании Reddit. В апреле 2023 года сервис объявил о закрытии бесплатного доступа к своему API, опасаясь бесконтрольного использования контента для обучения больших языковых моделей. Уже через два месяца доступ стал платным, что вынудило многие сторонние приложения, включая популярный клиент Apollo для iOS, прекратить существование из-за стоимости лицензии, оцениваемой в 20 миллионов долларов в год.
В начале 2024 года ситуация радикально изменилась: Google заключил соглашение с Reddit на сумму около 60 миллионов долларов в год. Позже, во время подготовки к первичному публичному предложению, Reddit раскрыл, что стоимость подобных лицензий выросла более чем до 200 миллионов долларов. Аналогичная тенденция наблюдалась у OpenAI, которая на регулярной основе объявляла о новых партнёрствах. Сделки заключались с Stack Overflow, News Corp (владельцем Wall Street Journal), Dotdash Meredith, Axel Springer и Financial Times. Стоимость договоров варьируется от 5 до 250 миллионов долларов, включая соглашения с издательством Wiley на 21–23 миллиона долларов каждая.
Что такое датасет?
Для понимания масштаба сделок важно знать, что такое данные в контексте искусственного интеллекта. В технических терминах это набор образцов информации, на которых модель учится выявлять закономерности. Будь то тексты форумов, код программ или описания объектов на изображениях — всё это служит «уроками» для алгоритма. Чем больше и качественнее эти уроки (датасеты), тем точнее становятся предсказания нейросети. Именно поэтому доступ к огромным массивам структурированной и неструктурированной информации стал стратегическим приоритетом для техногигантов.
Корпоративные архивы и банкротные аукционы
Поиск ценных данных привел компании к необычным решениям. В мае 2026 года авиакомпания Spirit Airlines прекратила деятельность, и её активы были распроданы адвокатами. Google выиграла банкротный аукцион, заплатив 10 миллионов долларов за право получить доступ к архивам компании. Это приобретение включает около 100 миллионов корпоративных электронных писем, 500 миллионов сообщений в Microsoft Teams, документы по управлению проектами и финансовые базы данных. Google утверждает, что не будет использовать персональные данные клиентов, но ценность этих бизнес-архивов для обучения моделей на уровне корпоративного языка и терминологии очевидна.
Правовые рамки и физический носитель
Развитие рынка привело к судебным разбирательствам и новым законам. В июле 2026 года суд Сан-Франциссо утвердил урегулирование спора против компании Anthropic на сумму 1,5 миллиарда долларов. Издательства и авторы обвинили разработчика Claude в нарушении авторских прав за скачивание миллионов книг с торрент-трекеров. Суд постановил, что правообладателям выплатят по 3000 долларов за каждое произведение, что стало крупнейшим взысканием в истории и закрепило необходимость легальности данных для обучения ИИ.
Как следствие, Anthropic запустила проект «Панама». Компания начала активно покупать физические копии книг в книжных магазинах, сканировать их для обучения моделей, а затем уничтожать оригиналы. Это решение позволило обойти ограничения на использование цифровых копий с пиратских источников и дало доступ к тексту без нарушения прав на электронные версии. Так сформировался новый рынок, где данные становятся активом, а их происхождение требует строгого юридического оформления.
Прогнозы на будущее
Исследователи Epoch AI прогнозируют, что общедоступный контент в сети начнет резко иссякать как источник данных уже к 2026 году, практически полностью исчезнув к 2032 году. Это связано с тем, что модели способны обрабатывать все больше информации, требуя уникальных и часто защищенных авторским правом материалов. Рынок переходит от сбора бесплатных комментариев к покупке физических носителей и корпоративных архивов.
Завершение круга
Цифровая эпоха, начинавшаяся как период свободного обмена информацией, трансформировалась в экономику данных. Комментарии в форумах, статьи в журналах и документы в архивах теперь имеют рыночную цену. Технологические гиганты готовы тратить сотни миллионов долларов, чтобы получить доступ к этому ресурсу. Каждый наш цифровой след сегодня — это не просто след, а потенциал для создания коммерчески успешной модели, что делает вопрос конфиденциальности и использования наших данных более актуальным, чем когда-либо.