LLM · искусственный интеллект · AI-поиск · бенчмарки · дата-инжиниринг · RAG · рынок труда · инвестиции в ИИ6 сентября в 19:32 · 3 мин

От гонки моделей к поиску данных: где сейчас деньги в индустрии ИИ

Публичные бенчмарки новых языковых моделей привлекают headlines, но реальный вектор инвестиций технологических гигантов смещается в другую сторону. Бюджеты на обучение нейросетей сокращаются относительно общего объема затрат, уступая место финансированию инфраструктуры поиска, доставки и фильтрации данных. Эксперты отмечают, что ключевым фактором качества ответа становится не сила модели, а доступ к актуальной и верифицированной информации.

Глубокий подводный архивный зал из стекла и холодной воды на скалистом берегу ночью.

# От шоу моделей к реальной инфраструктуре: как меняется индустрия ИИ

Публичный интерес к искусственному интеллекту сосредоточен на выпуске новых языковых моделей. Медиа заполнены сообщениями о рекордных результатах в бенчмарках и победителях «гонки за интеллектом». Однако анализ финансовых отчетов крупнейших IT-компаний показывает, что реальная битва происходит не в весовых матрицах моделей, а в слоях ниже: в поиске, индексации и доставке информации.

Смещение финансовых потоков от моделей к поиску

В индустрии существует заметное расхождение между маркетинговыми нарративами и бухгалтерскими реальностями. Компании заинтересованы в том, чтобы создавать благоприятный инвестиционный климат, поэтому громкое объявление о новой флагманской модели, превосходящей все предыдущие версии, является удобным инструментом отчетности. На самом деле, корпорации понимают, что ценность системы определяется не тем, как она обрабатывает информацию, а тем, какую информацию она обрабатывает.

Анализ открытых данных показывает устойчивую тенденцию перераспределения средств. Если отвлечься от затрат на «железо» (дата-центры и чипы), то видно явное смещение долей бюджета. В 2022 году на каждый доллар, инвестируемый в тренировку моделей, приходилось примерно 39 центов на поисковые инструменты. К 2026 году это соотношение пересмотрено и достигло 52 центов. Таким образом, в «нежелезной» части ИИ-бюджета инфраструктура поиска отжимает у обучения моделей почти треть средств.

Этот сдвиг объясняется фундаментальной потребностью в актуальности. Языковые модели, обученные на статических датасетах, неизбежно устаревают. Новые термины, факты и события не зашиты в их весах. Следовательно, связка даже нескольких простых моделей с широким и качественным поиском часто дает более релевантный результат, чем одна мощная флагманская модель, полагающаяся лишь на свои внутренние знания.

Эволюция рынка труда и требований к специалистам

Структура спроса на рынке труда в сфере ИИ претерпевает фундаментальные изменения, зеркально отражая финансовые потоки корпораций. Если в 2023 году основой требований были базовые компетенции машинного обучения, то к 2026 году фокус сместился на инженерию данных и технологии ретривала.

Сейчас наиболее актуальны специалисты, способные: * Строить сложные конвейеры обработки данных (data pipelines); * Внедрять технологии RAG (Retrieve-Generated Answers) для подключения моделей к внешним источникам; * Генерировать качественные синтетические данные для дообучения; * Жестко фильтровать вычисления от шума и невалидной информации.

Классические роли ML-инженеров, работающих исключительно с моделями «из коробки», постепенно срастаются с дата-инженерами. Ценность специалиста теперь определяется умением правильно собрать «дата-микс» и настроить маршрут информации к модели, а не только умение настраивать гиперпараметры.

Синергия инструментов и ансамбли

Поскольку ни одна поисковая система не обладает полным покрытием всех тематических доменов, для получения наиболее точных результатов эффективнее использовать ансамбли инструментов. Каждая компания имеет свои эксклюзивные базы данных и каналы доступа: * Alphabet — Google Search * Microsoft — Bing Search * Baidu — Baidu Search * ByteDance — Doubao Search * Alibaba — Quark Search * Tencent — WeChat Search

Исследования показывают, что использование связок из инструментов разных вендоров, особенно комбинируя те, кто силен в специфических областях, позволяет минимизировать слепые зоны любой отдельной системы. Для пользователей это означает необходимость перехода от простых запросов к формулировкам, активирующим внешние источники данных, либо использованию профессиональных сред, где настроено многоуровневое ретривание информации.

В конечном счете, индустрия ИИ перерастает стадию демонстрации изолированных интеллектуальных чудес и переходит к построению комплексной инфраструктуры данных.

Первоисточники

Habr AI
← Вернуться в эфир