Google DeepMind представляет агентское видеопонимание: сокращение затрат на 66% и прирост точности
Команда Google DeepMind внедрила новую функцию агентского видеоанализа в модели Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Данная технология позволяет моделям динамически выбирать сегменты видео для анализа, что приводит к снижению потребления токенов на 88% и уменьшению издержек до 66%, при этом повышая точность обработки на 7%.
# Агентское видеопонимание: новая эра эффективной обработки контента
В мире искусственного интеллекта обработка видео долгое время была компромиссом между качеством анализа и стоимостью. Традиционные методы требовали загрузки видео с фиксированной частотой кадров, что приводило к экспоненциальному росту потребления вычислительных ресурсов. Сегодня Google DeepMind предлагает решение этой дилеммы с запуском функции агентского видеопонимания (agentic video understanding) для своей линейки моделей Gemini.
Как работает динамический анализ
Ключевое отличие нового подхода заключается в переходе от пассивного потребления данных к активному, целенаправленному поиску. Вместо того чтобы транслировать видео через модель с постоянной частотой кадров (обычно 1 кадр в секунду по умолчанию), агентская модель действует как исследователь.
Система способна самостоятельно решать, какие именно моменты видео требуют внимания, и в каком режиме их анализировать. Если задача требует обнаружения быстрых движений или мелких деталей, модель автоматически переключается на повышение частоты кадров (FPS) только для этих конкретных сегментов. В то же время для спокойных сцен или анализа аудио и транскрипции она использует более экономичные методы. Это достигается через внутренний агентный цикл, который автоматически вызывает инструменты загрузки необходимых частей файла, избавляя разработчиков от необходимости вручную программировать сложные логики переключения режимов.
Что такое FPS в контексте ИИ? Частота кадров (FPS — frames per second) определяет количество изображений, которые модель просматривает за одну секунду видео. Высокое FPS позволяет видеть быстрое движение, но требует огромного количества токенов (единиц информации). Низкое FPS экономит ресурсы, но может пропускать важные детали. Агентское понимание позволяет модели сама находить этот баланс динамически.
Экономическая эффективность и рост точности
Тестирование на стандартных бенчмарках демонстрирует значительные преимущества новой архитектуры. При анализе стандартных видео задачи, модели Gemini с активированным агентским режимом демонстрируют следующие показатели:
* Снижение потребления токенов: до 88%. * Снижение затрат: до 66% (поскольку стоимость обработки прямо зависит от количества токенов). * Повышение точности: до 7%.
Особенно ярко эти преимущества проявляются при работе с длинновидовым контентом — от обучающих видео на 10 минут до лекций продолжительностью 90 минут или многочасовых записей. В таких сценариях традиционная статическая обработка либо становилась нерентабельной, либо требовала упрощения анализа, который терял критически важные детали. Модели Gemini 3.7 Flash, в частности, занимают наиболее выгодную позицию на графике Парето (Pareto frontier), обеспечивая оптимальное соотношение между точностью и стоимостью среди протестированных решений.
Расширенные возможности применения
Внедрение этой технологии открывает двери для множества сложных приложений, которые ранее были технически или экономически трудно реализуемы:
1. Извлечение мгновенных моментов: Возможность pinpoint точных границ коротких отрывков или изменений состояния, которые невозможно заметить при анализе с низкой частотой кадров. Это критически важно для автоматического монтажа и редактирования видео. 2. Поиск «иголки в стоге сена»: Ответ на сложные запросы по многочасовым материалам без необходимости просматривать каждый кадр с высокой детализацией, что позволяет экономить миллионы токенов. 3. Обнаружение аномалий: Способность динамически повышать частоту кадров в моменты интереса для детального inspections быстрых движений или визуальных артефактов. 4. Подсчет объектов и действий: Точное отслеживание повторяющихся физических движений и уникальных объектов на протяжении длительного времени.
Внедрение и доступность
Для разработчиков функция доступна сразу через стандартный интерфейс Gemini API в Google AI Studio и на платформе Gemini Enterprise Agent Platform. Активация осуществляется простой настройкой параметра обработки на "agentic" в конфигурации запроса. Важно отметить, что использование этой функции осуществляется по стандартным тарифам на токены Google без дополнительных сборов за саму функцию.
Google также планирует распространить эти улучшения на миллиарды пользователей внутри собственных продуктов. В ближайшее время агентское видеопонимание поступит в приложение Gemini для всех пользователей, поддерживающих модели Flash и Flash-Lite. В ближайшие месяцы эта технология станет основой для функции «Ask YouTube», которая будет предоставлять более качественные ответы, основанные на визуальном контенте видеороликов.
Как всегда в разработке ИИ, баланс между инновациями и надежностью остается приоритетом. Однако данный шаг демонстрирует, как интеграция продвинутых моделей с динамическими инструментами обработки данных может кардинально изменить экономику анализа видео, делая сложную обработку доступной для широкого круга задач.