Новый этап инклюзии: DeepMind представил модель SL2T для перевода языка жестов в текст
Google DeepMind представила прорывную модель перевода языка жестов в текст (SL2T), предназначенную для интеграции в потребительские приложения. Эта технология, разработанная совместно с сообществом глухих пользователей, позволяет пользователям телефонов выполнять действия, обычно требующие печати, используя язык жестов, начиная с американского языка жестов (ASL).
# Превращая язык жестов в цифровой доступ: выход DeepMind в реальный мир
Google DeepMind объявила о запуске модели перевода языка жестов в текст (Sign Language to Text, или SL2T). Это не просто очередной алгоритм: это попытка исправить системное несоответствие в развитии искусственного интеллекта. Пока технологии распознавания речи достигли совершенства, охватывая миллиарды пользователей, мир языков жестов, используемых 70 миллионами людей, оставался на периферии. DeepMind стремится изменить эту ситуацию, выводя свои разработки из лабораторий в потребительские продукты.
*Мы строим эти инструменты не только для глухих пользователей, но вместе с ними.* > — Упоминается в отчете об impact-оценке проекта.
Технологический прорыв и ограничения
Модель SL2T представляет собой качественный скачок в области машинного перевода для визуальных языков. В отличие от традиционных систем, которые пытаются последовательно сопоставить жесты отдельным словам (создавая «глюссы» или промежуточные описания), SL2T обучена работать с точками опоры на теле человека. Это позволяет модели понимать сложные, нелинейные конструкции языка жестов, такие как невербальные маркеры и пространственные построения, которые ранее терялись при трансформации в текст.
С технической точки зрения, это достижение особенно впечатляюще. Модель обучалась на массиве данных объемом более 100 000 часов, охватывающем более 50 языков жестов. При этом около четверти данных приходилось на американский язык жестов (ASL). Такой подход позволило модели выявить общие структурные паттерны между разными диалектами и языками, что повысило ее эффективность в задачах, где данные о конкретных языках ограничены.
По результатам тестов на бенчмарке FLEURS-ASL, модель показала результат в 70 BLEURT. Это «ноль-стрелковый» (zero-shot) показатель, превышающий все ранее зафиксированные результаты и указывающий на высокую точность перевода ASL на английский язык.
От лаборатории до смартфона: практическая реализация
Разработка SL2T не ограничивалась академическими экспериментами. Ключевой особенностью нового решения является его готовность к работе в мобильных устройствах. Пользователь может совершать жесты прямо на экране телефона, и модель преобразует их в текст в реальном времени.
На данный момент технология интегрирована в приложения Google Gboard и Live Transcribe для смартфонов Pixel 11. Это открывает новые возможности для повседневного использования:
* Навигация и поиск: Пользователь может выполнить жестовый запрос для поиска информации в интернете. * Коммуникация: Возможность быстро отвечать сообщениями или редактировать документы без необходимости печатать клавишами. * Интерактивный помощник: Интеграция с Gemini позволяет не только перевести фразу, но и решить сложные задачи или выполнить команды.
Важно отметить архитектуру передачи данных для защиты приватности. Система не отправляет на сервер видеопамяти пользователя. Вместо этого на устройстве с помощью модели MediaPipe Holistic отслеживаются только геометрические координаты ключевых точек тела. Эти координаты отправляются для перевода, после чего исходное изображение сразу удаляется. Это минимизирует риски утечки визуальных данных и повышает доверие пользователей.
Команда DeepMind также подчеркивает важность масштабируемости. Поскольку большинство пользователей не владеют специализированными жестами, модель была оптимизирована для работы в «периферийном режиме» (edge mode), позволяя выполнять сложные задачи даже с минимальным количеством жестов.
Глобальная доступность: от локального к универсальному
Хотя текущая версия фокусируется на ASL, конечная цель разработчиков — охватить все языки жестов мира. Для этого применяется подход мультиязычного обучения, который позволяет модели переносить знания между разными диалектами.
Для обеспечения качества и репрезентативности данных команда DeepMind активно сотрудничала с экспертами из сообщества глухих. В проекте участвовали представители 12 языков жестов, включая ASL, BSL, LSF, JSE и другие. Это позволило создать более точные и разнообразные обучающие наборы, которые учитывают особенности разных культурных контекстов.
Социальная ответственность и этика разработки
DeepMind подчеркивает, что разработка SL2T — это не только техническая задача, но и социальная миссия. Для этого была создана специальная рабочая группа из 180 специалистов, включая экспертов в области лингвистики, социологии и нейробиологии, которые помогают модели лучше понимать контекст и нюансы общения.
Проект также включает в себя регулярный аудит на предмет дискриминации и смещения алгоритмов. В частности, команда следит за тем, чтобы модель не воспроизводила стереотипы, связанные с полом, возрастом или социальным статусом пользователя.
Перспективы развития
Помимо перевода языка жестов, команда SL2T работает над созданием генеративных моделей, способных создавать текстовые описания жестов, а также разрабатывает инструменты для обучения глухих пользователей новым языкам.
На данный момент модель SL2T доступна в виде приложения для Android. Планируется ее интеграция в другие платформы, включая iOS и веб-интерфейсы, а также использование в образовательных и медицинских целях.
---
Итог: Модель SL2T — это важный шаг в сторону создания инклюзивного цифрового будущего. Технология не только расширяет возможности глухих пользователей, но и демонстрирует потенциал искусственного интеллекта для решения реальных социальных задач.
*Источники:* * [DeepMind Research Paper on SL2T](https://research.google/pubs/sign-language-to-text-transcription-and-translation/) * [Google Blog: SL2T Launch](https://googleblog.blogspot.com/2025/01/sign-language-to-text-sl2t-launch.html)