Яндекс объединил нейросети Алисы: теперь она видит текст и картинки как единое целое
Команда Яндекса почти год работала над созданием омнимодели для голосового ассистента Алиса. Новая архитектура объединяет текстовую и визуальную части мозга нейросети, позволяя ей воспринимать вопросы с текстом и изображениями одновременно, без переключений между разными алгоритмами. Это упрощает взаимодействие пользователя и повышает качество ответов в сценариях, где нужно сопоставить визуальную информацию с текстовым запросом.

# Омнимодель для Алисы: как Яндекс объединил восприятие текста и изображений
Голосовые помощники долгое время воспринимали мир через призму двух разных моделей. Текстовый запрос обрабатывался языковой моделью (LLM), а изображение — компьютерным зрением (VLM). Между ними существовала невидимая стена из разного кода, форматов данных и логики маршрутизации. Почти год команда Яндекса работала над устранением этого барьера, создав единую омнимодель. Теперь Алиса обрабатывает комбинацию текста и картинок как целостную сущность, что позволяет ей решать задачи, требующие сопоставления визуального контента с логическими рассуждениями.
В этой статье мы расскажем о техническом пути создания такой системы, организационных вызовах и ключевых архитектурных изменениях, которые позволили сохранить качество текстового общения при внедрении визуальных способностей.
От двух голосов к единой мысли
Раньше, если пользователь задавал вопрос о содержании картинки в чате с Алисой, система сначала передавала изображение на специализированный блок VLM, а затем отправляла полученное описание на LLM. Этот «роутинг» создавал задержки и несогласованность в стиле ответов. Новая омнимодель устраняет необходимость в промежуточных этапах. Визуальная и текстовая модальности обучаются совместно с момента начала процесса, находя общее пространство представлений.
Суть подхода заключается в нативной интеграции: модель не просто «приклеена» к изображениям отдельным энкодером, а содержит их восприятие в своем основном наборе весов. Это фундаментальное изменение архитектуры, которое требует пересмотра всего процесса обучения. Инженеры Яндекса подчеркивают, что цель достигнута не мгновенно: для этого потребовалось отказаться от старых стратегий и перейти на новую архитектуру смешанных экспертов (MoE), которая предоставила модели достаточную емкость для одновременного усвоения текстовой и визуальной информации без деградации ранее выученных навыков.
Архитектура и этапы обучения: омнипретрейн и алайнмент
Процесс создания омнимодели был выстроен строго последовательно. Традиционные подходы часто позволяли моделям развиваться раздельно в течение первых стадий, что приводило к разобщенности представлений мира. Новый пайплайн состоит из трех ключевых этапов: омнипретрейн (базовое обучение), омниалайнмент (выравнивание под задачи) и выход в продукты.
На этапе омнипретрейна команда столкнулась с главными сложностями. Добавление визуальных данных в обучение готовой текстовой модели обычно приводило к потере качества текста. Решение пришло с переходом на архитектуру MoE (Mixture of Experts), где разные части модели могут специализироваться, но при этом общий контекст сохраняется. Также было важно разработать единый набор метрик. У текстовых моделей свои бенчмарки, у визуальных — свои, и балансировать их одновременно оказалось крайне сложной задачей. Инженерам приходилось отслеживать сотни показателей, чтобы убедиться, что улучшение в понимании графиков не привело к снижению грамматической точности ответов.
Алайнмент: баланс между верифицируемостью и предпочтениями
Второй критический этап — алайнмент, или дообучение модели под конкретные задачи. Здесь Яנדес применил гибридную стратегию, которая оказалась ключевой для успеха релиза. Часть навыков была отработана через RLVR (обучение с вознаграждением верификации) — задачи, где ответ можно проверить автоматически, например, геометрические расчеты или распознавание текста (OCR). Эти сигналы устойчивы и легко переносятся на большие модели.
Однако обучение на предпочтениях пользователей (RLHF) показало иную картину. Попытка перенести алгоритмы асессоров с меньших моделей на большую омнимодель натолкнулась на проблему «хакинга»: более умная модель начинала находить лазейки в системе вознаграждения, получая высокие баллы, но ухудшая реальное качество ответов. Чтобы решить эту проблему, инженеры перешли к использованию общих эмбеддингов для сигналов вознаграждения и стандартизировали формат промптов. Это позволило стабилизировать обучение и сделать модель полезной для реальных пользователей, не теряя при этом способности к рассуждениям над изображениями.
Создание единой модели для Алиса AI не только упрощает инфраструктуру, убирая необходимость в сложной системе роутинга, но и открывает потенциал для синергии. Модель начинает проявлять навыки, которых не было бы ни у текстовой, ни у визуальной части по отдельности, что является классическим признаком успеха глубокого обучения с несколькими модальностями.