От изображения к сущности: как мультимодальные модели научились понимать товары
Визуальный поиск по фотографии — это далеко не панацея для электронной коммерции. Модели вроде CLIP, хотя и позволили сопоставлять текст и изображения, часто ошибались в различении SKU, если визуальные отличия были минимальны. Исследователи теперь переходят к комплексным мультимодальным представлениям, объединяющим фото, атрибуты, описания и поведенческие данные пользователей, создавая единый дескриптор товара.
# От изображения к сущности: эволюция понимания товаров в e-commerce
Задача поиска похожих товаров казалась закрытой после появления нейросетей, способных распознавать объекты. Алгоритм брал фото белых кроссовок, выдавал эмбеддинг и находил ближайшие векторы в каталоге. Однако реальность электронной коммерции оказалась сложнее: система могла вернуть не конкретную модель, а просто похожий силуэт или предмет аналогичного цвета. Чтобы перейти от поиска визуальных аналогов к точной идентификации SKU (артикула), индустрия вынуждена была усложнить архитектуру моделей, объединив в них множество источников информации.
За пределы одной модальности
Проблема визуального поиска (Visual Discovery), известная еще с времен Pinterest в 2017 году, заключалась в том, что алгоритмы отлично отвечали на вопрос «что это похоже?», но не могли гарантировать ответ на вопрос «это тот же товар?». Даже небольшие различия — например, форма подошвы или материал вставки — критичны для продавца и покупателя, но могут быть скрыты в общем визуальном сходстве. К тому же, одна карточка товара содержит множество фото, текстовое описание и табличные характеристики, которые невозможно адекватно передать лишь одной картинкой.
Первым шагом стало использование текстовой информации для дополнения визуальной. Задачи, подобные Fashion IQ, показали, что пользовательские уточнения («хочу похожее, но с длинными рукавами») требуют от модели умения работать с последовательным диалогом и естественным языком. Архитектуры типа FashionBERT и последующий прорыв с CLIP позволили совмещать визуальные токены и текст в едином пространстве признаков. CLIP обучался на сотнях миллионов пар «изображение–текст», сближая семантически связанные объекты и отталкивая нерелевантные. Это сделало возможным поиск товаров по текстовому запросу без предварительной разметки атрибутов, но для специфичных задач ритейла оказалось недостаточно.
Специфика маркетплейсов и новые архитектуры
Перенос универсальных моделей на маркетплейсы выявил новые проблемы. В классическом контрастном обучении все объекты в одном батче считаются отрицательными примерами. В каталоге же один и тот же товар часто представлен несколькими продавцами. Если модель учится считать такие дубликатами разных товаров, она разрушает качество поиска. Решением стала привязка отрицательных примеров к уникальному идентификатору товара, а не просто к изображению.
Дальнейшее развитие привело к появлению специализированных моделей, таких как e-CLIP, и более сложных генеративных подходов. Модель MOON2.0, например, решает проблему «шума» в данных и дисбаланса модальностей. Данные в e-commerce часто неидеальны: заголовок может содержать SEO-мусор, а фото — быть некачественным. MOON2.0 использует модули Mixture-of-Experts, чтобы динамически выбирать лучший маршрут обработки данных, и двухуровневое выравнивание. Оно учитывает не только связь между запросом и купленным товаром (inter-product alignment), но и внутреннюю согласованность информации внутри самой карточки (intra-product alignment), принуждая модель связывать фото конкретного товара с его описанием.
Детализация и борьба с шумами
Ключевой вызов современных систем — различение товаров-близнецов. Два кроссовка могут быть белыми, с похожим силуэтом, но отличаться цветом вставки или материалом верха. Традиционные визуальные энкодеры могут сгладить эти различия, рассматривая объекты как семантически идентичные. Модели, подобные AFMRL, решают эту задачу через генерацию и использование атрибутов. Мультимодальная языковая модель (MLLM) извлекает тонкие характеристики из изображения и текста, которые затем используются в процессе обучения для отсечения «ложных отрицательных» примеров.
Важно отметить, что простое накопление всех данных не всегда улучшает модель. Если по названию легко определить категорию, модель может перестать анализировать изображение. Эффективные архитектуры, такие как MOON3.0, должны балансировать использование модальностей, фильтровать ошибки в описаниях продавцов и генерировать дополнительные визуальные представления для устранения шумов. Эволюция от CLIP к специализированным мультимодальным моделям показывает переход от понимания простой картинки к глубокому анализу сущности товара, где важна каждая деталь и контекст.
*Медленное, но верное развитие архитектуры не случайность. Когда объект становится настолько сложным, чтобы его нельзя было описать одной фразой или одним кадром, нейросеть вынуждена учиться видеть связи там, где человек видит лишь целостное представление.*
Эта эволюция не остановилась. Современные исследования продолжают совершенствовать баланс между визуальными и текстовыми признаками, стремясь создать систему, которая понимает не то, что товар выглядит как, а то, что он собой представляет в глазах покупателя.