AI Visibility · AEO · нейросети · ChatGPT · Perplexity · Алиса AI · поисковые технологии · веб-аналитика22 сентября в 15:03 · 4 мин

Контекст меняет рейтинг: почему одни и те же запросы в AI дают разные бренды

Эксперимент с участием ChatGPT, Perplexity и Алисы AI показал, что видимости бренда (AI Visibility) недостаточно измерять только через фиксированные одиночные запросы. История разговора существенно меняет состав предлагаемых решений, особенно при сценариях с предшествующими упоминаниями конкурентов или специфическими бизнес-требованиями.

# Контекст меняет рейтинг: почему одни и те же запросы в AI дают разные бренды

В современных реалиях маркетинга и поисковой оптимизации метрика AI Visibility (видимость в искусственном интеллекте) становится все более важной. Она показывает, насколько часто бренд упоминается в ответах нейросетей на заданные пользователем запросы. Традиционно этот показатель измерялся путем запуска большого количества идентичных, независимых промптов (запросов). Предполагалось, что при одинаковом вопросе результат будет стабильным и предсказуемым.

Однако недавнее исследование, проведенное аналитиком Pragmatix Digital и опубликованное в издании Habr AI, опровергает это допущение. Эксперимент выявил, что финальный результат сильно зависит от того, какая история разговора предшествовала вопросу. Даже при идентичном финальном запросе «Какие CRM-системы вы бы посоветовали для компании в России?» набор рекомендуемых брендов менялся в зависимости от контекста диалога.

Методология эксперимента: что проверяли?

Исследование включало в себя 45 тестовых прогонов, разделенных на три группы по три диалога для каждой из трех систем: ChatGPT, Perplexity и Алиса AI. Финальный запрос был единым для всех сценариев, но условия подготовки различались.

В базовом сценарии (S0) новый чат открывался сразу с финальным вопросом. Это позволило установить контрольную точку разброса ответов: даже без контекста одни и те же промпты давали разные наборы брендов. Коэффициент Жаккара (мера совпадения множеств) для контрольных прогонов составил:

* Perplexity: 0,905 (высокая стабильность). * ChatGPT: 0,827 (средняя стабильность). * Алиса AI: 0,667 (низкая стабильность, широкий разброс вариантов).

Затем были добавлены контекстные сценарии: 1. S1: Система заранее знала о малом штате (8 сотрудников) и нежелании сложного внедрения. Результаты показали резкое сокращение списка рекомендованных CRM до 3–4 вариантов. Совпадение с базовым набором брендов упало значительно. 2. S5: Сценарий описывал долгий цикл сделки B2B с участием нескольких сотрудников и множеством коммуникаций. Здесь тоже наблюдалась перестановка брендов, но список оставался более длинным.

Влияние предшествующих реплик

Самый интригующим оказался сценарий S9, где не было изменений в требованиях к продукту, но пользователь упомянул конкретный бренд до основного вопроса.

* Сначала пользователь написал: «Коллега упомянул BPMSoft, но я пока ничего не знаю. Давайте посмотрим рынок шире». Только после этого был задан стандартный вопрос о выборе CRM.

Результат был показателен: в ChatGPT и Алисе AI частота упоминания BPMSoft резко выросла. В некоторых системах бренд занял первое место в списке рекомендаций, вытеснив привычных лидеров, таких как Битрикс24, даже без нового обоснования его выбора. Это демонстрирует способность моделей ассоциативно связывать запрос с предшествующей информацией.

В сценарии S11, где сами нейросети первыми называли бренды, а затем переключались на общий вопрос, устойчивого эффекта «подтягивания» бренда не наблюдалось. Это указывает на то, что влияние контекста зависит от того, кто инициирует упоминание — пользователь или модель.

Техническая суть и выводы

Для понимания результатов важно различать типы упоминаний. В исследовании были выделены три уровня: 1. Mention: простое упоминание в тексте. 2. Consideration: включение продукта в набор вариантов для рассмотрения. 3. Recommendation: явная рекомендация с обоснованием выбора под условия задачи.

Изменение набора брендов при одинаковом финальном вопросе свидетельствует о том, что современные LLM (большые языковые модели) работают не как статические базы ответов, а как динамические генераторы, чувствительные к траектории диалога.

Ключевые выводы для бизнеса и SEO:

* Метрики AI Visibility, основанные исключительно на независимых промптах, дают лишь частичную картину. Они показывают вероятность упоминания в «чистом» диалоге, но не отражают эффективность бренда в сложном сценарии, где пользователь уже имеет какую-то информацию. * Контекст — критический фактор. Предварительные упоминания, история диалога и предварительные знания пользователя могут перестраивать итоговый выбор модели. * Для точного мониторинга необходимо не только фиксировать список запросов, но и регламентировать сценарии разговора, включая историю диалога.

Этот эксперимент не означает, что текущие методы замера полностью бесполезны, но они требуют уточнения. AI Visibility должна учитывать не только частоту слов в ответе, но и вероятность их появления в конкретных коммуникативных сценариях.

*Авторское примечание*: Мир ИИ меняется быстрее, чем мы успеваем написать об этом. В такие моменты важно помнить, что за сухими цифрами рейтингов стоят живые диалоги, где каждый предыдущий оборот фразы может стать решающим аргументом для алгоритма.

Первоисточники

Habr AI
← Вернуться в эфир