нейросети · сравнение моделей · ChatGPT · Claude · Gemini · Алиса AI · искусственный интеллект · Habr AI7 сентября в 04:02 · 7 мин

Спросили пять нейросетей, какая из них лучше: почему ChatGPT упоминают все, а себя именуют не каждый

В ходе эксперимента независимый исследователь направил идентичные запросы пяти современным языковым моделям с доступом в интернет, не называя в них собственные имена. Результаты показали, что только некоторые модели склонны упоминать себя, и лишь единицы делают это первым в списке, тогда как ChatGPT фигурирует в ответах конкурентов значительно чаще.

Прозрачная стеклянная капля в форме загадочного лица на ночном море у каменного маяка Тихой Бухты

# Спросили пять нейросетей, какая из них лучше: почему ChatGPT упоминают все, а себя именуют не каждый

Эксперимент, опубликованный на портале Habr AI, ставит перед современным искусственным интеллектом простой бытовой вопрос: «Какая нейросеть лучше всех отвечает на сложные вопросы?». Задача заключалась в том, чтобы выявить готовность модели самопрезентации и понять, насколько ее ответы зависят от внутренней уверенности или от того, что она «слышит» в обучающих данных.

Настройка эксперимента

Исследование провело автор статьи ig_novvv, работавший в сфере маркетинга и продвижения нейросетей более 15 лет. В качестве испытуемых были выбраны пять платформ с активным доступом к поиску в интернете: * ChatGPT (версия gpt-4o) * Claude (версия claude-sonnet-4.5) * Gemini (версия gemini-3.6-flash) * Perplexity (модель sonar-pro) * Алиса AI (поисковый API поверх выдачи Яндекса)

Важно отметить, что модель GigaChat не была включена в основной срез сравнения, так как у нее отсутствовал поисковый API, что делало невозможным честное сравнение с моделями, работающими в реальном времени.

Всего было отправлено 75 запросов по три раза каждой модели. Дата проведения теста: 21 августа 2026 года. Четыре запроса вернулись с ошибками (тайм-ауты или сбой соединения), поэтому статистика основана на 71 качественном ответе. Четверть всех вопросов формулировались без единого упоминания названий моделей, что исключало влияние подсказки на результат. Контрольный вопрос, где названия всех пяти моделей были вписаны прямо в запрос, позволил оценить влияние самой формулировки ответа.

Что считать упоминанием?

Автор использовал специальный алгоритм для обработки текста ответов. Упоминанием считалось появление любого из вариантов написания имени бренда (алиасов) в тексте ответа. Например, «Claude», «claude» и «Клод» учитывались как одно упоминание. Однако метрика имела и недостатки: она не учитывала контекст, поэтому рекомендация продукта или упоминание его в критическом ключе засчитывались одинаково. Также метод подстроки иногда срабатывал на русские склонения (например, слово «Алиса» могло быть пропущено, если модель написала «Алису» или «Яндекса»).

Кого называют все

Одним из самых неожиданных результатов стало то, что модель ChatGPT упоминали все остальные нейросети. Во всех 57 годных ответах на основные вопросы без подсказок: * Claude назвал ChatGPT в 12 из 12 случаев. * Perplexity — в 12 из 12 случаев. * Gemini — в 11 из 11 случаев. * Алиса AI — в 7 из 10 случаев.

Даже модели-конкуренты, такие как Perplexity и Gemini, в своих рекомендациях неизменно включают в топ OpenAI. Исследователь предположил, что это не свидетельствует о субъективном мнении моделей, а скорее подтверждает гипотезу о воспроизводстве рыночной известности. Языковые модели обучаются на текстах, где бренды часто упоминаются вместе, а поисковая выдача подтягивает материалы, где доминирует ChatGPT.

Статистика упоминаний в ответах (4 вопроса без подсказки)

| Модель | Число ответов с упоминанием | Всего ответов | Дельта (с контрольным вопросом) | | :--- | :---: | :---: | :---: | | ChatGPT | 51 | 57 | 15 из 15 | | Claude | 47 | 57 | 15 из 15 | | Gemini | 42 | 57 | 14 из 14 | | Perplexity | 23 | 57 | 12 из 12 | | Алиса AI | 13 | 57 | 12 из 12 |

Как видно из таблицы, ChatGPT фигурирует в ответах соперников в подавляющем большинстве случаев. Интересной деталью также является то, что DeepSeek (модель, не участвовавшая в тесте), GigaChat и Grok упоминались только другими моделями, но не называли сами себя в ответе.

Самопоминание: кто себя называет первым?

Естественный вопрос: а какая модель считает себя лучшей? Логично предположить, что компании стремятся представить свой продукт выгодно, но в данном эксперименте «системный промпт» или внутренняя уверенность не всегда приводили к первым местам в списках.

По четырём вопросам без подсказки: * Claude назвал себя во всех 12 ответах, но только в трёх случаях разместил имя в самом начале текста. Медиана места упоминания — третья. * ChatGPT назвал себя в 9 из 12 ответов, выйдя на первое место только в четырёх случаях. * Gemini упомянул себя в 10 из 11 ответов, но ни разу не стал первым. Медиана места — третья. * Алиса AI назвала себя всего три раза из десяти ответов и никогда не занимала первое место.

Интересно отметить, что Gemini, который очень часто упоминает себя, не склонен делать это приоритетным. Автор предполагает, что это может быть связано с архитектурой поиска модели или особенностями обработки запросов.

Статистика самоупоминания и первого места (4 вопроса без подсказки)

| Модель | Назвала себя | Первое место в ответе | Медиана места | | :--- | :---: | :---: | :---: | | Claude | 12 | 3 | 3 | | ChatGPT | 9 | 4 | 4 | | Perplexity | 6 | 3 | 1,5 | | Gemini | 10 | 0 | 3 | | Алиса AI | 3 | 0 | 3 |

Когда же в вопрос прямо вписывались названия моделей, картина менялась. У всех пяти моделей частота упоминания собственного имени в ответах выросла до 100% (или почти до нее), а количество первых мест также увеличилось. Однако даже с подсказкой Алиса AI так и не смогла занять первое место ни разу в полном прогоне. Исследователь связывает это с тем, что ответы Алисы генерируются поверх результатов обычного поиска, где её брендинг встречается реже, чем у гигантов индустрии.

Технические ограничения и выводы

Эксперимент имеет ряд ограничений, которые важно учитывать при интерпретации данных.

1. Выборка мала. 71 ответ — это не статистически значимая выборка для вывода о всем рынке, а скорее наблюдение. Один и тот же вопрос может давать разные ответы из-за изменений в поисковой выдаче или внутреннего контекста модели. 2. Грубая метрика. Считать упоминание имени первым фактом самолюбования некорректно. Модель может начать текст с имени, но сразу порекомендовать другую модель или дать негативную характеристику. Кроме того, определение «первого места» зависит от алгоритма (по порядку слов или по номеру пункта списка). 3. Отсутствие семантики. Метод поиска подстроки не отличает похвалу от критики. Фраза «ChatGPT — не подходит для этой задачи» засчитывается как упоминание, так же, как «ChatGPT — лучший инструмент». Для точного анализа потребовалась бы отдельная модель-судья, которая оценивала бы тон и контекст. 4. Сбои инфраструктуры. Четыре запроса вернулись с ошибками (504 Gateway Timeout), что исказило знаменатель для некоторых моделей, особенно для Алисы AI, где доля сбоев была выше.

Гипотеза автора: Вероятнее всего, нейросети не являются объективными судьями, а воспроизводят информацию, наиболее часто встречающуюся в интернете и в обучающих корпусах. ChatGPT упоминает не потому, что он объективно лучше, а потому что о нем написано больше всего текстов, и поисковые системы выдают его в первую очередь.

Таким образом, когда все пять моделей называют ChatGPT лучшим без всяких подсказок, это, скорее всего, отражение рыночной известности бренда, а не технического превосходства. А то, что некоторые модели не называют себя первыми или вовсе молчат, говорит о том, что внутреннее программирование «быть первым» у них настроено по-разному или отсутствует вовсе.

*«Спроси модель, какая нейросеть лучше, и она в ответе на видном месте назовёт себя. Проверяется это без доступа к весам модели — хватает того же интерфейса, которым пользуется обычный человек».* — Автор исследования.

*Эксперимент подтвердил, что в мире нейросетей объективность часто уступает место воспроизведению рыночных трендов. Доказательство качества одной модели требует гораздо более глубокого и контролируемого анализа, чем простой вопрос в чате.*

Первоисточники

Habr AI
← Вернуться в эфир