Perplexity AI · AI writing · SEO · content strategy · LLM analysis · API integration20 сентября в 00:32 · 5 мин

Как Perplexity AI извлекает контент из источников: статистика на основе эмпирического анализа

Специалисты, занимающиеся написанием контента для веб-сайтов, часто задаются вопросом, сколько именно информации необходимо разместить на странице, чтобы нейросети корректно её интерпретировали. Исследование, проведённое на основе анализа сотен ответов модели Perplexity AI, выявило, что алгоритм не использует полный текст страницы. Напротив, нейросеть выделяет короткие, самодостаточные абзацы, игнорируя навигацию и технические элементы разметки.

# Перезагрузка стратегии контента: что видит Perplexity AI

В эпоху, когда поисковые системы всё чаще интегрируют возможности генеративного ИИ, понимание того, как именно работает обратная связь между сайтом и нейросетью, становится критически важным. Многие авторы материалов предполагают, что для попадания в ответы поисковой системы необходимо размещать исчерпывающий обзор темы, заполняя страницу множеством фактов и нюансов. Однако детальный анализ работы модели Perplexity AI (Sonar-pro) показывает, что этот подход может быть неэффективным.

В основе исследования лежит эксперимент: промты были отправлены через API модели 20 раз с тремя повторениями каждого запроса. Для каждого из 60 полученных ответов были установлены ссылки на источники, а затем проведено сопоставление цитат модели с исходным HTML-контентом веб-страниц. Цель заключалась в том, чтобы понять реальный масштаб текстового отрывка, который нейросеть считывает для формирования фактического ответа.

*Примечание редактора:* Важно разделять заявления самой компании об алгоритмах и проверяемые факты, полученные через эвристический анализ логов. Пока разработчики не раскрыли точную логику срезания контекста, эмпирические данные служат наиболее надежным ориентиром.

Структура «полезного» текста: абзац против страницы

Результаты анализа продемонстрировали значительное расхождение между общим объёмом текста на странице и тем, что реально попадает в контекстное окно модели. Из 1355 верифицированных ссылок на источники, ведущих на действующие URL, лишь 448 имели успешное соответствие в исходном тексте.

Ключевой вывод исследования заключается в том, что нейросеть ищет не «краткую выдержку» (snippet), а полноценные смысловые блоки. Для успешного попадания факта в ответ необходимо, чтобы в тексте страницы был абзац (или пункт списка, ячейка таблицы), который покрывает хотя бы треть слов утверждения модели.

Статистика показывает следующие закономерности: * Количество источников: На одной странице для генерации одного ответа в среднем задействуется всего два смысловых фрагмента из 85 доступных. * Объём текста: Медианная длина такого фрагмента составляет около 49 слов. При этом он занимает лишь 6,4% от общего объёма текста страницы, хотя в среднем может включать до 11,6% контента. * Уникальность: Дословное копирование встречается крайне редко (менее 1% случаев). Модель склонна к перефразированию, используя лексику источника, но строя собственные связки.

Это означает, что стратегия написания контента должна меняться. Вместо попыток насытить страницу множеством деталей, имеющих слабую взаимосвязь, эффективнее создавать несколько глубоких, автономных абзацев. Текст, вырванный из контекста, если он содержит ключевой факт и условие его применимости, с большей вероятностью будет корректно интерпретирован ИИ.

Техническая сторона вопроса: как именно происходит нарезка

Получение доступов к полным текстовым данным страниц в рамках API Perplexity ограничено. Интерфейс предоставляет лишь мета-данные и предпросмотр, но не полный исходный код. Это делает прямое наблюдение за работой алгоритма сложной задачей, требующей внешних методов анализа.

Исследователь разработал скрипт на языке Python, способный реконструировать процесс извлечения текста. Алгоритм не опирается на визуальное расположение элементов, а анализирует HTML-структуру. Критерием разделения текста служат закрывающие теги смысловых единиц: </p>, </li>, </h1>-</h6>, </td>, </blockquote>. Теги вёрстки, такие как </div>, намеренно исключаются, чтобы избежать дублирования текста, так как они часто служат только оберткой для контента.

Для сравнения фрагментов используется методология сведения слов к основам (stemming), при этом фильтруются короткие слова и стоп-слова. Метрика совпадения рассчитывается как доля общих основ слов между предложением ответа модели и найденным отрывком из источника. Пороговое значение совпадения установлено на уровне, который гарантирует смысловую релевантность, обычно требующую перекрытия минимум 30% слов исходного предложения.

Этот технический подход подтверждает, что модель работает с «крупными» единицами информации. Короткие строки, заголовки разделов или навигационные меню, даже если они содержат ключевые слова, часто пропускаются алгоритмом как шум. Именно поэтому заголовки типа «Может ли AI рекомендовать бренд?» могут вводить в заблуждение при автоматическом анализе, если они не содержат развернутой аргументации.

Практические выводы и ограничения исследования

Данные, полученные в ходе этого эксперимента, имеют определённые ограничения. Они базируются на одном прогоне по русскоязычным коммерческим запросам и отражают поведение конкретной версии модели. Тем не менее, основные выводы имеют универсальный характер для многих современных LLM (Large Language Models), использующих поисковую обратную связь.

Для авторов и специалистов по SEO рекомендуется пересмотреть подход к структурированию материалов: 1. Фокус на автономность: Каждое важное утверждение должно быть сформулировано так, чтобы оно было понятно без обращения к предыдущим абзацам. Избегайте чрезмерного использования местоимений и отсылок типа «как упоминалось ранее». 2. Объём: Доводить текст до идеального состояния в деталях можно меньше. Достаточно двух-трёх плотных абзацев (по 40–60 слов), в которых чётко раскрывается суть. 3. Стабильность ссылок: Важно учитывать, что ссылки на источники могут стать недействительными в течение месяца. Поэтому сохранение актуальности контента и стабильности URL является фактором доверия.

Технологии быстро меняются, и то, как именно нейросети читают веб-страницы, может эволюционировать. Однако текущие данные однозначно указывают на то, что качество контента зависит от его структурированности и чёткости изложения, а не от его избыточности. Понимание этого механизма позволяет оптимизировать затраты времени на создание материалов, фокусируясь на создании действительно полезных смысловых блоков.

В будущем стоит ожидать появления новых инструментов, позволяющих визуализировать этот процесс прямо в интерфейсах разработки, однако пока основным методом остается внимательный анализ собственных текстов и статистика цитирования.

Первоисточники

Habr AI
← Вернуться в эфир