LLM · продуктовое управление · генерация гипотез · автоматизация · e-commerce · искусственный интеллект · бэклог · промпт-инжиниринг8 сентября в 02:32 · 4 мин

Как команда «Магнита» перестала выедавать бэклог: создание LLM-пайплайна для генерации гипотез

В условиях исчерпания очевидных идей продуктовой команде «Магнита» пришлось придумать новый источник вдохновения. Продакт-менеджер Иван Одинцов рассказывает, как без привлечения отдельного разработчика была построена собственная автоматизированная экосистема на базе больших языковых моделей. Система превращает архив закрытых экспериментов в поток структурированных гипотез, отсеивая дубликаты и «нейрослоп» на раннем этапе, чтобы высвободить время специалистов для стратегических решений.

Стеклянная призма на каменном причале: внутри — структурированные архивы идей в холодном свете.

# Как мы собрали LLM-пайплайн, который генерирует продуктовые гипотезы

Приветствую. Меня зовут Иван Одинцов, и я работаю продакт-менеджером в команде товарных рекомендаций «Магнита». Наша задача звучит сложно и банально одновременно: придумывать идеи, которые делают приложение удобнее, и быстро проверять их на реальном рынке.

Некоторое время назад мы наткнулись на типичную проблему роста компаний: команда научилась эффективно выполнять задачи, но источник самих идей истощился. В бэклоге начался «осадок» — идеи с низкой эффективностью или высокой стоимостью реализации, до которых руки не доходили из-за нехватки качественного контента. Лучшее уже было внедрено, и нам требовался принципиально новый механизм генерации инсайтов.

От рутины к стратегии: почему ручные методы исчерпали себя

Мы попробовали классические подходы: внутренние мозговые штурмы, изучение конкурентов, анализ научной литературы. Каждый метод имел свои границы. Мозговые штурмы приводили к тому, что команда начинала думать в одну и ту же колею. Конкуренты скрывают свои алгоритмы, а научные статьи о рекомендательных системах появляются редко и часто не учитывают специфику нашей ниши.

Потолок возможностей был ограничен. Именно тогда мы решили использовать искусственный интеллект, но не просто попросить ChatGPT придумать что-то «крутое». Мы поняли, что для качественного результата нужна не модель сама по себе, а контекст.

Мы выбрали путь создания собственного LLM-пайплайна. Главное отличие подхода в том, что модель обучается на истории нашей собственной работы: какие эксперименты мы уже провели, что сработало, а что провалилось. В отличие от чат-ботов, наш инструмент воспроизводим, накапливает знания от запуска к запуску и говорит на языке конкретных бизнес-метрик, а не общих фраз.

Архитектура генератора: превращение данных в идеи

Система, которую мы построили, состоит из четырех последовательных этапов. Первые три работают полностью автоматически, четвертый требует человеческого участия.

Этап 1: Структурирование истории

Вся информация об экспериментах изначально лежала в Confluence в виде разрозненных документов. Наша первая задача — привести это к единому виду. Скрипт автоматически выгружает карточки экспериментов, оценивает их бизнес-эффект (влияние на выручку и релевантность рекомендаций) и формулирует инсайт. Результат сохраняется в базе данных SQLite, создавая чистую историю успеха и неудач.

Этап 2: Генерация гипотез

Сердцем процесса является контекстный селектор. Он не загружает в модель всю историю подряд, а отбирает только релевантные данные. Например, для генерации идей по аптечной карте он подтягивает лишь эксперименты по этой категории и схожим форматам.

Модель генерирует гипотезы пяти типов: от консервативных улучшений работающих механик до смелых инноваций, которые ранее никто не пробовал. Это позволяет варьировать риск от запуска.

Этап 3: Автоматическое ревью

Перед тем как гипотеза попадет к человеку, она проходит строгую фильтрацию по трем параметрам:

1. Дубль: насколько идея похожа на уже запущенные тесты. 2. Уже делали: пересекается ли она с историей экспериментов. 3. Потенциал: ожидаемая сила эффекта.

Для каждой гипотезы рассчитывается интегральный показатель качества (Quality Score). Формула взвешивает эти факторы, чтобы автоматически отсеять дубликаты и идеи, которые уже реализованы. Гипотезы с низким баллом отбрасываются, а высококачественные попадают на стол продакта.

Этап 4: Решение эксперта

Только продакт принимает окончательное решение по гипотезам, прошедшим фильтр. Он оценивает техническую реализуемость, приоритет и вносит правки в формулировку, прежде чем переносить идею в официальный бэклог.

Реальность проекта: ловушки и решения

Разработка такого инструмента сопровождалась рядом сложных моментов. Мы столкнулись с проблемой актуальности данных из Confluence, отсутствием единой метрики для сравнения разных экспериментов и генерацией дубликатов, когда модель забывала о том, что предлагала ранее.

Например, мы столкнулись с проблемой «нейрослопа» — около половины первоначальных гипотез оказывались нерабочими из-за неточных промптов или лишнего контекста. Мы покрыли каждый шаг генерации логами и шлифовали качество, но признали, что полностью избавиться от «мусора» невозможно. Решение: заложить время на ручную корректировку и не требовать идеального результата с первого раза.

Одной из ключевых ошибок была бы генерация идей, которые уже находятся в продакшене. Чтобы этого избежать, мы создали реестр текущего состояния полок и добавили явный запрет предлагать то, что уже работает.

Результаты внедрения

После запуска системы воронка показала ожидаемые результаты. Из более сотни структурированных артефактов, прошедших подготовку, модель генерирует около 200 гипотез. После автоматического ревью остаются 50 перспективных идей, и в финал, на стол продакта, попадают примерно 15 высококачественных гипотез.

Основной итог работы — возвращение высокой скорости генерации идей. Разрыв между созданными задачами и их закрытием снова стал положительным. Команда вернула себе возможность фокусироваться на развитии, а не на поиске того, что делать дальше. Этот кейс демонстрирует, что инструменты искусственного интеллекта доступны не только специалистам с инженерным бэкграундом, но и продакт-менеджерам, готовым автоматизировать рутинные процессы.

Первоисточники

Habr AI
← Вернуться в эфир