Автоматизация анализа интервью: превращение аудио в гипотезы с помощью Cursor и локальных моделей
Процесс сбора инсайтов после интервью часто сводится к многократному прослушиванию записей и ручной обработке заметок, что повышает риск упустить важные детали под влиянием когнитивных искажений. Продуктовый дизайнер Анастасия из Ticketland, совместно с командой МТС, разработала методологию использования ИИ-редактора Cursor и локальных моделей распознавания речи для создания прозрачной цепочки: от сырого аудио до проверенных продуктовых гипотез. Данный подход позволяет исключить «галлюцинации» на этапе фактчекинга и сохранить фокус исследователя на смысловом анализе.
# От беседы к гипотезам: как выжать инсайты из аудио с помощью Cursor
Интервью часто становится точкой, где эффективность общения резко обрывается. Многие исследователи и дизайнеры сталкиваются с ситуацией, когда после качественного диалога тратятся часы на переслушивание аудиофайлов и обработку спешно сделанных заметок. Человеческий мозг подвержен систематическим ошибкам: он склонен искать подтверждение уже имеющимся убеждениям, игнорируя противоречащие данные. Чтобы избежать этого, необходим объективный инструмент обработки.
В статье, опубликованной в блоге МТС на платформе Habr, представлена система автоматизации этого процесса. Автор, продуктовый дизайнер Анастасия, описывает способ организации работы на локальном компьютере с помощью редактора кода Cursor. Методика базируется на семи этапах и позволяет трансформировать звуковую запись в структурированные инсайты и проверемые гипотезы без передачи данных в сторонние облачные сервисы.
Подготовка и техническая настройка
Первым и критически важным этапом является этическая подготовка собеседника. Нервозность респондента из-за боязни записи может привести к тому, что он даст социально ожидаемые, а не честные ответы. Автор рекомендует заранее объяснить цель записи, гарантировать конфиденциальность и указать на то, что материал будет удален после анализа.
С технической стороны процесс начинается с подготовки окружения. В отличие от онлайн-сервисов, данный метод использует локальные модели. Для расшифровки голоса применяется модель OpenAI Whisper, установленная локально через Homebrew или аналогичные средства, а не через веб-интерфейс. Для решения проблемы идентификации говорящих (различения собеседников в диалоге) может потребоваться дополнительный инструмент, например, WhisperX.
Редактор Cursor в этом случае выступает не просто как среда разработки, а как интеллектуальный агент. С его помощью настраиваются так называемые «скилы» (инструкции). Через чат с ИИ пользователь может инициировать установку необходимых библиотек Python (например, openai-whisper и ffmpeg) и создать локальный скрипт транскрибации. Эта инструкция сохраняется в проекте и впоследствии вызывается одной командой в интерфейсе редактора, избавляя от необходимости вручную управлять терминалом при каждой новой записи.
Чистка текста и извлечение фактов
Сырой текст, полученный в результате расшифровки, содержит паузы, повторы и слова-паразиты. На этапе очистки нейросеть выполняет рутинную работу по удалению «мусора», сохраняя при этом смысл, эмоциональные акценты и факты. Здесь важно настроить промпт так, чтобы алгоритм не менял смысловые конструкции, а лишь структурировал текст.
Следующий шаг — проверка гипотез, для чего используется модель с большим контекстным окном, например, Claude Sonnet. Исследователь задает список конкретных вопросов, сформулированных до начала интервью. ИИ анализирует текст транскрипта и отвечает на вопросы строго на основе предоставленного материала. Если того факта не было, система корректно сообщает об отсутствии данных, избегая выдумывания информации («галлюцинаций»). Это создает надежную базу данных, свободную от человеческой предвзятости при чтении.
Поиск скрытых инсайтов и генерация гипотез
Даже при тщательном планировании интервью могут возникнуть неожиданные темы. Автор предлагает промт для выявления скрытых инсайтов, таких как сильные эмоциональные реакции, неэффективные способы решения проблем пользователя (костыли) или выявленные противоречия между словами и действиями. Примером может служить ситуация, когда пользователь испытывает стресс из-за страха пропустить билет, что вызывает нагрузку на серверы, но эта деталь не была прямой целью анкетирования.
На финальном этапе все собранные данные преобразуются в продуктовые гипотезы. ИИ структурирует наблюдения, предлагая формулировки типа: «Если мы сделаем Х, то получим эффект Y, потому что у пользователей есть проблема Z». Система разделяет подтвержденные наблюдения от предположений и ранжирует гипотезы по приоритету.
Таким образом, ИИ берет на себя роль ассистента, обрабатывающего громоздкие данные, в то время как человек сосредотачивается на интерпретации результатов и стратегии продукта.