AudioToText: превращение записей встреч в основу управления требованиями с помощью MLX Whisper и Django
Проект AudioToText представляет собой инструмент, который трансформирует голосовые записи совещаний в структурированные данные для анализа требований. Используя связку MLX Whisper для распознавания речи, диаризацию спикеров и веб-интерфейс на Django, система генерирует не просто текстовые транскрипты, а сопоставимые позиции участников по конкретным сущностям, выявляя противоречия и сохраняя историю принятия решений.
# AudioToText: управление требованиями через записи встреч
В эпоху, когда транскрибация встреч и краткое резюме (summary) стали стандартными функциями как корпоративных сервисов, так и связок «транскрипт + LLM», возникает дефицит другого: материала, позволяющего сопоставлять позиции разных людей по одним и тем же сущностям без потери истории решений. Проект AudioToText возник из необходимости превратить записи встреч в рабочий артефакт для аналитиков и архитекторов.
Как это работает
AudioToText обрабатывает записи, разбивая их на блоки, связанные с конкретными спикерами, и связывает эти блоки с проектными сущностями. Это позволяет выявлять не только фактическое содержание дискуссии, но и скрытые противоречия между участниками.
Ключевые возможности
* Многошаговый пайплайн: От загрузки аудио до генерации сопоставимых summary. Проект использует каскадную обработку: сначала ASR, затем NER, далее генерация summary и финальное сопоставление. Такая структура позволяет легко добавлять новые этапы анализа без изменения ядра системы. * Рецензирование и правки: Между автоматическим распознаванием и финальным результатом существует слой ревью. Это позволяет корректировать ошибки ASR и NER, обеспечивая высокое качество данных для последующего анализа. * Локальный запуск: Проект спроектирован так, чтобы работать на Apple Silicon без необходимости подключения к облачным GPU или внешним SaaS. Это критично для конфиденциальных данных. * Управление сущностями: Система поддерживает ручную и автоматическую аннотацию named entities (NER), группируя реплики по смысловым блокам для удобной работы аналитиков.
Отложенные функции
Разработчики сознательно оставляют за рамками текущего релиста такие задачи, как REST API, асинхронные рабочие процессы и интеграции с PostgreSQL для векторного поиска. Эти компоненты планируются как следующая ступень развития проекта, направленная на автоматизированное обнаружение конфликтов требований на основе семантического сравнения эмбеддингов.
Модель данных и права доступа
Для корректного управления требованиями AudioToText разделяет понятия user (учетная запись) и project-member (участник конкретного проекта). Это позволяет привязывать голоса участников (спикеров) к конкретным пользователям или сохранять анонимные профили для внешних экспертов. Система поддерживает гибкую модель ролей: от внешнего зрителя (viewer) до аналитика (analyst) и менеджера проекта (project_manager), обеспечивая баланс между доступом к данным и возможностью их редактирования.
Почему это важно для команд
AudioToText не просто транскрибирует разговоры; он структурирует их для последующего анализа, позволяя командам быстро находить противоречия, подтверждать решения и сохранять контекст проекта.