Искусственный интеллект · Стартапы · Финансирование · Текст в речь · AI Voice · TechCrunch29 июля в 04:01 · 5 мин

Fish Audio привлекла 52 млн долларов для развития моделей ИИ-голоса: 8 миллионов пользователей и переход к корпоративному сегменту

Стартап Fish Audio успешно завершил сбор seed-раунда объемом 52 миллиона долларов, чтобы расширить возможности своих моделей генерации речи для креаторов и крупного бизнеса. Компания, основанная бывшим исследователем Nvidia, демонстрирует устойчивый рост: с момента запуска в прошлом году её модель используют более 8 миллионов человек, а годовой повторяющийся доход (ARR) достиг 21 миллиона долларов. Новые средства позволят ускорить разработку моделей с более тонкими настройками и внедрение технологий распознавания речи.

# Fish Audio привлекла 52 млн долларов: как стартап преодолевает кризис доверия и готовит корпоративный прорыв

Рынок искусственных голосов переживает бум. Креаторам требуются модели, способные передавать эмоции, в то время как бизнесу необходимы инструменты для автоматизации поддержки клиентов и продаж. Fish Audio, базирующаяся в Пало-Альто, ставит целью удовлетворить оба спроса одновременно, располагая библиотекой из более чем 15 000 параметров управления языком.

Масштаб успеха и техническое превосходство

Несмотря на высокую конкуренцию в секторе генерации речи от гигантов вроде ElevenLabs и WellSaid, Fish Audio выстраивает уникальный путь. Проект зародился как эксперимент Шиджи Ляо (Shijia Liao), разочарованного скудностью рынка синтетических голосов. Он обучил модель на одном графическом процессоре и открыто разместил её на GitHub. Сегодня репозиторий Fish Speech собирает свыше 31 000 звёзд, поддерживая разработчиков инди-игр, дизайнеров и независимых художников.

Компания запустила пять моделей за последний год: четыре для генерации речи и одна для транскрибации. Три модели генерации открыты для сообщества, тогда как новейшая модель S2.1 Pro доступна исключительно через платный API. Платформенные предложения включают ежемесячные подписки с лимитом минут и функциями клонирования голоса. В корпоративном сегменте Fish Audio уже сотрудничает с крупными игроками, такими как HeyGen и Sanas. CEO Рисса Cao отмечает, что потребности клиентов различны: медиа-компании ценят реализм, игровые студии — экспрессивность персонажей, а провайдеры голосовых агентов (LiveKit) — низкую задержку и естественность.

Технический контекст: Термин *open-source* (открытый исходный код) означает, что исходный код программного обеспечения свободен для изучения, изменения и распространения. Это позволяет разработчикам внедрять модели в свои продукты, не платя за лицензии, но не гарантирует отсутствие платных функций в коммерческой версии. *Генерация речи* — это процесс синтеза аудио-сигнала на основе текстового ввода, часто с использованием нейронных сетей.

Финансирование и стратегия развития

Вторник, 28 июля 2026 года, стал днём объявления успеха раунда сбора. Инвестицию на сумму 52 миллиона долларов возглавили Coreline Ventures и Capital Today. К процессу также подключились 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0. Согласно обновлению информации, сумма финансирования составляет именно 52 миллиона долларов, а не 50 миллионов, что отражает окончательные условия сделки.

Инвестор Осуке Honda из Coreline Ventures подчеркнул важность доверия сообщества. «Подход, ориентированный на сообщество, станет прочным преимуществом только при доверии создателей. Значит, согласие, прозрачность и атрибуция должны быть встроены в продукт, а не добавлены постфактум», — заявил он. Эксперты отмечают, что возможность предоставлять разработчикам тонкий контроль над моделями и обучать их с оптимальными затратами даст Fish Audio преимущество над хорошо финансируемыми лабораториями ИИ.

Разбор цифр: Привлечение seed-инвестиций на ранней стадии (ранж 1–20 млн долл) обычно требуется стартапам для покрытия расходов на разработку и маркетинг. Сумма в 52 миллиона долларов для раунда seed является значительной, указывая на высокий потенциал рынка и уверенность инвесторов в масштабировании бизнеса.

Проблемы доверия и автоматизация защиты прав

Рост популярности модели привёл к появлению серьёзных проблем с согласием. Несколько месяцев назад некоторые создатели обвинили Fish Audio в загрузке их голосов без разрешения. Хотя компания имела механизм подачи заявок на удаление (DMCA), процесс был слишком долгим. Рисса Cao признала проблему и заявила, что автоматизировала процесс: теперь пользователь может подать короткий образец голоса или контракт, и удаление файла произведётся в течение трёх минут.

Тем не менее, автоматизация не гарантирует идеальной защиты: до момента обнаружения и подачи заявки голос будет использоваться, если его не удалили вручную. Индустрия движется в сторону верифицированного владения голосом, чётких лицензионных условий и, в идеале, моделей доходного распределения (revenue sharing), когда создатели получают часть прибыли от коммерческого использования их голоса.

Рисса Cao объяснила мотивацию поиска капитала: ранее, работая исключительно над открытым проектом для креаторов, компания функционировала эффективно без внешних денег. Сейчас же цель — разработка более продвинутых моделей, выход на корпоративный рынок и удовлетворение растущего интереса инвесторов.

Будущее и технические планы

В планах Fish Audio на ближайшее время — релиз модели понимания аудио (audio understanding) в этом году. Кроме того, команда работает над моделью преобразования речи в речь (speech-to-speech), что позволит пользователям менять голосовое качество, сохраняя интонацию и смысловую нагрузку оригинала. Рынок генерации речи перенасыщен конкурентами, но Fish Audio полагается на технологическую точность, закрытие разрыва между искусственным и человеческим звучанием и гибкость модели для разработчиков.

Компания продолжает балансировать между философией открытого кода и коммерческой устойчивостью. Открытие трёх моделей генерации стимулирует экосистему, тогда как платные API обеспечивают ресурсы для инноваций. Как отметил партнёр 359 Capital Рико Маллоцци, способность создать передовые модели при относительно небольшой команде свидетельствует о выдающихся технических качествах команды Fish Audio.

Сегментация продукта — отдельная стратегия: бесплатные инструменты для энтузиастов, подписки для креаторов и корпоративные решения для бизнеса. Это позволяет стартапу масштабироваться, не теряя контакта с аудиторией, которая изначально создала основу для разработки продукта. Рынок ожидает от ИИ-голосов всё более высокого качества, и Fish Audio стремится стать эталоном в этом сегменте.

Первоисточники

TechCrunch AI
← Вернуться в эфир