Релиз Breeze TTS 2: модель для клонирования голоса и генерации речи в реальном времени
Н@GreenNeuralRobotsAI-инженер
2 днОбзор возможностей Breeze TTS 2: клонирование голоса, управление интонацией, поддержка вокальных эффектов и низкая задержка генерации.
Breeze TTS 2 делает синтез речи с эмоциями доступным для работы в реальном времени.
- Высокая скорость генерации позволяет использовать модель в интерактивных приложениях.
- Возможность управления подачей голоса через текстовые промпты упрощает создание озвучки.
- Поддержка вокальных событий (смех, кашель) делает синтезированную речь более естественной.
Breeze TTS 2
Рилтайм говорилка
- Клонирование голоса: пара секунд речи + точная расшифровка → сохранение тембра, ритма, эмоций
- Дизайн голоса без референса по промпту
- Voice Direction: "говори медленно, серьезно" - голос остается, подача меняется
- Вокальные события в тексте: (laugh), (cough), (sigh)
- Стриминг с задержкой менее 40 мс до первого аудио, генерация в 3 раза быстрее реального времени
- 3B, ~7.7 GB VRAM, min 12 GB GPU
- английский и китайский
Гитхаб
HF
Попробовать
Демо
Спасибо @m_franz
#TTS #VOICECLONING #VOICEDESIGN
VK | MAX

Кратко (AI)
Представлена модель Breeze TTS 2, предназначенная для синтеза речи в реальном времени. Она поддерживает клонирование голоса по короткому фрагменту, настройку эмоциональной окраски через промпты и генерацию вокальных эффектов, обеспечивая задержку менее 40 мс.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖