Релиз Breeze TTS 2: модель для клонирования голоса и генерации речи в реальном времени
Н@GreenNeuralRobotsAI-инженер
2 днBreeze TTS 2
Рилтайм говорилка
- Клонирование голоса: пара секунд речи + точная расшифровка → сохранение тембра, ритма, эмоций
- Дизайн голоса без референса по промпту
- Voice Direction: "говори медленно, серьезно" - голос остается, подача меняется
- Вокальные события в тексте: (laugh), (cough), (sigh)
- Стриминг с задержкой менее 40 мс до первого аудио, генерация в 3 раза быстрее реального времени
- 3B, ~7.7 GB VRAM, min 12 GB GPU
- английский и китайский
Гитхаб
HF
Попробовать
Демо
Спасибо @m_franz
#TTS #VOICECLONING #VOICEDESIGN
VK | MAX
