← к ленте

Релиз Breeze TTS 2: модель для клонирования голоса и генерации речи в реальном времени

Н@GreenNeuralRobotsAI-инженер
2 дн

Обзор возможностей Breeze TTS 2: клонирование голоса, управление интонацией, поддержка вокальных эффектов и низкая задержка генерации.

Breeze TTS 2 делает синтез речи с эмоциями доступным для работы в реальном времени.

  • Высокая скорость генерации позволяет использовать модель в интерактивных приложениях.
  • Возможность управления подачей голоса через текстовые промпты упрощает создание озвучки.
  • Поддержка вокальных событий (смех, кашель) делает синтезированную речь более естественной.
Breeze TTS 2 Рилтайм говорилка - Клонирование голоса: пара секунд речи + точная расшифровка → сохранение тембра, ритма, эмоций - Дизайн голоса без референса по промпту - Voice Direction: "говори медленно, серьезно" - голос остается, подача меняется - Вокальные события в тексте: (laugh), (cough), (sigh) - Стриминг с задержкой менее 40 мс до первого аудио, генерация в 3 раза быстрее реального времени - 3B, ~7.7 GB VRAM, min 12 GB GPU - английский и китайский Гитхаб HF Попробовать Демо Спасибо @m_franz #TTS #VOICECLONING #VOICEDESIGN VK | MAX
Релиз Breeze TTS 2: модель для клонирования голоса и генерации речи в реальном времени

Кратко (AI)

Представлена модель Breeze TTS 2, предназначенная для синтеза речи в реальном времени. Она поддерживает клонирование голоса по короткому фрагменту, настройку эмоциональной окраски через промпты и генерацию вокальных эффектов, обеспечивая задержку менее 40 мс.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖