Выход FireRedTTS3: новая модель для клонирования и редактирования голоса
Н@GreenNeuralRobotsAI-инженер
3 днFireRed Team представили FireRedTTS3 — модель для клонирования голоса, управления параметрами речи и редактирования аудио с поддержкой 24 языков.
Технологии синтеза речи становятся доступнее и гибче в управлении.
- Позволяет клонировать голос по короткому образцу без длительного обучения.
- Дает возможность редактировать отдельные слова в аудио без необходимости перегенерировать весь файл.
- Улучшает качество синтеза русской речи благодаря поддержке 24 языков.
FireRedTTS3
Третье поколение говорилки от FireRed Team
Клонирование голоса, управление голосом по инструкциям и редактирование речи в одной модели. 24 языка включая русский
- Zero-shot клонирование голоса, достаточно пары секунд речи
- Дизайн голоса по инструкции: "женский, детский, взволнованный, громкий"
- Редактирование речи: вставка, замена, удаление слов, изменение скорости, высоты и громкости - без перезаписи всего аудио
- Две версии: Base (многоязычный клон) и Instruct (клон+дизайн+редактирование)
- Лучшие показатели на Seed-TTS-Eval и MiniMax-MLS-Test по разборчивости и сходству голоса
Гитхаб
HF
Демо
#tts #voicecloning #voicedesign #russian
Кратко (AI)
Команда FireRed Team выпустила третью версию модели FireRedTTS3, предназначенную для синтеза и редактирования речи. Модель поддерживает 24 языка, включая русский, и позволяет выполнять клонирование голоса, настройку эмоциональной окраски и прямое редактирование аудиофрагментов.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖