← к ленте

Выпуск TeraTTSv2: локальный движок синтеза речи

Н@GreenNeuralRobotsAI-инженер
1 нед

TeraSpace представили TeraTTSv2 — локальный TTS на ONNX Runtime с поддержкой русского и английского языков, потоковой передачей и клонированием голосов.

Это эффективный инструмент для разработчиков, позволяющий внедрить качественный синтез речи без зависимости от облачных API.

  • Работает локально на CPU, обеспечивая приватность данных.
  • Поддерживает потоковую генерацию, что важно для интерактивных приложений.
  • Позволяет клонировать голоса и настраивать параметры синтеза через GUI.
TeraTTSv2 Локальный TTS от TeraSpace на ONNX Runtime Русский и английский работает на CPU, ничего в облако не уходит. Готовый движок с диффузионным синтезом и потоковой отдачей аудио. • Генерация речи на русском и английском с тегами [ru] и [en] в одном запросе • Автоматическая расстановка ударений в русском через RUAccent, ручные + приоритетнее • 10 готовых голосов, рекомендованные русские ru_f1 и ru_m5 • Потоковая отдача аудио чанками • Числа разворачиваются словами на нужном языке • 44.1 кГц, моно, float32 • Два сэмплера - distilled на 8 шагов или teacher с настраиваемым CFG • duration_scale меняет темп, режимы ударений full и dictionary • Голоса от supertonic-3 подходят к TeraTTSv2 - скрипт supertonic_json_to_teratts.py конвертит json в стиль. Их можно подбирать (и клонировать) через через supertonic3-voice-clone • Supertonic-Voice-Mixer - GUI, крутит латент стиля и миксует голоса • Английским голосом на русском - пробуйте duration_scale 0.8 Демо Клонирование Миксер Скрипт закину в коменты #tts #russian #voicecloning

Кратко (AI)

TeraSpace выпустили TeraTTSv2, локальный движок для синтеза речи на базе ONNX Runtime, работающий полностью на CPU. Модель поддерживает русский и английский языки, потоковую генерацию аудио, автоматическую расстановку ударений и совместима с инструментами для клонирования голосов supertonic-3.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖