← к ленте

Выпущен Dialogs: открытый корпус выразительной русской речи для TTS

Б@boris_againAI-инженер
1 мес

Представлен Dialogs — новый открытый корпус русской разговорной речи для обучения моделей синтеза, принятый на конференцию Interspeech 2026.

🎉 Подготовили статью "Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants", с Ильёй Латышевым, которую приняли на Interspeech 2026 Слова Ильи:
Это был мой первый подобный опыт, и теперь я могу с уверенностью сказать: если кажется, что всё, что может пойти не по плану, обязательно пойдёт не по плану — скорее всего, так и будет 😄 Переносы записей, сорванные дедлайны, организационные сложности, постоянные мелкие проблемы, которые по отдельности кажутся незначительными, но вместе сильно тормозят работу. В какой-то момент начинает казаться, что проект уже никогда не закончится. Но в итоге всё получилось, и я очень рад, что мы довели его до конца. За время работы я понял, насколько много мелочей влияют на качество речевого корпуса. Например: • желательно использовать одинаковые микрофоны и одинаковую аудиоцепочку для всех дикторов; • одинаковое расстояние до микрофонов; • необходимо контролировать уровень фонового шума и акустику помещения; • важно не менять настройки записи между сессиями; • стоит заранее продумать организацию записи, потому что именно она часто становится источником самых неожиданных проблем.
Одной из особенностей нашего корпуса стали условия записи диалогов. Два актёра театра сидели напротив друг друга и читали реплики, видя мимику, жесты и эмоциональную реакцию собеседника. Несмотря на то что текст был заранее подготовлен, такое взаимодействие делало реплики значительно более естественными и выразительными. Это заметно отличается от записи, когда каждый диктор работает в одиночку и произносит свои реплики изолированно. В результате получился открытый студийный корпус выразительной русской разговорной речи: • 20 часов записей; • 3 профессиональных диктора — актёра театра; • широкий набор эмоций и разговорных стилей; • открытая лицензия для исследований. Корпус в первую очередь предназначен для файнтюна моделей синтеза речи. В статье мы также показываем результаты обучения моделей и субъективную оценку качества (MOS) для различных разговорных стилей. 📄 Статья на arxiv: https://arxiv.org/abs/2607.14310 📄Статья на hf: https://huggingface.co/papers/2607.14310 🤗 Датасет: https://huggingface.co/datasets/langswap/dialogs-ru-emotional-conversations 🎤 Демо: https://huggingface.co/spaces/frappuccino/dialogs-ru-tts Спасибо Илье за работу над этим проектом - это было очень непросто и ресурсозатратно и я очень хочу чтобы результаты нашей работы приносили пользу таким же исследователям речевых технологий как мы. Подписывайтесь на канал Ильи, он делает крутые обзоры там! @decent_researcher И на этот канал, @voicestuff

Кратко (AI)

Исследователи представили Dialogs, открытый корпус русской разговорной речи, записанный профессиональными театральными актерами для улучшения качества синтеза речи. Датасет включает 20 часов эмоционально окрашенных диалогов и предназначен для дообучения TTS-моделей. Работа была принята к публикации на конференции Interspeech 2026.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖