Релиз Audio8 TTS Preview 0.1B





Alibaba представила Qwen-Audio-3.0-TTSi — модель синтеза речи в двух версиях: Flash (для голосовых интерфейсов в реальном времени) и Plus (для генерации с упором на естественность и точную передачу тембра). Модель поддерживает 16 языков, включая русский, умеет клонировать голос по образцу и заняла 1-е место в рейтинге Artificial Analysis TTS Leaderboardi (версия Plus).
Голосом можно управлять как обычными текстовыми инструкциями («читай медленно», «как сказку перед сном», «голосом ведущей утреннего радио»), так и с помощью 86 встроенных тегов эмоций и звуков — например [angry], [whispers], [laughing], [sighing], [breaths]. Модель пока не выложена в open source, доступ продаётся через Alibaba Cloud.
ByteDance Seed представила Seed Audio 1.0 — аудиомодель, которая по одному промпту генерирует целую звуковую сцену: речь, атмосферу и звуковые эффекты одновременно. Доступ к модели открыт через платформу BytePlusi.
Модель ориентирована на озвучку, подкасты и дубляж: она позволяет жёстко задавать тайминг репликi с точностью до 100 мс и создавать голоса как по текстовому описанию, так и по аудио- или визуальному референсу.
Илья Латышев и Борис (автор канала «Борис опять») подготовили статью «Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants», которую приняли на конференцию Interspeech 2026i. В основе статьи — открытый студийный корпус выразительной русской разговорной речи объёмом 20 часов, записанный тремя профессиональными актёрами театра с разметкой эмоций.
Особенность корпуса — актёры записывали диалоги, сидя друг напротив друга и видя мимику и жесты партнёра, хотя текст реплик был заранее подготовлен (scriptedi). Такой подход сделал речь заметно более естественной и эмоциональной по сравнению с записью дикторов по одному. Корпус предназначен в первую очередь для файнтюна моделей синтеза речи (TTSi) и распространяется по открытой лицензии для исследований.
Команда с Ильёй Латышевым подготовила статью «Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants», которую приняли на конференцию Interspeech 2026i. В статье представлен открытый студийный корпусi выразительной русской разговорной речи, предназначенный в первую очередь для файнтюнiа моделей синтеза речи.
Особенность корпуса — способ записи диалогов: два актёра театра сидели друг напротив друга и читали заранее подготовленные реплики, видя мимику, жесты и эмоциональную реакцию собеседника, что сделало речь заметно более естественной и выразительной по сравнению с изолированной записью каждого диктора.
Это всё на сейчас.