ByteDance Seed представила Seed Audio 1.0 — аудиомодель, которая по одному промпту генерирует целую звуковую сцену: речь, атмосферу и звуковые эффекты одновременно. Доступ к модели открыт через платформу BytePlusi.
Модель ориентирована на озвучку, подкасты и дубляж: она позволяет жёстко задавать тайминг репликi с точностью до 100 мс и создавать голоса как по текстовому описанию, так и по аудио- или визуальному референсу.
100 мсточность тайминга реплик
2 минутымаксимум аудио за один проход
20+ языковподдерживаемых моделью
- За один проход можно сгенерировать до двух минут аудио, лимит промпта — 3000 знаков
- Клонирование голосаi: к промпту подключаются до трёх аудиоклипов через теги @Audio1, @Audio2, @Audio3; вместо аудио можно дать картинку с описанием персонажа
- Поддерживается более 20 языков с переносом тембра голоса между ними
- По данным Нейронавт, русский язык модель почти не тянет — промпт нужно писать на английском
- Цена использования — примерно $0.15–0.19 за минуту аудио
- В планах ByteDance — добавить видеореференсы и многодорожечную генерацию
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖