← к умной ленте

ByteDance выпустила Seed Audio 1.0 — модель для генерации целых звуковых сцен

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

ByteDance Seed представила Seed Audio 1.0 — аудиомодель, которая по одному промпту генерирует целую звуковую сцену: речь, атмосферу и звуковые эффекты одновременно. Доступ к модели открыт через платформу BytePlusi.

Модель ориентирована на озвучку, подкасты и дубляж: она позволяет жёстко задавать тайминг репликi с точностью до 100 мс и создавать голоса как по текстовому описанию, так и по аудио- или визуальному референсу.

100 мсточность тайминга реплик
2 минутымаксимум аудио за один проход
20+ языковподдерживаемых моделью
  • За один проход можно сгенерировать до двух минут аудио, лимит промпта — 3000 знаков
  • Клонирование голосаi: к промпту подключаются до трёх аудиоклипов через теги @Audio1, @Audio2, @Audio3; вместо аудио можно дать картинку с описанием персонажа
  • Поддерживается более 20 языков с переносом тембра голоса между ними
  • По данным Нейронавт, русский язык модель почти не тянет — промпт нужно писать на английском
  • Цена использования — примерно $0.15–0.19 за минуту аудио
  • В планах ByteDance — добавить видеореференсы и многодорожечную генерацию

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖