ByteDance Seed анонсировала SeedRealtimei — нативную аудиовизуальную full-duplexi-модель, которая одновременно смотрит видео, слушает пользователя и отвечает голосом без классической паузы «сначала договорите, потом отвечу». Релиз рассматривается как ответ Alibaba и её Wan Streameri — конкуренция среди мультимодальных моделей смещается от качества ответов к скорости и естественности взаимодействия, то есть к тому, «кто меньше похож на бота с задержкой».
Ключевая архитектурная особенность — единая модель для аудио, видео и текста, учитывающая временную последовательность событий, а не только отдельные кадры. Это позволяет связывать сказанное с происходящим в кадре и понимать, обращаются ли вообще к модели.
- Модель может проявлять инициативу: сама сообщать об изменениях в кадре, подключать инструмент прямо во время разговора и корректно обрабатывать перебивание пользователя
- SeedRealtime умеет игнорировать посторонние шорохи и разговоры чужих людей, не срываясь на реакцию по любому звуку
- Модель способна разрешать двусмысленные фразы, опираясь на визуальный контекст, и реагировать на объекты, только что появившиеся в поле зрения
- По данным Нейронавт, модель также фокусируется на распознавании цели взаимодействия и намерений пользователя (интент)
- Открытых весов нет; согласно Нейронавт, доступны только ссылки на демо, публичного API также нет
- Официальный анонс опубликован в блоге ByteDance Seed по адресу seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction, есть отдельная страница продукта seed.bytedance.com/en/SeedRealtime
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖