seedrealtimeСбросить фильтр ×

ByteDance представила SeedRealtime — full-duplex аудиовизуальную модель для естественного диалога

ByteDance Seed анонсировала SeedRealtimei — нативную аудиовизуальную full-duplexi-модель, которая одновременно смотрит видео, слушает пользователя и отвечает голосом без классической паузы «сначала договорите, потом отвечу». Релиз рассматривается как ответ Alibaba и её Wan Streameri — конкуренция среди мультимодальных моделей смещается от качества ответов к скорости и естественности взаимодействия, то есть к тому, «кто меньше похож на бота с задержкой».

Ключевая архитектурная особенность — единая модель для аудио, видео и текста, учитывающая временную последовательность событий, а не только отдельные кадры. Это позволяет связывать сказанное с происходящим в кадре и понимать, обращаются ли вообще к модели.

Полный разбор →

Это всё на сейчас.