← к умной ленте

ByteDance представила SeedRealtime — full-duplex аудиовизуальную модель для естественного диалога

ByteDance Seed анонсировала SeedRealtimei — нативную аудиовизуальную full-duplexi-модель, которая одновременно смотрит видео, слушает пользователя и отвечает голосом без классической паузы «сначала договорите, потом отвечу». Релиз рассматривается как ответ Alibaba и её Wan Streameri — конкуренция среди мультимодальных моделей смещается от качества ответов к скорости и естественности взаимодействия, то есть к тому, «кто меньше похож на бота с задержкой».

Ключевая архитектурная особенность — единая модель для аудио, видео и текста, учитывающая временную последовательность событий, а не только отдельные кадры. Это позволяет связывать сказанное с происходящим в кадре и понимать, обращаются ли вообще к модели.

  • Модель может проявлять инициативу: сама сообщать об изменениях в кадре, подключать инструмент прямо во время разговора и корректно обрабатывать перебивание пользователя
  • SeedRealtime умеет игнорировать посторонние шорохи и разговоры чужих людей, не срываясь на реакцию по любому звуку
  • Модель способна разрешать двусмысленные фразы, опираясь на визуальный контекст, и реагировать на объекты, только что появившиеся в поле зрения
  • По данным Нейронавт, модель также фокусируется на распознавании цели взаимодействия и намерений пользователя (интент)
  • Открытых весов нет; согласно Нейронавт, доступны только ссылки на демо, публичного API также нет
  • Официальный анонс опубликован в блоге ByteDance Seed по адресу seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction, есть отдельная страница продукта seed.bytedance.com/en/SeedRealtime

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖