← к ленте

ByteDance представила SeedRealtime — мультимодальную модель для real-time общения

М@cgeventAI-инженер
3 нед

ByteDance выпустила SeedRealtime, аудиовизуальную full-duplex модель, способную непрерывно анализировать видео и голос для естественного взаимодействия.

Это новый стандарт взаимодействия с ИИ, где ассистент реагирует на мир в реальном времени, а не просто отвечает на текстовые запросы.

  • Технология позволяет ИИ видеть и слышать пользователя одновременно, устраняя паузы на «раздумья».
  • Модель лучше понимает контекст, связывая визуальные изменения в кадре с речью пользователя.
  • Повышается качество взаимодействия за счет способности ИИ корректно обрабатывать перебивания и фоновые шумы.
ByteDance бахнула SeedRealtime Это прям ответочка Алибабскому на Wan Streamer. Они выкатили SeedRealtime, нативную аудиовизуальную full-duplex-модель. На понятном это значит, что ассистент может непрерывно смотреть видео, слушать пользователя и отвечать голосом, не устраивая привычную драму «сначала вы договорите, потом я подумаю». Главное отличие от обычных голосовых ассистентов - единая архитектура для аудио, видео и текста. Модель учитывает не только отдельные кадры, но и временную последовательность событий, умеет связывать сказанное с происходящим в кадре и различать, обращаются ли вообще к ней. Например, она может понять двусмысленную фразу по визуальному контексту или отреагировать на объект, который только что появился в поле зрения. Еще наряднее то, что SeedRealtime умеет проявлять инициативу. ByteDance утверждает, что модель может сама сообщить об изменении в кадре, подключить инструмент прямо во время разговора, корректно обработать перебивание и не срываться на каждый шорох или разговор посторонних. Открытых весов пока нет. Тут битва идёт не за то, кто лучше отвечает на вопрос, а за то, кто меньше похож на бота с задержкой. Ссылки: Официальный анонс ByteDance Seed: https://seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction Страница SeedRealtime: https://seed.bytedance.com/en/SeedRealtime @cgevent

Кратко (AI)

ByteDance анонсировала SeedRealtime — нативную аудиовизуальную модель с поддержкой full-duplex, которая позволяет ассистенту непрерывно обрабатывать видео и голос. Система способна понимать контекст происходящего в кадре, реагировать на перебивания и проявлять инициативу, минимизируя задержки в общении. Открытые веса модели на данный момент недоступны.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖