ByteDance представила SeedRealtime — мультимодальную модель для real-time общения
М@cgeventAI-инженер
3 недByteDance выпустила SeedRealtime, аудиовизуальную full-duplex модель, способную непрерывно анализировать видео и голос для естественного взаимодействия.
Это новый стандарт взаимодействия с ИИ, где ассистент реагирует на мир в реальном времени, а не просто отвечает на текстовые запросы.
- Технология позволяет ИИ видеть и слышать пользователя одновременно, устраняя паузы на «раздумья».
- Модель лучше понимает контекст, связывая визуальные изменения в кадре с речью пользователя.
- Повышается качество взаимодействия за счет способности ИИ корректно обрабатывать перебивания и фоновые шумы.
ByteDance бахнула SeedRealtime
Это прям ответочка Алибабскому на Wan Streamer.
Они выкатили SeedRealtime, нативную аудиовизуальную full-duplex-модель. На понятном это значит, что ассистент может непрерывно смотреть видео, слушать пользователя и отвечать голосом, не устраивая привычную драму «сначала вы договорите, потом я подумаю».
Главное отличие от обычных голосовых ассистентов - единая архитектура для аудио, видео и текста. Модель учитывает не только отдельные кадры, но и временную последовательность событий, умеет связывать сказанное с происходящим в кадре и различать, обращаются ли вообще к ней. Например, она может понять двусмысленную фразу по визуальному контексту или отреагировать на объект, который только что появился в поле зрения.
Еще наряднее то, что SeedRealtime умеет проявлять инициативу. ByteDance утверждает, что модель может сама сообщить об изменении в кадре, подключить инструмент прямо во время разговора, корректно обработать перебивание и не срываться на каждый шорох или разговор посторонних.
Открытых весов пока нет.
Тут битва идёт не за то, кто лучше отвечает на вопрос, а за то, кто меньше похож на бота с задержкой.
Ссылки:
Официальный анонс ByteDance Seed: https://seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction
Страница SeedRealtime: https://seed.bytedance.com/en/SeedRealtime
@cgevent
Кратко (AI)
ByteDance анонсировала SeedRealtime — нативную аудиовизуальную модель с поддержкой full-duplex, которая позволяет ассистенту непрерывно обрабатывать видео и голос. Система способна понимать контекст происходящего в кадре, реагировать на перебивания и проявлять инициативу, минимизируя задержки в общении. Открытые веса модели на данный момент недоступны.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖