JoyAI-Video-Edit: 16B-модель для редактирования видео в реальном времени
ByteDance представила SeedRealtime — full-duplex аудиовизуальную модель для естественного диалога
ByteDance Seed анонсировала SeedRealtimei — нативную аудиовизуальную full-duplexi-модель, которая одновременно смотрит видео, слушает пользователя и отвечает голосом без классической паузы «сначала договорите, потом отвечу». Релиз рассматривается как ответ Alibaba и её Wan Streameri — конкуренция среди мультимодальных моделей смещается от качества ответов к скорости и естественности взаимодействия, то есть к тому, «кто меньше похож на бота с задержкой».
Ключевая архитектурная особенность — единая модель для аудио, видео и текста, учитывающая временную последовательность событий, а не только отдельные кадры. Это позволяет связывать сказанное с происходящим в кадре и понимать, обращаются ли вообще к модели.
Релиз VibeVoice-ASR-BitNet для работы на CPU

OpenAI добавил в Codex голосового агента на базе GPT-Live
В приложение Codexi завезли ChatGPT Voice, построенный на недавно выпущенной модели GPT-Livei. Новая функция позволяет вести полноценный голосовой диалог с агентом: модель одновременно говорит, слушает и параллельно координирует работу агентов в приложении, выполняя задачи и ища информацию прямо во время разговора.
Обновление подано как шаг к «вайб-кодингу» через голос, но заявленный релиз Opus 5 и обещанной GPT-5.6 Sol на Cerebras пока не состоялся — по данным Data Secrets, эти релизы отложены.
Вышла версия Lucy 2.5: реалтаймовый видеокомпозитинг
NVIDIA представила модель для интерактивной генерации движений человека
SAM-MT: мультизадачная сегментация в реальном времени
ABot-World: генератор интерактивных миров в реальном времени
LiveEdit: потоковое редактирование видео на базе Wan2.1
Это всё на сейчас.