NVIDIA представила Nemotron VoiceChat — полнодуплексную речевую модель на 11B параметров, которая ведёт живой разговор без пауз и умеет вызывать внешние инструменты прямо во время диалога (поиск в интернете, календарь и другие). По данным источников, это первая открытая модель такого класса с поддержкой tool calling.
Модель позиционируется как универсальный голосовой ИИ-агент: она поддерживает естественное чередование реплик, перебивание пользователем, эмоциональную окраску речи и мультимодальные сценарии взаимодействия, а также допускает файнтюн под разные стили голоса.
11Bпараметров модели
480 мсзадержка при перебивании
550 000 часовобъём обучающей речи
- Модель имеет 11B параметров и распространяется как открытая (веса доступны на GitHub и Hugging Face, по данным Нейронавт)
- Задержка при перебивании пользователем составляет 480 мс (по данным Not Boring Tech)
- Обучена на 550 тысячах часов реальной и синтетической речи
- В одном диалоге модель может слушать, говорить, прерывать собственный ответ и вызывать инструменты одновременно
- Поддерживает генерацию речи с эмоциональной окраской и файнтюн под разные стили голоса
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖