голосовые технологииСбросить фильтр ×

Speko: единый API и роутер для голосовых AI-моделей

A@ai_productAI-инженер
1 нед
Speko: единый API и роутер для голосовых AI-моделей

ChatGPT как среда голосового взаимодействия

T@techsparksAI-инженер
1 мес

OpenAI выпустила GPT-Live — голосовой режим ChatGPT, слушающий и говорящий одновременно

AI-редакция
14 источников · показать все· свернуть
хайп · 14обновлено 1 мес назад

OpenAI представила GPT-Live — новое поколение голосовых моделей для ChatGPT Voice, построенное на full-duplexi архитектуре: модель одновременно слушает пользователя и генерирует речь, а не работает по очереди, как раньше. Это заменяет старый каскад STT→LLM→TTS и режим Advanced Voice Modei, которые ждали паузы и часто резко перебивали собеседника или, наоборот, «зависали».

Теперь модель может поддакивать («угу», «ага»), молчать, если пользователь просто задумался, и мгновенно включаться в разговор, а сложные вопросы незаметно передаёт «старшей» модели GPT-5.5 в фоне, продолжая при этом поддерживать беседу. Раскатка началась 8 июля 2026 года глобально на iOS, Android и в браузере.

9обновлённых голосов ChatGPT
8 июля 2026дата начала глобальной раскатки
GPT-5.5модель, куда делегируются сложные задачи

Полный разбор →

Стартап Aleph представил технологию распознавания «немой речи» через УЗИ гортани

Стартап AlephNeuro (по данным другого источника — Aleph) показал прототип системы, которая распознаёт речь без единого звука: датчик УЗИ прикладывается под подбородок, а нейросеть транскрибирует в текст движения языка и гортани во время артикуляции.

Идея решает проблему «шептунов» — инженеров, которые бормочут команды в микрофон, диктуя код голосовым помощникам типа Клода, глядя в терминал. Технология позволяет отдавать голосовые команды ИИ полностью молча, что может изменить практику «голосового вайбкодингiа».

ВыводКомпания заметила, что ультразвуковое сканирование гортани позволяет фиксировать движения языка при артикуляции без произнесения звука

Полный разбор →

Это всё на сейчас.