OpenAI представила GPT-Live — новое поколение голосовых моделей для ChatGPT Voice, построенное на full-duplexi архитектуре: модель одновременно слушает пользователя и генерирует речь, а не работает по очереди, как раньше. Это заменяет старый каскад STT→LLM→TTS и режим Advanced Voice Modei, которые ждали паузы и часто резко перебивали собеседника или, наоборот, «зависали».
Теперь модель может поддакивать («угу», «ага»), молчать, если пользователь просто задумался, и мгновенно включаться в разговор, а сложные вопросы незаметно передаёт «старшей» модели GPT-5.5 в фоне, продолжая при этом поддерживать беседу. Раскатка началась 8 июля 2026 года глобально на iOS, Android и в браузере.
- Архитектура принимает решение «слушать/говорить/молчать/перебить/вызвать инструмент» несколько раз в секунду, а не последовательно обрабатывает реплики
- На старте делегирование сложных задач идёт в GPT-5.5, по данным Метаверсище и ИИще — конкретно в GPT-5.5 Instant либо GPT-5.5 Thinking с уровнями рассуждения Medium и High
- GPT-Live-1 становится основной голосовой моделью для тарифов Go, Plus и Pro; GPT-Live-1 minii — для бесплатных пользователей; доступ в API пока не открыт, обещан позже
- Обновили все девять голосов ChatGPT и улучшили отделение голоса пользователя от шума и посторонних разговоров на фоне (по данным Метаверсище и ИИще)
- В голосовом режиме появились визуальные виджеты — погода, спорт, котировки акций (Tips AI, Метаверсище и ИИще)
- Video и демонстрация экрана в GPT-Live пока не поддерживаются — для этого нужно временно переключаться на старые (legacy) режимы голоса
- По данным Serge_AI, добавлена дополнительная защита — особенно для подростков и по чувствительным темам вроде психологического состояния; по данным Data Secrets, некоторые языки пока звучат с заметным акцентом
- Релиз состоялся на день раньше выхода Grok-4.5, который, по мнению Data Secrets, немного затмил анонс GPT-Live
OpenAI обещает позже добавить в GPT-Live поддержку видео и демонстрации экрана, а также открыть доступ к модели через API; языковые акценты и другие шероховатости планируется постепенно исправлять.
Это произошло: Claude научился создавать навыки по записи экрана и голосу — функция Record a Skill →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖