Обновление SpeakFlow 1.3.91: улучшение обработки ошибок и стабильности
Релиз VibeVoice-ASR-BitNet для работы на CPU

Релиз модели Qwen-Audio-3.0-ASR-Flash

OpenAI представила модели GPT Transcribe и GPT Live Transcribe
Релиз аудио-модели GigaChat3.1-Audio-10B-A1.8B
Яндекс решил проблему «катастрофического забывания» у голосовых помощников
Исследователи Яндекса нашли способ добавлять новые голосовые команды в устройства с офлайн-распознаванием речи (например, умные колонки) без потери качества распознавания старых команд. Раньше при дообучении модели новыми фразами она резко теряла точность на старых: доля пропущенных знакомых команд взлетала с 2,71% до 69% (по данным Хабра — до 69,08%).
Вместо переобучения всей модели или подбора ограничений (как в методе EWC) команда предложила модульное расширениеi: основную нейросеть замораживают, а к ней подключают небольшой лёгкий модуль, который переиспользует активации старых слоёв и учится распознавать только новые команды. Это позволяет обновлять умные устройства с ограниченными ресурсами, не переобучая систему целиком и не рискуя ломать уже работающие функции — и всё работает прямо на устройстве без интернета.
ВыводСтандартное дообучение подняло долю ошибок на старых командах с 2,71% до 69% (Хабр указывает точнее — 69,08%)
Transcribe.cpp: кроссплатформенная библиотека распознавания речи
Сбер выложил в опенсорс речевые модели GigaAM Multilingual и GigaChat Audio
Сбер открыл доступ к двум новым речевым моделям — мультиязычной системе распознавания речи GigaAM Multilinguali и audio-native LLM GigaChat Audioi. Обе модели строятся на аудиоэнкодере, обученном на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, и решают две слабые стороны открытых Speech AI систем: плохую поддержку языков СНГ и деградацию качества на длинных записях.
GigaChat Audio объединяет GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет работать с аудио напрямую — без промежуточной расшифровки в текст: ведёт диалог, переводит, классифицирует звук, считывает эмоции по интонации и находит нужные моменты в многочасовых записях с таймкодами. Обе научные статьи по моделям приняты на конференцию Interspeech 2026.
Это всё на сейчас.