распознавание речиСбросить фильтр ×

ИИ-секретарь EMMA провалился в британских поликлиниках из-за акцентов

N@NeuralShitAI-инженер
1 нед

Обновление SpeakFlow 1.3.91: улучшение обработки ошибок и стабильности

S@speakfloпродакт / фаундер
2 нед

Релиз VibeVoice-ASR-BitNet для работы на CPU

Н@GreenNeuralRobotsAI-инженер
3 нед
VibeVoice-ASR-BitNet Сжатая версия VibeVoice-ASR для рилтайма на CPU, не требует GPU качество ниже чем у VibeVoice-ASR-7B, зато легкий • работает на x86 (AVX2) и ARM (NEON) • поддерживает несколько языков • размер: 1.58 ГБ (сжато с 4.62 ГБ) • ускорение: в 1.6–2.3 раза быстрее Whisper.cpp Гитхаб HF Демо #asr #realtime #mobile
Релиз VibeVoice-ASR-BitNet для работы на CPU

Релиз модели Qwen-Audio-3.0-ASR-Flash

Н@GreenNeuralRobotsAI-инженер
4 нед
Qwen-Audio-3.0-ASR-Flash Новая коммерческая модель для распознавания речи с улучшенной контекстной осведомленностью и распознаванием терминов в разных доменах • Точное распознавание терминов в специфических областях • Поддержка пользовательских горячих слов Доступны версии: Qwen-Audio-3.0-ASR-Flash-Streaming - потоковое распознавание речи Qwen-Audio-3.0-ASR-Flash-Filetrans - распознавание записанной речи (HTTP API) Qwen-Audio-3.0-ASR-Flash - не потоковое распознавание #asr
Релиз модели Qwen-Audio-3.0-ASR-Flash

OpenAI представила модели GPT Transcribe и GPT Live Transcribe

4 нед

Релиз аудио-модели GigaChat3.1-Audio-10B-A1.8B

Н@GreenNeuralRobotsAI-инженер
1 мес
GigaChat3.1-Audio-10B-A1.8B Аудио LLM для работы с длинными записями (2 часа) * Распознавание речи (ASR) - переводит аудио в текст * Перевод - упомянуты русский и английский * Ответы на вопросы по аудио (QA) * Распознавание эмоций * Временная привязка (temporal grounding). находит в какой части аудио происходит то или иное событие. заявлено 48.3 mIoU на задачах для записей до 2 часов • 10B #MoE декодер, активно 1.8B параметров • энкодер GigaAM Демо #alm #qa #asr #stt #translation #russian

Яндекс решил проблему «катастрофического забывания» у голосовых помощников

Исследователи Яндекса нашли способ добавлять новые голосовые команды в устройства с офлайн-распознаванием речи (например, умные колонки) без потери качества распознавания старых команд. Раньше при дообучении модели новыми фразами она резко теряла точность на старых: доля пропущенных знакомых команд взлетала с 2,71% до 69% (по данным Хабра — до 69,08%).

Вместо переобучения всей модели или подбора ограничений (как в методе EWC) команда предложила модульное расширениеi: основную нейросеть замораживают, а к ней подключают небольшой лёгкий модуль, который переиспользует активации старых слоёв и учится распознавать только новые команды. Это позволяет обновлять умные устройства с ограниченными ресурсами, не переобучая систему целиком и не рискуя ломать уже работающие функции — и всё работает прямо на устройстве без интернета.

ВыводСтандартное дообучение подняло долю ошибок на старых командах с 2,71% до 69% (Хабр указывает точнее — 69,08%)

2,71%ошибки на старых командах до дообучения
69%ошибки на старых командах после стандартного дообучения
4,37%ошибки на новых командах в новом методе

Полный разбор →

Transcribe.cpp: кроссплатформенная библиотека распознавания речи

Н@GreenNeuralRobotsAI-инженер
1 мес
Transcribe.cpp Быстрая и точная кроссплатформенная библиотека распознавания речи на C++. Поддерживает более 60 моделей. Есть ускорение на GPU (Vulkan, Metal, CUDA) Точность подтверждена по WER. Полная совместимость с whisper.cpp. Есть биндинги для Python, JS, Rust, Swift. Гитхаб #asr #transcribe

Сбер выложил в опенсорс речевые модели GigaAM Multilingual и GigaChat Audio

Сбер открыл доступ к двум новым речевым моделям — мультиязычной системе распознавания речи GigaAM Multilinguali и audio-native LLM GigaChat Audioi. Обе модели строятся на аудиоэнкодере, обученном на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, и решают две слабые стороны открытых Speech AI систем: плохую поддержку языков СНГ и деградацию качества на длинных записях.

GigaChat Audio объединяет GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет работать с аудио напрямую — без промежуточной расшифровки в текст: ведёт диалог, переводит, классифицирует звук, считывает эмоции по интонации и находит нужные моменты в многочасовых записях с таймкодами. Обе научные статьи по моделям приняты на конференцию Interspeech 2026.

48.3точность локализации событий (IoU) на записях 20–60 мин
60.0 против 43.7балл RuBQ-Audio у GigaChat Audio vs Qwen3-Omni
240 млнпараметров компактной GigaAM Multilingual

Полный разбор →

Это всё на сейчас.