asrСбросить фильтр ×

IBM представила открытые модели Granite 4.2 и Granite Speech 5.0

15 ч
IBM представила открытые модели Granite 4.2 и Granite Speech 5.0

Релиз VibeVoice-ASR-BitNet для работы на CPU

Н@GreenNeuralRobotsAI-инженер
3 нед
VibeVoice-ASR-BitNet Сжатая версия VibeVoice-ASR для рилтайма на CPU, не требует GPU качество ниже чем у VibeVoice-ASR-7B, зато легкий • работает на x86 (AVX2) и ARM (NEON) • поддерживает несколько языков • размер: 1.58 ГБ (сжато с 4.62 ГБ) • ускорение: в 1.6–2.3 раза быстрее Whisper.cpp Гитхаб HF Демо #asr #realtime #mobile
Релиз VibeVoice-ASR-BitNet для работы на CPU

Релиз модели Qwen-Audio-3.0-ASR-Flash

Н@GreenNeuralRobotsAI-инженер
4 нед
Qwen-Audio-3.0-ASR-Flash Новая коммерческая модель для распознавания речи с улучшенной контекстной осведомленностью и распознаванием терминов в разных доменах • Точное распознавание терминов в специфических областях • Поддержка пользовательских горячих слов Доступны версии: Qwen-Audio-3.0-ASR-Flash-Streaming - потоковое распознавание речи Qwen-Audio-3.0-ASR-Flash-Filetrans - распознавание записанной речи (HTTP API) Qwen-Audio-3.0-ASR-Flash - не потоковое распознавание #asr
Релиз модели Qwen-Audio-3.0-ASR-Flash

Релиз аудио-модели GigaChat3.1-Audio-10B-A1.8B

Н@GreenNeuralRobotsAI-инженер
1 мес
GigaChat3.1-Audio-10B-A1.8B Аудио LLM для работы с длинными записями (2 часа) * Распознавание речи (ASR) - переводит аудио в текст * Перевод - упомянуты русский и английский * Ответы на вопросы по аудио (QA) * Распознавание эмоций * Временная привязка (temporal grounding). находит в какой части аудио происходит то или иное событие. заявлено 48.3 mIoU на задачах для записей до 2 часов • 10B #MoE декодер, активно 1.8B параметров • энкодер GigaAM Демо #alm #qa #asr #stt #translation #russian

Transcribe.cpp: кроссплатформенная библиотека распознавания речи

Н@GreenNeuralRobotsAI-инженер
1 мес
Transcribe.cpp Быстрая и точная кроссплатформенная библиотека распознавания речи на C++. Поддерживает более 60 моделей. Есть ускорение на GPU (Vulkan, Metal, CUDA) Точность подтверждена по WER. Полная совместимость с whisper.cpp. Есть биндинги для Python, JS, Rust, Swift. Гитхаб #asr #transcribe

Сбер выложил в опенсорс речевые модели GigaAM Multilingual и GigaChat Audio

Сбер открыл доступ к двум новым речевым моделям — мультиязычной системе распознавания речи GigaAM Multilinguali и audio-native LLM GigaChat Audioi. Обе модели строятся на аудиоэнкодере, обученном на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, и решают две слабые стороны открытых Speech AI систем: плохую поддержку языков СНГ и деградацию качества на длинных записях.

GigaChat Audio объединяет GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет работать с аудио напрямую — без промежуточной расшифровки в текст: ведёт диалог, переводит, классифицирует звук, считывает эмоции по интонации и находит нужные моменты в многочасовых записях с таймкодами. Обе научные статьи по моделям приняты на конференцию Interspeech 2026.

48.3точность локализации событий (IoU) на записях 20–60 мин
60.0 против 43.7балл RuBQ-Audio у GigaChat Audio vs Qwen3-Omni
240 млнпараметров компактной GigaAM Multilingual

Полный разбор →

MOSS-Transcribe-preview-2B: модель для распознавания английской речи

Н@GreenNeuralRobotsAI-инженер
1 мес
MOSS-Transcribe-preview-2B Модель для преобразования английской речи в текст. Использует Qwen3-1.7B-base и Qwen3-Omni-MoE аудиоэнкодер. • распознаёт английскую речь • обучена на публичных #ASR корпусах • дообучена с помощью reinforcement learning • выдаёт транскрипцию аудио Хуже работает с неанглийской речью, акцентами, шумом, перекрывающимися голосами Студия #asr #stt

Релиз Qwen3-ASR: новые возможности распознавания речи

Н@GreenNeuralRobotsAI-инженер
1 мес

Anti-Vocale: локальная транскрипция аудио на Android

Н@GreenNeuralRobotsAI-инженер
1 мес
Anti-Vocale Локальная транскрипция голосовых на Android, без облака • транскрибирует из мессенджеров через меню обмена • несколько моделей ASR: Whisper, Gemma, Parakeet, Qwen3-ASR, Nemotron 3.5 • прогрессивный вывод текста по сегментам • статистика скорости для каждой модели на устройстве • журнал транскрипций с поиском • VAD-удаление тихих сегментов Whisper Turbo large ужат до ~1 ГБ. Есть настройки потоков, индикатор достоверности, плавающее окно. #android #stt #vad

Это всё на сейчас.