ИИllmаудионейросетиобработказвукаgeminiqwen3-omniКак LLM работают с аудио: от транскрипции до нативного пониманияП@neural_proseccoмедиа / агрегатор3 недумеют ли ллм слушать аудиодорожки? 🎧 я, конечно, не просто распознавание речи в текст, но и про то как понять интонации и разные акустические события С видео все давно понятно - почти любая модель режет его на кадры с требуемой частотой кадров и разбирает как картинки. Со звуком - большинство агентов запускают скил на распознавание речи, но есть и исключения классический пайплайн выглядит так: перевести в текст/токены - ллм анализирует вход и выдает текст - текст генерируется в речь, то есть модель получает расшифровку, а не звук, так работает например voice mode у клода. Быстро и дешево, но по дороге теряется тон, ирония, эмоции, кто говорит, неречевые события 😳 Впрочем есть и нативные аудио-модели, у которых звук подается прямо в контекст как токены, наравне с текстом. Технически это делается двумя способами: либо аудио-энкодер переводит сырой звук или спектрограмму в эмбеддинги, либо нейрокодек сжимает звук в дискретные токены - и во втором случае модель умеет не только слушать, но и говорить сама, без стороннего синтеза речи. Проще говоря, для одних ллмок для работы со звуком нужны внешние тулы (будь то простое распознавание речи или комплексный анализ эмоций и тональностей), а другие при обучении видели не только картинки и текст, но и аудио (а точнее все вместе), а это значит, что умеют с ним работать 🤑 вот пара примеров таких моделей: • Gemini - самый универсальный вариант, разбирает музыку и не-речевые звуки (жанр, эмоция трека, шумы на фоне), различает спикеров, понимает таймстемпы. Правда, пока не настолько хорошо, чтобы стабильно разобрать любой трек на аккорды • OpenAI - в июле выкатили апдейт, где модель слушает и говорит одновременно, поддакивает «mhmm» и перебивается как живой человек и умеет понимать простые речевые события и интонации • Qwen3-Omni - лучший опенсорс по результатам замеров на бенчмарках - анализ музыки по стилю и ритму, 19 языков. И единственная модель, которую я все еще не попробовала в контексте музыки и звука 🤨 Предполагаю, что это активно используется в ai кол-центрах (например анализ эмоций клиента), вся работа с генерацией музыки, разметка звуковых событий, и из менее очевидного что мне запомнилось - мониторинг различных инструментов на предмет поломок на заводе (например станков) или даже подсчет птиц в лесу. "Зачем я прочитал этот пост, если я не работаю в аудио стартапе" - могли подумать вы 😑 Мое личное предположение - использовать для поиска и генерации трендовой музыки в маркетинге, как сейчас многие уже делают с видео креативами. Ну и просто потому что 7 лет моего опыта в аудио процессинге никуда не делись и мне все равно интересно поглядывать, что там происходит 🐵 @neural_proseccollmаудионейросетиобработказвукаgeminiqwen3-omni