← к ленте

Как LLM работают с аудио: от транскрипции до нативного понимания

П@neural_proseccoмедиа / агрегатор
3 нед

Разбор того, как современные LLM обрабатывают звук: классические пайплайны с распознаванием речи против нативных аудио-моделей и их применение.

Понимание звука нейросетями меняет способы взаимодействия с контентом и автоматизации процессов.

  • Нативные аудио-модели позволяют анализировать интонации и неречевые звуки, что недоступно при простой транскрипции.
  • Технология находит применение в анализе клиентского опыта, мониторинге промышленного оборудования и создании маркетингового контента.
  • Развитие моделей типа Qwen3-Omni делает продвинутый анализ аудио доступным в open-source сегменте.
умеют ли ллм слушать аудиодорожки? 🎧 я, конечно, не просто распознавание речи в текст, но и про то как понять интонации и разные акустические события С видео все давно понятно - почти любая модель режет его на кадры с требуемой частотой кадров и разбирает как картинки. Со звуком - большинство агентов запускают скил на распознавание речи, но есть и исключения классический пайплайн выглядит так: перевести в текст/токены - ллм анализирует вход и выдает текст - текст генерируется в речь, то есть модель получает расшифровку, а не звук, так работает например voice mode у клода. Быстро и дешево, но по дороге теряется тон, ирония, эмоции, кто говорит, неречевые события 😳 Впрочем есть и нативные аудио-модели, у которых звук подается прямо в контекст как токены, наравне с текстом. Технически это делается двумя способами: либо аудио-энкодер переводит сырой звук или спектрограмму в эмбеддинги, либо нейрокодек сжимает звук в дискретные токены - и во втором случае модель умеет не только слушать, но и говорить сама, без стороннего синтеза речи. Проще говоря, для одних ллмок для работы со звуком нужны внешние тулы (будь то простое распознавание речи или комплексный анализ эмоций и тональностей), а другие при обучении видели не только картинки и текст, но и аудио (а точнее все вместе), а это значит, что умеют с ним работать 🤑 вот пара примеров таких моделей: • Gemini - самый универсальный вариант, разбирает музыку и не-речевые звуки (жанр, эмоция трека, шумы на фоне), различает спикеров, понимает таймстемпы. Правда, пока не настолько хорошо, чтобы стабильно разобрать любой трек на аккорды • OpenAI - в июле выкатили апдейт, где модель слушает и говорит одновременно, поддакивает «mhmm» и перебивается как живой человек и умеет понимать простые речевые события и интонации • Qwen3-Omni - лучший опенсорс по результатам замеров на бенчмарках - анализ музыки по стилю и ритму, 19 языков. И единственная модель, которую я все еще не попробовала в контексте музыки и звука 🤨 Предполагаю, что это активно используется в ai кол-центрах (например анализ эмоций клиента), вся работа с генерацией музыки, разметка звуковых событий, и из менее очевидного что мне запомнилось - мониторинг различных инструментов на предмет поломок на заводе (например станков) или даже подсчет птиц в лесу. "Зачем я прочитал этот пост, если я не работаю в аудио стартапе" - могли подумать вы 😑 Мое личное предположение - использовать для поиска и генерации трендовой музыки в маркетинге, как сейчас многие уже делают с видео креативами. Ну и просто потому что 7 лет моего опыта в аудио процессинге никуда не делись и мне все равно интересно поглядывать, что там происходит 🐵 @neural_prosecco

Кратко (AI)

Автор анализирует два подхода к обработке аудио в LLM: использование внешних инструментов для транскрипции и нативное понимание звука через аудио-токены. Рассматриваются возможности моделей Gemini, OpenAI и Qwen3-Omni, а также их практическое применение в анализе эмоций, мониторинге оборудования и маркетинге.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖