← к ленте

Создание агентного цикла для работы с аудио

A@oestickAI-инженер
1 мес

Автор описывает проблему отсутствия нативного аудио-восприятия у AI-агентов и представляет решение в виде расширения для PI-агента.

Несуществующие агенты для аудио В последнее время много работаю с генерацией аудио. И удивляет, что в основном аудио пайплайны собираются в условном comfy – визуальном блочном редакторе. Удивляет потому что это как писать код пайплайном в n8n вместо клода Основная проблема тут – нет полноценного агентного цикла, где модель видит, а точнее слышит, результаты предыдущих действий и может сама выбирать что с этим делать делаше Но тут есть одна техническая сложность, которая многое объясняет: у моделей пока нет нативного восприятия аудио. Например, умение "видеть" картинки уже есть. Поэтому клод код может посмотреть скриншоты лендинга, который он сделал, увидеть косяки и поправить их. Картинки – в контексте той же модели, которая пишет код А с аудио так не работает – большинство моделей не умеют в нативный аудио input Вы скажете: так есть же gemini. Это да. Но: ни одна агентная обертка не поддерживает чтение аудио файлов чисто на уровне тулов. Агентный экзоскелет просто не может просунуть аудиофайл в API запрос к "мозгу". Да, можно подключить gemini по api к основному агенту и отправлять туда аудио с промптом мол "расскажи, чего не хватает" (кстати, китайская glm-5.2 все еще с картинками работает именно так). Но это все равно что глухой композитор, который зовет своего племянника послушать музыку и сказать, что он там слышит – работает, очевидно, плохо из-за эффекта глухого телефона Вот и получается, что сейчас просто нет привычного нам агентного решения (со скиллами, запуском терминальных комманд, форками сессий, субагентами и т.д.), которое может полноценно работать с аудио (= замыкая фидбэк луп) ——— UPD: Спустя два часа после написания текста выше: 1. Собран простенький самодельный агент вокруг gemini на 300 js строк, с агентным циклом, интерактивностью, fork/edit/resume и проверен подход 2. Это все перенесено в PI в виде экстеншна, который патчит тул чтения файлов (он там by design умеет и текст читать, и бинарные данные) Короче, теперь добавить своему агенту "уши" можно в 1-2 строки:
npm install -g pi-agent

pi install git:github.com/toolittlecakes/pi-gemini-audio-read
(не забываем потом /login → google → api key и выбрать модель gemini-3.5-flash) Где нужно: генерация музыки, качественные аудио переводы, работа с voice cloning, монтаж аудио (и видео, если это подкаст) Ограничения: 20мб на файл – не добавлял загрузку файлов через file api. И нет видео инпута
Вообще, забавно, как вдохновляют задачки, у которых в целом нет существующего решения (по крайней мере публичного). Ощущение, что оказываешься на землях, где "ни ступала нога человека"

Кратко (AI)

Автор анализирует проблему отсутствия полноценных агентных циклов для генерации аудио из-за отсутствия нативного аудио-инпута у большинства моделей. В качестве решения он разработал расширение для PI-агента, позволяющее использовать Gemini для анализа аудиофайлов в рамках агентного цикла.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖