Технический разбор архитектуры Gemma4: переход к нативному omnimodal
D@dealerAIAI-инженер
1 месОбзор технического отчета Gemma4: как модель обрабатывает аудио и видео без внешних бэкбонов через прямую проекцию в эмбеддинги.
Gemma4 техрепорт и честный omnimodal на 12b от 🕸
Вот ждал 📦, что будет пример в лоб, как кодировать без предобученных бэкбонов аудио, видео и картинок информацию и кидать в модель. Это и есть настоящее omnimodal, тк multimodal работает именно с доп моделями в своих модальностях + слой проекции. 😮💨
Ребята из 🏳️🌈 с выходом Gemma4 зарепортили инфу о такой модели. Теперь информация с разных модальностей кодируется напрямую в матрицы и проходит всего лишь слой эмбеддингов внутри модели без доп внешних clip'ов и тп.
Почитать можно в тех репорте тут. 🤙
Как это работает детально:
1. Изображение. Не используется ни vit, ни clip, ни resnet. Только патчи 48x48х3 (rgb канал 🧠) в нарезке серией. После выпрямляется в flatten и эмбедится в плотном слое (чисто факторизация а-ля как в SVD и als).
2. Аудио. Никаких мелспектров, а только сырой PCM сигнал. Нарезка также по 40мс частотой 16кГц, выпрямление и снова проекция.
Все это порождает эмбы токенов звука и аудио, которые кормятся в слои внимания вместе с текст эмбами.
Важный нюанс с позицией: Чтобы модель знала, где находится патч, инженеры не используют сложные 2D-RoPE эмбы. Они добавляют факторизованные координатные вложения - отдельные обучаемые векторы для координаты X и координаты Y, которые просто прибавляются к полученному токену картинки или звука. 🧠
В общем, для меня это было самое интересное. Тк в остальном в мире уже видны лучшие практики, которые комбинируй как можешь: и по локально-глобальному вниманию, и по sparsed attention, и хаки с KV, rope, скрытое рассуждение (только тут оно не в латентах, а тупо скрывают тексты от юзера), и обобщенные слои с early exit для MTP (multi token prediction).
Итого, читаем. Образовываемся и stay tuned 🦾
Кратко (AI)
В техническом отчете Gemma4 представлена архитектура, реализующая концепцию настоящего omnimodal обучения. Модель обрабатывает изображения и аудио напрямую через слои эмбеддингов, исключая использование внешних бэкбонов вроде CLIP или ViT, что позволяет интегрировать данные разных модальностей в единое пространство внимания.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖