← к ленте

Технический разбор архитектуры Gemma4: переход к нативному omnimodal

D@dealerAIAI-инженер
1 мес

Обзор технического отчета Gemma4: как модель обрабатывает аудио и видео без внешних бэкбонов через прямую проекцию в эмбеддинги.

Gemma4 техрепорт и честный omnimodal на 12b от 🕸 Вот ждал 📦, что будет пример в лоб, как кодировать без предобученных бэкбонов аудио, видео и картинок информацию и кидать в модель. Это и есть настоящее omnimodal, тк multimodal работает именно с доп моделями в своих модальностях + слой проекции. 😮‍💨 Ребята из 🏳️‍🌈 с выходом Gemma4 зарепортили инфу о такой модели. Теперь информация с разных модальностей кодируется напрямую в матрицы и проходит всего лишь слой эмбеддингов внутри модели без доп внешних clip'ов и тп. Почитать можно в тех репорте тут. 🤙 Как это работает детально: 1. Изображение. Не используется ни vit, ни clip, ни resnet. Только патчи 48x48х3 (rgb канал 🧠) в нарезке серией. После выпрямляется в flatten и эмбедится в плотном слое (чисто факторизация а-ля как в SVD и als). 2. Аудио. Никаких мелспектров, а только сырой PCM сигнал. Нарезка также по 40мс частотой 16кГц, выпрямление и снова проекция. Все это порождает эмбы токенов звука и аудио, которые кормятся в слои внимания вместе с текст эмбами. Важный нюанс с позицией: Чтобы модель знала, где находится патч, инженеры не используют сложные 2D-RoPE эмбы. Они добавляют факторизованные координатные вложения - отдельные обучаемые векторы для координаты X и координаты Y, которые просто прибавляются к полученному токену картинки или звука. 🧠 В общем, для меня это было самое интересное. Тк в остальном в мире уже видны лучшие практики, которые комбинируй как можешь: и по локально-глобальному вниманию, и по sparsed attention, и хаки с KV, rope, скрытое рассуждение (только тут оно не в латентах, а тупо скрывают тексты от юзера), и обобщенные слои с early exit для MTP (multi token prediction). Итого, читаем. Образовываемся и stay tuned 🦾

Кратко (AI)

В техническом отчете Gemma4 представлена архитектура, реализующая концепцию настоящего omnimodal обучения. Модель обрабатывает изображения и аудио напрямую через слои эмбеддингов, исключая использование внешних бэкбонов вроде CLIP или ViT, что позволяет интегрировать данные разных модальностей в единое пространство внимания.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖