Технический отчет по моделям Gemma 4
M@machinelearning_interviewAI-инженер
1 месОбзор новой линейки мультимодальных моделей Gemma 4 от Google: архитектурные улучшения, эффективность параметров и результаты бенчмарков.
Gemma 4 Technical Report
Gemma 4 - новая открытая мультимодальная линейка моделей Google.
Она умеет рассуждать, читать изображения, понимать аудио, работать с длинным контекстом и эффективно запускаться в разных размерах от 2.3B до 31B параметров.
Модели E2B и E4B с эффективным размером 2.3B и 4B примерно догоняют или обгоняют Gemma 3 27B, используя примерно в 10 раз меньше параметров.
Аудиоэнкодер стал на 78% меньше, а KV-cache для длинного контекста удалось сократить до 37.5%.
E4B даже обходит Gemma 3 27B на long-context benchmark RULER 128k: 86.6 против 66.0.
Интересная деталь: 12B-модель не использует отдельные vision и audio encoders. Вместо этого она напрямую подаёт image patches и audio chunks в LLM.
А 31B-модель стала лучшей dense open model в Arena Text. При этом 26B MoE активирует всего 3.8B параметров и всё равно набирает 1438 Elo.
https://www.alphaxiv.org/abs/2607.02770
Кратко (AI)
Google представила Gemma 4, новую линейку открытых мультимодальных моделей с поддержкой текста, аудио и изображений. Модели демонстрируют высокую эффективность: версии E2B и E4B превосходят Gemma 3 27B при значительно меньшем количестве параметров, а 31B-модель показала лучшие результаты среди dense-моделей в Arena Text.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖