Google выпустил технический отчёт по Gemma 4 — новой открытой мультимодальной линейке моделей, размещённой в архиве (alphaxiv.org/abs/2607.02770). Линейка охватывает размеры от 2.3B до 31B параметров и умеет рассуждать, читать изображения, понимать аудио и работать с длинным контекстом.
По оценке источника 1, принципиально нового в отчёте немного — в основном добавлены дополнительные эвалы для long-context и аудио-задач по сравнению с предыдущими релизами.
2.3B–31Bдиапазон размеров моделей линейки
86.6 против 66.0результат E4B vs Gemma 3 27B на RULER 128k
1438 Eloрейтинг 26B MoE-модели в Arena Text
- Модели E2B и E4B (эффективный размер 2.3B и 4B параметров) догоняют или превосходят Gemma 3 27B, используя примерно в 10 раз меньше параметров
- Аудиоэнкодер стал на 78% меньше, а KV-cachei для длинного контекста сокращён до 37.5%
- E4B превосходит Gemma 3 27B на long-context бенчмарке RULER 128ki: 86.6 против 66.0
- 12B-модель не использует отдельные vision и audio encoders — image patches и audio chunks подаются напрямую в LLM
- 31B-модель стала лучшей dense open model в Arena Text
- 26B MoEi-модель активирует всего 3.8B параметров, но набирает 1438 Elo в Arena Text
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖