← к ленте

Технический отчет по моделям Gemma 4

1 мес

Обзор новой линейки мультимодальных моделей Gemma 4 от Google: архитектурные улучшения, эффективность параметров и результаты бенчмарков.

Gemma 4 Technical Report Gemma 4 - новая открытая мультимодальная линейка моделей Google. Она умеет рассуждать, читать изображения, понимать аудио, работать с длинным контекстом и эффективно запускаться в разных размерах от 2.3B до 31B параметров. Модели E2B и E4B с эффективным размером 2.3B и 4B примерно догоняют или обгоняют Gemma 3 27B, используя примерно в 10 раз меньше параметров. Аудиоэнкодер стал на 78% меньше, а KV-cache для длинного контекста удалось сократить до 37.5%. E4B даже обходит Gemma 3 27B на long-context benchmark RULER 128k: 86.6 против 66.0. Интересная деталь: 12B-модель не использует отдельные vision и audio encoders. Вместо этого она напрямую подаёт image patches и audio chunks в LLM. А 31B-модель стала лучшей dense open model в Arena Text. При этом 26B MoE активирует всего 3.8B параметров и всё равно набирает 1438 Elo. https://www.alphaxiv.org/abs/2607.02770

Кратко (AI)

Google представила Gemma 4, новую линейку открытых мультимодальных моделей с поддержкой текста, аудио и изображений. Модели демонстрируют высокую эффективность: версии E2B и E4B превосходят Gemma 3 27B при значительно меньшем количестве параметров, а 31B-модель показала лучшие результаты среди dense-моделей в Arena Text.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖