← к ленте

Cohere Labs представила компактную VLM North Micro Vision

1 нед

Cohere Labs выпустила North Micro Vision — компактную VLM на 2,4 млрд параметров, оптимизированную для работы с документами и графиками в высоком разрешении.

Новая модель позволяет эффективно анализировать сложные документы и графики на обычном оборудовании.

  • Сохранение исходного разрешения изображения позволяет модели распознавать мелкий текст и данные в таблицах.
  • Компактный размер модели (2,4 млрд параметров) делает её пригодной для запуска на локальных устройствах.
  • Открытая лицензия Apache 2.0 упрощает внедрение технологии в бизнес-процессы.
🌟 Cohere Labs выложила компактную зрительно-языковую модель North Micro Vision Модель на 2,4 млрд параметров стала самой маленькой в линейке VLM компании. От большинства таких моделей она отличается тем, что работает с изображением в исходном разрешении.
Обычно картинку перед подачей в модель сжимают, и мелкий текст, разметка таблицы и подписи на графике при этом теряются. Здесь пропорции сохраняются, а верхняя планка соответствует странице A4, отсканированной при 200 dpi.
Отсюда и заявленная область применения - документы, таблицы, графики, скриншоты, формы. Компактный размер удобен для дообучения под свою предметную область, а квантованные сборки, по словам Cohere, пойдут не только на сервере, но и на ноутбуке или устройстве мобильного класса. 🟡Архитектура Зрительный энкодер на 400 млн параметров вырос из SigLIP 2 и держит исходное разрешение за счёт двумерного RoPE вместе с обученными одномерными позиционными эмбеддингами. Языковая часть - собственная North Micro LLM на 2 млрд параметров, повторяющая архитектуру Command A+: три слоя внимания со скользящим окном и RoPE чередуются с одним глобальным слоем, который работает вообще без позиционных эмбеддингов.
Получается разделение труда - окна с RoPE держат локальный контекст, глобальный слой смотрит на всё сразу и в разметке позиций не нуждается.
Между ними проектор, и здесь изюминка. Вместо того чтобы отдать языковой модели один готовый набор признаков, Cohere подмешивает эмбеддинги патчей с нескольких уровней зрительного энкодера в соответствующие ранние слои языковой модели. Так модель видит картинку сразу на разных степенях обобщения. Принцип взят из DeepStack. 🟡Тесты Замеры проводили через VLMEvalKit, сравнивая с восемью моделями размером от 1,6 до 5,1 млрд параметров. Сильнее всего North Micro Vision выглядит там, куда её и целили.
На DocVQA 0,921, на ChartQA 0,808, на AI2D 0,775, на RefCOCO 0,732 (втрое выше, чем у Ministral и Qwen3-VL).
Общий язык и рассуждение даются слабее.
На MMMU 0,329, худший результат в таблице; на MMLU и MMLU-Pro модель тоже уступает большинству соседей.
📌Лицензирование: Apache 2.0 License. 🟡Статья 🟡Модель 🟡Демо @ai_machinelearning_big_data #AI #ML #VLM #NorthMicroVision #Cohere
Cohere Labs представила компактную VLM North Micro Vision

Кратко (AI)

Cohere Labs представила North Micro Vision, компактную зрительно-языковую модель на 2,4 млрд параметров, способную обрабатывать изображения в исходном разрешении без потери мелких деталей. Модель ориентирована на работу с документами, таблицами и графиками, а её архитектура позволяет запускать её на мобильных устройствах и ноутбуках.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖