Liquid AI представила мультимодальную модель LFM2.5-VL-3B
Н@GreenNeuralRobotsAI-инженер
1 недLiquid AI выпустила компактную мультимодальную модель LFM2.5-VL-3B для работы на смартфонах с поддержкой OCR и анализа интерфейсов.
Развитие компактных моделей позволяет запускать продвинутый ИИ локально на смартфонах без облачных вычислений.
- Повышение приватности данных за счет локальной обработки.
- Возможность использования ИИ-ассистентов для анализа экранов и документов в офлайн-режиме.
- Снижение зависимости от интернет-соединения для мультимодальных задач.
LFM2.5-VL-3B
Очередная компактная модель от Liquid AI
Мультимодальная зрительно-языковая, работает на самртфоне
Обходит заметно более крупные модели в задачах по экранам, привязке объектов и распознаванию текста.
• Понимание экранов мобильных, веб и настольных интерфейсов
• Grounding - привязка объектов к координатам по запросу на естественном языке
• Полностраничное OCR с разметкой макета - текст, таблицы, формулы, графики
• Вызов функций и инструментов
• Работа с несколькими изображениями сразу
• База LFM2.5-2.6B плюс визуальный энкодер SigLIP2 NaFlex 400M
• Контекст 32 768 токенов, 16 языков включая русский
• Около 3 ГБ памяти
• 20 ток/с на Galaxy S26 Ultra
HF
Демо
#multimodal #vlm #compact #mobile

Кратко (AI)
Компания Liquid AI представила компактную мультимодальную модель LFM2.5-VL-3B, оптимизированную для работы на мобильных устройствах. Модель специализируется на анализе интерфейсов, распознавании текста и объектов, а также поддерживает работу с несколькими изображениями одновременно.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖