vlmСбросить фильтр ×

Обновление ComfyUI-QwenVL: оптимизация работы с видео

Н@GreenNeuralRobotsAI-инженер
12 ч
ComfyUI-QwenVL запуск Qwen-VL внутри #ComfyUI - визуальное понимание и генерация текста. Раньше при попытке скормить видео 1080p нода вылетала с OOM, теперь автоматический рассчет токенов и масштабирование кадров под контекст модели - Умное масштабирование видео: 1080p/4K автоматически поджимается под безопасный бюджет токенов — 16-32 кадра без вылета - Маленькие видео (480p) не трогает — идут в оригинале - Можно переопределить вручную через dropdown: auto, 384, 448, 512, 768, original Работает с GGUF (llama.cpp) и Transformers (Hugging Face) #vlm VK | MAX
Обновление ComfyUI-QwenVL: оптимизация работы с видео

Алиса AI научилась распознавать рукописный текст, даже когда буквы слились в закорючки

Яндекс представил обновление голосового помощника Алиса AIi: теперь он умеет распознавать рукописный текст с фотографий — от студенческих конспектов до врачебных рецептов. Возможность появилась благодаря новой VLM-модели (vision-language model, модель, объединяющая распознавание изображений и текста).

Чтобы продемонстрировать возможности технологии, в Москве появились плакаты, на которых буквы «И», «ш», «л» и «м» написаны физически одинаково и слипаются в сплошную волну — различить их человеку можно только по смыслу фразы. Алиса AI при этом выдаёт с фото корректно распознанный текст даже на такой слитной скорописи.

Полный разбор →

Google DeepMind представили TIPS: модель для пространственного понимания изображений

Н@GreenNeuralRobotsAI-инженер
1 нед
Google DeepMind представили TIPS: модель для пространственного понимания изображений

AVA-Encoder: система графов знаний для видеогенерации от Qwen

Н@GreenNeuralRobotsAI-инженер
1 нед
AVA-Encoder: система графов знаний для видеогенерации от Qwen

MOSS-VL: открытая визуально-языковая модель с реалтайм-стримингом

Н@GreenNeuralRobotsAI-инженер
1 нед
MOSS-VL Семейство открытых визуально-языковых моделей от OpenMOSS. Флагманская фишка - реалтайм-стриминг: модель смотрит на входящие кадры и отвечает параллельно, не дожидаясь конца видео модель живёт в настоящем времени, а не смотрит запись постфактум. Вместо внешних планировщиков и опроса раз в секунду - три встроенных поведения: ответ в любой момент, проактивное молчание, своевременная коррекция. • 11B параметров, контекст 256K • Кванты FP8 и NF4 Гитхаб HF Демо #vlm #realtime #fp8 #nf4 #dialog #interactive VK | MAX

Tencent представила модель EVIE-Preview-4.5B для визуального поиска по документам

Н@GreenNeuralRobotsAI-инженер
1 нед
EVIE-Preview-4.5B Модель Tencent для визуального поиска по документам на базе Qwen3.5-4B ищет релевантные страницы по запросу, глядя на картинки, а не на извлечённый текст. Эмбеддинги ультракомпактные, 128 измерений на токен, отсюда низкие требования к памяти и быстрый поиск. • Поиск по сканам, PDF, таблицам, диаграммам и отчётам без OCR • Мультиязычность - EN, FR, DE, IT, ES, PT, ZH и другие • Zero-shot на новых языках и форматах #SOTA на ViDoRe • Обходит 8B модели, будучи вдвое меньше Гитхаб HF #vlm #search #ocr VK | MAX
Tencent представила модель EVIE-Preview-4.5B для визуального поиска по документам

Cohere Labs представила компактную VLM North Micro Vision

1 нед
Cohere Labs представила компактную VLM North Micro Vision

Alibaba представила фреймворк для рекомендаций правок в генерации изображений

Н@GreenNeuralRobotsAI-инженер
1 нед
What to Edit Next Фреймворк от Alibaba для рекомендаций следующих правок в чате по генерации картинок. После каждой итерации подсказывает, что отредактировать дальше - чтобы совет был уместным, разнообразным и выполнимым на текущем изображении. На базе Qwen3-VL-8B кода-весов нет #research #vlm
Alibaba представила фреймворк для рекомендаций правок в генерации изображений

Spatial Memory Agent: улучшение пространственного мышления VLM

Н@GreenNeuralRobotsAI-инженер
1 нед
Spatial Memory Agent Фреймворк для улучшения пространственного мышления VLM без дообучения. Замороженная модель сама улучшает рассуждения, превращая проверенный опыт в переносимые уроки. • Самоэволюция без обновления параметров и внешних пространственных инструментов • Дистилляция проверенного опыта в компактные карточки памяти • Перенос памяти между моделями и бенчмарками Прикручено к Qwen3.5-9B, Qwen3.6-27B, Qwen3.6-35B-A3B, Qwen3.5-122B-A10B Код ждем #vlm
Spatial Memory Agent: улучшение пространственного мышления VLM

Liquid AI представила мультимодальную модель LFM2.5-VL-3B

Н@GreenNeuralRobotsAI-инженер
1 нед
Liquid AI представила мультимодальную модель LFM2.5-VL-3B

RE-GoT: эволюция вознаграждений через графы мыслей

T@kryak_startupAI-инженер
2 нед
RE-GoT: эволюция вознаграждений через графы мыслей

Video-DeepResearch: новый подход к мультимодальным агентам

Н@GreenNeuralRobotsAI-инженер
2 нед
Video-DeepResearch: новый подход к мультимодальным агентам

OpenMOSS представила MOSS-VL-Realtime

Н@GreenNeuralRobotsAI-инженер
3 нед
MOSS-VL-Realtime Потоковая видеоязыковая модель от OpenMOSS на 11B параметров, понимает видео в реальном времени • обработка кадров с привязкой к таймстампам • прерываемое взаимодействие в потоке • динамическая коррекция ответов по новым кадрам • режим проактивной тишины при отсутствии событий • контекстное окно 256K • работа с потоковым видео без ожидания конца Демо Демо2 #streaming #vlm #qa #realtime
OpenMOSS представила MOSS-VL-Realtime

Инструмент для анализа видео с помощью Claude

Н@GreenNeuralRobotsAI-инженер
1 мес
watch Скилл понимания видео для Claude • анализ хуков, визуала и структуры роликов • поиск багов по записи экрана • резюме выступлений с таймкодами • выделение реальных изменений из продуктового видео • поддержка YouTube, Loom, TikTok, локальных файлов • работает через yt-dlp и ffmpeg • кадры по смене сцен, без дублей • транскрипция через Groq Whisper при отсутствии субтитров • экономия токенов за счёт точечного отбора кадров • синхронная связка "кадр + речь" для точного анализа #skill #vlm #video2text
Инструмент для анализа видео с помощью Claude

Релиз мультимодальной модели GLM-5.2-Vision-NVFP4

Н@GreenNeuralRobotsAI-инженер
1 мес
GLM-5.2-Vision-NVFP4 Версия GLM-5.2 с видением тянет текст и картинки, отвечает на вопросы, описывает, руссуждает по изображениям Прикрутили визуальный энкодер MoonViT от Kimi-K2.6 • работа с высоким разрешением без сильного падения скорости • оптимизация под NVFP4 • мультимодальные эмбеддинги, лучше стыкует текст и визуал • до 4096 токенов на картинку, контекст 1М #vlm #nfvp4 #vqa #qa

TimeLens2: поиск моментов в видео по текстовому запросу

Н@GreenNeuralRobotsAI-инженер
1 мес
TimeLens2 Модель для поиска моментов в видео по текстовому запросу. Превращает видеопоток в постоянную визуальную память с привязкой к сущностям. По запросу на естественном языке выдаст интервалы на временной шкале • обрабатывает однократные и повторяющиеся события • работает с видео от третьего лица и эгоцентрическими • выдаёт один или несколько временных интервалов • использует мультимодальные LLM • есть несколько версий модели: TimeLens2-4B и TimeLens2-8B Гитхаб HF Демо #vlm #captioning #video2text #mllm

IGGT4D: онлайн-понимание 4D-сцен в видеопотоке

Н@GreenNeuralRobotsAI-инженер
1 мес
IGGT4D Онлайн-понимание 4D-сцен в видеопотоке. Строит единую модель сцены на лету - геометрия, движение камеры, объекты. • сегментирование и олтслеживание объектов, глубина • обрабатывает кадры по очереди • переиспользует прошлый контекст через causal spatial-temporal modeling. Всю историю не хранит для экономии памяти • обновляет представление сцены инкрементально • чётко выделяет отдельные объекты. код / веса ждем #vlm #tracking #segmentation #videoto4d #vidfeo2depth

Самые сложные темы в изучении Deep Learning и LLM

Т@tech_priestessAI-инженер
1 мес
А поделитесь, какая тема была для вас самой сложной при изучении глубокого обучения и особенно LLM/VLM/etc? В чем оказалось сложнее всего разобраться?

Google DeepMind представили GenCeption

Н@GreenNeuralRobotsAI-инженер
1 мес
GenCeption от Google DeepMind Единая feed-forward модель мультизадачного зрения. Заменяет зоопарк специализированных моделей • оценка глубины, нормалей поверхности, позы камеры • сегментация, 2D/3D ключевые точки • работа с плотными и разреженными задачами Обучена на синтетических видео, работает на реальных данных. Использует замороженную диффузионную text-to-video основу плюс лёгкие задачи-специфичные головы Код/веса ждем #vlm #video2depth #video2normals #tracking #video2camera #video2pose

UniVR: Единый подход к визуальным рассуждениям

Н@GreenNeuralRobotsAI-инженер
1 мес
UniVR: Thinking in Visual Space for Unified Visual Reasoning Визуальное мышление и рассуждения в одной модели. Единый подход к разным визуальным задачам от понимания сцены до планирования действий • работа с пространственными отношениями в кадре • мультимодальное рассуждение на базе визуальных данных • интеграция низкоуровневых признаков и высокоуровневой семантики Гитхаб ждем #vlm

PadCaptioner: эффективная модель для описания видео

Н@GreenNeuralRobotsAI-инженер
1 мес
https://github.com/showlab/PadCaptioner Модель для создания подробных описаний видео с помощью мультимодальных данных. Работает эффективнее больших аналогов, при этом точнее описывает события. учитывает слабые локальные зависимости между событиями в видео, что позволяет генерировать описания параллельно без потери качества. Превосходит 7B аналоги по эффективности. Гитхаб ждем #captioning #vlm #video2text

SenseNova-Vision: мультимодальная модель для компьютерного зрения

Н@GreenNeuralRobotsAI-инженер
1 мес
SenseNova‑Vision Мультимодальная генеративная модель для компьютерного зрения (7B, MoT) • решает сразу несколько задач без отдельных голов под каждую: детекция, OCR, сегментация, ключевые точки, нормали, глубина, поза камеры • принимает инструкции на естественном языке • генерирует текст, изображения или смешанные выходы • единый подход вместо набора узкоспециализированных моделей Гитхаб HF Демо #vlm #multimodal #t2i #i2t #detection #segmentation #image2depth #image2normals

Hugging Face и Cerebras представили опенсорсного голосового агента

Н@GreenNeuralRobotsAI-инженер
1 мес
real-time voice AI Hugging Face и Cerebras собрали пример опенсорсного голосового диалогового агента в рилтайме • Gemma 4 VLM на Cerebras — быстрый инференс • Parakeet (Nvidia) — распознавание речи • Qwen3TTS (Alibaba) — синтез голоса • задержка минимальна, отклик почти мгновенный Работает в роботах Reachy Mini (свыше 9000 устройств) Гитхаб Демо #realtime #dialog #voicemode #vlm #multimodal #interactive #tts #stt #duplex

ShutterMuse: ассистент фотографа на базе Qwen3-VL-8B-Instruct

Н@GreenNeuralRobotsAI-инженер
1 мес
ShutterMuse Ассистент фотографа на базе Qwen3-VL-8B-Instruct MLLM для подсказок по съёмке в реальном времени. Помогает оценивать кадры и ставить позы. • советы держать, дорабатывать или отбрасывать снимок • рамки композиции поверх кадра • рекомендации поз для портретов Гитхаб HF - 18 ГБ - на чем это должно работать, с камерой, клавиатурой, в рилтайме? #vlm #assistant

SpatialClaw: фреймворк NVIDIA для пространственного рассуждения VLM

Н@GreenNeuralRobotsAI-инженер
1 мес

RPC-Bench: новый бенчмарк для оценки LLM и VLM на научных статьях

1 мес
Ещё ↓