vlmСбросить фильтр ×

Обновление ComfyUI-QwenVL: оптимизация работы с видео

Н@GreenNeuralRobotsAI-инженер
13 ч
ComfyUI-QwenVL запуск Qwen-VL внутри #ComfyUI - визуальное понимание и генерация текста. Раньше при попытке скормить видео 1080p нода вылетала с OOM, теперь автоматический рассчет токенов и масштабирование кадров под контекст модели - Умное масштабирование видео: 1080p/4K автоматически поджимается под безопасный бюджет токенов — 16-32 кадра без вылета - Маленькие видео (480p) не трогает — идут в оригинале - Можно переопределить вручную через dropdown: auto, 384, 448, 512, 768, original Работает с GGUF (llama.cpp) и Transformers (Hugging Face) #vlm VK | MAX
Обновление ComfyUI-QwenVL: оптимизация работы с видео

Алиса AI научилась распознавать рукописный текст, даже когда буквы слились в закорючки

Яндекс представил обновление голосового помощника Алиса AIi: теперь он умеет распознавать рукописный текст с фотографий — от студенческих конспектов до врачебных рецептов. Возможность появилась благодаря новой VLM-модели (vision-language model, модель, объединяющая распознавание изображений и текста).

Чтобы продемонстрировать возможности технологии, в Москве появились плакаты, на которых буквы «И», «ш», «л» и «м» написаны физически одинаково и слипаются в сплошную волну — различить их человеку можно только по смыслу фразы. Алиса AI при этом выдаёт с фото корректно распознанный текст даже на такой слитной скорописи.

Полный разбор →

Это всё на сейчас.