video2textСбросить фильтр ×

TimeLens2: поиск моментов в видео по текстовому запросу

Н@GreenNeuralRobotsAI-инженер
1 мес
TimeLens2 Модель для поиска моментов в видео по текстовому запросу. Превращает видеопоток в постоянную визуальную память с привязкой к сущностям. По запросу на естественном языке выдаст интервалы на временной шкале • обрабатывает однократные и повторяющиеся события • работает с видео от третьего лица и эгоцентрическими • выдаёт один или несколько временных интервалов • использует мультимодальные LLM • есть несколько версий модели: TimeLens2-4B и TimeLens2-8B Гитхаб HF Демо #vlm #captioning #video2text #mllm

PadCaptioner: эффективная модель для описания видео

Н@GreenNeuralRobotsAI-инженер
1 мес
https://github.com/showlab/PadCaptioner Модель для создания подробных описаний видео с помощью мультимодальных данных. Работает эффективнее больших аналогов, при этом точнее описывает события. учитывает слабые локальные зависимости между событиями в видео, что позволяет генерировать описания параллельно без потери качества. Превосходит 7B аналоги по эффективности. Гитхаб ждем #captioning #vlm #video2text

Это всё на сейчас.