← к ленте

Релиз компактной OCR-модели OvisOCR2

1 мес

Вышла OvisOCR2 — компактная OCR-модель на 0.8B параметров для структурированного парсинга документов в Markdown.

OvisOCR2 вышел на ModelScope. Это компактная OCR-модель на 0.8B параметров для page-level document parsing: на вход подаётся изображение страницы, на выходе получается структурированный Markdown в нормальном порядке чтения. Формулы модель отдаёт в LaTeX, таблицы в HTML, визуальные области помечает image tags с bbox-координатами. По заявленным результатам OvisOCR2 набрала 96.58 overall на OmniDocBench v1.6 и стала первой end-to-end моделью, которая заняла первое место в лидерборде, где раньше доминировали pipeline-системы. На PureDocBench тоже сильный результат: 75.06 Avg3. Это важнее, чем просто победа на одном бенчмарке, потому что документный парсинг давно страдает от переобучения под популярные наборы. Модель сделана на базе Qwen3.5-0.8B и дообучалась через SFT, RL и OPD. Для деплоя есть поддержка vLLM, лицензия Apache 2.0. https://modelscope.ai/models/ATH-MaaS/OvisOCR2

Кратко (AI)

На платформе ModelScope представлена компактная OCR-модель OvisOCR2 с 0.8 млрд параметров, предназначенная для преобразования изображений документов в структурированный Markdown. Модель базируется на архитектуре Qwen3.5-0.8B и демонстрирует высокие показатели в бенчмарках OmniDocBench v1.6 и PureDocBench, превосходя многие существующие pipeline-системы.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖