Релиз компактной OCR-модели OvisOCR2
M@machinelearning_interviewAI-инженер
1 месВышла OvisOCR2 — компактная OCR-модель на 0.8B параметров для структурированного парсинга документов в Markdown.
OvisOCR2 вышел на ModelScope.
Это компактная OCR-модель на 0.8B параметров для page-level document parsing: на вход подаётся изображение страницы, на выходе получается структурированный Markdown в нормальном порядке чтения.
Формулы модель отдаёт в LaTeX, таблицы в HTML, визуальные области помечает image tags с bbox-координатами.
По заявленным результатам OvisOCR2 набрала 96.58 overall на OmniDocBench v1.6 и стала первой end-to-end моделью, которая заняла первое место в лидерборде, где раньше доминировали pipeline-системы.
На PureDocBench тоже сильный результат: 75.06 Avg3. Это важнее, чем просто победа на одном бенчмарке, потому что документный парсинг давно страдает от переобучения под популярные наборы.
Модель сделана на базе Qwen3.5-0.8B и дообучалась через SFT, RL и OPD. Для деплоя есть поддержка vLLM, лицензия Apache 2.0.
https://modelscope.ai/models/ATH-MaaS/OvisOCR2
Кратко (AI)
На платформе ModelScope представлена компактная OCR-модель OvisOCR2 с 0.8 млрд параметров, предназначенная для преобразования изображений документов в структурированный Markdown. Модель базируется на архитектуре Qwen3.5-0.8B и демонстрирует высокие показатели в бенчмарках OmniDocBench v1.6 и PureDocBench, превосходя многие существующие pipeline-системы.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖