Компания Firecrawl открыла исходный код быстрого парсера документов на Rusti. Сначала инструмент называли pdf-inspector и он конвертировал только PDF в Markdown, но затем Firecrawl расширила его до anydoc — библиотеки, которая переводит в Markdown не только PDF, но и DOCX, PPTX, XLSX и ещё около 10 других форматов, сохраняя заголовки, таблицы, списки и общую структуру документа.
Инструмент рассчитан на подготовку данных для RAGi-пайплайнiов и AI-агентов: он ставится локально (в том числе на макбук, работает в браузере) и встраивается напрямую в пайплайны обработки документов, например в Claude Code.
0,002 секвремя обработки одной страницы PDF
0,47 секвремя конвертации PDF на 200 страниц
<5 мссреднее время обработки документа в anydoc
- По данным Not Boring Tech, обработка одной страницы PDF занимает 0,002 секунды, а PDF на 200 страниц — 0,47 секунды по последним тестам
- По данным Нейронавта, конвертация 200 PDF занимает 2,8 секунды — цифры источников по скорости расходятся
- CodeCamp указывает среднее время обработки менее 5 мс на документ у версии anydoc, поддерживающей 14+ форматов
- БлоGнот протестировал утилиту: конвертация документов на десятки-сотни килобайт занимает 50-130 мс, дольше всего запускается сам процесс
- Инструмент не обрабатывает изображения: из PPTX со слайдами с картинками получается ~500 байт (только текстовая обёртка), из отсканированного PDF — вообще ничего
- По мнению автора БлоGнота, для агентов это не критично, так как Claude и GPT умеют читать изображения нативно, а офисные форматы без такого парсера часто требуют разбора как XML
- Код доступен на GitHub, ссылка указана как https://github.com/firecrawl/anydoc
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖