← к умной ленте

Firecrawl выпустила опенсорсный Rust-парсер документов anydoc (бывший pdf-inspector)

Компания Firecrawl открыла исходный код быстрого парсера документов на Rusti. Сначала инструмент называли pdf-inspector и он конвертировал только PDF в Markdown, но затем Firecrawl расширила его до anydoc — библиотеки, которая переводит в Markdown не только PDF, но и DOCX, PPTX, XLSX и ещё около 10 других форматов, сохраняя заголовки, таблицы, списки и общую структуру документа.

Инструмент рассчитан на подготовку данных для RAGi-пайплайнiов и AI-агентов: он ставится локально (в том числе на макбук, работает в браузере) и встраивается напрямую в пайплайны обработки документов, например в Claude Code.

0,002 секвремя обработки одной страницы PDF
0,47 секвремя конвертации PDF на 200 страниц
<5 мссреднее время обработки документа в anydoc
  • По данным Not Boring Tech, обработка одной страницы PDF занимает 0,002 секунды, а PDF на 200 страниц — 0,47 секунды по последним тестам
  • По данным Нейронавта, конвертация 200 PDF занимает 2,8 секунды — цифры источников по скорости расходятся
  • CodeCamp указывает среднее время обработки менее 5 мс на документ у версии anydoc, поддерживающей 14+ форматов
  • БлоGнот протестировал утилиту: конвертация документов на десятки-сотни килобайт занимает 50-130 мс, дольше всего запускается сам процесс
  • Инструмент не обрабатывает изображения: из PPTX со слайдами с картинками получается ~500 байт (только текстовая обёртка), из отсканированного PDF — вообще ничего
  • По мнению автора БлоGнота, для агентов это не критично, так как Claude и GPT умеют читать изображения нативно, а офисные форматы без такого парсера часто требуют разбора как XML
  • Код доступен на GitHub, ссылка указана как https://github.com/firecrawl/anydoc

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖