把文档变成喂 LLM 的结构化 Markdown
docling 解决的是任何 RAG 系统之前那个不起眼却关键的步骤:把杂乱文档变成模型能用的干净、结构化文本。它吃 PDF、DOCX、PPTX、HTML、图片等,产出保留阅读顺序、标题和表格的 Markdown 或 JSON。扁平文字会把这些结构丢光。它起于 IBM Research(DS4SD 组),如今作为 docling-project 挂在 LF AI & Data 基金会下,这对你可能拿来搭管线的东西来说,是个有意义的治理信号。截至 2026-06 有 61,641 星,成为 RAG 时代上升最快的文档工具之一。
它做什么
核心活儿是版面感知解析。docling 不只抽字符,它理解页面结构,所以一篇双栏论文、一张表格、一套幻灯片出来时结构仍在。它能通过可插拔后端对扫描页跑 OCR,可选用一个视觉语言模型(GraniteDocling)处理更难的版面,还集成了 LangChain、LlamaIndex 等,以及给 agent 用的 MCP server。本地执行是有意为之的特性,所以敏感文档不必离开你的机器。
安装
pip install docling
然后 CLI 把一个文件或 URL 直接转成 Markdown:
docling https://arxiv.org/pdf/2408.09869
更难的文档可以开视觉语言管线,比如 docling --pipeline vlm <file>。详细安装选项在项目文档里。
适合与不适合
需要为 RAG 管线做版面感知解析、表格和阅读顺序重要、又要求本地离线处理以保隐私时,选它。基金会治理加 MIT 许可让它是个合理的长期依赖,LangChain 和 LlamaIndex 集成让它能塞进现有栈。
它比简单转换器重:它拉进深度学习模型,所以冷启动要下权重,大 PDF 要花真实的时间和内存。如果你只想从 office 文件里快速取文字、不要版面智能,markitdown 这类轻量转换器更省事。而且如下面的坑所示,表格和扫描件的准确率不错但没被解决。
docling 和其它文档解析器的对比
| docling | unstructured | markitdown | jina reader | |
|---|---|---|---|---|
| Stars | 61,641 | 14,936 | 152,764 | 11,235 |
| 重心 | 版面感知解析 | RAG 预处理管线 | 轻量转换 | URL 转 Markdown |
| 版面与表格 | 强 | 基于分区 | 基础 | 无 |
| 运行 | 本地 | 本地加付费 API | 本地 | 托管加自托管 |
| 适合 | 论文、报告、扫描件 | 企业 ETL | 快速 office 转 Markdown | 网页 |
数字为截至 2026 年 6 月的 GitHub 数据。unstructured 是偏 ETL 的管线,有开源库加付费平台。markitdown 是轻量快速转换那一路。jina reader 抓的是网页 URL。docling 的优势是版面感知、本地、基金会治理的解析。
star 曲线
star 曲线随 RAG 走向主流而陡升,「我怎么从 PDF 里弄出干净文本」一下成了所有人的问题。转入 LF AI & Data 基金会加稳定的发布节奏,说明这份增长有真实治理接着。
issue 区给你的预警
那 900 多个未决 issue,混着功能请求和值得知道的真实局限。扫描件和中文 PDF 仍可能因 OCR 后端不同而输出乱码,所以测你自己的文档。表格抽取不错,但出过内容在单元格间重复的 bug,所以喂给下游逻辑的表格要核对。依赖体量大,招过像强制装 OpenCV 这类抱怨。大文档慢且吃内存,尤其开了视觉语言管线时。这些都不削弱核心价值,是把版面感知解析做扎实的代价。
相关仓库
要偏 ETL 的管线,看 unstructured。要轻量转换,看 markitdown。要网页,看 jina reader。要支撑文档解析的 OCR 引擎,看 Tesseract 和 PaddleOCR。想看什么在涨,见 每日榜 和 每周报告。
常见问题
docling 还是 unstructured,该用哪个? docling 专注保留阅读顺序和表格的版面感知解析,且本地运行。unstructured 是 ETL 式管线,有开源库加付费平台和广泛的 RAG 集成。要版面保真和本地处理用 docling,要托管式 ingest 管线用 unstructured。
docling 还是 markitdown? docling 做带 OCR 和可选视觉模型的版面感知解析,代价更重。markitdown 是轻量转换器,快速把 office 文件变 Markdown、没有版面智能。结构重要用 docling,只想快速取文字用 markitdown。
docling 能离线跑吗? 能。本地执行是核心特性,这也是处理敏感文档时选它的关键原因。注意首次运行会下模型,留一次余量。
docling 在表格和扫描 PDF 上准吗? 不错但不完美。表格按结构抽取,但出过重复 bug;扫描件或中文 PDF 取决于 OCR 后端,可能乱码。下游信任输出前,先测你的真实文档。
docling 谁维护? 它起于 IBM Research,如今作为 docling-project 挂在 LF AI & Data 基金会下,MIT 许可,这比单公司项目是更强的治理信号。