拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Docling 快速上手:如何把 PDF、DOCX 等 20+ 格式解析成 AI 可用的结构化文档

Docling 快速上手如何把 PDF、DOCX 等 20 格式解析成 AI 可用的结构化文档【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling在 RAG 应用里文档预处理常是第一个卡点同一批材料散落在 PDF、Word、HTML 里转成文本后表格和公式全乱。Docling 是一个开源的文档解析库把这些格式统一转换成结构化的 DoclingDocument再导出为 Markdown、HTML、JSON支持完全本地运行适合做 AI 文档流水线的预处理层。快速上手2 分钟完成 Docling 安装与首次转换最短路径是 pip 安装后用终端一条命令转换一篇 PDFpip install docling docling https://arxiv.org/pdf/2206.01062 # 官方示例在当前目录生成 .md 文件要接入代码流程用 Python APIfrom docling.document_converter import DocumentConverter source https://arxiv.org/pdf/2408.09869 # 本地路径或 URL 均可 converter DocumentConverter() doc converter.convert(source).document print(doc.export_to_markdown()) # 输出带标题、表格标记的结构化 Markdown跑通后你会看到输出的不是裸文本标题层级、表格、段落都带着语义结构。核心能力从多格式文档解析到 RAG 分块多格式输入一个工具处理 20 种格式除 PDF 外Docling 支持 DOCX、PPTX、XLSX 办公格式HTML、EPUB 网页与电子书格式WAV/MP3 音频、邮件EML/MSG甚至 MP4 等视频全部统一转成 DoclingDocument不需要为每种格式维护一套代码。PDF 深度解析版面、阅读顺序、表格结构默认开启PDF 管道默认识别页面版面并确定阅读顺序表格结构识别do_table_structure和 OCRdo_ocr也默认开启公式与代码增强可手动打开from docling.datamodel.base_models import InputFormat from docling.datamodel.pipeline_options import PdfPipelineOptions from docling.document_converter import DocumentConverter, PdfFormatOption opts PdfPipelineOptions(do_ocrTrue, do_formula_enrichmentTrue) # OCR 公式识别 converter DocumentConverter(format_options{InputFormat.PDF: PdfFormatOption(pipeline_optionsopts)})结果里公式会被转成 LaTeX多栏版式按正确的阅读顺序还原不再左右交叉。导出与 RAG 分块Markdown、JSON 与 HybridChunkerDoclingDocument 可导出 Markdown、HTML 或无损 JSON配合内置的 HybridChunker 可直接切成带标题上下文的分块喂给向量库from docling.chunking import HybridChunker chunker HybridChunker() for chunk in chunker.chunk(doc): # doc 是 DoclingDocument print(chunk.text) # 每个分块携带文本与标题层级AI 框架集成原生对接 LangChain 与 LlamaIndexDocling 提供 LangChain、LlamaIndex、CrewAI、Haystack 等框架的即插即用集成以及 MCP server 和 API 服务docling-serve形态具体接入方式见 集成文档。与传统解析方案的区别表格和公式为什么能保住| 维度 | 传统 PDF 文本提取工具 | Docling | | - | - | - | | 输出物 | 原始文本流 | DoclingDocument 语义结构标题/表格/公式/图片 | | 表格 | 按坐标排成乱码文本 | 重建行列关系与单元格内容 | | 公式与代码 | 丢失或乱码 | 识别为 LaTeX / 代码块按需开启 | | 格式覆盖 | 一种格式一个工具 | PDF、办公、网页、音频等 20 格式统一解析 | | 部署方式 | 多为商业 API | 可全本地运行支持离线环境 |关键差异在于 Docling 先把文档转成带版面信息的层级结构再按需导出而传统工具以文本流为终点。对版面复杂的文档两者的输出质量差距最明显。一个真实场景混合格式材料批量做 RAG 知识库以前搭知识库要先人工把 50 篇 PDF、Word、网页材料统一成一种格式再逐篇修表格乱码至少一两天。现在 Docling 文档解析一遍目录即可批量转成结构化 Markdown再用内置分块器直接分块几小时搞定。import glob from docling.document_converter import DocumentConverter converter DocumentConverter() # 复用同一个实例 for path in glob.glob(materials/*, recursiveTrue): doc converter.convert(path).document print(doc.export_to_markdown()[:80]) # 抽查解析效果实用技巧5 条避坑参数建议⏱️ OCR、表格结构、公式识别都会显著拖慢速度按需开启官方文档明确建议只启用需要的功能。生产批量处理时设置document_timeout建议 90–120 秒防止单个文档拖垮整个批次。老款 Intel Mac 上 PyTorch 不兼容时改用pip install docling[mac_intel]安装。PDF 本身有可靠文本层时设force_backend_textTrue可跳过版面模型、直接取内嵌文本速度更快。追求更高精度可换 VLM 管道docling --pipeline vlm --vlm-model granite_docling 文件.pdf。局限与适用边界它不擅长什么手写体、极度模糊的扫描件OCR 准确率仍然有限建议保留人工复核环节。VLM 管道和公式识别明显慢于默认版面管道高吞吐在线服务更适合用默认管道或部署 docling-serve。音视频转写需要额外安装asr扩展依赖pip install docling[asr]。数据安全方面Docling 可以完全本地运行敏感文档无需上传第三方服务适合内网和离线环境部署。写在最后如果文档格式混杂且需要保留结构Docling 是目前完成度较高的开源文档解析选择。更多细节见 官方快速开始 与 示例代码。【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门