5 分钟跑通 Markitdown:把 PDF、Word、Excel 一键转成 Markdown
5 分钟跑通 Markitdown把 PDF、Word、Excel 一键转成 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown手边一份 PDF 合同想把文字丢给大模型总结复制粘贴半天格式全乱。Markitdown 是微软开源的 Python 工具一条命令把 PDF、Word、Excel、PPT 转成 Markdown标题层级和表格结构原样保留。读完你能装好它、跑通第一个转换再掌握批量转换和 OCR 两个进阶操作。一条命令把文档变成 Markdown以前你要打开 PDF全选复制手动重排标题和表格。现在只需要一行命令。Markitdown 自动识别文件类型选对解析器输出的 Markdown 直接能喂给 GPT、Claude 这类大模型。 从零到跑通只要 30 秒一条命令装好[all] 表示装齐 PDF、Office、网页等全部格式的依赖只需 Python 3.10 以上pip install markitdown[all]装完转一个文件结果直接打印到终端markitdown report.pdf跑完你会看到类似这样的输出标题、分隔线、表格都在TECHMART ELECTRONICS 4567 Innovation Blvd San Francisco, CA 94103 Wireless Noise-Cancelling Headphones AUDIO-5521 1 $349.99 $299.99要写进文件就加-o在 Python 里用它也一样from markitdown import MarkItDown md MarkItDown() print(md.convert(report.xlsx).text_content)跑完打印的就是这份 Excel 每个工作表的标准 Markdown 表格。 核心能力格式、图片、批量一份文件库十几种格式它内置了十几个转换器按文件扩展名和 MIME 类型可以理解为文件类型标识自动路由格式说明产出PDF、Word、PPT标题、列表、表格保留层级标准 MarkdownExcel.xlsx/.xls每个工作表一张表每张工作表一个 Markdown 表HTML、RSS、维基页面正文提取链接保留干净正文 MarkdownEPUB、CSV、JSON、ZIP嵌套内容逐个提取分节 MarkdownYouTube 视频链接抓取字幕带时间轴文本比如转 Excelmarkitdown test.xlsx -o test.md产出就是每个工作表一节、表格原样还原的 Markdown。图片和多媒体也能转图片转换会先读 EXIF 元数据相机、拍摄时间这些藏在文件里的信息装了 exiftool 就有。配一个大模型客户端还能顺手生成图片描述。下面这段给一张测试图生成说明文字from markitdown import MarkItDown from openai import OpenAI md MarkItDown(llm_clientOpenAI(), llm_modelgpt-4o) print(md.convert(test_llm.jpg).text_content)跑完你会看到输出里多出# Description:段落内容就是大模型写的图片描述。音频如 test.m4a转出来是带时间轴的转写文本装audio-transcription扩展即可markitdown https://www.youtube.com/watch?v...直接抓 YouTube 字幕攒视频素材做总结很省事。整个文件夹批量转换一个 ZIP 包直接转压缩包里的文件逐个处理markitdown test_files.zip docs.md产出的 Markdown 按文件分节每个文件一节。处理散落的 PDF 文件夹用一条 find 命令并行转find . -name *.pdf -exec markitdown {} -o out/{}.md \;跑完 out/ 目录里多一份 PDF 对应一份 md10 个文件从手动 40 分钟压到一条命令几秒。⚙️ 进阶玩法扫描件 OCR 与云端提取markitdown-ocr扫描件救星扫描件 PDF 里没有文本层普通转换只能得到空白。markitdown-ocr 插件用 LLM 视觉能力把每页渲染成 300 DPI 图像识别文字。逐行看这个配置from markitdown import MarkItDown from openai import OpenAI md MarkItDown( enable_pluginsTrue, # 启用第三方插件 llm_clientOpenAI(), # 视觉模型客户端 llm_modelgpt-4o, # 支持图片输入的模型 llm_promptExtract all text, preserving table structure., # 自定义提取提示词 ) print(md.convert(scanned_invoice.pdf).text_content)跑完你会看到*[Image OCR]标记的段落里嵌入了发票上的文字位置和正文顺序一致。插件靠 Python 的 entry points 机制自动注册安装pip install markitdown-ocr后加-p启用markitdown --list-plugins可查已装插件。仓库里的 markitdown-sample-plugin 就是一个几十行的最小插件示例。Azure Content Understanding限定范围用云端pip install markitdown[all]已含相关依赖。本地转换精度不够或需要提取发票、合同这类结构化字段时把指定格式路由给 Azure Content Understandingmd MarkItDown(cu_endpointyour-cu-endpoint, cu_file_types[ContentUnderstandingFileType.PDF])第一个参数是你在 Azure 里创建的端点第二个参数限定只有 PDF 走云端其余格式仍用本地转换。效果差别输出开头多一段 YAML 字段块比如InvoiceDate: 2019-11-15关键字段直接可查。 场景速查表你的需求命令 / 配置预期产出单份 PDF 转 Markdownmarkitdown report.pdf report.md保留标题层级的 mdExcel 转表格markitdown test.xlsx -o test.md每张工作表一个 Markdown 表YouTube 字幕提取markitdown https://www.youtube.com/watch?v...带时间轴的文本扫描 PDF 提取文字装 markitdown-ocr配 llm_client[Image OCR]包裹的识别文字ZIP 包整包转换markitdown archive.zip all.md按文件分节的 md只让 PDF 走云端cu_file_types[ContentUnderstandingFileType.PDF]带 YAML 字段的 md查看已装插件markitdown --list-plugins插件名列表手边那份 PDF 合同的活现在一条markitdown就能交差。先装起来拿一份真实文件跑一遍看输出再决定要不要上 OCR。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考