markitdown:3 步把 PDF、Word、EPUB 批量文档转成 Markdown,5 分钟跑通
markitdown3 步把 PDF、Word、EPUB 批量文档转成 Markdown5 分钟跑通【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown你手里压着一批 PDF、Word 和电子书要整理进笔记库或者直接喂给 LLM 做问答复制粘贴又总是把标题和表格拍成一坨。markitdown 就是干文档转 Markdown 这件事的开源 Python 工具一条命令把文件转成结构化 Markdown全程本地运行、免费不上传任何文件。支持哪些格式能力全景一张表markitdown 的定位是面向文本分析和 LLM 的转换输出是给人看也基本可读的 Markdown重点保留的是结构而不是版式。支持范围见下表输入格式输出备注PDF、Word(docx)、Excel(xls/xlsx)、PPT(pptx)Markdown含标题、表格、列表需装对应依赖组如[pdf][docx][xlsx][pptx]EPUB单个 Markdown 文件基础安装即可无需额外依赖HTML、CSV、JSON、XMLMarkdown 或保留结构文本基础安装即可JPG/PNG 等图片文字描述 EXIF 元数据图片描述依赖视觉模型WAV/MP3 等音频语音转写文本依赖组[audio-transcription]建议装 ffmpegZIP、Outlook 邮件、YouTube 链接ZIP 逐个解压转换 / 邮件正文 / 视频字幕邮件需[outlook]组标题层级、列表、表格、链接都会映射成对应 Markdown 语法不是粗暴提取纯文本CLI 和 Python API 双入口随手转换用命令批量自动化用代码全部本地执行文件不出机器。从零装好只需 3 条命令python3 --versionmarkitdown 要求 Python 3.10低版本先升级或换环境。pip install markitdown[all][all]一次性装齐 PDF、Office、音频等全部可选依赖省得转换中途报缺库。markitdown your-file.pdf document.md跑完就行document.md里能看到标题层级和正文都已经结构化。想从源码跑参与开发的话clone 仓库后执行pip install -e packages/markitdown[all]即可。EPUB 转 Markdown 实测输出用仓库自带的 test.epub 走一遍完整流程markitdown test.epub -o mybook.md实际得到的输出长这样**Title:** Test EPUB Document **Authors:** Test Author **Language:** en **Description:** A test EPUB document for MarkItDown testing **Identifier:** test-book-id # Chapter 1: Test Content This is a **test** paragraph with some formatting. It includes: - A bullet point - Another point开头的 Title / Authors / Language 等字段是从 EPUB 内部的 Dublin Core 元数据里自动抽出来的等于顺手帮你生成了著录信息EPUB 本质是 ZIP 压缩包markitdown 先定位容器描述文件再按 spine 阅读顺序逐章拼接章内的strong、ul等 XHTML 标签被映射成加粗、列表等 Markdown 语法整本书合并输出为单个文件直接丢进笔记工具或给大模型都没问题。CLI 参数速查表与 Python API 调用参数作用示例-o指定输出文件不写则打印到终端markitdown a.docx -o a.md-x手动提示扩展名管道输入时很有用cat unknown \| markitdown -x pdf-m手动提示 MIME 类型markitdown -m text/html a-c指定字符集解决乱码markitdown a.txt -c UTF-8-p启用第三方插件如 OCR 增强markitdown a.pdf -p--list-plugins查看已装插件markitdown --list-plugins-v打印版本号markitdown -v不传文件参数时markitdown 自动从 stdin 读取管道输入适合嵌进脚本流水线cat example.pdf | markitdown -x pdfPython API 适合批量处理或嵌入自己的工具核心就四行from markitdown import MarkItDown md MarkItDown() result md.convert(test.xlsx) print(result.markdown)convert()的参数换文件名即可切换任意受支持格式。图片这类非文本输入也能进同一个入口下面这张仓库测试素材就演示了图片转换场景转换报错别慌6 个常见坑的解法转 PDF 报缺库→ 只装了裸包没装可选依赖组 → 一开始就pip install markitdown[all]安装直接失败→ Python 版本低于 3.10这是最常见的我明明按教程做了 → 升级环境管道输入识别不出格式→ markitdown 靠扩展名猜类型stdin 没有扩展名 → 补-x pdf或-m提示转音频时出现 Couldnt find ffmpeg→ 音频转写组件缺 ffmpeg → 装一下 ffmpeg纯文档转换不受影响服务器上处理用户文件→ markitdown 以当前进程权限做 I/O直接传用户可控路径有风险 → 改用convert_local()、convert_stream()这类更窄的入口控制输入范围期望逐像素还原版式→ 官方定位是文本和结构转换不是 DTP → 高保真排版需求别选它。横向对比markitdown vs 在线转换 vs 手动复制粘贴评估维度markitdown在线转换服务手动复制粘贴上手成本一条命令 ⚡打开浏览器即可零成本格式与结构保留✅ 标题/列表/表格⚠️ 视服务而定❌ 基本丢失批量处理✅ 循环/API 皆可❌ 逐个上传❌隐私安全✅ 全程本地❌ 文件要上传✅成本免费⚠️ 多有额度限制时间成本高边界与行动建议markitdown 把打不开结构的文档变成干净的 Markdown 文本但不负责逐像素还原版式——做设计稿或版式工程的需求别选它要把文档库整理成文本、喂给 LLM 做问答摘要选它。装好[all]依赖组今天就该把文档库转一遍了。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考