python使用mineru解析pdf等格式的文档
1、主页MinerU | 面向 Agent 和 RAG 的智能文档解析平台2、在线解析文档MinerU 在线文档解析3、使用代码批量处理文档例如将pdf文件转成md文件import os from mineru.cli.common import do_parse from mineru.data.data_reader_writer import FileBasedDataWriter if __name__ __main__: # 1️⃣ 输入 PDF pdf_path 2020-03-17__厦门灿坤实业股份有限公司__200512__闽灿坤__2019年__年度报告.pdf with open(pdf_path, rb) as f: pdf_bytes f.read() # 2️⃣ 输出目录 output_dir output os.makedirs(output_dir, exist_okTrue) # 3️⃣ MinerU 要求必须是「列表」 pdf_file_names [os.path.basename(pdf_path)] pdf_bytes_list [pdf_bytes] p_lang_list [] # 自动语言识别 # 4️⃣ 图片 writer img_writer FileBasedDataWriter( os.path.join(output_dir, images) ) # 5️⃣ 核心解析 do_parse( pdf_file_namespdf_file_names, pdf_bytes_listpdf_bytes_list, p_lang_listp_lang_list, output_diroutput_dir, img_writerimg_writer, parse_methodauto )需要先执行pip install -U mineru[all] pip install hf_xet下载模型from modelscope import snapshot_download snapshot_download(OpenDataLab/PDF-Extract-Kit-1.0, local_dirrD:\LLM\Local_model\PDF-Extract-Kit-1.0)并且设置环境变量MINERU_MODEL_DIR D:\LLM\Local_model\PDF-Extract-Kit-1.0然后运行代码在指定目录下生成了md文件和相关的json等文件用typora工具打开该md文件效果如下文档格式没乱原来pdf文件里是表格的地方在md文件里还是表格等等。