拓冰建站拓冰建站
首页 / 资讯中心 / 正文

PDF 论文翻译如何完整又快,公式排版还能留住?

PDF 论文翻译如何完整又快公式排版还能留住【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslate命令pdf2zh是一个 PDF 论文翻译工具只翻译文字层公式、图表、目录和双栏版式都不动适合要啃外文文献的学生和科研人员。读外文文献的痛点复制粘贴翻译为什么会毁掉版式遇到一篇外文论文很多人第一反应是把文字复制出来丢给翻译网站。网页文章这么干没问题论文却基本会翻车公式变成乱码符号双栏被贴成错乱的一长条图注和脚注跑到不相干的位置。所以 PDF 论文翻译要做的不只是把字换成中文版式也得跟着保住。PDFMathTranslate 正是为此设计的开源工具只有文本层参与翻译其余元素全部跳过。pdf2zh 安装命令从 pip 到第一次翻译把版本和网络确认好安装就是最省心的部分。下面四个前提缺一个首跑就会卡住Python 版本要在 3.11 到 3.12 之间pyproject.toml声明3.11,3.133.10、3.13 都不行网络要通首次运行会从 Hugging Face 拉取 ONNX 版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx断网会一直卡在下载依赖不用手动装pip install时 onnxruntime、pdfminer、gradio 等会自动带入Windows 上跑 exe 版本若报 DLL 加载失败先安装 VC 2015–2022 运行库操作本身只有两步pip install pdf2zh pdf2zh document.pdf翻译服务默认是 Google不配密钥也能跑。执行结束后当前目录会多出两份产物document-mono.pdf是纯译文版document-dual.pdf是中英对照版。首轮执行会在模型下载上多花点时间属于正常现象。翻完的 PDF 长什么样公式与双栏版式为什么还在官方演示挑的是一篇 Nature 论文中文版效果如下中英同页对照双栏位置一致图编号、脚注、页眉各在其位数学符号完整没散架。原理并不复杂DocLayout-YOLO 的 ONNX 模型先逐页检测公式、图片、表格、目录等元素只有文字块会被送去翻译服务其余一律跳过译文再按原字体、原位置回填。整条管线分版面解析、逐块翻译、最后合成三步所以版式漂移很少。想看实现细节可以翻源码 pdf2zh/doclayout.py。单个、批量、GUI、容器、MCP五种入口怎么选只翻一篇论文pdf2zh paper.pdf结果直接落在当前目录。要一次翻完整个文件夹pdf2zh --dir /path/to/papers/ -o results/目录里的 PDF 批量处理产物统一进-o指定的目录。更喜欢用鼠标pdf2zh -i启动后打开http://localhost:7860/在浏览器里配置服务、挑页码、实时预览。不想在本机装 Python 环境 执行docker pull byaidu/pdf2zh再docker run -d -p 7860:7860 byaidu/pdf2zh同样是 7860 端口的 Web 界面。希望在 AI 对话里直接翻 PDFpdf2zh --mcp注册进 Claude Desktop配置示例见官方进阶文档。pdf2zh 常用参数日常 8 个选项下表按用途排列覆盖日常大多数情况参数作用示例-p只翻译指定页码pdf2zh paper.pdf -p 1-3,5-s切换翻译服务-s deepl、-s openai:gpt-4o-mini-li/-lo源语言 / 目标语言-li en -lo zh-t翻译线程数并发处理-t 4-o输出目录缺省为当前目录-o results/--ignore-cache忽略翻译缓存强制重新翻译--ignore-cache--prompt加载自定义 LLM 提示词文件--prompt my.txt--config加载 JSON 配置文件--config c.json高频问题修复扫描版、模型下载、鉴权报错扫描版 PDF 翻不动文件是纯图片扫描件没有文本层而 pdf2zh 解析的就是文本层自然取不到内容。先用 OCR 生成文本层再投入翻译。模型下载卡住首次运行要拉wybxc/DocLayout-YOLO-DocStructBench-onnx部分地区访问 Hugging Face 受限。运行前设置镜像即可set HF_ENDPOINThttps://hf-mirror.comPowerShell 用户写成$env:HF_ENDPOINT https://hf-mirror.com。切换服务后报鉴权错误多半是对应环境变量没提前设置比如DEEPL_AUTH_KEY、OPENAI_API_KEY。各服务对应哪些变量名官方进阶文档里的表格查得到设完再执行。适合谁不适合谁想要PDF 翻成中文、版式还在装好 pdf2zh 就能快速交付第一批论文。但它不是万能的纯扫描文档OCR 路径目前还是实验功能效果因文件而异、希望嵌入闭源商业产品的用户仓库采用 AGPL-3.0 许可先看清条款、以及追求逐字逐句绝对精确的场合都不建议直接上手先对照官方进阶文档确认适用性。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门