拓冰建站拓冰建站
首页 / 资讯中心 / 正文

4步把公式截图变成LaTeX代码:pix2tex OCR实战教程

4步把公式截图变成LaTeX代码pix2tex OCR实战教程【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCRpix2tex仓库名 LaTeX-OCR是一个基于视觉Transformer的数学公式OCR工具给它一张公式图片它返回对应的 LaTeX 源码。如果你经常从 PDF 或论文截图里搬公式却只能对着屏幕逐字敲 LaTeX这篇文章适合你——从安装到出结果全程不超过 4 步。先说场景公式为什么不好复制PDF 里的公式是死的。想引用某篇论文里的一个公式文字选中复制往往得到一串乱码手动重打 LaTeX 又费时还容易抄错符号。pix2tex 干的事情很简单把图片 → LaTeX 代码这一步自动化。你截一张公式图它输出一段可以直接粘进文档的 LaTeX 源码再配合任何渲染器就能还原成公式。它是怎么做到的模型由两部分拼接而成 ViT 编码器带 ResNet 主干负责看图把公式图片切块后编码成视觉特征Transformer 解码器负责写代码逐 token 生成 LaTeX 序列官方报告的效果指标为BLEU 0.88、归一化编辑距离 0.10、token 准确率 0.60。对公式这种短文本来说这个准确度已经够日常使用。模型对图片尺寸很敏感所以 pix2tex 额外训练了一个小的 ResNetimage resizer自动把输入图缩放到模型最顺手的分辨率。源码可以看 pix2tex/models/ 目录模型定义就在vit.py和transformer.py里。安装 pix2tex环境要求只有一个Python 3.7依赖 PyTorch。pip install pix2tex[gui]方括号里的标签决定装哪套依赖按需选择[gui]命令行 图形界面新手推荐本文主线[api]额外装 FastAPI用于起 Web 服务[train]额外装训练相关依赖[all]全部装齐首次运行时会自动下载模型权重文件不需要手动找 checkpoint。不想装包、直接读源码的话也可以克隆仓库git clone https://gitcode.com/GitHub_Trending/la/LaTeX-OCR后浏览 docs/installation.md 的完整安装说明。三条路拿到第一个结果命令行处理已有图片最直接的方式是调用pix2tex命令。传一个图片路径pix2tex formula.png不传路径则进入交互模式提示符下粘贴图片文件路径回车即可预测在 Windows 和 macOS 上还能直接把图片拷进剪贴板后按回车。预测结果会同时复制到系统剪贴板终端里按t0.1可以随时调节 temperature采样温度输入show则用 XeLaTeX 把结果渲染回图片。图形界面随手一截就出码装过[gui]标签后直接运行latexocr窗口弹出后点Snip快捷键 AltSmacOS 上是 OptionS框选屏幕上的公式预测结果会即时渲染出来并写入剪贴板。结果不满意就点Retry重跑一次也可以在窗口底部的 Temperature 滑块上把值调低让输出更稳定。在 Python 里当函数用写脚本、批量处理时把LatexOCR当普通对象调用from PIL import Image from pix2tex.cli import LatexOCR model LatexOCR() print(model(Image.open(formula.png)))想做成团队内部服务也可以pip install -U pix2tex[api]后运行python -m pix2tex.api.run会在 8502 端口起一个 FastAPI 服务接口定义见 pix2tex/api/app.py。结果不准时调这两处换分辨率重试模型偏爱中小分辨率的图。拍得太近、放得太大反而更容易错退远一点重新截图往往比调参数更管用。调 temperature温度低同一张图反复预测输出一致温度高每次可能给不同候选。拿不准就调低温度求稳结果接近正确时再调高试试别的写法。另外要记住OCR 不是 100% 的交付前务必把生成的 LaTeX 通读一遍再渲染确认。进阶用数据微调自己的模型如果你的公式有大量特殊记号自定义宏、生僻符号可以用自己的数据训练。流程分三步生成数据集。把图片路径和 LaTeX 标签的对应关系打包成 pklpython -m pix2tex.dataset.dataset --equations math.txt --images imgs/ --out dataset.pkl改配置。打开 pix2tex/model/settings/config.yaml把data和valdata指向刚生成的.pkl再按需调超参数。开训python -m pix2tex.train --config pix2tex/model/settings/config.yaml训练用的数据管线爬取、渲染成 PNG、LaTeX 归一化都放在 pix2tex/dataset/ 目录里想自建数据集可以先翻一遍。常见疑问速答装完跑不起来先确认 PyTorch 已正确安装CPU 环境下加--no-cuda参数。结果和原图对不上优先换截图分辨率重试其次调低 temperature。想要 Web 演示页API 服务自带 Streamlit 前端python -m pix2tex.api.run会同时拉起前后端浏览器打开 8501 端口即可。想在线体验仓库 notebooks/ 目录下有现成的 Colab 笔记本改几行就能跑。pix2tex 把截图里的公式变成了能编辑的源码对写文档、整理文献的人是很顺手的小工具。装好之后建议先拿一张论文截图走一遍命令行流程感受下输出质量再决定要不要搭 API 服务或微调模型——代码就在手边动手比读文档更快。【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门