拓冰建站拓冰建站
首页 / 资讯中心 / 正文

SiYuan 图片文字识别完整指南:3 步从图片批量提取文字

SiYuan 图片文字识别完整指南3 步从图片批量提取文字【免费下载链接】siyuanAn open-source, privacy-first, self-hosted knowledge workspace where humans and AI agents work together 开源、隐私优先、自托管的知识工作空间让人与智能体在此协作项目地址: https://gitcode.com/GitHub_Trending/si/siyuan本文从会议照片、截图文献这类真实场景出发介绍 SiYuan 如何借助开源 Tesseract OCR 引擎把图片里的文字转成可搜索、可编辑的纯文本。内容涵盖环境检查、三步操作、识别语言包与参数配置、常见故障排查帮你在右键菜单里一次完成 SiYuan 图片文字识别。两个让人头疼的场景客户会议拍的白板照片板书内容想抄进纪要只能对着照片手打一遍从 PDF 翻拍的图表注释鼠标框选复制不到字全文搜索也搜不到这张图里的内容。这类文字在图里的素材传统做法是单独开 OCR 软件、导出、再粘贴回笔记链路很长。SiYuan 的做法是一句话能说清的内置调用系统里的 Tesseract OCR图片粘贴进笔记后自动后台识别结果直接落库右键菜单随时查看和复制。如何启用 SiYuan 图片文字识别先装好 TesseractSiYuan 本身不打包 Tesseract它启动时自动检测系统命令所以第一步是装好依赖Windowschoco install tesseractmacOSbrew install tesseractLinuxDebian/Ubuntusudo apt install tesseract-ocr tesseract-ocr-chi-sim按需加装其他语言包装完重启 SiYuan在日志里看到类似这一行说明功能已就绪tesseract-ocr enabled [ver5.3.3, maxSize2.0MB, langsengchi_sim]如果只有一行告警或菜单里找不到 OCR 项通常是 tesseract 不在 PATH 里macOS 装完后偶发。SiYuan 会依次尝试/usr/local/bin/tesseract和/opt/homebrew/bin/tesseract两个常见位置仍找不到就按上面的命令重装一次。三步拿到识别结果粘贴、右键、复制把图片放进笔记直接把会议照片拖进编辑区或复制粘贴。png、jpg、jpeg、tiff、bmp、webp、gif 等常见位图格式都支持单张默认上限 2MB。等后台识别无需任何操作新图片会自动进入 OCR 队列在空闲时段被后台任务处理每轮最多处理 7 张避免占满资源。识别进度会显示在右下角状态栏。右键查看文字在图片上点右键进入 OCR 子菜单识别文本直接显示在一个文本框里可复制、可修正觉得结果不对选重新 OCR即可强制重跑一次。识别出的文字不只是看一眼它会写进工作区的索引之后全文搜索能直接搜到图里的句子这正是把截图文献变成可检索知识的价值所在。识别语言包怎么选参数在哪里调SiYuan 默认加载系统里已安装的中英文、日语等主流语言包英文、简繁中文、日、法、西、德、俄及方向检测。想自定义行为用环境变量控制即可均在启动前设置环境变量作用示例SIYUAN_TESSERACT_LANGS限定识别语言组合连接SIYUAN_TESSERACT_LANGSchi_simengSIYUAN_TESSERACT_MAX_SIZE单张图片大小上限字节默认 2000000SIYUAN_TESSERACT_MAX_SIZE5000000SIYUAN_TESSERACT_TIMEOUT单张识别超时时间毫秒默认 7000SIYUAN_TESSERACT_TIMEOUT15000SIYUAN_TESSERACT_ENABLED临时关闭 OCR 功能SIYUAN_TESSERACT_ENABLEDfalse语言包选择建议只选图片里真实出现的语言。多塞语言包不会让结果更准反而可能干扰语种判断比如纯中文会议纪要chi_simeng就够了。注意SIYUAN_TESSERACT_LANGS是在已安装语言里做筛选写进去但系统没装的语言包会被自动跳过不会报错。批量处理图片文字也不用挑文件把素材陆续拖进笔记即可后台任务会一轮一轮地把未识别的图片消化完已经出过结果的图片不会重复处理。图片文字识别常见问题排查现象可能原因处理办法右键没有 OCR 菜单或提示Tesseract OCR 未安装或未配置tesseract 未安装或不在 PATH按上文安装命令重装重启 SiYuan 后看日志确认tesseract-ocr enabled结果乱码、整段英文识别成拼音缺少对应语言包安装对应语言包如tesseract-ocr-chi-sim并用SIYUAN_TESSERACT_LANGS指定组合大图识别不到、菜单里无结果超过默认 2MB 上限先压缩图片或调大SIYUAN_TESSERACT_MAX_SIZE识别中途无结果日志有 timeout 记录单张耗时超过 7 秒默认超时调大SIYUAN_TESSERACT_TIMEOUT或换清晰度更高的原图手写体识别率低引擎对手写支持有限属正常情况关键内容人工修正一次重新 OCR前可先把文字框里的内容留档另有一个容易忽略的点加密笔记本里的图片是密文SiYuan 会主动跳过其 OCR避免垃圾文本污染搜索索引。小结与进阶提示启用流程就三件事装 Tesseract → 重启 SiYuan → 把图片拖进笔记剩下的交给后台任务识别结果缓存在工作区assets/ocr-texts.json重启不丢失重复图片不重复计算想理解或扩展行为核心逻辑都在这几个文件里kernel/util/ocr.goTesseract 调用与结果解析、kernel/model/ocr.go后台自动 OCR 任务、app/src/menus/protyle.ts右键菜单入口改动前建议先读懂再加环境变量需要源码自行编译时可执行git clone https://gitcode.com/GitHub_Trending/si/siyuan获取仓库。对会议照片整理这类高频场景建议把语言包固定成chi_simeng把单张上限适度调大。用一周左右你会发现截图素材终于能被全文搜索看见了。【免费下载链接】siyuanAn open-source, privacy-first, self-hosted knowledge workspace where humans and AI agents work together 开源、隐私优先、自托管的知识工作空间让人与智能体在此协作项目地址: https://gitcode.com/GitHub_Trending/si/siyuan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门