拓冰建站拓冰建站
首页 / 资讯中心 / 正文

25 分钟跑通 Jasminum:中文元数据抓取与 PDF 大纲书签的 Zotero 插件实操教程

25 分钟跑通 Jasminum中文元数据抓取与 PDF 大纲书签的 Zotero 插件实操教程【免费下载链接】jasminumA Zotero add-on to retrive CNKI meta data. 一个简单的Zotero 插件用于识别中文元数据项目地址: https://gitcode.com/gh_mirrors/ja/jasminumJasminum 是一个面向 Zotero 的中文文献插件解决三件事题录字段空缺、下载目录里的 PDF 无处挂靠、长论文翻不到目录。这篇实操教程带你从源码构建到三个核心功能全部跑通全程约 25 分钟不需要写代码。先看结果弄完之后你的 Zotero 长什么样装好插件后会出现的两帧典型画面先把预期对一下。第一帧是抓取任务的确认窗口。插件从文件名里解析出标题去数据源拉回一批候选题录按相似度排好序选中对的那条点「确认」作者、期刊、年份这些字段直接填进题录。第二帧是 PDF 阅读器里的书签面板。一篇没有内置目录的中文论文左侧多出一棵章节树点哪个标题就跳到哪一页下面的内容就是讲这两帧画面怎么变出来。自查清单这几类麻烦你碰上过几个先扫一眼勾中的条目对应哪个功能拖进库里的知网 PDF作者、期刊、期号一片空白题录建好了附件栏却是空的PDF 孤零零躺在下载目录四十页的论文没有书签找一节内容全靠滚轮中文作者被拆成了两条独立题录你看到的现象对应的功能操作入口题录字段空缺中文元数据抓取附件右键 → 茉莉花抓取PDF 孤悬在下载目录本地附件匹配条目右键 → 小工具 → 在下载文件夹中查找附件PDF 内部没有目录大纲书签PDF 阅读器左侧的书签按钮姓名被拆成多条姓名拆分与合并条目右键 → 小工具勾中两条以上后面基本都用得上。构建与安装三条命令出插件包前提只有一个装好 Node.js。剩下按顺序敲。第一步拉取源码git clone https://gitcode.com/gh_mirrors/ja/jasminum第二步进目录装依赖cd jasminum npm install第三步打包npm run build构建成功后build目录里会多出一个.xpi文件。打开 Zotero走「工具 → 插件」点齿轮图标里的「从文件安装」选中这个.xpi按提示重启。⚠️ 卡住排查npm install慢就先给 npm 换国内镜像源构建报错多半是 Node 版本太旧装 18 以上再试。重启后进偏好设置核对「当前位于中国大陆」的勾选状态和你的实际网络一致它决定数据源走哪条链路。装完顺手翻一下 README.md功能说明比这里更全。给只有文件名的 PDF 补齐题录使用场景手里有一批只靠文件名存活的 PDF没有对应题录。插件抓取靠的始终是一件事——从文件名认出标题。分步操作把 PDF 拖进 Zotero生成一个空壳题录在附件上点右键进「茉莉花抓取」选「抓取期刊元数据」书籍文件选书籍项任务窗口弹出后按相似度从上往下核对重点看来源类型和发表日期两列选定后点「确认」。同名文章常有期刊、会议、报纸好几个版本同时命中。相似度、来源类型、发表日期三项都能对上的那条基本就是正解。 命中率很大程度取决于文件名。下载文件命名随意的人要么把习惯改成「标题_作者」要么在偏好设置里把解析模板换成「智能识别」。验收信号确认后回到题录页作者、期刊、年份字段全部有值附件正常挂在题录下面。把下载目录里的 PDF 挂回对应条目使用场景用 Connector 抓中文期刊题录写入成功、附件下载失败的例子很常见。手动把 PDF 存进下载目录之后剩下的配对可以让插件代劳。分步操作在偏好设置的「本地附件查找设置」里把附件下载文件夹指到浏览器真实的下载目录回到条目上右键选「小工具 → 在下载文件夹中查找附件」插件扫完全目录按文件名与题录标题的匹配度排序列出候选文件选中对的那个确认导入。匹配成功后原始文件按你的设定走三条路之一处理方式结果无须处理原文件留在下载目录备份附件移入下载目录下的 jasminum-backup 文件夹删除附件原文件删掉Zotero 里已存一份 下载目录指对了这个功能才扫得到文件。处理方式选「删除附件」最省空间前提是确认导入的附件能正常打开。验收信号题录下多出附件子节点且能直接打开选了「删除」的话下载目录里那个文件已经不在。给长论文生成可跳转的目录树使用场景中文期刊的 PDF 普遍不嵌书签一篇五十页的长文找「4.2 节」得先数页码。分步操作双击打开 PDF在阅读器左侧边栏点茉莉花的书签按钮插件解析文本层后生成章节树。顶排五个按钮分别管展开全部、折叠全部、新增节点、删除节点、写回 PDF长文阅读用键盘更顺↑/↓在书签间移动←/→折叠展开空格改文字\加子节点[/]调层级Delete删节点。改完大纲记得点「保存到 PDF」把结构写进文件本身。⚠️ 两个常见坑扫描版 PDF 没有文本层解析结果是空的得先做 OCR书签默认只存在本地配置里换设备要用就得先写回 PDF。验收信号点任意章节标题视图直接跳到对应页码不用手动翻。进阶设置值得动一遍的五个选项偏好设置窗口界面定义见 addon/chrome/content/preferences-main.xhtml以下几项建议过一遍文件名解析模板默认「标题_作者」也支持自定义%t标题、%g作者、%y年份、%j其他信息分隔符自定。文件名风格混乱的人选「智能识别」兜底。自动抓取开关勾选后每次拖入中文 PDF/CAJ 都会自动发起抓取适合批量入库的人。元数据抓取来源知网默认开启万方、中华医学期刊按需勾选。数据源越多覆盖越广等待也越长。各数据源的实现集中在 src/modules/services/ 目录想加源可以从这里入手。大纲书签开关「启用大纲书签」是总开关如果 Zotero 自带大纲和书签面板互相干扰勾「禁用 Zotero 自带的大纲」。姓名工具「导入新条目时自动拆分姓名」解决入库即拆错的问题「拆分/合并姓名时包括英文名」决定英文名是否跟着处理。常见问题Q候选列表里期刊、会议、报纸都有怎么取舍A先看相似度排序再看来源类型是否和目标一致最后用发表日期交叉验证。三项都对得上再确认宁慢勿错。Q勾了自动抓取拖入 PDF 却没反应A按顺序查三处自动抓取开关是否打开、地区勾选是否与实际网络相符、文件名是否对得上当前解析模板。多数情况是文件名太随意先按「标题_作者」重命名再试。Q书签面板打开是空的A两个可能。一是「启用大纲书签」没勾二是 PDF 为扫描版没有可解析的文本层先做 OCR 再生成。Q改完书签没点「保存到 PDF」重启后还在吗A在。默认以本地配置形式保存随时打开都在「保存到 PDF」是额外把结构写进文件方便换设备或分享。收尾三步跑完整个闭环挑一篇只有文件名的 PDF走一遍元数据抓取把题录补齐把下载目录里落单的一个 PDF 用匹配功能挂回条目打开最长的那篇论文生成一次大纲顺手试一遍键盘跳转。三步走完库里的中文条目字段齐全附件各归各位长文自带目录。重复劳动交给插件你的时间留给读论文。【免费下载链接】jasminumA Zotero add-on to retrive CNKI meta data. 一个简单的Zotero 插件用于识别中文元数据项目地址: https://gitcode.com/gh_mirrors/ja/jasminum创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门