如何把 arXiv 论文变成可查询知识图谱:graphify /graphify add 完整实战流程
如何把 arXiv 论文变成可查询知识图谱graphify /graphify add 完整实战流程【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify如果你平时要读大量 arXiv 论文大概率被一个问题困扰论文看完就忘概念之间的关联全靠脑子记。开源项目graphify解决的正是这个问题——它能把你的代码库、文档、SQL 配置、PDF 和论文一起变成一个可查询的知识图谱本地 tree-sitter AST 解析、每条边都解释得清楚、不依赖向量数据库。而其中最实用的一招就是/graphify add命令一条命令抓取 arXiv 论文自动并入图谱。本文带你完整走一遍这条流程。先认识 graphify它和普通论文管理工具有什么不同特性说明本地确定性解析代码用 tree-sitter AST 解析无 LLM、不出机器每条边都有解释边被标记为EXTRACTED源文件里明确存在或INFERRED图谱解析推断不是向量索引没有 embedding是真正可遍历的图支持提问、追踪两概念间最短路径它的三大处理流程详见 docs/how-it-works.md 中的设计说明Pass 1 代码结构本地 AST 解析免费、无 API 调用Pass 2 音视频本地 faster-whisper 转写同样不出机器Pass 3 文档/论文/图片用你 AI 助手的模型做语义抽取论文摘要就属于这一步论文抓取逻辑的核心实现在 graphify/ingest.py 中它会自动识别 arXiv 链接抓取标题、作者和摘要。三步准备环境前提条件Python 3.10推荐用uv或pipx。# 第 1 步安装 CLIPyPI 包名是双 y 的 graphifyy uv tool install graphifyy # 第 2 步把技能注册给你的 AI 助手Claude Code、Cursor、Codex、Gemini CLI 等 graphify install # 第 3 步在 AI 助手里对目录跑一次建图 /graphify .运行完成后会生成三个文件graph.html浏览器打开可点击交互、GRAPH_REPORT.md图谱报告、graph.json完整图数据后续随时查询。 安装后如果提示graphify: command not found运行uv tool update-shell再开一个新终端即可。/graphify add 抓取 arXiv 论文的完整流程在 AI 助手中直接输入/graphify add https://arxiv.org/abs/1706.03762以 Transformer 那篇经典论文Attention Is All You Need为例graphify 会自动完成四件事第 1 步识别 URL 类型。内置逻辑见graphify/ingest.py中的_detect_url_type检测到arxiv.org走 arXiv 专用抓取路径。第 2 步抓取摘要与元数据。从 arXiv 页面提取标题、作者列表和摘要正文。第 3 步落盘为带元信息的 Markdown。文件保存到语料目录默认./raw文件名形如arxiv_1706_03762.md内容大致长这样--- source_url: https://arxiv.org/abs/1706.03762 arxiv_id: 1706.03762 type: paper title: Attention Is All You Need paper_authors: Vaswani, Ashish; Shazeer, Noam; ... --- # Attention Is All You Need **Authors:** ... **arXiv:** 1706.03762 ## Abstract ...第 4 步自动更新图谱。技能文档graphify/skills/claude/references/add-watch.md要求抓取成功后立即对语料目录跑增量更新新论文节点会并入现有图谱无需手动重建。整个过程大约几十秒且论文抓取本身不需要任何 API key。抓取之后把论文问起来图建好之后你就开始查图而不是读文件了graphify query what connects attention to the optimizer? # 用自然语言提问 graphify explain Attention # 解释某个概念 graphify path Attention PositionalEncoding # 追踪两个概念的最短路径论文里的自注意力、位置编码会变成图中的节点和你代码里的对应实现连成边。graphify 仓库自带了这个场景的完整案例worked/karpathy-repos/README.md 展示了 3 个代码仓库 5 篇 arXiv 论文包括 1706.03762、FlashAttention 等组成的语料最终得到约 285 个节点、17 个社区每次查询比直接读 52 个原始文件节省 71.5 倍 token。进阶玩法不只是 arXiv/graphify add对多种链接自动识别一条命令通吃链接类型处理结果arXiv抓取摘要 元数据存为.mdYouTube / 视频 URL用 yt-dlp 下载音频本地转写成.txtTwitter/X 推文抓取推文内容和作者存为.mdPDF 直链直接下载.pdf图片链接下载后由模型做视觉抽取任意网页转成 Markdown 入库还可以给语料打标签方便团队区分谁加的/graphify add https://arxiv.org/abs/2205.14135 --author Vaswani --contributor 你另外--watch模式可以后台监听语料目录代码文件变更会自动重建图谱论文/文档变更则提示你跑一次/graphify --update适合长期维护论文库的场景。新手常见问题Q不加--author会有什么影响不影响功能只是元数据里的贡献者字段会记为unknown方便日后溯源。Q抓多篇论文怎么组织把语料集中在一个目录比如./raw每加一篇都自动增量并入定期跑/graphify ./raw --update只重抽有变化的文件未改动文件走 SHA256 缓存直接跳过不花重复成本。Q想要完整仓库自己跑一遍克隆仓库https://link.gitcode.com/i/312dae422eb1884dc10d5efed8f7acd1worked/目录下每个文件夹都保留了原始输入和真实输出GRAPH_REPORT.md、graph.json可以直接复现验证。总结graphify 的/graphify add让读论文变成了一条流水线粘贴链接 → 自动抓取摘要 → 并入知识图谱 → 用自然语言追问。没有向量库、没有黑盒每条关系都能解释。装好只需两行命令第一次抓论文只需一条/graphify add值得每个经常泡在 arXiv 上的工程师试试。【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考