拓冰建站拓冰建站
首页 / 资讯中心 / 正文

3 步在 Claude 和 Cursor 里直接对话上百页 PDF:PageIndex MCP 接入指南

3 步在 Claude 和 Cursor 里直接对话上百页 PDFPageIndex MCP 接入指南【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndexPageIndex MCP 把一套免向量数据库的长文档分析系统接进 Claude 桌面版和 Cursor它先把长 PDF 转成一层层带页码的目录树再由 AI 顺着树找章节让你直接在对话里查专业文档、引用原文出处。整个接入只需要 3 步。 它是怎么读长文档的目录树而不是切块传统 RAG 的做法是把文档切成一小块一小块转成向量存进数据库靠字面相似去猜你要找哪段——问题是相似不等于相关找到的段落经常对不上问题。PageIndex 走的是另一条路推理式 RAG。它先给整份文档生成一棵树状索引就像给人看的目录但每个节点都带章节标题、页码范围和一小段摘要检索时让模型看着这棵树逐层下楼从大的章节判断到小的子节最后只把真正相关的段落读出来。这套机制带来两个实际好处不切块文档保持原本的自然章节结构答案不会被拦腰切断。可追溯每次检索都能说清我为什么从第 3 章走到 3.2 节、答案在第 21~28 页结果不是黑盒里捞出来的。 接入步骤3 步完成 PageIndex MCP 配置整个准备过程只有三件事装完即可以挂到支持 MCP 协议的客户端里。第 1 步拿到代码git clone https://gitcode.com/GitHub_Trending/pa/PageIndex第 2 步装依赖pip3 install --upgrade -r requirements.txt要求 Python 3.8 以上。另外在仓库根目录建一个.env文件把你的大模型 API Key如 OPENAI_API_KEY放进去——建树和检索这两步都要调用大模型。第 3 步在客户端注册 MCP 服务器打开 Claude 桌面版的设置或 Cursor 的 MCP 配置面板在 MCP Servers 里添加 PageIndex MCP 服务器条目指向本仓库即可。核心运行参数都在 config.yaml 里默认模型、每节点最大页数、摘要开关等都可以直接改核心的建树逻辑在 page_index_classic.py想自己跑一遍也可以用仓库根目录的 run_pageindex.py 给任意 PDF 生成一份树索引看看效果。 一个索引两处可用Claude 与 Cursor 怎么用同一个 MCP 服务器两种打开方式Claude 里做长文档分析在对话中直接上传或指定一份 PDFPageIndex 负责建索引你负责提问——本季营收同比变化多少这条监管条款针对什么情形模型会先沿树索引定位章节再给出带页码出处的答案。适合几百页的财报、监管文件、学术论文。Cursor 里边写边查写代码时随时向文档要答案。比如查某个 API 的参数含义、某项配置在技术手册里的原文模型直接引用手册的章节和页码你不用切窗口去翻 PDF也不用担心引用的是差不多的段落。两边共享同一套树索引逻辑索引建好一次问答体验一致。 谁用得上它典型长文档场景PageIndex 的目标读者手里往往躺着这类文档金融与投资财报、SEC 文件、基金年报。项目在金融问答基准 FinanceBench 上达到 98.7% 的准确率远高于普通向量 RAG这是它最能打的场景。法律与合规监管条文、合同、政策文件——条款编号多、层级深恰好是目录树的结构强项。技术与工程产品手册、规范文档、教材章节多、交叉引用多人工翻目录比全局搜关键词靠谱。学术与医学长篇论文、教材需要跨章节综合信息时尤其受益。一句话文档越长、层级越多、越需要先定位再细读它的价值越明显。️ 两个让效果更稳的小技巧预处理保结构树索引的质量取决于文档层级能不能被正确识别。如果 PDF 是从其他格式转过来的、或者排版比较花建议先用 PageIndex 的 OCR 方案重新转一版再建树比直接解析更稳。按文档类型调参数max-pages-per-node和max-tokens-per-node控制每个索引节点装多少内容——文档章节细碎就把每节点页数调小章节粗大则调大。改 config.yaml 即可生效。至于建索引要花多久基本不是瓶颈下图是 PageIndex Flash 的实测数据上千页的文档建一棵完整树索引大约只需几分钟。想继续深入快速入门pageIndex_chat_quickstart.ipynb最小可跑的推理式 RAG 示例pageindex_RAG_simple.ipynb基于视觉的免 OCR 检索vision_RAG_pageindex.ipynb树检索策略教程tree-search多文档检索工作流doc-search现成的示例文档与生成的树结构examples/documents/上手最快的方式挑一份你真正在用的长文档跑一遍建树然后问一个只有翻到具体章节才能答上来的问题——答案越具体、出处页码越清楚这套 PageIndex MCP 接入就越值。【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门