拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何用 LiteParse 做文档搜索:searchItems 实战完全指南

如何用 LiteParse 做文档搜索searchItems 实战完全指南【免费下载链接】liteparseA fast, helpful, and open-source document parser项目地址: https://gitcode.com/GitHub_Trending/li/liteparseLiteParse 是一款开源、快速的本地文档解析器能把 PDF、DOCX 等文档解析为带坐标信息bounding box的结构化文本。它内置的searchItems函数让文档搜索变得异常简单不只是告诉你找到了还能告诉你关键词出现在哪一页、哪个位置并且能自动拼合被拆碎的相邻文本片段。本文带你用 3 个简短示例快速掌握 LiteParse 文档搜索的完整玩法。为什么 searchItems 适合做文档搜索普通搜索只能返回有没有这个词而文档场景经常需要知道这个词在哪里。LiteParse 的搜索能力解决三个痛点定位坐标每个文本片段TextItem都带x、y、width、height坐标搜索结果直接给你合并后的精确包围盒方便在页面上高亮或做引用溯源跨片段匹配PDF 引擎常把一句话拆成多个碎片比如 T-Shirt 和 XL 可能是两个片段searchItems会自动把相邻片段拼接后再搜索避免明明有却搜不到多语言同构Python、Node.js/TypeScript、浏览器 WASM 三种环境提供的 API 完全一致写一次思路到处用。核心实现非常轻量源码在 search.rs配套的单元测试覆盖了跨片段匹配、大小写、多结果等边界场景。Python 快速上手三步搜索收据金额以图中的收据为例想在里面找出GROSS或T-Shirt的位置只需三步from liteparse import LiteParse, search_items parser LiteParse() result parser.parse(receipt.pdf) for page in result.pages: matches search_items(page.text_items, T-Shirt) for m in matches: print(f第 {page.page_num} 页: {m.text} 位置({m.x:.0f}, {m.y:.0f}))search_items接收该页的text_items列表和要搜索的词返回一组合并后的文本项——text字段就是你的关键词坐标则是合并后的整体包围盒。Python 端封装见 parser.py#L892-L926。几个新手容易踩的点情况行为大小写不同搜t-shirt默认不区分大小写照样能命中关键词跨两个文本片段自动拼接相邻片段返回一个合并结果关键词出现多次返回多条结果每个都带独立坐标传空字符串返回空列表不会误匹配全部内容TypeScript 用法与 Python 完全对称Node.js 端导出的是同名风格的searchItems接受一个选项对象import { LiteParse, searchItems } from llamaindex/liteparse; const parser new LiteParse({ outputFormat: json }); const result await parser.parse(receipt.pdf); for (const page of result.pages) { const hits searchItems(page.textItems, { phrase: SUM, caseSensitive: false, }); hits.forEach((h) console.log(Found at (${h.x}, ${h.y}) ${h.width}×${h.height}), ); }注意 Node 端绑定使用驼峰命名textItems、pageNum而 Python 用蛇形命名text_items、page_num。Node 端封装在 lib.ts#L985-L995类型声明可看 native.d.ts。浏览器场景则通过 WASM 版本获得同样的searchItems函数见 lib.rs#L1544-L1566无需任何服务端即可在页面里完成文档搜索。进阶技巧把搜索结果变成可视引用搜索的终极价值是可视化定位。因为坐标单位是 PDF 点1/72 英寸原点在页面左上角只要在生成页面截图时按dpi / 72的比例换算就能在截图上精确画出关键词的高亮框——这正是 RAG 和 AI Agent 做引用溯源的标准玩法const SCALE dpi / 72; // 例如 150 DPI 时约 2.08 const pixelX match.x * SCALE; const pixelY match.y * SCALE;官方指南提供了完整的搜索 截图 高亮工作流推荐阅读visual-citations.mdx。几个实用建议整段定位想高亮整个段落或表格而非单个词解析时开启extract_blocks每个块自带覆盖所有行的bbox免去手动拼接坐标归一化JSON 里每页的width/height也是 PDF 点除以它即可把坐标转成百分比截图与解析用同一 DPI默认都是 150 DPI保持一致才能精准对齐。小结LiteParse 的searchItems把文档搜索 精确定位压缩成了一个纯函数输入文本项列表和关键词输出带合并坐标的匹配结果。无论是 Python 脚本、Node.js 服务还是浏览器端三行代码就能让搜索命中直接落到页面上的具体位置。配合截图与高亮你就能轻松构建带可视引用的文档问答系统。更多输出格式、批量解析等能力可参考 README.md 与 集成测试。【免费下载链接】liteparseA fast, helpful, and open-source document parser项目地址: https://gitcode.com/GitHub_Trending/li/liteparse创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门