拓冰建站拓冰建站
首页 / 资讯中心 / 正文

PDF、Word、EPUB统统能摄入:LLM Wiki多格式文档解析与多模态图片描述实战

PDF、Word、EPUB统统能摄入LLM Wiki多格式文档解析与多模态图片描述实战【免费下载链接】llm_wikiLLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。项目地址: https://gitcode.com/gh_mirrors/ll/llm_wikiLLM Wiki 是一款跨平台桌面知识库工具能将 PDF、WordDOCX、EPUB 等多格式文档解析为自动组织、互相链接的 wiki并通过多模态图片描述让文档里的图表、照片变得可搜索、可引用。本文带你快速上手它的文档解析与图片处理全流程无需写一行代码。为什么是 LLM Wiki而不是每次现查的 RAG传统 RAG 每次提问都临时检索、临时回答LLM Wiki 的思路是“编译一次长期维护”LLM 读取你的原始文档增量地生成并持续更新一个持久化 wiki。核心是三层架构与三大操作Raw Sources原始来源你导入的文档只读、不可变WikiLLM 生成的 Markdown摘要页、实体页、概念页全部带sources[]溯源Schema规则约束页面结构与工作方式摄入采用“两步思维链”先分析实体、观点、与已有知识的冲突再生成 wiki 页面。一个文档通常能产出 10~15 个互相链接的页面。多格式文档解析一张表看懂支持范围格式解析方式说明PDF内置 Rust pdfium 抽取可选 MinerU 云 / 本地 API / 本地 Pipeline复杂版式、表格、公式推荐 MinerU失败自动回退内置解析DOCXdocx-rs标题、加粗/斜体、列表、表格 → 结构化 MarkdownPPTXZIP XML逐页slide抽取保留标题/列表结构XLSX / XLS / ODScalamine正确单元格类型、多工作表 → Markdown 表格EPUB / MOBI纯 Rust 电子书解析器书籍元数据、章节目录、正文拒绝加密 DRM 文件网页剪辑Readability.js Turndown.js一键剪藏去广告导航转干净 Markdown图片 / 音视频原生预览与内置播放器图片还可直接作为来源导入复杂 PDF 的进阶选项MinerU在设置 → MinerU PDF 解析器中可启用 MinerU 云端或自托管本地服务用于表格、公式和复杂版式的高质量解析。注意云端模式下 PDF 内容会上传敏感文档请选本地模式。该配置界面见 mineru-section.tsx完整规格见 multimodal-images.md。多模态图片描述让文档里的图也能被搜索这是 LLM Wiki 最出彩的环节之一——文档中嵌入的图片图表、示意图、截图、照片不再是“死图”而是可检索的知识提取预处理阶段从 PDF 逐页提取图片或直接从 PPTX/DOCX 的 ZIP 包读取ppt/media、word/media。默认过滤 100×100 以下的小图标/logo单文档上限 500 张实现见 extract_images.rs落盘图片按来源保存至项目wiki/media/来源slug/img-1.png并随来源删除级联清理TS 层调度逻辑在 extract-source-images.ts描述每张新图调用一次视觉 LLM提示词被精心固定为“事实性描述”——逐字记录可见文字、图表坐标轴与数值、图结构2~4 句禁止推测见 vision-caption.ts注入描述作为 alt 文本写回源 Markdown描述再交给摄入 LLM确保生成 wiki 页面时图片被就地保留而非丢弃可搜索描述是普通文本随页面走分块与向量检索——你直接搜“Q3 营收柱状图”也能命中那张图搜索结果附缩略图、灯箱预览并跳回来源省钱按图片 SHA-256 缓存描述.llm-wiki/image-caption-cache.json同一 logo 在 50 份 PDF 里出现也只调用一次模型缓存逻辑见 image-caption-pipeline.ts视觉模型支持 OpenAI、Anthropic、Google (Gemini)、Azure OpenAI、Ollama 及任意 OpenAI 兼容端点在设置 → 图片描述中开启开关并选择供应商multimodal-section.tsx。默认关闭——开启后每张新图消耗一次视觉调用预算敏感请先小规模试用。最快上手4 步完成摄入创建项目启动应用 → 新建项目选 Research / Reading / 通用等模板→设置中配置 LLM 供应商与模型开启图片描述设置 → 图片描述打开开关选好视觉模型可选启用 MinerU面对大量复杂版式 PDF 时开启并选云端或本地导入并观察来源 (Sources)中批量导入 PDF / DOCX / EPUBActivity 面板实时展示逐文件摄入进度随后用Chat提问、在Knowledge Graph中查看知识连接核心源码文件速查想深入看看它是怎么实现的可以直接打开这些文件多格式解析入口fs.rsPDF 文本抽取、ebook.rsEPUB/MOBI 安全解析图片提取extract_images.rs图片编排与 Markdown 注入extract-source-images.ts视觉描述vision-caption.ts、image-caption-pipeline.ts两步摄入主流程ingest.ts多模态设计规格multimodal-images.md小结LLM Wiki 把“读文档”变成了“记账”PDF、Word、PPT、Excel、EPUB 统统摄入为可交叉引用的 wiki 页面而多模态图片描述让图表里的坐标轴数值、截图里的文字都成为可检索的一等公民。开启视觉模型 按需启用 MinerU你的私人知识库就能自动长出来。【免费下载链接】llm_wikiLLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。项目地址: https://gitcode.com/gh_mirrors/ll/llm_wiki创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门