WeKnora 快速上手指南:5 分钟把散落文档变成能问答的知识库
WeKnora 快速上手指南5 分钟把散落文档变成能问答的知识库【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnoraWeKnora 是一个开源的 LLM 知识平台把原始文档变成可检索的 RAG 问答、自主推理的智能体和自维护的 Wiki。它解决的核心问题是——你的资料躺在各处搜不准问不倒还得靠人手工整理。从图中可以看到整体分层输入渠道层Web UI、API、IM 机器人→ 核心引擎层文档处理 RAG 问答 ReAct Agent→ 存储层PostgreSQL、向量库、Neo4j每个组件都可替换LLM、向量库、存储后端都能换成你自己的。它解决什么问题资料散落、搜不到、问不倒先说三个很常见的场景。一是资料散落各处产品文档在网盘操作手册在飞书FAQ 在 Wiki新人入职只能一个个翻。二是搜不到传统搜索靠关键词你问怎么改密码文档里写的是修改登录凭据搜不出来。三是问不倒好不容易搜到了还得自己读、自己拼答案跨多个文档的问题基本无解。WeKnora 把这三步合并成一条流水线输入是文档支持 PDF、Word、Excel、PPT、Markdown、图片等 10 种格式处理是解析 → 分块 → 向量化入库输出是能直接提问的对话入口回答还带可点击的引用点一下就跳回原文。这意味着你可以把整个部门的文档一次性喂给它之后无论是新人提问还是跨文档的复杂问题都有带出处的答案——而且部署在本地或私有云数据不出门。上图是智能问答界面回答正文里有引用角标点开引用抽屉能看到每条答案对应哪份文档检索的是知识库还是联网来源也做了区分。5 分钟跑起来最简部署路径前置条件只有 Docker 和 Git。完整命令在 README 的 Getting Started 章节跑通所需的最简步骤git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora cp .env.example .env docker compose pull docker compose up -d浏览器打开http://localhost即可注册一个账号会自动得到一个属于你的工作空间建知识库、选对话模型和向量模型本地 Ollama 或任意 OpenAI 兼容 API 都行上传文档等解析完成就能提问。想要知识图谱、对象存储、链路追踪这些可选组件加--profile参数即可比如docker compose --profile neo4j up -d启用知识图谱。这意味着你不需要改一行代码十几分钟就能有一个能回答自己文档内容的最小闭环。核心机制拆解分块和检索两条流水线机制一自适应三阶段分块。输入一份文档先跑一个文档分析器统计结构特征Markdown 标题数量、分页符、多语言章节标记等再从三档策略里选最合适的一档headingMarkdown 风格文档在#/##/###边界切每块还带上面包屑标题路径heuristicPDF 风格文档按分页符、编号章节切legacy递归切分兜底默认 512 字符、50 字符重叠用切菜的类比不是所有菜都切丁鱼片肉丝要区别对待auto模式就是先看看这是哪种食材再下刀。官方基准测试Vecta 2026-0250 篇论文里512 token 15% 重叠的递归切分拿到了 69% 端到端准确率是单项最优基线WeKnora 在此基础上叠加结构感知。详见 docs/CHUNKING.md。这意味着同一套配置能同时管好 FAQ、Markdown 文档和 PDF 报告不用为每类文档单独调参。机制二多路混合检索管线。一次问答请求进来后走的事件驱动管线是查询改写 → 并行检索BM25 关键词 密集向量→ 重排序 → 融合合并 → 截断 → 流式生成回答。类比一下不是让一个图书管理员去找书而是派多个渠道同时找关键词查、语义查再请一个裁判重排模型把最相关的排前面最后才交给 LLM 作答。上图展示了数据准备、查询检索、生成响应三个阶段的整体流程。这条管线还支持断线续传生成结果走独立的 StreamManager页面刷新或网络抖动后可以从断点继续读。这意味着即使你的问题措辞和原文不一致靠向量这一路也能捞回来而重排把噪声压下去答案的出处更靠谱。一个真实场景走一遍上传产品手册问操作问题按 快速上手文档 的完整流程走一遍每一步都能在仓库文档里找到对应截图。给什么一份产品手册 PDF加一个可用的对话模型 向量模型。项目做什么上传后文档异步解析状态依次是pending → processing → finalizing → completed列表页实时刷新进度解析即分块按该知识库配置的策略切片并生成向量索引。解析完成后进对话页选上这个库直接提问。得到什么一条带引用角标的回答。点角标跳到原文对应位置可以逐条核对答案出处。如果要更复杂的问题对比 A 和 B 两种配置的区别切到智能推理 Agent它基于 ReAct 架构自己决定检索几轮、要不要联网、要不要调工具。到这里从一份 PDF到能问答、带出处的最小闭环就完整了。值得调的几个参数config.yaml 里的三个旋钮默认配置在 config/config.yaml以下三个最值得先看knowledge_base: chunk_size: 512 # 分块大小 chunk_overlap: 50 # 块间重叠 conversation: embedding_top_k: 30 # 向量检索取回条数 rerank_threshold: 0.3 # 重排准入阈值调优方向依据 docs/CHUNKING.md 的设置参考表chunk_sizeFAQ / 原子问答建议 200–400叙事长文 1000–2000一般文档保持 512chunk_overlapFAQ 和结构化记录可以设 0论证跨块的长文给 150–200rerank_threshold答案精度优先就调高召回优先就调低并配合更大的embedding_top_k注意一点向量模型建库后不建议更换换了要重建索引初始化向导里也做了限制。适合谁以及下一步一句话选型建议如果你需要把私有文档变成可问答的知识库且要求数据留在自己手里WeKnora 是目前少数能同时覆盖 RAG 问答、Agent 推理和 Wiki 三种形态的开源方案。接下来按你的诉求挑扩展方向即可接飞书 / Notion / 语雀 / RSS 自动同步文档把问答接到企业微信、飞书等 IM 里或者用官方 MCP Server 把 29 个工具挂给你的编程助手。更远的规划——Lite 轻量化版本、语义分块、时序知识库——见 docs/ROADMAP.md完整文档在 website-docs/。克隆下来跑一遍从你自己的第一份文档开始问起来。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考