01-从第一性原理理解RAG-企业知识库为什么不能只依赖大模型

发布时间:2026/7/30 9:34:01
01-从第一性原理理解RAG-企业知识库为什么不能只依赖大模型 从第一性原理理解 RAG为什么企业知识库不能只依赖大模型系列从零构建企业 RAG 知识库第 1 篇1. 先拆开企业问答的真实需求企业并不是只需要一段“像答案的话”而是需要答案基于组织允许访问的资料资料更新后不必重新训练整个模型回答能说明来自哪份文档没有证据时拒绝猜测不同用户只能看到自己有权访问的数据。大模型的核心能力是根据输入 Token 和训练中学到的统计规律预测后续 Token。模型参数不是企业数据库也不会自动知道刚更新的制度更不能天然理解当前登录用户的数据权限。2. RAG 的第一性结构RAGRetrieval-Augmented Generation检索增强生成把任务拆成两个阶段Retrieval从外部知识中找出与问题相关、且用户有权访问的证据 Generation把问题和证据交给模型生成受证据约束的回答因此RAG 不是某个产品名称也不等于“向量数据库”。只要系统在生成之前检索外部资料并把结果用于约束回答就具备 RAG 的基本结构。3. 最小数据模型fromdataclassesimportdataclassdataclass(frozenTrue)classChunk:可检索的最小证据单元。chunk_id:strdocument_id:strtenant_id:strtext:strsource_title:strdataclass(frozenTrue)classSearchContext:权限信息必须来自可信登录会话。tenant_id:strallowed_document_ids:frozenset[str]tenant_id和allowed_document_ids不能由模型填写也不能从用户问题中推断。4. 先用确定性检索理解闭环下面不是生产级搜索而是一个可运行的关键词重合检索器。它帮助我们看清必须先过滤权限再计算相关性。importredefterms(text:str)-set[str]:教学分词提取英文单词、数字和连续中文字符。returnset(re.findall(r[A-Za-z0-9_]|[\u4e00-\u9fff],text.lower()))defretrieve(question:str,chunks:list[Chunk],context:SearchContext,top_k:int3,)-list[Chunk]:ifnotquestion.strip():raiseValueError(问题不能为空)ifnot1top_k20:raiseValueError(top_k 必须在 1 到 20 之间)query_termsterms(question)scored:list[tuple[int,str,Chunk]][]forchunkinchunks:# 权限过滤必须发生在候选进入结果之前ifchunk.tenant_id!context.tenant_id:continueifchunk.document_idnotincontext.allowed_document_ids:continuescorelen(query_termsterms(chunk.text))ifscore0:# chunk_id 作为稳定排序键保证测试结果可复现scored.append((-score,chunk.chunk_id,chunk))scored.sort()return[item[2]foriteminscored[:top_k]]5. 没有证据时必须拒答defbuild_grounded_prompt(question:str,evidence:list[Chunk])-str:ifnotevidence:return现有授权资料中没有足够证据请不要猜测。context_text\n\n.join(f[{item.chunk_id}] 来源{item.source_title}\n{item.text}foriteminevidence)returnf 你是企业知识库助手。 只能根据 evidence 回答不得使用无法从证据确认的事实。 回答中的关键结论必须引用对应 chunk_id。 证据冲突时说明冲突证据不足时回答“现有资料无法确认”。 evidence{context_text}/evidence question{question.strip()}/question .strip()Prompt 约束不能保证模型永远不幻觉最终还需要输出校验、评测和人工审核。6. 可复验测试deftest_permission_filter_happens_before_retrieval()-None:chunks[Chunk(c1,d1,tenant-a,退款期限为七天,A 租户制度),Chunk(c2,d2,tenant-b,退款期限为三十天,B 租户制度),]contextSearchContext(tenant-a,frozenset({d1}))resultretrieve(退款期限,chunks,context)assert[item.chunk_idforiteminresult][c1]assert三十天notinbuild_grounded_prompt(退款期限,result)deftest_no_evidence_refuses_to_guess()-None:promptbuild_grounded_prompt(董事长手机号是什么,[])assert不要猜测inprompt7. RAG 能解决什么不能解决什么RAG 能改善私有知识接入知识更新速度回答溯源一部分事实性幻觉查询前的数据权限过滤。RAG 不能自动保证检索一定召回正确文档文档本身没有错误或冲突模型一定忠实使用证据用户一定有权查看检索结果所有问题都适合用知识库回答。8. 对抗性审查文档内容同样是不可信数据可能包含 Prompt Injection权限过滤应在检索阶段完成不能生成后再删除不把整个企业文档库塞进上下文证据必须保留文档、页码或段落等来源元数据知识更新后要使旧索引和缓存失效高风险答案需要人工确认。9. 总结RAG 的本质不是“给大模型加数据库”而是把知识事实从模型参数中分离出来检索系统负责找到授权证据生成模型负责基于证据表达。企业知识库的可靠性来自两部分共同受控。