拓冰建站拓冰建站
首页 / 资讯中心 / 正文

MerchantOps-KBQA 实践(十二):RAG 评估集、expected_source 与 Bad Case

RAG 评估不应只看“回答读起来像不像”。对于商户运营知识库更先要确认系统是否进入正确领域、是否引用正确版本、是否在知识不足时拒答。一、评估数据项目维护 10 条评估问题、5 个 Bad Case 和 5 份 Runbook五个知识领域各有可验证样本。每条问题记录expected_source用于检查 Metadata 过滤和来源引用。二、校验内容GET /api/assessment和离线校验器检查字段完整性、预期领域、Bad Case 编号与 Runbook 覆盖。它们验证数据和链路是否自洽不把静态样本结果包装成线上准确率。三、典型 Bad Case过期规则提示人工确认最新版本。相似门店混淆不能把其他对象的资料带入答案。缺少周期或口径的指标问题不能擅自推导结论。先用 Bad Case 暴露边界再决定是否调整阈值或文档是比盲目追求“回答更多”更稳妥的迭代方式。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门