淘天二面被问:RAG怎么做Bad Case分析,面试者说:统计指标,比如准确率、召回率,通过这些指标发现问题。面试官笑了一下,没接话...

发布时间:2026/7/28 0:07:48
淘天二面被问:RAG怎么做Bad Case分析,面试者说:统计指标,比如准确率、召回率,通过这些指标发现问题。面试官笑了一下,没接话... 我的一个本科的师弟上周去面了阿里做大模型应用的是二面。聊了大概半小时吧聊了RAG架构聊了chunk策略还聊了向量数据库的选型。他自己感觉聊得还挺顺的。然后呢面试官突然就抛出了一个问题“你们平时怎么做Bad Case分析的”师弟心里想这不就是送分题嘛张口就来“我们会统计一些指标比如准确率、召回率通过这些指标发现问题。”说完他自己其实都有点心虚了——因为面试官笑了一下嘛也没接话然后就追问了一句“召回率低你怎么知道是检索的问题还是排序的问题”师弟当场就卡住了。后面呢又被追问了两三个问题基本上是层层递进地把他那个是什么都知道一点但没有一个说得深的底裤给扒了个干净。面试完他跟我吐槽复盘了很久越想越觉得后背发凉。这个问题看起来挺简单的但实际上呢它是一道筛选简历水分的题。而他呢交出来的是一份典型的水分答案。今天就把师弟这次社死现场给整理成一篇文章希望能帮大家避个坑吧。✦ ✦ ✦一、师弟的答案到底错在哪先说结论哈。这个回答不算错但是它就是正确的废话。“统计准确率、召回率发现问题”——这句话本身确实没毛病嘛。但是呢它只回答了知道要看指标这个问题完全没回答具体怎么做这个更关键的问题。这就好比什么呢就好比面试官问你怎么排查一个线上bug你回答看日志找问题。听起来是对的但等于没说一样。那面试官真正想考察的是什么呢其实就是要看你有没有去拆解过RAG这条链路看你知不知道一个bad case可能出在哪个环节以及看你有没有真正动手去排查过。而不是说停留在那个整体指标的上帝视角上面。事后我俩一起复盘了一下像这种回答方式呢通常会暴露出这么几个问题。大家可以对号入座一下做好扎心的准备哈。1. 只谈指标不谈拆解RAG不是一个黑盒模型它其实是一条链路。这条链路大概是这样的查询理解然后到检索召回然后到排序或者重排然后到上下文拼接最后才是生成。这里面任何一环出了错呢都可能导致最终的答案不理想。而准确率“召回率这类整体指标呢它们只能告诉你效果不好”但是完全没法告诉你到底哪里不好。面试官那一句召回率低你怎么知道是检索还是排序的问题他其实是在问什么呢他是在问你有没有分环节排查的方法论。而师弟当时的答案里呢根本就没有环节这个概念所以自然就被一问就倒了。2. 潜台词里透露出甩锅模型的思维事后想想哈如果让师弟继续往下答的话他大概率会说出效果不好可能是模型能力不够这种话。这个呢其实就是排查bad case的时候最容易犯的一种懒惰归因。真正做过的人都知道这么一个事儿就是RAG系统里面大多数bad case呢它其实是出在检索和知识库这个层面的而不是生成模型本身的问题。你上来就怪模型这个是没有工程经验的表现。3. 没有提人工看中间结果这种最朴素的手段指标是抽象的嘛但是出问题的往往是具体的某一条数据。那真正靠谱的排查方式是什么呢其实就是把改写后的query、召回的chunk、还有拼接进prompt的完整上下文一步步地给打印出来然后用肉眼去看到底是哪一步开始跑偏的。这个呢是最基本也是最有效的手段。但是师弟当时完全没提到这一点。4. 没有具体案例面试官后来问他能举个例子吗师弟举的例子非常空洞。他是这么说的“比如用户问了个问题系统答错了我们就去分析。”——这种例子就等于没举嘛。具体错在哪里、怎么去验证、怎么去修的一个都没有。✦ ✦ ✦二、如果重新回答一次应该怎么说复盘之后呢我和师弟一起把正确答案给整理成了一套可以直接在面试里说出来的框架。这里分享给大家。第一步先说清楚为什么要做建立认知框架“整体指标只能告诉我们效果好不好但没法告诉我们坏在哪、怎么修。所以呢我们会针对具体的bad case做逐环节的排查。”就这一句话呢就能让面试官知道你脑子里是有一条完整的RAG链路的而不是把它当成一个黑盒。第二步讲清楚具体的排查顺序RAG的排查呢它本质上是一个漏斗式的过程。你需要按顺序去检查这些环节环节排查内容查询理解query改写或者拆解有没有偏离原意检索召回相关文档到底有没有被召回回来排序/重排召回来了但是排名够不够靠前能不能进入送给LLM的那个上下文上下文拼接最终喂给LLM的prompt内容是不是完整的格式是不是正确的生成模型有没有正确利用给到它的内容有没有出现幻觉、答非所问的情况这一步呢是整个回答的核心。它能体现出你到底有没有真正定位问题的能力而不是停留在那个看指标的表层。第三步讲清楚怎么归类、怎么排优先级你要对每个bad case去打标签比如说这是检索问题呢还是排序问题呢还是生成幻觉呢还是知识库质量问题呢还是意图识别错误呢。然后去统计一下各类问题的占比优先去解决那些高频而且影响大的问题。这个体现的是什么呢这个体现的是一种工程化的思维。而不是说碰到一个就修一个的那种救火式排查。第四步讲一个具体、有细节的例子这一步呢是最容易拉开差距的地方。我举个师弟复盘时想到的真实例子吧用户问“我今年请了几天年假还剩多少” 系统回答“根据公司规定员工每年可享受10天带薪年假。”这是一个典型的答非所问。用户问的是我个人还剩多少他需要去查个人请假记录的。但是系统呢把它当成了公司年假政策来检索了。排查下来发现什么呢发现检索和生成环节其实都没问题问题出在最上游的查询理解或者意图识别上面。系统没有去区分知识库问答和需要查询个人数据的业务问题这属于典型的路由缺失。这种例子的价值在哪里呢它的价值在于具体。具体到问题是什么、答案是什么、错在哪个环节、怎么去验证、怎么去修一步都不能少。面试官问你举个例子他考察的就是你有没有真的动手做过而不是编一个笼统的故事来糊弄。第五步提一句沉淀机制“修复验证过的bad case呢我们会把它沉淀成固定的回归测试集防止后面换模型、调prompt的时候老问题又复现出来。”这一句话虽然不长但是它能体现出一种闭环意识。很多人排查完bad case就觉得结束了嘛但是成熟的工程实践一定会去考虑一个问题那就是怎么去防止同样的问题再次发生。✦ ✦ ✦三、写在最后这次面试对师弟来说呢其实是个挺好的教训。很多看起来像是送分的问题呢它恰恰就是筛选真实经验和背过八股的一个分水岭。“统计准确率、召回率这种回答呢不是错而是太浅了。它是一个合格的开场白但如果没有后续的分环节排查方法论和具体案例”就很容易被面试官一句追问给打回原形。如果你也即将面对类似的问题呢不妨提前把自己遇到过的bad case在脑子里过一遍。它错在哪个环节你是怎么去验证的怎么去修的修复之后你们有没有做什么防止它再犯的事情把这几个问题想清楚了比背十个术语都管用。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】