AI 评测系列(03):LLM-as-Judge——让 LLM 评价 LLM 的正确姿势

发布时间:2026/7/21 22:17:11
AI 评测系列(03):LLM-as-Judge——让 LLM 评价 LLM 的正确姿势 LLM-as-Judge 的工作原理LLM-as-Judge 把一个 LLM 的输出质量评估任务,交给另一个(或同一个)LLM 来完成。基本形态有两种:单答案打分(Pointwise)JUDGE_PROMPT="""评估以下 AI 回答的质量(1-10分): 维度:准确性、相关性、清晰度 问题:{question} 回答:{answer} 返回 JSON:{ {"accuracy": int, "relevance": int, "clarity": int}}"""两答案对比(Pairwise)COMPARE_PROMPT="""下面两个回答中哪个更好? 问题:{question} 回答 A:{answer_a} 回答 B:{answer_b} 只回答 "A" 或 "B"。"""Pairwise 更适合比较两个版本的优劣(如 Prompt A vs Prompt B),Pointwise 更适合监控单个系统的质量趋势。三个实验:偏见有多严重实验 1:位置偏见实验设计:同一对答案,评测两次——第一次 A 排第一、第二次 B 排第一。无偏见时,胜者应该与顺序无关,第一位置胜率应接近 50%。defexperiment_position_bias():forpairinanswer_pairs:winner_order1=judge_pairwise(question,answer_a,answer_b)# A firstwinner_order2=judge_pairwise(question,answer_b,answer_a)# B first# 如果无偏见,winner_order1 == winner_order2 的概率应该是 100%实验结果:第一位置胜率: 67% (无偏基线: 50%) 第二位置胜率: 33% 一致率: 67% (