Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
文章总结与翻译一、主要内容本文聚焦大型语言模型(LLMs)在多轮交互中的答案不稳定性问题,通过实验与建模展开深入研究:实验设计:选取Gemini 1.5 Flash、GPT-4.1-nano、Claude 3.5 Haiku等模型,在MMLU、MathQA等4类涵盖不同难度与领域的数据集上,采用"Think again"(TA)、“Are you sure?”(RUS)、“You are wrong”(URW)三类简单跟进提示,以及语义等价的改写问题提示,进行多轮(最多10轮)询问实验。核心发现:多轮提示会导致模型准确率显著下降,URW这类对抗性提示影响最显著,Gemini 1.5 Flash在TA提示下9轮准确率下降约10%,Claude 3.5 Haiku在改写问题+TA提示下下降7.5%;马尔可夫链能有效建模多轮交互中的准确率动态变化,模型最终会收敛到低于初始准确率的稳态准确率(平均比首轮低8%左右);线性探针可通过模型隐藏状态预测未来答案变化,早期网络层已存在预测信号,TA提示下预测效果更稳定。控制实验验证:排除模型疲劳等干扰因素,证实准确率下降主要由提示压力导致。二、创新点首次系统探究无新证据情况下,简单跟进提示与语义改写提示对LLMs多轮答案稳定性的影响,覆盖多模型、多数