拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Synthetic Cognitive Walkthrough: Aligning Large Language Model Performance with Human Cognitive W...

文章总结与翻译一、主要内容本文聚焦于利用大型语言模型(LLMs)自动化认知走查(CW)这一可用性测试方法,核心探索LLMs能否模拟人类在CW中的行为,以降低传统测试的成本和资源消耗。研究设计双角色LLM代理架构:设计了 facilitator(引导者)和 evaluator(评估者)两个AI代理,分别模拟CW中的研究人员引导角色和用户评估角色,通过迭代优化的提示词实现界面导航、思维外显和流程推进。两项对比研究:研究1:对比GPT-4、Gemini-2.5-pro与10名人类评估者在两款移动应用(语言学习类、旅行预订类)上的CW表现,从任务完成率、导航路径一致性、潜在失败点识别三个维度展开分析。研究2:探索通过额外提示词优化LLM对人类潜在失败点的预测能力,对比“有上下文”(LLM完整走查流程)和“无上下文”(仅单屏独立评估)两种模式的效果。核心发现LLM与人类的行为差异:LLM的任务完成率更高(GPT-4达100%,Gemini-2.5-pro达97.2%,人类为88.2%),导航路径更接近最优路径,步骤更少;人类评估者在不确定下一步时更倾向于广度优先搜索(探索性行为),且易受记忆误差影响;LLM则更理性,优先选择最可能的
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门