LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

发布时间:2026/7/20 10:17:24
LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models 一、文章主要内容总结本文针对老挝语这类东南亚低资源语言缺乏大型综合评估基准的问题,提出了首个大规模、多维度的老挝语大语言模型评估基准LaoBench。该基准包含超过17,000个精心筛选的样本,分为开源(Lao-7k、Lao-500)和闭源(Lao-10k)子集,覆盖三大核心维度:知识应用(历史、政治、文化、科学等领域)、K12基础教育(贴合老挝国家课程的人文、自然科学等内容)、老挝语-中文-英语双语翻译(涵盖国际事务、文化历史等场景)。数据构建采用“专家人工编撰+自动化智能体验证”的严格流程,确保语言准确性、文化相关性和教育价值。闭源子集用于官方平台的黑盒评估以保障公平性和数据安全,开源子集支持社区参与和基准持续更新。通过对多款主流开源(如Qwen3系列、DeepSeek-V3.2-Exp)和闭源(如GPT-5-High、Gemini-2.5-Pro)大语言模型的评估发现:闭源模型整体表现优于开源模型,GPT-5-High在知识应用和K12教育维度表现最佳,Gemini-2.5-Pro在翻译任务中领先;思维链(CoT)提示能显著提升模型在复杂推理任务中的性能;当前模型在老挝语的领域知识理解、抽象推理和翻译流畅度上仍与人类水平存在较大差距,凸显了低资源语言建模的挑战。二、文章创新点首个老挝语大规模多维度基准:填补了东南亚低资源语言缺乏综合评估工具的空白,首次覆盖知识应用、基础教育、双语翻译三大核心场景,样本量超17,000个,兼具规模与深度。混合式数据构建与验证 pipeline:融合专家人工编撰(闭卷题)与L