评估题解别把样例通过当成有效性
评估题解别把样例通过当成有效性样例通过只说明少量公开输入能运行。评估题解时要把解析、编译、功能测试、资源限制和端到端任务完成度分别记录否则无法知道失败来自模型、测试集还是运行环境。静态分析可以检查语法与部分危险结构但不能证明算法正确。隔离运行用于检查真实执行行为测试集应包含边界、随机对拍与已知反例。端到端评估还要看用户问题是否得到正确回答而不是只看代码退出码。type Evaluation struct { Parsed, Compiled, Tested bool FailureStage string }随机测试必须设置种子并保存失败输入才能复现资源限制、编译器版本和镜像版本也要进入报告。任何通过率、延迟或内存结论都应附带这些条件。分层评估的价值是定位与改进不是生成漂亮总分。发现失败后优先补充反例、修复提示或缩小适用范围。报告里还应保留每个阶段的原始状态而不是只给一个“通过/失败”。例如编译失败就不应被记为算法错误资源超限也不等同于解析错误。评估口径稳定后版本之间的差异才可比较否则一次换镜像或换题集就足以让结论失去参照。