按明确标准评估模型
Rubric-Based Model Evaluation
用统一的评分标准和样本比较模型表现。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
比较两份事故摘要是否保留事实。教学输入为12:04发生测试失败,生产影响未知、原因未知;答案A保留未知,答案B写“数据库故障影响全部客户”。流畅度不能抵消新增事实。
具体做法
评估前固定同一输入、样本与量表:时间匹配、影响有依据、原因不被编造。每项输出pass/fail/unknown及支持句,先用代码或原文比对客观字段,再采纳模型对语义的判断。隐藏不相关模型标签,保留未能判断与平局;用人工标注样本检查评分偏差,另审查输出中的新增主张。
反例
凭感觉挑文笔更好的摘要,给模型B高分,不核对事故输入。
改进写法
对A与B按同一三项量表评估,引用各自时间、影响与原因句。核对原文:生产和原因未知,B新增数据库及全部客户应失败。给逐项理由和未决项,不把文笔总分当事实正确性。
为什么这样改
固定量表让评分判据显式,证据句让理由可挑战。客观核对与语义评估结合,可以避免模型凭流畅印象将无依据的事实奖励为高质量。
如何验证
教学A若正确保留三项,可在这些项通过;B的影响与原因失败。将A日期改错应触发时间失败;删除材料则相应项未知而非继续判断。比较模型评分与人工标签并记录分歧,结果不代表实际模型排名。
适用边界
评估模型可能偏好自身风格、较长回答或标签,需校准与反例。固定样本不能代表全部任务;通过量表也不证明输出无其他错误。冻结来源采用的PASS/FAIL协议不强制本例放弃未知状态。