evaluation

测试与评估

P26

用证据支撑结论

Evidence Chain / Proof-of-Work

测试与评估

每个结论都指向实际检查过的证据,并说明哪些部分尚未验证。

P27

制定具体的评分标准

Scoring Rubrics

测试与评估

在评分前写清各档分数的依据,以及什么结果需要采取行动。

P28

先检查自己的草稿

Self-Critique

测试与评估

展示结果前,按明确的错误类型检查并修正草稿。

P47

用证据说明评审发现

Evidence-First Review

测试与评估

报告缺陷时写清触发条件、执行路径和实际后果。

P48

按 YAML 规则清单评审

Rule-Catalog Review (YAML)

测试与评估来源未确认

逐项核对规则清单,记录具体违反了哪条规则。

P107

让新 Agent 试读文档

Reader Testing with Sub-Agent

测试与评估

检查没参与之前讨论的读者能否独立理解文档。

P108

隐藏版本身份做 A/B 对比

Blind A/B Comparison

测试与评估

在相同任务上比较两个版本的输出,不向评估者透露版本身份。

P115

用 QA Agent 检查实际页面

QA Sub-Agent with Visual Verification

测试与评估

交付前渲染产物,检查用户实际会看到的内容。

P158

计划要求的缺陷也要报告

Plan-Mandated Defect Is Still a Finding

测试与评估

即使缺陷来自原计划,评审也应指出问题并解释影响。

P160

评审时复用有效测试证据

Reviewer Does Not Re-Run the Implementer's Tests

测试与评估

现有证据有效时不重复测试,有具体疑点时只检查相关部分。

P175

区分工具执行的三种状态

Tool-Ran Tri-State Provenance

测试与评估

区分工具是否存在、可运行及实际运行,并另记执行结果和任务覆盖。

P198

分别检查标准与需求

Two-Axis Orthogonal Review (No Cross-Axis Reranking)

测试与评估

按两个独立维度评审,不用其中一个维度的结果改变另一个的排序。

P204

无法安全运行时追踪代码路径

Static-Trace Verification When Execution Is Unsafe

测试与评估

执行会有风险时,通过静态追踪验证行为,并说明验证局限。

P227

按承诺的交付类型评分

Grade the declared artifact kind

测试与评估

交付可执行产物和交付对话说明,需要不同的评分证据。

P233

用实际使用方验证产物

Validate the consumer interpretation

测试与评估

本地宽松的读取器通过,不代表真正接收产物的工具也能接受。

P237

按完整预期结果核对评分

Bind grader results to the full expectation set

测试与评估

确认评分对应正确样本,再按全部预期项重新计算总分。

P238

同时评审代码和通过标准

Review changes to the quality bar itself

测试与评估

检查验证器是否被放宽,避免靠降低要求让测试通过。

P242

以实测基线逐步提高要求

Measured baseline ratchet

测试与评估

不使用会让现有基线必然失败的任意目标,先保证实测表现不退步。

P244

排除正常波动后再判断改进

Noise-aware intervention comparison

测试与评估

在相同条件下比较单个变化,只有差异超过正常波动才认为有效。

P252

条件没变化时复用验证结果

Reuse verification until its assumptions change

测试与评估

只有相关代码或基线假设变化后,才重跑已经通过的检查。

P257

区分生成波动与评分波动

Separate build variance from scoring variance

测试与评估

分别测量每次生成产物的差异,以及对同一产物重复评分的差异。

P259

根据具体结论提出核验问题

Concrete, intent-aware verification prompts

测试与评估

问题应对应真实的结论和假设;用户已经要求核验时直接执行。

P266

检查 Agent 操作后的实际环境

Grade the environment left by an agent

测试与评估

任务会改变环境时,应评分最终状态;对话记录用于检查过程要求。

P269

说明评测参考答案的来源

Record the origin of evaluation references

测试与评估

标明答案是独立核验的,还是由参与比较的系统生成的。

P273

确认最终组合配置能工作

Confirm the selected configuration as a whole

测试与评估

分步选择多个设置后,用新运行验证最终组合,并沿用预先确定的标准。

P274

优化无效时先定位失败层

Classify the failing layer when optimization stalls

测试与评估

连续改写没有改善结果时,先判断问题在哪一层,而非继续堆指令。

P275

从真实应用入口进行评测

Evaluate the real application entry point

测试与评估

走应用实际的上下文组装、工具路由和重试路径,而非只复刻最终请求。

P283

汇总前区分增量与累计计数

Establish counter semantics before totals

测试与评估

先确认指标是本次增量还是累计读数,避免重复计入总数。

P294

页面之间要有动作和状态衔接

Successor screens require an action and carried state

测试与评估

把多屏设计当作完整用户旅程,检查触发下一屏的动作与传递的数据。

P301

避免版式泄露测试答案

Remove presentation answer cues

测试与评估

让不同选项的呈现方式保持一致,避免从布局看出正确答案。

P320

在真实环境中比较设计方案

Compare structural variants in shared context

测试与评估

把方案放到实际使用环境里比较,并保持测试数据一致。

P335

知道答案后的描述不算独立验证

Conditioned Description Is Not Independent Validation

测试与评估

评分者已看到被测答案时,应标为有条件的描述,不能当成独立佐证。

P352

说明测量到底统计了什么

Measurement Unit and Scope Boundaries

测试与评估

先声明计数单位和范围,再用结果支撑其他资源或行为方面的判断。

P387

按用户旅程比较同类产品

Persona-grounded peer benchmarking

测试与评估

先确定用户和起止边界,再比较步骤与证据;估算、未知和待选择目标分别记录。

P388

试验前固定次数和判定规则

Predeclare trials and verdict rules

测试与评估

随机评测开始前固定样本和尝试次数,并保留每次计划内的结果。