用证据支撑结论
Evidence Chain / Proof-of-Work
每个结论都指向实际检查过的证据,并说明哪些部分尚未验证。
Evidence Chain / Proof-of-Work
每个结论都指向实际检查过的证据,并说明哪些部分尚未验证。
Scoring Rubrics
在评分前写清各档分数的依据,以及什么结果需要采取行动。
Self-Critique
展示结果前,按明确的错误类型检查并修正草稿。
Dual-Model Adversarial Planning
让两个模型分别提出和挑战方案,保留有依据的分歧。
Evidence-First Review
报告缺陷时写清触发条件、执行路径和实际后果。
Rule-Catalog Review (YAML)
逐项核对规则清单,记录具体违反了哪条规则。
Rubric-Based Model Evaluation
用统一的评分标准和样本比较模型表现。
Reader Testing with Sub-Agent
检查没参与之前讨论的读者能否独立理解文档。
Blind A/B Comparison
在相同任务上比较两个版本的输出,不向评估者透露版本身份。
QA Sub-Agent with Visual Verification
交付前渲染产物,检查用户实际会看到的内容。
Plan-Mandated Defect Is Still a Finding
即使缺陷来自原计划,评审也应指出问题并解释影响。
Diff-Scoped Review with Named-Risk Escape Hatch
把范围限制在变更内容;需要扩大范围时说明具体风险。
Reviewer Does Not Re-Run the Implementer's Tests
现有证据有效时不重复测试,有具体疑点时只检查相关部分。
Reachability-Scoped Delta
按当前路径可访问的内容界定变更范围。
Tool-Ran Tri-State Provenance
区分工具是否存在、可运行及实际运行,并另记执行结果和任务覆盖。
Differential Baseline-Equivalence Oracle
通过差分比较判断新旧实现是否保留了要求的行为。
No-Op Test (Behavior-vs-Default Pruning)
与不添加指令的情况比较,删除没有实际作用的规则。
Two-Axis Orthogonal Review (No Cross-Axis Reranking)
按两个独立维度评审,不用其中一个维度的结果改变另一个的排序。
Absence-of-Seam as a Finding
如果职责无法分开或独立替换,应将这种结构问题记录下来。
Static-Trace Verification When Execution Is Unsafe
执行会有风险时,通过静态追踪验证行为,并说明验证局限。
Validate measured artifact constraints
测量生成结果是否符合交付要求,再针对超限部分修改。
Pilot a fixed extraction contract
确定要抽取的字段,用少量样本验证后再批量处理。
Abuse cases beside intended use cases
针对每个信任边界列出可能的滥用,再选择保护措施。
Grade the declared artifact kind
交付可执行产物和交付对话说明,需要不同的评分证据。
Validate the consumer interpretation
本地宽松的读取器通过,不代表真正接收产物的工具也能接受。
Bind grader results to the full expectation set
确认评分对应正确样本,再按全部预期项重新计算总分。
Review changes to the quality bar itself
检查验证器是否被放宽,避免靠降低要求让测试通过。
Measured baseline ratchet
不使用会让现有基线必然失败的任意目标,先保证实测表现不退步。
Noise-aware intervention comparison
在相同条件下比较单个变化,只有差异超过正常波动才认为有效。
Owned negative routing controls
测试“不该调用这个 Skill”时,还要确认请求被交给合适的替代者。
Ordered reconciliation of reviewer findings
把评审结论当作待验证的判断,结合实际产物分类后再行动。
Task acceptance and standing readiness
既验证本次要求的行为,也检查项目一贯的交付要求。
Reuse verification until its assumptions change
只有相关代码或基线假设变化后,才重跑已经通过的检查。
Verify the evidence channel itself
主动生成已知信号,确认能从预期的通道查到它。
Keep answer keys outside agent reach
把答案与被测系统隔离,包括历史记录和前几轮生成的文件。
Keep attempts, grades and traces coherent
区分执行失败与可评分结果,确保分数、轨迹和用量属于同一次调用。
Separate build variance from scoring variance
分别测量每次生成产物的差异,以及对同一产物重复评分的差异。
Concrete, intent-aware verification prompts
问题应对应真实的结论和假设;用户已经要求核验时直接执行。
Regrade all variants after a criterion change
用新指标对所有候选的已保存输出重新评分,再推荐最佳方案。
Use fresh no-change controls after drift
环境变化时,用同一时期的原方案作对照,避免只与历史分数比较。
Grade the environment left by an agent
任务会改变环境时,应评分最终状态;对话记录用于检查过程要求。
Freeze comparison references across rounds
保留固定参考文件;增加更难的对照时也保留旧参考。
Record the origin of evaluation references
标明答案是独立核验的,还是由参与比较的系统生成的。
Keep selection feedback out of revision prompts
不把保留样本的结果透露给改写提示词的模型,并准确描述筛选样本的用途。
Confirm the selected configuration as a whole
分步选择多个设置后,用新运行验证最终组合,并沿用预先确定的标准。
Classify the failing layer when optimization stalls
连续改写没有改善结果时,先判断问题在哪一层,而非继续堆指令。
Evaluate the real application entry point
走应用实际的上下文组装、工具路由和重试路径,而非只复刻最终请求。
Trace invalid data back to its origin
从失败结果向上追踪调用者和参数,定位错误输入最早产生的位置。
Establish counter semantics before totals
先确认指标是本次增量还是累计读数,避免重复计入总数。
Use an independent, mutation-sensitive oracle
独立计算预期值,并确认看似合理的错误行为也会导致测试失败。
Successor screens require an action and carried state
把多屏设计当作完整用户旅程,检查触发下一屏的动作与传递的数据。
Remove presentation answer cues
让不同选项的呈现方式保持一致,避免从布局看出正确答案。
Guardrail negative-control proof
构造一次故意违规的操作,确认被阻止,再恢复干净的成功状态。
Explicit partial and invalid fixture intent
测试中明确哪些样本是有效但不完整,哪些用于验证错误处理。
Mechanics to checks, judgment to review
语法和结构问题用自动检查处理,文字规则重点说明需要判断的部分。
Compare structural variants in shared context
把方案放到实际使用环境里比较,并保持测试数据一致。
Qualify observations by when they were captured
区分历史证据、未验证快照、当前观察和未知状态。
Hard Blockers Override Aggregate Scores
先应用硬性门槛,再判断综合分数是否足以交付。
Conditioned Description Is Not Independent Validation
评分者已看到被测答案时,应标为有条件的描述,不能当成独立佐证。
Choose Metrics from Failure Costs
先明确要做的决策和各类错误的代价,再选择指标并优化分数。
Measurement Unit and Scope Boundaries
先声明计数单位和范围,再用结果支撑其他资源或行为方面的判断。
Related-Input Invariant Oracle
除固定样本外,还检查输入变换后输出应满足的关系。
Compare Candidate and Baseline on the Same Trial Panel
保存每次配对结果,再按预先声明的整体标准判断。
Propagate Failed Prerequisites
某项前提验证失败后,所有依赖它的检查结果都要重新判断。
Retry Success vs Repeated Reliability
一次经过重试的成功,不能证明所有重复试验都能成功。
Aggregate and Slice Evaluation Gates
除总体分数外,分别检查重要任务类型,并在看结果前确定门槛。
Separate behavior success from intervention benefit
分别说明目标行为是否完成,以及新增指令是否带来改善。
Comparable-coverage trend reporting
检查范围和测量条件可比时,才把结果作为趋势比较。
Keep claims within the observed channel
摘要和回归断言都保留原证据的验证边界。
Independent completion witness
区分外部观察到的行为和被测代码自己声明的完成状态。
Review both overlapping completion orders
组合测试共享状态上的竞争操作,避免只分别检查每个操作。
Persona-grounded peer benchmarking
先确定用户和起止边界,再比较步骤与证据;估算、未知和待选择目标分别记录。
Predeclare trials and verdict rules
随机评测开始前固定样本和尝试次数,并保留每次计划内的结果。