online branch: main

2026-10-10

RSS llms.txt GitHub

OpenAI、Anthropic 的评测实践:谁来给 AI 裁判打分?

$
OpenAI、Anthropic 的评测实践:谁来给 AI 裁判打分?,大厂 Evals 经验系列中文封面

大厂 Evals 经验系列 · 06

Agent 在测试中失败,团队通常会先检查模型、提示词和工具。但如果题目漏了要求,或评分器坚持一种不必要的写法,系统可能做对了事情,却依然拿不到分。

这篇把三个官方项目放在同一个问题下阅读:怎样验证评测本身。它们分别提供题目审查、裁判检查和场景校准的做法;本文不把它们当作一套已经统一验证的流程。

题目有没有把要求告诉被测系统

OpenAI 在 SWE-bench Verified 中举出一种缺陷:问题描述没有要求某个特定行为,测试却检查了该行为,甚至检查精确的警告文案。被测 Agent 无法从题目获得完整要求。团队因此让专业开发者审查任务描述与测试是否合理。原文

解读批注|隐藏测试本身可以合理:被测系统不必看到所有测试代码。但测试检查的行为应能从任务约定得出。未告知的要求与未公开的测试代码,需要区分。

我的建议是给每道重要任务做一次“要求对照”:逐条列出评分项,并指出它依据题目中的哪句话、哪条已明确提供的规则。找不到依据时,补充任务描述,或重新判断评分项是否必要。

还有一个检查是执行参考解法。它失败时,先定位题目、参考解法、评分器或环境的问题。参考解法通过也不能证明评测毫无缺陷,但能排除部分明显的配置和规则冲突。

AI 裁判也需要独立检查

PaperBench 将复杂的论文复现任务拆成有明确标准的子任务,并为自动评分的模型裁判准备了单独的评测。项目介绍

精选译句:“通过为裁判建立单独的基准,评估我们裁判的表现。”原文短句为 “assess our judge’s performance by creating a separate benchmark for judges”。

解读批注|把评分交给另一个模型,不会自动得到标准答案。需要检查裁判怎样处理明显错误、合理替代解、证据不足和接近边界的答案。

例如,为一个假设的资料分析任务准备四种回答:事实和引用都正确;文字很流畅但引用不支持结论;事实正确但格式不同;遗漏一项必须回答的问题。先让领域人员按已确认规则判断,再看裁判是否作出同样的关键区分。

这种小样本对照可以发现问题,不能直接证明裁判对所有场景可靠。应保留分歧样本和原因,并检查新任务上的判断,防止只把裁判调到熟悉几个示例。

82.5% 的一致率,可能掩盖怎样的错误

下面是一组本文设计的教学数字,不是厂商实验结果。准备 40 个已按明确规则完成人工复核的样本,其中 20 个合格、20 个不合格。假设裁判判断如下:

人工复核结果 裁判通过 裁判不通过 合计
合格 19 1 20
不合格 6 14 20
合计 25 15 40

裁判与人工判断一致的样本为 19+14=33,一致率 33/40=82.5%。但不合格样本中,有 6/20=30% 被错误放行;合格样本中,有 1/20=5% 被错误拒绝。若只展示 82.5%,就看不到两类错误的明显差别。

还可以换一个问题:裁判判为通过的 25 个样本里,有多少其实不合格?答案是 6/25=24%。30% 与 24% 的分母不同,不能混用。前者描述对不合格样本的漏拦截,后者描述本批已放行结果的错误占比。

哪一种错更重要,要看裁判承担什么工作。用于寻找可改进的写作片段时,错拒绝可能增加返工;用于筛查必须满足的行为条件时,错放行可能让关键问题漏过。没有统一的一致率阈值能替所有业务决定验收。实际样本比例改变,这些总体指标也会改变,因此报告要保留样本构成与关键类别。

本例还把人工复核当作对照,不意味着人工天然正确。若领域人员意见有分歧,先记录争议和规则缺口,完成必要的裁定;证据不足的样本单独标记,不能强行塞进二分类来美化一致率。

校准裁判,不能只把答案写得更像参考文案

裁判校准是用已确认样本检查、修订判断规则的过程。它应减少实质误判,而不是让模型偏爱某一种表达方式。

可在事实与证据不变时,把同一答案写成简洁版和流畅版,检查判定是否无理由变化;也可保留漂亮措辞,却加入一条无依据的关键结论,检查裁判是否发现。合理替代解、缺失证据和边界样本,要分别覆盖。每次给出判断时,还应指明触发的规则和对应证据片段,方便复核,而不是只留下分数。

用于修改规则的样本,与最后验证效果的样本应分开。否则裁判可能记住示例,却没有学会对新情形应用标准。换裁判模型、修改细则或换任务领域后,原来的校准结果也不能自动延续。

对有明确系统状态的条件,应直接检查状态证据。例如“预算是否改为已确认数值”可查后端记录,没必要仅让文本裁判阅读“已修改”后投票。开放解释质量才需要按明确细则判断;多位模型意见一致仍不能补出缺失的事实证据。以上为本文提出的设计方法,不声称它们已在三个项目中作为同一套流程得到验证。

自动生成题目后,还要确认它真的在测目标

Anthropic 的 Bloom 根据指定行为生成场景,再评估行为的出现程度。它允许配置生成与评分过程,并以人工判断检查模型裁判。官方说明

解读批注|自动生成场景可以扩大覆盖,但“生成了许多题”不能证明题目质量。场景可能太容易、太刻意,或测到别的行为。生成模型和评分模型也可能存在共同偏差;需要独立样本和人工校核。

从这点延伸,一个业务评测集可以分别标记人工任务、线上问题改写和自动生成任务。比较三类任务的失败模式,有助于判断测试集是否只在某一种构造方式下有效。这个划分是本文的产品建议,不是 Bloom 已验证的业务部署方案。

本文中文图解

图解说明:根据本文原创解读,以 Archify 定义节点与关系,再制作中文信息图;图中检查顺序或分组为本文建议,不是厂商原始实验图。

一张可以拿到评审会上的检查表

检查对象 要拿出什么证据 暂时不能得出的结论
题目 完整输入、提供的规则、评分项对应依据 描述简短就一定清楚
参考解法 在当前环境中的运行结果及失败原因 参考解法通过就证明题目完美
自动评分器 可复核断言和允许的合理差异 形式不同就一定错误
模型裁判 人工校核样本、关键分歧与修订记录 一个裁判总能正确判断另一个模型
自动生成场景 目标覆盖、真实性与不同来源的样本 题目数量增加就必然更可信

这张表用于确定评测的可信范围,不提供统一的验收阈值。高后果的动作,仍要有具体的状态与权限检查;开放文本的质量,则可能需要明确细则和人工复核。

留一份评测缺陷记录

失败复盘可以同时给出两种记录:任务表现的失败原因,以及评测本身的可疑点。后者需要证据,不能仅因为成绩不理想就归咎于题目。

若复核确认评分项有误,修订后应重新运行受影响的测试,并保留规则版本。旧分数使用旧规则,新分数使用新规则;比较时说明变更,才能判断改善发生在系统还是评测定义上。

评测规则也要验收。下一次发现一个难以解释的失败,可以先对照题目、参考解法与评分依据,留下可复查结论,再决定应修系统还是修评测。

来源:OpenAI,Introducing SWE-bench Verified(2024-08-13)、PaperBench(2025-04-02);Anthropic,Bloom(2025-12-19)。本文为多源精选解读;检查表与假设样本为原创设计。