AI 科技观察

模型评测

榜单帮不了你选模型:自建评测集的做法

公开榜单只能说明模型在一套公开题目上的得分,不能直接回答它能否把你的工作做对。

作者:AI 科技观察阅读时间:19 分钟
明亮桌面上的模型评测卡片、公开榜单和自建评测集对比
选型不是只看榜单,而是用自己的任务做测量。来源:AI 科技观察 · AI 生成图,供本站文章使用。

MMLU 是过去五年被引用最多的模型能力榜单之一。一项对其中 5,700 道题做人工重新标注的研究给出的结果是:约 6.49% 的题目本身就是错的——标答案错、多个选项都对、或者关键条件缺失;在病毒学子集里,被分析题目的错误比例高达 57%。用修正后的题集重跑,模型排名会发生变化。[1]

SWE-bench 是目前最被看重的代码智能体榜单。一项研究把“测试太弱、改错也能过”和“答案直接写在 issue 里”两类题目滤掉之后,三个主流智能体在 SWE-bench Verified 上的平均解决率从 51.7% 降到 25.9%;在 SWE-bench Lite 上从 42.1% 降到 21.8%。[2]

这两个数字指向一个更具体的问题:公开榜单回答的是“哪个模型在这套题上得分高”,而你的选型问题是“哪个模型能把手上的活干对”。 这两个问题不同,公开榜单对后一个问题的区分度正在下降。

本文要回答的是:榜单失灵的机制到底是什么,以及一个个人或小团队要花多少成本、用什么方法,才能做出一套真正能拿来做选型决策的私有评测集。

目录

  1. 1.1. 榜单在回答谁的问题
  2. 2.2. 失灵的三种机制:污染、饱和、过拟合
  3. 3.3. 题目本身也会错
  4. 4.4. 一套能用的私有评测集长什么样
  5. 5.5. 打分:人、规则、与 AI 判官的边界
  6. 6.6. 多少题算够,差多少算真的差
  7. 7.7. 评测集也会过期
  8. 8.8. 选型时要问六个问题
  9. 9.结论
  10. 10.来源与引用

1. 榜单在回答谁的问题

公开评测的设计目标是可比性:让不同实验室、不同时间点的模型能在同一把尺上比。公开榜单依赖公开题目、固定口径和广泛领域;你的选型需要私有题目、贴合业务的口径,以及只覆盖真实任务的窄领域。

问题在于目标冲突:面向所有人的考试,无法同时充当某个岗位的面试。

<table header-row="true"> <tr> <td>维度</td> <td>公开榜单</td> <td>私有评测集</td> </tr> <tr> <td>要回答的问题</td> <td>这一代模型能力边界在哪</td> <td>这个模型能不能接我的活</td> </tr> <tr> <td>题目来源</td> <td>学术数据集、公开仓库、众包</td> <td>你自己的真实请求与历史失败</td> </tr> <tr> <td>是否公开</td> <td>必须公开(否则不可复现)</td> <td>必须不公开(否则会被污染)</td> </tr> <tr> <td>可接受的题量</td> <td>数千到数万</td> <td>二十到一百</td> </tr> <tr> <td>失效方式</td> <td>饱和、污染、被优化</td> <td>题目过时、与当前业务无关</td> </tr> </table>

公开榜单适合筛除模型,不适合选定模型。排名很低的模型可能确实不适合你的任务;两个高排名模型只差一两个百分点时,这个差距通常不足以支持选型。

2. 失灵的三种机制:污染、饱和、过拟合

第一种是污染。 模型在 web 规模语料上训练,而榜单题目也在网上,于是测试集进入训练集几乎不可避免。一份覆盖到 2025 年末、汇总 55 项研究的系统文献综述,把这一类问题归纳为一个已经成形的研究领域。[3]

代码领域的污染形式最隐蔽:题目本身没泄漏,但修好该 issue 的补丁就在仓库的 git 历史里,而 git 历史几乎肯定在训练数据里。一项研究直接测了这件事:不给模型访问仓库的权限、只给 issue 文本,让它说出该改哪个文件,准确率能达到 76%。[4] 只根据 issue 文本很难可靠完成这个任务;如果模型仍能猜中,训练数据泄漏就是一种可能解释。

第二种是饱和。 当顶部模型挤在天花板附近,分数差就不再代表能力差。多份厂商与第三方的汇总显示,到 2026 年前沿模型在 MMLU 上已到 93% 左右、GSM8K 接近 99%,HumanEval 的前五名差距只剩约 1 个百分点(此处为二手汇总,未逐项核对各模型官方技术报告)。[5] 饱和的后果很直接:当差距小于测试集自身的标注噪声(参考 MMLU 的 6.49% 错误率),榜单就失去了分辨能力。[1]

第三种是过拟合,包括对榜单机制本身的过拟合。 这一点上最详尽的公开研究是《The Leaderboard Illusion》,它分析了 Chatbot Arena 约 200 万场对战、243 个模型,指出未公开的私有测试实践使少数厂商获益:它们可以在正式发布前提交多个变体参赛,挑分数最高的公开,其余撤回。论文的建议也很具体:禁止提交后撤回、强制披露私有变体数量、对每家厂商的变体数设上限。[6]

这三种机制即使没有作弊也会发生。一个指标同时成为优化目标和评价尺度后,区分能力就会下降。问题出在测量制度。

3. 题目本身也会错

上一节的三种机制至少还假定了“题目是对的”。实际上这个假定也不成立。

MMLU 的 6.49% 错误率已经说明问题。错误分布还很不均匀:病毒学子集里,被分析题目的错误比例高达 57%。[1] 这意味着如果你刚好关心某个子领域的得分,那个子分数可能基本不可读。

Anthropic 在一篇讨论评测困难的官方文章里说得更直:同一个 MMLU 分数,因为少样本示例数量、是否使用思维链、选项格式如何呈现等差异,完全可能不可比;他们也在题集里找到了标错或根本无法回答的题。这类“看似标准化”的评测,实际执行中充满了人为判断。[7]

代码评测那边,即使是人工校验过的版本也不干净。OpenAI 在发布 SWE-bench Verified(500 道工程师确认可解的题)时,自己列了原版的三类问题:单元测试过分特定、有些甚至与 issue 无关,会把正确解法判错;不少 issue 描述欠定义,根本无法判定什么算做对;环境搭建不稳定,有时无论如何修改测试都会失败。[8]

而即使用上了 Verified 版本,“通过”也不等于“正确”。一项采用差分补丁测试的实证研究对三个开源智能体的“看似可行补丁”做了逐个比对,发现相当一部分只是通过了不够强的测试,行为与人类补丁存在实质差异。[9] 另一项工作直接把两类问题题目滤掉重跑,得出了本文开头引的那组降幅:51.7% → 25.9%。[2]

看榜单分数前,至少要核对三个问题:题目数量、测试口径(尝试次数、脚手架和预算),以及题目发布时间是否早于模型知识截止。三个问题有一个答不上来,这个分数就只能作为参考。

同一份代码评测中,分数还会受到脚手架(工具链、重试策略、上下文注入方式)的影响。二手汇总中有“相差可达二十多个百分点”的说法。[5] 本文未能核对到一手数据,因此不引用具体幅度;但可以确定,模型与脚手架应作为一个整体评估,改变脚手架就改变了被测系统。

4. 一套能用的私有评测集长什么样

私有评测集从二十到五十道题就可以开始使用,前提是题目全部来自你的真实请求。

题目来源按优先级排:

1. 过去真实失败的例子。这是最值钱的一类。任何一次你说“这个模型怎么这么蠢”的时候,那次对话就是一道题。随手存,不要靠回忆。

2. 高频低风险任务。你每周重复很多次的那些活,它们决定了日常体验。

3. 低频高代价任务。很少做,但错了代价很大——数字、引用、合约条款、权限相关的代码。

4. 已知边界。你知道很难的题,用来测天花板。

5. 陷阱题。前提错误、资料不足或问题本身矛盾时,正确行为是拒答或反问。

每道题建议只存四个字段,以控制维护成本:输入(完整原文,包括附件与上下文)、验收标准(一句话写清什么算对)、失败类型(事实错 / 格式错 / 漏步骤 / 跑偏 / 不该回答却回答)、难度标记。

分层比总分重要。一个只给“22/30”的评测集几乎没用,因为你不知道错的是哪三层。建议直接分三档:

<table header-row="true"> <tr> <td>层次</td> <td>内容</td> <td>判定规则</td> </tr> <tr> <td>底线层</td> <td>绝对不能错的事:数字、引用、安全、拒答边界</td> <td>错一道即否决,不看总分</td> </tr> <tr> <td>主体层</td> <td>日常高频任务</td> <td>看通过率,带置信区间</td> </tr> <tr> <td>天花板层</td> <td>已知很难的题</td> <td>只看趋势,不进决策权重</td> </tr> </table>

评测集必须保密。不要把它传到公开仓库、不要贴到公开论坛。一旦公开,它就进入了下一轮训练语料的征集路径——这就是前面那些榜单正在经历的事。公开评测领域对此的应对手段是持续更新:LiveBench 的做法就是定期用新题替换旧题,以限制污染窗口。[10] 你的私有集不靠更新频率,而靠不公开。

5. 打分:人、规则、与 AI 判官的边界

题目好做,打分难做。三种手段各有适用边界。

规则判定——能自动化就自动化。数字对不对、JSON 能不能解析、引用的 URL 能不能打开、代码能不能跑、测试能不能过。这一层应该尽可能大,因为它不会累、不会漂移。

人工判定——底线层必须留给人。实践界的评测指南里有一条建议很反直觉但很有效:建议指定一个领域专家作为质量的最终裁定人,由其定标准、保一致性;多人标注时,则要走完整流程——先写评分细则与通过 / 不通过的例子,各自独立标一批相同样本,用 Cohen's Kappa 之类修正了偶然一致的指标算标注者间一致度,开对齐会讨论分歧,迭代细则直到一致度稳定。[11] 对个人创作者或小团队来说,“就一个裁定人”反而是最现实的选择。

AI 判官——能用,但必须知道它错在哪。MT-Bench 那篇工作给出了正面证据:在各三千条专家投票与众包投票上,GPT-4 作为判官与人类的一致率超过 80%,与人与人之间的一致率相当;同一篇也列了四类局限:位置偏差、冗长偏好、自我抬高偏差、推理能力不足。[12]

后续研究把这些偏差测得更实。一项覆盖 15 个判官模型、两个基准集 22 个任务、约 40 个待评模型、超过 15 万次评判的研究确认:位置偏差不是随机波动,在不同判官与不同任务上差异显著,且当两个候选答案质量接近时偏差最严重。[13] 这恰好是选型场景的典型情形——你要比的两个模型本来就差不多。

自我偏好偏差可能来自困惑度。一项研究提出了量化指标,发现 GPT-4 存在显著的自我偏好,并把原因指向困惑度:判官会给低困惑度(也就是对它而言更“熟悉”)的文本明显高于人类的评分,无论文本是否由它生成。[14] 因此,用 A 模型去判 A 模型的输出需要额外校准;自我偏好不会自动抵消。

可操作的四条防护:判官模型与被评模型不同源;每对比较正反位置各跑一次,不一致则计平局;要求判官先给理由再给结论,方便你抽查;抽 10% 的判定结果人工复核,把判官自己的准确率也当一个指标盯着。

AI 判官适合做筛选与分类(找出可疑样本、打上失败类型标签),不适合做排名与验收。把它作为初筛工具,把人的时间留给底线层,这个分工目前更可靠。

6. 多少题算够,差多少算真的差

样本量是这个话题里最容易出错的环节。跑 20 道题,看到 A 模型 16/20、B 模型 14/20,并不足以支持稳定结论;这个差距在统计上很可能只是噪声。

Anthropic 一篇专门讲评测统计的论文把这件事说得很清楚:评测就是实验,而行业习惯是把最高分加粗,很少做显著性检验;应该做的是把题目看作从一个看不见的总体里抽出来的样本,报告标准误与置信区间,比较两个模型时用配对分析,并在实验前就规划好题量。[15]

把量级算出来会更直观。下表是本文按二项分布估算的单个模型通过率误差(假定真实通过率接近 50%,这是误差最大的情形):

<table header-row="true"> <tr> <td>题量</td> <td>标准误差</td> <td>95% 置信区间半宽(约)</td> <td>意义</td> </tr> <tr> <td>20</td> <td>11.2 个百分点</td> <td>±22 个百分点</td> <td>只能发现巨大差异</td> </tr> <tr> <td>50</td> <td>7.1 个百分点</td> <td>±14 个百分点</td> <td>能分辨明显差异</td> </tr> <tr> <td>100</td> <td>5.0 个百分点</td> <td>±10 个百分点</td> <td>开始能谈十个点的差距</td> </tr> </table>

数字看起来很悲观,但有一个关键的缓解手段:配对比较。两个模型跑同一批题时,大部分题两边都对或都错,这些题对差值没有贡献;真正提供信息的只有“一对一错”的题。只看这部分,差值的方差会下降,但能减少多少题量取决于两个模型在每道题上的相关性。上面那篇论文的核心建议之一就是这个:比较两个模型时不要各自算分再相减,而要直接分析配对差。[15]

落到操作上的三条:同一批题、同一组参数、只换模型;每题至少跑三次,记录稳定性而不只记录最好一次(很多真实场景里“三次里有一次错”比“总体低五个点”更致命);只报差值与区间,不报孤立的百分比。

如果两个模型在二三十道题上的差距不到两三道,这个差距不足以支持“A 更好”的结论。更合理的判断是:“在我关心的任务上,这两个模型暂时区分不出来。”这时可以比较价格、延迟、配额和数据政策,这些指标更容易精确测量。

7. 评测集也会过期

一套自建评测集需要持续维护,主要会从三方面衰减。

一是自己也会被污染。 只要你把题目发给了云端模型,它就可能进入对方的日志或训练管道(取决于你的帐号类型与数据政策)。问题在于默认设置和数据政策。对策是使用不参与训练的 API 档位;保留一小部分题,作为从不发给任何云端模型的“净题”,专门用来发现异常提升。

二是业务漂移。 半年前的高频任务,今天可能已经不做了。建议季度重建一次:把新积累的真实失败换进去,把连续两个季度所有模型都全对的题退役。

三是饱和。 当你关心的模型在主体层上全部接近满分,这套题就会失去分辨能力。公开榜单遇到的问题也会出现在你的评测集上,只是发生得更慢。退役旧题、加入新题是常规维护。

现任模型也必须纳入参考系。 每次评测都要把现任方案重跑一遍,不能直接沿用上一次的分数。模型会在你不知道的时候更新、系统提示词会变、默认参数会调,历史分数不能当常量用。

8. 选型时要问六个问题

1. 这个分数是在回答我的问题吗? 榜单衡量的是通用能力边界,岗位匹配度需要用自己的任务评估。[6]

2. 题目能不能被背下来? 注意题目发布时间与知识截止的先后,以及 git 历史这类间接泄漏。[4][3]

3. 题目本身对吗? 连 MMLU 与 SWE-bench 这样的标杆都有可观测的错题率与弱测试问题。[1][2][8]

4. 谁在打分,它的偏差在哪? 位置、冗长、自我偏好三类偏差都已被量化,且在差距小时最严重。[12][13][14]

5. 这个差距超过噪声了吗? 二三十道题的置信区间比大多数人想象的宽得多;用配对比较。[15]

6. 换了包装还是同一个系统吗? 脚手架、重试、上下文注入方式都是被测对象的一部分。[8][5]

结论

榜单失效的原因、私有评测集的做法和样本量问题,可以归纳为四点:

第一,榜单失效来自指标目标与选型目标的错位。 污染、饱和和对榜单机制的过拟合,即使没有作弊也会发生。即使题目完美,榜单也不能直接回答“这个模型能不能接我的活”。[6][10][3]

第二,题目本身的错误率已经大到能改变排名。 MMLU 约 6.49% 的题有错,部分子集高得多;SWE-bench Verified 在滤除弱测试与答案泄漏后,解决率从 51.7% 降到 25.9%。[1][2]

第三,对具体选型来说,二十到五十道自己的题比公开榜单更有用,但必须分层、保密,并配有验收标准。 底线层错一道就否决,不看总分;一旦公开,这套题就会失去作用。

第四,小样本的结论必须带区间。 二十道题的置信区间约为 ±20 个百分点量级(本文估算);区分不出来时,应比较价格、延迟与数据政策,不要强行得出能力结论。[15]

这些结论归结到选型上,就是一个实用判断:选型本质上是一个测量工程问题。看再多测评文章、参加再多发布会,也不能代替自己跑二十道题。这套题建立后,可以在每次新模型发布时复用。

来源与引用

  1. Are We Done with MMLU?

    Gema et al. · NAACL 2025 / arXiv · 正文引用

  2. SWE-Bench+: Enhanced Coding Benchmark for LLMs

    Aleithan et al. · OpenReview · 正文引用

  3. Are LLM Benchmarks Already Contaminated? A Systematic Literature Review

    Authors listed in the paper · GEM 2026 / ACL Anthology · 正文引用

  4. The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason

    Shanchao Liang, Spandan Garg, Roshanak Zilouchian Moghaddam · NeurIPS 2025 LAW Workshop / arXiv · 正文引用

  5. 榜单饱和与 scaffolding 差异的二手汇总

    多个第三方榜单与厂商博文 · 二手汇总材料 · 正文引用

  6. The Leaderboard Illusion

    Singh et al. · Cohere Labs / Ai2 / Princeton / Stanford · 正文引用

  7. Challenges in evaluating AI systems

    Anthropic · Anthropic · 正文引用

  8. Introducing SWE-bench Verified

    OpenAI · OpenAI · 正文引用

  9. LiveBench: A Challenging, Contamination-Limited LLM Benchmark

    Colin White et al. · ICLR 2025 · 正文引用

  10. LLM Evals: Everything You Need to Know

    Hamel Husain · Hamel Husain · 正文引用

  11. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

    Lianmin Zheng et al. · NeurIPS 2023 / arXiv · 正文引用

  12. Self-Preference Bias in LLM-as-a-Judge

    Koki Wataoka, Tsubasa Takahashi, Ryokan Ri · NeurIPS 2024 Workshops: SafeGenAI · 正文引用