一张基准表格讲不完的故事

GPT-5.5 发布当天,最初的反应是怀疑。基准数字确实更好,但好得并不多。直到几小时后,人们真正上手,结论才清晰起来:相比 GPT-5.4,这是一次阶跃式提升。经典的「基准表格」显然漏掉了一半真相。

漏掉的那一半,是 x 轴。把 token 放上去,再去比 5.5 和 5.4,事情就明白了:在一个网络安全评测上,如果各自用「最大」测试时计算量来衡量,5.5 看起来没比 5.4 强多少;但换一个评测,一旦控制住 token、成本和延迟,5.5 对 5.4 的优势立刻拉开。

问题出在测量方式:GPT-5.5 根本不是在和 5.4 相同的 token 预算(或美元预算)下被评测的。把测试时计算量对齐,5.5 才显出真实身位。

平台期比你想的远得多

一个常见的反驳是:那我们干脆搭一个评测框架,不断加测试时计算,直到性能达到平台期,不就行了?

从经验上看,这个平台期非常远。有时在实际能承受的预算内,根本看不到它。autoresearch 实验里,性能在数百次实验之后仍在继续往上爬;某个网络安全评测里,模型即使在超过 1 亿 token 之后,表现仍在快速改善。

更值得注意的规律是:越强的模型,性能随时间提升的幅度也越大。看起来很可能是——模型越强,它在更长时间跨度上运作的效率越高。于是平台期被一再推远,甚至可能消失。对做 Agent 的人来说,这是个直接的结论:你给一个强模型更长的运行窗口、更多 rollout,它的回报曲线没那么快变平。

正确的评测姿势:画曲线,而不是报一个数

所以评测模型的正确方式,是画出「性能 vs 测试时计算」的曲线,把 token、成本或真实耗时中的某一个放在 x 轴上。ARC-AGI 已经在这么做——它衡量的是分数与成本之间的关系。

另一种合理选择,是给模型设定一个明确的 token / 时间 / 成本预算,并把这个预算告诉它。这其实更接近人类的考试场景:SAT、国际数学奥林匹克,都是在固定时间约束下被评测的。

三种 x 轴各有取舍,没有完美选项:

  • token:不能跨模型直接比,分词器、速度、每 token 成本都不一样。
  • 美元成本:取决于批处理、硬件利用率这些实现细节,成本和延迟之间可以相互权衡。
  • 真实耗时:也不完美,因为 best-of-N 这类多智能体技术能扩大测试时计算,却不显著增加延迟。

但哪怕是其中任何一条曲线,都比一个孤零零的标量数字信息量大得多。

当能力变成「推理预算的函数」,安全评测怎么做

这套逻辑往前推一步,就戳中了一个更尖锐的问题。前沿模型发布前,实验室通常会评估网络安全、生物安全等滥用风险,一旦跨过能力阈值就推迟发布、等缓解措施到位。但如果能力本身是推理计算量的函数——那安全评测该在什么推理预算下跑?

现实是,大多数用于发布决策的安全评测,压根不看模型用了多少推理计算。Gemini 3 Deep Think 的发布是个有用的例子:它的基准分数远高于以往模型,却没有附带评估其风险的模型卡,这在 AI 安全社区引发了不少愤怒。

但 Brown 的判断是,针对这次发布的批评其实没打中要害。Deep Think 看起来很可能只是对其他已有系统卡模型的一层脚手架封装——外部任何人大概都能复现这套脚手架。换句话说,只要有人愿意为那种规模的推理付费,把一堆模型查询脚手架化地拼起来,Deep Think 的能力本来就已经触手可及;Deep Think 只是让普通用户更方便地用上它。

真正该引发愤怒的,是 Gemini 3 以及其他模型发布时,系统卡没有把基准表现作为测试时计算量的函数来测量。理想中的模型评测,应该是一族随推理预算变化的能力曲线,而不是一行数字。

这里有个现实约束:一个有组织的国家级行为体,可以为单个任务投入超过 1000 万美元的推理计算;但评测一个模型往往涉及数千到数百万次 rollout,每次都用这么高的预算去测并不现实。好在性能似乎会随推理计算量以某种可预测的方式扩展,于是可行的做法是——在相对低的预算下评测,再带着不确定性往高预算外推。

外推不能解决所有问题。长周期评测会引入新的复杂性:可能只有真把一个 Agent 跑满一年,才能有把握评估它在一年尺度上的失调风险。实验室甚至可能很快陷入一个尴尬位置——它们的 Agent 能运行的时间跨度,超过了新模型的开发周期。到那时,不推迟发布,就没法在发布前把一个模型在其最大运行寿命内评测完。

给做 AI 产品的人的三条具体建议

  • 发布模型时,公布带 x 轴的基准曲线,把 token、成本或时间放上去。至少,要报告达到某个标量结果时用掉的推理预算。
  • 基准排行榜应追踪推理使用量,或设置明确的 token / 成本 / 时间预算。不少基准已经在转向,但还远不是标准实践。
  • Preparedness Frameworks 和 RSP 在判断模型是否跨过安全阈值时,应明确纳入推理计算,并估计多个推理预算下的能力,包括带明确不确定性的外推。

为什么是现在

如果你关注这个领域已久,整篇文章看起来可能没什么新东西——自 2024 年 9 月 o1 发布起,我们就知道推理模型的表现会随推理计算扩展。

但将近两年后,前沿实验室发布新模型时,仍普遍只报一个数字;当某个脚手架系统用 100 倍推理预算拿到更好结果时,安全组织仍然会感到惊讶;RSP 在判断关键能力水平时,仍经常忽略推理计算。

结构性的变化在于:最新模型比以往任何时候都更能吃下测试时计算,把性能平台期推得更远。这个趋势只要继续,每过一个发布周期,那些不考虑推理计算的基准分数就会更不可信一分。对自己搭 Agent、自己付推理账单的人来说,这件事更实际——别再用「某模型在某榜上拿了多少分」来选型,去看它在你能承受的预算区间里,那条曲线长什么样。把推理预算当成能力测量里的一等公民,现在正是时候。