榜单看多了容易生出一个错觉:第一名就是该用的那个。这一轮数据恰好是反例。 解题率最高的 GPT-6 Astra 是 80.0%,排第三的 GPT-5.6 Sol 是 76.7%, 只差 3.3 个百分点;但每道解对的题,前者花 $0.1384,后者花 $0.0468,差近三倍。
这轮评测覆盖 16 个前沿模型,题目是高频生成的新鲜编码任务, 共消耗 21 百万 token、$110 算力成本。 把解题率、每题成本、中位耗时三列摆在一起,名次给出的结论就没那么牢靠了。
本文要点
- 解题率榜首 GPT-6 Astra(80.0%),但它对第二、第三名的领先在统计上并不显著
- 最值得先测的是 GPT-5.6 Sol:76.7% 解题率,每题成本只有 Astra 的三分之一
- 开源权重最强是 DeepSeek V4 Pro(75.0%),代价是中位耗时 435 秒——全榜最慢
- 每题成本从 $0.0018 到 $0.5774,差 300 多倍;中位耗时从 6 秒到 435 秒,差 70 倍
- 相邻名次的 15 组两两对比里,没有一组达到统计显著
能力和成本放在一起,结论就变了
解题率放纵轴、每题成本放横轴,16 个模型立刻分出三类: 右上角又好又便宜,左上角贵但强,下方是解题率不够用的。 绿线是「值得买前沿」——落在线上,意味着没有任何模型能在解题率和成本上同时超过它。
yiwaai.com — 前沿模型评测 — 能力 vs 成本
2026-09-20 · 每题成本占最贵模型的百分比(向右更便宜)
图 1 · 能力与成本的关系。横轴向右更便宜,纵轴向上解题率更高,右上角是「又好又便宜」。绿色台阶线是值得买前沿:给定预算下能达到的最高解题率,线下方的点都存在更便宜且解题率不低的替代品
数据来源:yiwaai.com
最扎眼的是 claude-fable-5-1:它孤零零落在图的最左边,每题 $0.5774, 是全榜最贵的一个,解题率却只有 68.3%,排第九——花最多的钱买第九名。 gpt-5.6-sol 和 deepseek-v4.1-flash 则都落在前沿线上: 前者用 8% 的成本拿到 76.7%,后者用 3% 的成本拿到 73.2%。
完整榜单
名次按解题率排,箭头是相对上一轮的变动。这一轮动得不小: Claude Opus 5 上升 7 位到第 4,GPT-5.6 Terra 下滑 9 位到第 12。
yiwaai.com — 前沿模型评测 — 当前榜单
2026-09-20 · 高频抗污染排名
| # | 模型 | 解题率 | 比最慢快 | 比最贵便宜 |
|---|---|---|---|---|
| 1 | gpt-6-astra | 80.0% | 94% | 76% |
| 2▲3 | grok-4.6 | 76.8% | 50% | 75% |
| 3▼1 | gpt-5.6-sol | 76.7% | 84% | 92% |
| 4▲7 | claude-opus-5 | 75.4% | 94% | 34% |
| 5▲3 | deepseek-v4-pro-0813 | 75.0% | 最慢 | 90% |
| 6▲3 | deepseek-v4.1-flash | 73.2% | 69% | 97% |
| 7 | muse-spark-1.3 | 70.0% | 62% | 87% |
| 8▼2 | qwen-3-8-max | 70.0% | 71% | 77% |
| 9▼2 | claude-fable-5-1 | 68.3% | 96% | 最贵 |
| 10▼6 | gemini-3.8-flash | 64.4% | 95% | 89% |
| 11▼1 | nvidia-nemotron-3-ultra-550b-a55b | 64.0% | 73% | 61% |
| 12▼9 | gpt-5.6-terra | 60.0% | 87% | 88% |
| 13 | kimi-k3 | 58.0% | 87% | 67% |
| 14 | gpt-5.6-luna | 52.0% | 90% | 99% |
| 15 | zai-org-glm-5-3-flash | 44.0% | 95% | 99% |
| 16 | mercury-2.5 | 26.7% | 99% | 100% |
表 1 · 完整榜单。名次后的箭头是相对上一轮的变动,绿升红降;色块对应厂商
数据来源:yiwaai.com
延迟:容易被忽略的第三个维度
中位耗时从 6 秒到 435 秒,差 70 倍。这一列决定一个模型能放在系统的什么位置上: 交互式补全和离线批处理能容忍的延迟,根本不是一个量级。
yiwaai.com — 前沿模型评测 — 解题耗时
2026-09-20 · 圆点 = 中位数,横线 = +1σ 波动范围
图 2 · 解题耗时。圆点是中位数,横线向右延伸一个标准差,代表这个模型的耗时波动范围
数据来源:yiwaai.com
gpt-6-astra 的真正优势在这里显出来:解题率第一,中位耗时只有 26 秒,又快又准。 deepseek-v4-pro-0813 的 75.0% 则是拿 435 秒换来的; 同门的 deepseek-v4.1-flash 让出 1.8 个百分点,把耗时压到 135 秒、成本降到 3%。 对多数团队来说,后者更实用。
为什么名次不该当定论
把相邻名次的两个模型摆在一起,只数「一方解对、另一方没解对」的题, 差距立刻小得可疑。Astra 对 Grok 4.6 是 6 比 3,Sol 对 Opus 5 是 4 比 1—— 这个样本量说明不了谁一定更强。
yiwaai.com — 前沿模型评测 — 头对头
2026-09-20 · 相邻名次之间的分歧题 · 每条只计只有该模型解对的题
p=0.51 · 不显著 · 47 题结果一致
p=0.69 · 不显著 · 50 题结果一致
p=0.38 · 不显著 · 52 题结果一致
p=0.69 · 不显著 · 46 题结果一致
p=1 · 不显著 · 46 题结果一致
p=0.11 · 不显著 · 36 题结果一致
p=0.75 · 不显著 · 35 题结果一致
p=1 · 不显著 · 39 题结果一致
p=0.61 · 不显著 · 44 题结果一致
p=1 · 不显著 · 45 题结果一致
p=0.75 · 不显著 · 48 题结果一致
p=1 · 不显著 · 47 题结果一致
p=0.39 · 不显著 · 48 题结果一致
p=0.14 · 不显著 · 35 题结果一致
p=0.065 · 不显著 · 41 题结果一致
图 3 · 相邻名次的头对头。每条的长度是「只有这一方解对」的题数,中间数字是两边结果一致的题数。15 组对比没有一组达到统计显著
数据来源:yiwaai.com
15 组对比,没有一组达到统计显著,p 值最低的一组也只到 0.065。 换成 Elo 看更直观:几乎所有模型的置信区间都彼此重叠。
yiwaai.com — 前沿模型评测 — Elo
2026-09-20 · 圆点 = 点估计,横线 = bootstrap 置信区间
图 4 · Elo 评分(Bradley-Terry,按题目难度加权)。圆点是点估计,横线是 bootstrap 置信区间。注意几乎所有区间都彼此重叠——这正是名次不该被当作定论的原因
数据来源:yiwaai.com
Elo 榜的顺序和解题率榜并不一致。gpt-5.6-sol 在 Elo 上排第二(1721), 反超解题率第二的 grok-4.6(1652)——Elo 按题目难度加权, 而 Sol 在难题上更稳。两个榜单谁更对,取决于你的任务里难题占多少。
如果你要路由大量编码任务,Sol 是该先测的那个模型。
三类场景,三个不同的选择
把上面几张图叠起来看,选型结论会按场景分叉:
- 要最高解题率、预算不敏感:GPT-6 Astra。80.0% 解题率, 26 秒中位耗时,代价是每题 $0.1384。
- 大批量生产任务:GPT-5.6 Sol。落后 Astra 3.3 个百分点, 成本只有三分之一,中位耗时 69 秒。实际意义上的默认选项。
- 必须用开源权重:DeepSeek V4 Pro(75.0%)最强,也最慢; 延迟有要求就换 V4.1 Flash,用 1.8 个百分点换来 135 秒耗时和 3% 的成本。
- 不建议:为这类工作负载付 Claude Fable 5.1 的价格。 68.3% 的解题率配全榜最高的每题成本,账算不过来。
为什么不直接看那些常见的基准分
老基准会被模型、厂商和调 prompt 的人反复见到,分数越好看, 对「现在该部署什么」的参考价值越低。高频生成全新题目衡量的是当前的编码能力, 而不是模型认出旧考题的能力。
还有一个问题:这些活真的需要前沿模型吗
上面三列都在回答「哪个模型更强」。但在真实系统里,还有一个更靠前的问题: 这次调用到底需不需要一个会写代码、会推理的模型。 同期发布的 Jev 正好是这个问题的极端答案。
Jev 来自 TypeSafe AI,创始人 Diogo Almeida 此前在 OpenAI 参与过 RLHF 与 InstructGPT 的研究。 它的能力边界被砍得很窄:不聊天、不写代码、不生成文字, 只接收非结构化输入,一次并行计算就吐出带校准概率的结构化判断—— 预定义类型内的选择、评分或布尔值。官方口径是端到端 70 到 500 毫秒, 输入 $0.042 / 百万 token、输出免费,单次决策约 $0.0004。
把这个数量级放回上面的表里对照一下:本轮最便宜的编码模型每题 $0.0018, 最贵的 $0.5774。一次 Jev 判断的成本比前者还低一个身位, 延迟则落在毫秒级,而全榜最快的模型中位耗时是 6 秒。 两者当然不做同一件事——但这正是要点:把分类、路由、初筛这类判断 交给一个会写代码的模型,付的是它写代码的价钱。
第三方实测也支持这个分工。有人拿 100 道「是否与 AI 相关」的预筛题, 让 Jev 与 GLM-5.3 Flash、DeepSeek V4.1 Flash、Qwen 3.7 Flash 同跑: GLM 唯一全对,但最慢最贵;Jev 准确率第二、成本更低。 换成一条内容同时判断十个问题的并行任务,Jev 才显出结构优势—— 准确率最高、速度最快、成本第二低。 而 Qwen 3.7 Flash 虽然单价只有 Jev 一半,任务量一大,正确率掉约 7 个百分点。
名字本身也在讲这个赌注。Jev 取自杰文斯悖论:蒸汽机效率提高后, 单位耗煤下降,但用煤变得划算、更多行业开始烧,全社会煤炭消费反而上升。 TypeSafe 赌智能也会这样——单次判断便宜到接近免费时,判断的次数会暴涨。
亿娲的读法
我们做交付时,模型选型从来不是挑一个「最强的」。同一套系统里, 不同环节对这三列的要求本就不同:面向用户的交互环节先看延迟, 批量跑的数据处理环节先看成本,只有少数关键判定环节值得用最贵的模型。 这也是我们把多模型网关做成基础设施的原因——按任务在模型间调度, 而不是全局绑定一个。
Jev 这类模型的出现,把这件事又往前推了一层: 调度的粒度不止是「哪个模型」,还有「这一步到底要不要生成」。 一条链路里真正需要写代码、写文案的环节往往只有一两处, 其余是路由、分类、判重、要不要终止——这些用判断型模型做完, 贵的模型只在该出手的地方出手。前置一层校准过的判断, 顺带还把不确定性显式化了:低置信度自动落到人工, 比让一个大模型笃定地答错要安全。
还有一点更重要:公开榜单衡量的是通用编码能力, 不等于它在你的业务数据上的表现。真正决定效果的, 往往是数据口径、上下文组织和流程编排,而不是模型之间那几个百分点。 选型前用自己的真实任务跑一轮小样本,比照榜单排名靠得住。