BLOG
模型评测选型

16 个前沿模型的编码评测:解题率第一的,不是你该上生产的那个

亿娲AI · 技术团队约 14 分钟

榜单看多了容易生出一个错觉:第一名就是该用的那个。这一轮数据恰好是反例。 解题率最高的 GPT-6 Astra 是 80.0%,排第三的 GPT-5.6 Sol 是 76.7%, 只差 3.3 个百分点;但每道解对的题,前者花 $0.1384,后者花 $0.0468,差近三倍。

这轮评测覆盖 16 个前沿模型,题目是高频生成的新鲜编码任务, 共消耗 21 百万 token、$110 算力成本。 把解题率、每题成本、中位耗时三列摆在一起,名次给出的结论就没那么牢靠了。

本文要点

  • 解题率榜首 GPT-6 Astra(80.0%),但它对第二、第三名的领先在统计上并不显著
  • 最值得先测的是 GPT-5.6 Sol:76.7% 解题率,每题成本只有 Astra 的三分之一
  • 开源权重最强是 DeepSeek V4 Pro(75.0%),代价是中位耗时 435 秒——全榜最慢
  • 每题成本从 $0.0018 到 $0.5774,差 300 多倍;中位耗时从 6 秒到 435 秒,差 70 倍
  • 相邻名次的 15 组两两对比里,没有一组达到统计显著

能力和成本放在一起,结论就变了

解题率放纵轴、每题成本放横轴,16 个模型立刻分出三类: 右上角又好又便宜,左上角贵但强,下方是解题率不够用的。 绿线是「值得买前沿」——落在线上,意味着没有任何模型能在解题率和成本上同时超过它。

yiwaai.com — 前沿模型评测 — 能力 vs 成本

2026-09-20 · 每题成本占最贵模型的百分比(向右更便宜)

值得买不值得1234567891011121314151680%27%100%0%每题成本 · 占最贵模型的百分比(向右更便宜)解题率(向上更高)1gpt-6-astra占最贵 24%2grok-4.6占最贵 25%×3gpt-5.6-sol占最贵 8%4claude-opus-5占最贵 66%×5deepseek-v4-pro-0813占最贵 10%×6deepseek-v4.1-flash占最贵 3%7muse-spark-1.3占最贵 13%×8qwen-3-8-max占最贵 23%×9claude-fable-5-1占最贵 100%×10gemini-3.8-flash占最贵 11%×11nvidia-nemotron-3-ultra-550b-a55b占最贵 39%×12gpt-5.6-terra占最贵 12%×13kimi-k3占最贵 33%×14gpt-5.6-luna占最贵 1%×15zai-org-glm-5-3-flash占最贵 1%16mercury-2.5占最贵 0%台阶线 = 值得买前沿 · × = 成本被支配OpenAISpaceXAIAnthropicHigh-FlyerMetaAlibabaGoogleNVIDIAMoonshot AIzaiother

图 1 · 能力与成本的关系。横轴向右更便宜,纵轴向上解题率更高,右上角是「又好又便宜」。绿色台阶线是值得买前沿:给定预算下能达到的最高解题率,线下方的点都存在更便宜且解题率不低的替代品

数据来源:yiwaai.com

最扎眼的是 claude-fable-5-1:它孤零零落在图的最左边,每题 $0.5774, 是全榜最贵的一个,解题率却只有 68.3%,排第九——花最多的钱买第九名。 gpt-5.6-sol 和 deepseek-v4.1-flash 则都落在前沿线上: 前者用 8% 的成本拿到 76.7%,后者用 3% 的成本拿到 73.2%。

完整榜单

名次按解题率排,箭头是相对上一轮的变动。这一轮动得不小: Claude Opus 5 上升 7 位到第 4,GPT-5.6 Terra 下滑 9 位到第 12。

yiwaai.com — 前沿模型评测 — 当前榜单

2026-09-20 · 高频抗污染排名

#模型解题率比最慢快比最贵便宜
1gpt-6-astra80.0%94%76%
2▲3grok-4.676.8%50%75%
3▼1gpt-5.6-sol76.7%84%92%
4▲7claude-opus-575.4%94%34%
5▲3deepseek-v4-pro-081375.0%最慢90%
6▲3deepseek-v4.1-flash73.2%69%97%
7muse-spark-1.370.0%62%87%
8▼2qwen-3-8-max70.0%71%77%
9▼2claude-fable-5-168.3%96%最贵
10▼6gemini-3.8-flash64.4%95%89%
11▼1nvidia-nemotron-3-ultra-550b-a55b64.0%73%61%
12▼9gpt-5.6-terra60.0%87%88%
13kimi-k358.0%87%67%
14gpt-5.6-luna52.0%90%99%
15zai-org-glm-5-3-flash44.0%95%99%
16mercury-2.526.7%99%100%

表 1 · 完整榜单。名次后的箭头是相对上一轮的变动,绿升红降;色块对应厂商

数据来源:yiwaai.com

延迟:容易被忽略的第三个维度

中位耗时从 6 秒到 435 秒,差 70 倍。这一列决定一个模型能放在系统的什么位置上: 交互式补全和离线批处理能容忍的延迟,根本不是一个量级。

yiwaai.com — 前沿模型评测 — 解题耗时

2026-09-20 · 圆点 = 中位数,横线 = +1σ 波动范围

0200400600800gpt-6-astra26s ±63grok-4.6218s ±310gpt-5.6-sol69s ±70claude-opus-525s ±224deepseek-v4-pro-0813435s ±332deepseek-v4.1-flash135s ±329muse-spark-1.3167s ±125qwen-3-8-max128s ±347claude-fable-5-119s ±208gemini-3.8-flash23s ±79nvidia-nemotron-3-ultra-5…118s ±156gpt-5.6-terra56s ±51kimi-k358s ±226gpt-5.6-luna43s ±28zai-org-glm-5-3-flash22s ±262mercury-2.56s ±2每题耗时(秒)

图 2 · 解题耗时。圆点是中位数,横线向右延伸一个标准差,代表这个模型的耗时波动范围

数据来源:yiwaai.com

gpt-6-astra 的真正优势在这里显出来:解题率第一,中位耗时只有 26 秒,又快又准。 deepseek-v4-pro-0813 的 75.0% 则是拿 435 秒换来的; 同门的 deepseek-v4.1-flash 让出 1.8 个百分点,把耗时压到 135 秒、成本降到 3%。 对多数团队来说,后者更实用。

为什么名次不该当定论

把相邻名次的两个模型摆在一起,只数「一方解对、另一方没解对」的题, 差距立刻小得可疑。Astra 对 Grok 4.6 是 6 比 3,Sol 对 Opus 5 是 4 比 1—— 这个样本量说明不了谁一定更强。

yiwaai.com — 前沿模型评测 — 头对头

2026-09-20 · 相邻名次之间的分歧题 · 每条只计只有该模型解对的题

grok-4.6
3
6
gpt-6-astra

p=0.51 · 不显著 · 47 题结果一致

gpt-5.6-sol
4
2
grok-4.6

p=0.69 · 不显著 · 50 题结果一致

claude-opus-5
1
4
gpt-5.6-sol

p=0.38 · 不显著 · 52 题结果一致

deepseek-v4-pro-0813
2
4
claude-opus-5

p=0.69 · 不显著 · 46 题结果一致

deepseek-v4.1-flash
2
2
deepseek-v4-pro-0813

p=1 · 不显著 · 46 题结果一致

muse-spark-1.3
2
8
deepseek-v4.1-flash

p=0.11 · 不显著 · 36 题结果一致

qwen-3-8-max
6
4
muse-spark-1.3

p=0.75 · 不显著 · 35 题结果一致

claude-fable-5-1
6
5
qwen-3-8-max

p=1 · 不显著 · 39 题结果一致

gemini-3.8-flash
6
9
claude-fable-5-1

p=0.61 · 不显著 · 44 题结果一致

nvidia-nemotron-3-ultra-550b-a55b
6
6
gemini-3.8-flash

p=1 · 不显著 · 45 题结果一致

gpt-5.6-terra
4
6
nvidia-nemotron-3-ultra-550b-a55b

p=0.75 · 不显著 · 48 题结果一致

kimi-k3
6
7
gpt-5.6-terra

p=1 · 不显著 · 47 题结果一致

gpt-5.6-luna
4
8
kimi-k3

p=0.39 · 不显著 · 48 题结果一致

zai-org-glm-5-3-flash
5
12
gpt-5.6-luna

p=0.14 · 不显著 · 35 题结果一致

mercury-2.5
2
9
zai-org-glm-5-3-flash

p=0.065 · 不显著 · 41 题结果一致

图 3 · 相邻名次的头对头。每条的长度是「只有这一方解对」的题数,中间数字是两边结果一致的题数。15 组对比没有一组达到统计显著

数据来源:yiwaai.com

15 组对比,没有一组达到统计显著,p 值最低的一组也只到 0.065。 换成 Elo 看更直观:几乎所有模型的置信区间都彼此重叠。

yiwaai.com — 前沿模型评测 — Elo

2026-09-20 · 圆点 = 点估计,横线 = bootstrap 置信区间

75010001250150017502000gpt-6-astra1817 (1683–2092)gpt-5.6-sol1721 (1589–1963)grok-4.61652 (1506–1801)claude-opus-51628 (1501–1811)deepseek-v4.1-flash1595 (1448–1754)gemini-3.8-flash1572 (1405–1733)muse-spark-1.31553 (1320–1754)deepseek-v4-pro-08131543 (1399–1709)claude-fable-5-11531 (1405–1678)qwen-3-8-max1491 (1289–1662)nvidia-nemotron-3-ultra-5…1490 (1330–1611)gpt-5.6-terra1423 (1257–1576)kimi-k31417 (1259–1545)zai-org-glm-5-3-flash1380 (1059–1572)gpt-5.6-luna1376 (1170–1530)mercury-2.5810 (669–906)Elo

图 4 · Elo 评分(Bradley-Terry,按题目难度加权)。圆点是点估计,横线是 bootstrap 置信区间。注意几乎所有区间都彼此重叠——这正是名次不该被当作定论的原因

数据来源:yiwaai.com

Elo 榜的顺序和解题率榜并不一致。gpt-5.6-sol 在 Elo 上排第二(1721), 反超解题率第二的 grok-4.6(1652)——Elo 按题目难度加权, 而 Sol 在难题上更稳。两个榜单谁更对,取决于你的任务里难题占多少。

如果你要路由大量编码任务,Sol 是该先测的那个模型。

— 本轮榜单数据

三类场景,三个不同的选择

把上面几张图叠起来看,选型结论会按场景分叉:

  • 要最高解题率、预算不敏感:GPT-6 Astra。80.0% 解题率, 26 秒中位耗时,代价是每题 $0.1384。
  • 大批量生产任务:GPT-5.6 Sol。落后 Astra 3.3 个百分点, 成本只有三分之一,中位耗时 69 秒。实际意义上的默认选项。
  • 必须用开源权重:DeepSeek V4 Pro(75.0%)最强,也最慢; 延迟有要求就换 V4.1 Flash,用 1.8 个百分点换来 135 秒耗时和 3% 的成本。
  • 不建议:为这类工作负载付 Claude Fable 5.1 的价格。 68.3% 的解题率配全榜最高的每题成本,账算不过来。

为什么不直接看那些常见的基准分

老基准会被模型、厂商和调 prompt 的人反复见到,分数越好看, 对「现在该部署什么」的参考价值越低。高频生成全新题目衡量的是当前的编码能力, 而不是模型认出旧考题的能力。

还有一个问题:这些活真的需要前沿模型吗

上面三列都在回答「哪个模型更强」。但在真实系统里,还有一个更靠前的问题: 这次调用到底需不需要一个会写代码、会推理的模型。 同期发布的 Jev 正好是这个问题的极端答案。

Jev 来自 TypeSafe AI,创始人 Diogo Almeida 此前在 OpenAI 参与过 RLHF 与 InstructGPT 的研究。 它的能力边界被砍得很窄:不聊天、不写代码、不生成文字, 只接收非结构化输入,一次并行计算就吐出带校准概率的结构化判断—— 预定义类型内的选择、评分或布尔值。官方口径是端到端 70 到 500 毫秒, 输入 $0.042 / 百万 token、输出免费,单次决策约 $0.0004。

把这个数量级放回上面的表里对照一下:本轮最便宜的编码模型每题 $0.0018, 最贵的 $0.5774。一次 Jev 判断的成本比前者还低一个身位, 延迟则落在毫秒级,而全榜最快的模型中位耗时是 6 秒。 两者当然不做同一件事——但这正是要点:把分类、路由、初筛这类判断 交给一个会写代码的模型,付的是它写代码的价钱。

第三方实测也支持这个分工。有人拿 100 道「是否与 AI 相关」的预筛题, 让 Jev 与 GLM-5.3 Flash、DeepSeek V4.1 Flash、Qwen 3.7 Flash 同跑: GLM 唯一全对,但最慢最贵;Jev 准确率第二、成本更低。 换成一条内容同时判断十个问题的并行任务,Jev 才显出结构优势—— 准确率最高、速度最快、成本第二低。 而 Qwen 3.7 Flash 虽然单价只有 Jev 一半,任务量一大,正确率掉约 7 个百分点。

名字本身也在讲这个赌注。Jev 取自杰文斯悖论:蒸汽机效率提高后, 单位耗煤下降,但用煤变得划算、更多行业开始烧,全社会煤炭消费反而上升。 TypeSafe 赌智能也会这样——单次判断便宜到接近免费时,判断的次数会暴涨。

亿娲的读法

我们做交付时,模型选型从来不是挑一个「最强的」。同一套系统里, 不同环节对这三列的要求本就不同:面向用户的交互环节先看延迟, 批量跑的数据处理环节先看成本,只有少数关键判定环节值得用最贵的模型。 这也是我们把多模型网关做成基础设施的原因——按任务在模型间调度, 而不是全局绑定一个。

Jev 这类模型的出现,把这件事又往前推了一层: 调度的粒度不止是「哪个模型」,还有「这一步到底要不要生成」。 一条链路里真正需要写代码、写文案的环节往往只有一两处, 其余是路由、分类、判重、要不要终止——这些用判断型模型做完, 贵的模型只在该出手的地方出手。前置一层校准过的判断, 顺带还把不确定性显式化了:低置信度自动落到人工, 比让一个大模型笃定地答错要安全。

还有一点更重要:公开榜单衡量的是通用编码能力, 不等于它在你的业务数据上的表现。真正决定效果的, 往往是数据口径、上下文组织和流程编排,而不是模型之间那几个百分点。 选型前用自己的真实任务跑一轮小样本,比照榜单排名靠得住。