看实测成本,别看单价
推理档位不改变单价 —— Claude Opus 5 的 low 和 max 都是 $5 / 1M。档位改变的是模型消耗的推理 Token 数量,所以真正拉开差距的是实际账单:跑完同一套评测,Opus 5 的 low 花 $162,max 花 $1,619,差 10 倍。默认横轴用的就是这个实测成本。
同一个模型,不同档位是不同的产品。
Claude Opus 5 在 low 和 max 之间差了 11.4 分,价格却是同一个。
这个站把每个「模型 × 推理档位」作为独立一行来比,而不是给每个模型一个笼统的分数。
每个点是一个推理档位,同一模型的档位按 low→max 连成一条梯。鼠标悬停看模型名与数据;点击空白处放置准线。
—
从最低档升到最高档,多花的钱换来多少分。只统计有两个以上实测档位的模型。
一档一行。分数来自该档位自己的独立评测,不从模型总分推算。
| 模型 | 档位 | 智能指数 | 实测成本 | 输入 / 1M | 输出 / 1M | 每美元分数 | 上下文 |
|---|
—
三件容易读错的事。
推理档位不改变单价 —— Claude Opus 5 的 low 和 max 都是 $5 / 1M。档位改变的是模型消耗的推理 Token 数量,所以真正拉开差距的是实际账单:跑完同一套评测,Opus 5 的 low 花 $162,max 花 $1,619,差 10 倍。默认横轴用的就是这个实测成本。
把横轴切成「输入单价 / 输出单价 / 混合价」时,同一模型的各档位会重合成一条竖线 —— 这不是画错了,而是单价确实与档位无关。竖线的含义是:同样的单价,档位决定你能拿到多少智能(以及付出多少实际成本)。
Artificial Analysis 对少数尚未完整跑测的档位给出估算值并自行标记,本站原样保留这个标记。空心点即估算,实心点为实测。没有分数的档位不会被填补,直接不出现。
厂商直价与 OpenRouter 聚合价常有出入(Kimi K3 相差近一倍)。本站两套都保留,可在图表上切换,不替你做取舍。
ChatGPT / Codex 的最高档 ultra 是客户端编排模式 —— 官方文档说明它用多个子代理并行处理任务,不是 API 的 reasoning.effort 参数。因此它既没有档位级评测分,也没有实测成本。图上从最高档位点向右上画虚线开口箭头:还有更高一档,但位置未知,绝不给它编一个坐标。悬停箭头或查明细表可以看到它。
60 个档位如果都标上模型名,画面会糊成一片、引线也容易指错。所以图上只有点和梯,模型名与全部数据都在悬停提示里。点击任意点会联动到下方明细表的对应行。
在图表空白处点一下,会出现两条虚线分别落到横纵坐标轴上,并在轴上标出该位置对应的成本与智能指数,方便横向比对。再点同一处、或双击图表可收起。切换标度和筛选时准线会保留。