正在读取模型档案与评测数据…
正在读取模型档案与评测数据…
Anthropic·2 个数据来源·更新于 2026-09-26
只在同一来源、同一口径下比较。切换来源可查看不同测试结果。
当前配置:各基准设置见下表
不同来源的分数不能直接相加或横向比较;评测任务成本不是 API Token 单价。
8 项已收录成绩 · 保留原始单位和测试条件
Extended thinking (up to 64K tokens). AIME 2025 using nucleus sampling with a top_p of 0.95.
成绩出处Extended thinking (up to 64K tokens). Average over 14 non-English languages.
成绩出处No extended thinking. Simple scaffold with bash tool and file editing tool via string replacements. Scores reported out of full 500 problems.
成绩出处Extended thinking with tool use (up to 64K tokens, prompt addendum, increased max steps from 30 to 100).
成绩出处Extended thinking with tool use (up to 64K tokens, prompt addendum, increased max steps from 30 to 100).
成绩出处只展示有可靠来源的资料;优先采用厂商官网与官方模型仓库。
美元 / 百万 Token。不同服务商或测试配置的报价分别列出。
| 来源 / 服务商 | 输入 | 输出 | 缓存读取 |
|---|---|---|---|
| OpenRouter · anthropic/claude-opus-4.1 | $15 | $75 | $1.5 |
同名模型通过开发机构和明确版本关联。预览版、日期版本和不同规模模型分别建档。
公开模型页与公开榜单;自报成绩单独标识
公开模型目录与 API 报价