正在读取模型档案与评测数据…
正在读取模型档案与评测数据…
Anthropic·5 个数据来源·更新于 2026-09-26
只在同一来源、同一口径下比较。切换来源可查看不同测试结果。
当前配置:各基准设置见下表
综合分数和同榜图表来自 LLM Stats 榜单(采集于 2026-09-25);下方逐项成绩来自模型页。榜单出处
LLM Stats Score · 同一来源与榜单口径,分数越高越好
| 模型与配置 | LLM Stats Score | 每任务成本 |
|---|---|---|
| Claude Opus 5.5 | 59.7 | 未公布 |
| GPT-6 Astra | 59.5 | 未公布 |
| Claude Opus 5 | 54.8 | 未公布 |
| Claude Fable 5.1 · 当前模型 | 54.5 | 未公布 |
| GPT-5.6 Sol | 54.4 | 未公布 |
| Claude Mythos Preview | 54.3 | 未公布 |
| Claude Fable 5 | 54 | 未公布 |
不同来源的分数不能直接相加或横向比较;评测任务成本不是 API Token 单价。
7 项已收录成绩 · 保留原始单位和测试条件
Fable 5.1 with production safeguards enabled. Zapier AutomationBench private held-out set / business workflows.
成绩出处Fable 5.1 with production safeguards enabled. CursorBench 3.2.0 (catalog id cursorbench-3.2).
成绩出处Fable 5.1 with production safeguards enabled. GDPval-AA v2 Elo (max_score 3000); not the older GDPval-AA Elo figures from Fable 5.
成绩出处Fable 5.1 with production safeguards enabled. Multidisciplinary reasoning with tools.
成绩出处Fable 5.1 with production safeguards enabled. OSWorld 2.0 partial score on the authors' August 2026 task release (not comparable to earlier OSWorld numbers). Safeguard interventions scored zero on OSWorld 2.0.
成绩出处Fable 5.1 with production safeguards enabled. Terminal-Bench 4.0 (not Terminal-Bench 2.1). Mythos 5.1 scored 60.9% on the same table.
成绩出处Fable 5.1 with production safeguards enabled. Terminal-Bench-Science 0.1 accuracy; SE ±3.5–4.5 pts. Public leaderboard uses a different setup (3 trials/task, Claude Code harness).
成绩出处只展示有可靠来源的资料;优先采用厂商官网与官方模型仓库。
美元 / 百万 Token。不同服务商或测试配置的报价分别列出。
| 来源 / 服务商 | 输入 | 输出 | 缓存读取 |
|---|---|---|---|
| Anthropic | $10 | $50 | $0.25 |
同名模型通过开发机构和明确版本关联。预览版、日期版本和不同规模模型分别建档。
公开评测数据;保留来源原始口径
公开模型页与公开榜单;自报成绩单独标识
公开评测数据;保留来源原始口径
Arena 官方公开数据集 · CC BY 4.0
公开模型目录与 API 报价
| 来源 / 配置 | 采集时间 | 原始数据 |
|---|---|---|
| Artificial AnalysisClaude Fable 5.1 (max with fallback)SHA-256 b9324ff6388c2fd3… | 2026-09-25T19:40:27Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (xhigh with fallback)SHA-256 b9324ff6388c2fd3… | 2026-09-25T19:40:27Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (high with fallback)SHA-256 b9324ff6388c2fd3… | 2026-09-25T19:40:27Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (medium with fallback)SHA-256 b9324ff6388c2fd3… | 2026-09-25T19:40:27Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (low with fallback)SHA-256 b9324ff6388c2fd3… | 2026-09-25T19:40:27Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)SHA-256 5beb2f0dcdc468c1… | 2026-09-26T00:27:47Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)SHA-256 5beb2f0dcdc468c1… | 2026-09-26T00:27:47Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)SHA-256 5beb2f0dcdc468c1… | 2026-09-26T00:27:47Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)SHA-256 5beb2f0dcdc468c1… | 2026-09-26T00:27:47Z | 查看来源 |
| Artificial AnalysisClaude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)SHA-256 5beb2f0dcdc468c1… | 2026-09-26T00:27:47Z | 查看来源 |
| LLM StatsClaude Fable 5.1 | 2026-09-25T19:40:20Z | 查看来源 |
| LLM StatsClaude Fable 5.1SHA-256 161db7b156333c1e… | 2026-09-26T00:28:59Z | 查看来源 |
| BenchLMClaude Fable 5.1 | 2026-09-24 | 查看来源 |
| ArenaClaude Fable 5.1 (Max) | 2026-09-25T19:40:08Z | 查看来源 |
| OpenRouterClaude Fable 5.1SHA-256 4c26b1452fbd2acd… | 2026-09-26T00:28:52Z | 查看来源 |