Aider-Polyglot厂商自报 · 越高越好
71.6%
Thinking mode
成绩出处AIME 2024厂商自报 · 越高越好
91.4%
Pass@1, Thinking mode
成绩出处AIME 2025厂商自报 · 越高越好
87.5%
Pass@1, Thinking mode
成绩出处BrowseComp厂商自报 · 越高越好
8.9%
Search agent with pre-defined workflow
成绩出处BrowseComp-zh厂商自报 · 越高越好
35.7%
Search agent with pre-defined workflow
成绩出处CodeForces厂商自报 · 越高越好
0.64分
Div1 Rating, Thinking mode
成绩出处GPQA厂商自报 · 越高越好
81%
Pass@1, Thinking mode
成绩出处HMMT 2025厂商自报 · 越高越好
79.4%
Pass@1, Thinking mode
成绩出处Humanity's Last Exam厂商自报 · 越高越好
17.7%
Pass@1, Thinking mode, text-only subset
成绩出处LiveCodeBench厂商自报 · 越高越好
73.3%
Pass@1, 2408-2505, Thinking mode
成绩出处MMLU-Pro厂商自报 · 越高越好
85%
Thinking mode
成绩出处MMLU-Redux厂商自报 · 越高越好
93.4%
Thinking mode
成绩出处SimpleQA厂商自报 · 越高越好
92.3%
Search agent evaluation
成绩出处SWE-bench Multilingual厂商自报 · 越高越好
30.5%
Agent mode
成绩出处SWE-Bench Verified厂商自报 · 越高越好
44.6%
Agent mode
成绩出处Terminal-Bench厂商自报 · 越高越好
5.7%
Terminus 1 framework
成绩出处