AI2D厂商自报 · 越高越好
84.5%
multimodal evaluation
成绩出处BIG-Bench Extra Hard厂商自报 · 越高越好
19.3%
0-shot evaluation
成绩出处BIG-Bench Hard厂商自报 · 越高越好
87.6%
0-shot evaluation
成绩出处Bird-SQL (dev)厂商自报 · 越高越好
54.4%
- evaluation
成绩出处ChartQA厂商自报 · 越高越好
78%
multimodal evaluation
成绩出处DocVQA厂商自报 · 越高越好
86.6%
multimodal evaluation
成绩出处ECLeKTic厂商自报 · 越高越好
16.7%
0-shot evaluation
成绩出处FACTS Grounding厂商自报 · 越高越好
74.9%
- evaluation
成绩出处Global-MMLU-Lite厂商自报 · 越高越好
75.1%
0-shot evaluation
成绩出处GPQA厂商自报 · 越高越好
42.4%
0-shot evaluation diamond
成绩出处GSM8k厂商自报 · 越高越好
95.9%
0-shot evaluation
成绩出处HiddenMath厂商自报 · 越高越好
60.3%
0-shot evaluation
成绩出处HumanEval厂商自报 · 越高越好
87.8%
0-shot evaluation
成绩出处IFEval厂商自报 · 越高越好
90.4%
0-shot evaluation
成绩出处InfoVQA厂商自报 · 越高越好
70.6%
multimodal evaluation
成绩出处LiveCodeBench厂商自报 · 越高越好
29.7%
0-shot evaluation
成绩出处MATH厂商自报 · 越高越好
89%
0-shot evaluation
成绩出处MathVista-Mini厂商自报 · 越高越好
67.6%
multimodal evaluation
成绩出处MBPP厂商自报 · 越高越好
0.74%
3-shot evaluation
成绩出处MMLU-Pro厂商自报 · 越高越好
67.5%
0-shot evaluation
成绩出处MMMU (val)厂商自报 · 越高越好
64.9%
multimodal evaluation
成绩出处MRCR v2 (8-needle)厂商自报 · 越高越好
13.5%
128k (non-thinking)
成绩出处Natural2Code厂商自报 · 越高越好
84.5%
0-shot evaluation
成绩出处SimpleQA厂商自报 · 越高越好
10%
0-shot evaluation
成绩出处TextVQA厂商自报 · 越高越好
65.1%
multimodal evaluation
成绩出处VQAv2 (val)厂商自报 · 越高越好
71%
multimodal evaluation
成绩出处WMT24++厂商自报 · 越高越好
53.4%
0-shot evaluation
成绩出处