AI2D厂商自报 · 越高越好
84.2%
multimodal evaluation
成绩出处BIG-Bench Extra Hard厂商自报 · 越高越好
16.3%
0-shot evaluation
成绩出处BIG-Bench Hard厂商自报 · 越高越好
85.7%
0-shot evaluation
成绩出处Bird-SQL (dev)厂商自报 · 越高越好
47.9%
- evaluation
成绩出处ChartQA厂商自报 · 越高越好
75.7%
multimodal evaluation
成绩出处DocVQA厂商自报 · 越高越好
87.1%
multimodal evaluation
成绩出处ECLeKTic厂商自报 · 越高越好
10.3%
0-shot evaluation
成绩出处FACTS Grounding厂商自报 · 越高越好
75.8%
- evaluation
成绩出处Global-MMLU-Lite厂商自报 · 越高越好
69.5%
0-shot evaluation
成绩出处GPQA厂商自报 · 越高越好
40.9%
0-shot evaluation diamond
成绩出处GSM8k厂商自报 · 越高越好
94.4%
0-shot evaluation
成绩出处HiddenMath厂商自报 · 越高越好
54.5%
0-shot evaluation
成绩出处HumanEval厂商自报 · 越高越好
85.4%
0-shot evaluation
成绩出处IFEval厂商自报 · 越高越好
88.9%
0-shot evaluation
成绩出处InfoVQA厂商自报 · 越高越好
64.9%
multimodal evaluation
成绩出处LiveCodeBench厂商自报 · 越高越好
24.6%
0-shot evaluation
成绩出处MATH厂商自报 · 越高越好
83.8%
0-shot evaluation
成绩出处MathVista-Mini厂商自报 · 越高越好
62.9%
multimodal evaluation
成绩出处MBPP厂商自报 · 越高越好
0.73%
3-shot evaluation
成绩出处MMLU-Pro厂商自报 · 越高越好
60.6%
0-shot evaluation
成绩出处MMMU (val)厂商自报 · 越高越好
59.6%
multimodal evaluation
成绩出处Natural2Code厂商自报 · 越高越好
80.7%
0-shot evaluation
成绩出处SimpleQA厂商自报 · 越高越好
6.3%
0-shot evaluation
成绩出处TextVQA厂商自报 · 越高越好
67.7%
multimodal evaluation
成绩出处VQAv2 (val)厂商自报 · 越高越好
71.6%
multimodal evaluation
成绩出处WMT24++厂商自报 · 越高越好
51.6%
0-shot evaluation
成绩出处