正在读取模型档案与评测数据…
正在读取模型档案与评测数据…
Google·1 个数据来源·更新于 2026-09-26
只在同一来源、同一口径下比较。切换来源可查看不同测试结果。
当前配置:各基准设置见下表
不同来源的分数不能直接相加或横向比较;评测任务成本不是 API Token 单价。
13 项已收录成绩 · 保留原始单位和测试条件
Ability to provide factuality correct responses given documents and diverse user requests
成绩出处Challenging dataset of questions written by domain experts in biology, physics, and chemistry
成绩出处Code generation in Python. Code Generation subset covering more recent examples: 06/01/2024 - 10/05/2024
成绩出处Challenging math problems including algebra, geometry, pre-calculus, and others
成绩出处Multi-discipline college-level multimodal understanding and reasoning problems
成绩出处只展示有可靠来源的资料;优先采用厂商官网与官方模型仓库。
美元 / 百万 Token。不同服务商或测试配置的报价分别列出。
同名模型通过开发机构和明确版本关联。预览版、日期版本和不同规模模型分别建档。
公开模型页与公开榜单;自报成绩单独标识
| 来源 / 配置 | 采集时间 | 原始数据 |
|---|---|---|
| LLM StatsGemini 2.0 FlashSHA-256 a67615f6e3b85d2b… | 2026-09-26T00:30:52Z | 查看来源 |