聚合展示多个 AI 模型基准排行榜,实时更新
数据源健康面板
· 站点插件 v1.0.35
· 数据抓取于 26-10-02 16:21 (UTC+8:00)
12 个榜单
12/12 已就绪
936 条榜内位次(同一模型上榜两个榜算两条)
最新 Artificial Analysis · 今天
1 个榜超 14 天未更新(司南 OpenCompass)
卡片内条长按各榜榜首归一化,跨卡比较长度没有意义;各榜主指标口径见卡片标签。
预览
12 个榜 ·
936 条位次 ·
每榜最多预览前十行
代码工程
改 issue · 多语言编辑 · 长程任务
3 个榜
长程软件工程基准 · 模型 Pass@1 / 成本 / 输出 Token / Agent 步数
完整榜 ↗
竞技场
Pass@1 · %
1
美国 · OpenAI
gpt-6-astra
74%本榜冠军
-
2
美国 · Google
gemini-3-8-flash
74%
-
3
美国 · Anthropic
claude-opus-5
74%
-
4
美国 · OpenAI
gpt-5-6-sol
73%
-
5
美国 · Anthropic
claude-fable-5
70%
-
6
美国 · OpenAI
gpt-5-6-terra
70%
-
7
中国 · 智谱AI
glm-5-3
69%
-
8
中国 · 月之暗面
kimi-k3
69%
-
9
美国 · xAI
grok-4-6
67%
-
10
美国 · OpenAI
gpt-5-6-luna
67%
500 个人工校验的 GitHub issue · % 已解决(行业最权威的代码修复基准)
完整榜 ↗
评测榜
已解决率 · %
1
OR
国际 · ornith-ai
Ornith-1.5-397B
86%本榜冠军
-
2
MI
国际 · mindlab-research
Macaron-V1-Venti
86%
-
3
MI
国际 · mindlab-research
Macaron-V1-Coding-Venti
86%
-
4
OR
国际 · ornith-ai
Ornith-1.0-397B
82%
-
5
中国 · DeepSeek
DeepSeek-V4-Pro
81%
-
6
中国 · MiniMax
MiniMax-M3
81%
-
7
中国 · 月之暗面
Kimi-K2.6
80%
-
8
中国 · 零一万物
Inkling-Small
80%
-
9
中国 · DeepSeek
DeepSeek-V4-Flash
79%
-
10
OR
国际 · ornith-ai
Ornith-1.5-35B-A3B
79%
225 道 Exercism 编程题 · 6 语言代码生成/编辑通过率(Aider 官方多语言基准)
完整榜 ↗
竞技场
通过率 · %
1
美国 · OpenAI
gpt-5
88%本榜冠军
-
2
O3
国际 · o3-pro (high)
o3-pro
85%
-
3
美国 · Google
gemini-2.5-pro-preview-06-05
83%
-
4
O3
国际 · o3 (high)
o3
81%
-
5
美国 · xAI
grok-4
80%
-
6
美国 · OpenAI
o3 (high) + gpt-4.1
78%
-
7
美国 · Google
Gemini 2.5 Pro Preview 05-06
77%
-
8
中国 · DeepSeek
DeepSeek-V3.2-Exp
74%
-
9
美国 · Google
Gemini 2.5 Pro Preview 03-25
73%
-
10
美国 · Anthropic
claude-opus-4-20250514
72%
工具使用
终端操作 · 函数调用
3 个榜
真实 Shell 终端任务 · 模型 + Agent 组合 Accuracy(CLI 智能体基准)
完整榜 ↗
竞技场
Accuracy · %
1
美国 · OpenAI
GPT-6 Astra
58%本榜冠军
-
2
美国 · Anthropic
Fable 5.1
58%
-
3
美国 · Anthropic
Opus 5
54%
-
4
美国 · Anthropic
Fable 5
45%
-
5
中国 · 智谱AI
GLM-5.3
42%
-
6
美国 · xAI
Grok 4.7
38%
-
7
美国 · OpenAI
GPT-5.6 Sol
37%
-
8
美国 · Anthropic
Opus 4.8
24%
-
9
美国 · OpenAI
GPT-5.6 Terra
22%
-
10
美国 · xAI
Grok 4.6
20%
BFCL V4 · 函数调用(工具调用)综合准确率 · 伯克利 Gorilla 官方榜
完整榜 ↗
竞技场
总体准确率 · %
1
美国 · Anthropic
Claude-Opus-4-5-20251101 (FC)
77%本榜冠军
-
2
美国 · Anthropic
Claude-Sonnet-4-5-20250929 (FC)
73%
-
3
美国 · Google
Gemini-3-Pro-Preview (Prompt)
73%
-
4
中国 · 智谱AI
GLM-4.6 (FC thinking)
72%
-
5
美国 · xAI
Grok-4-1-fast-reasoning (FC)
70%
-
6
美国 · Anthropic
Claude-Haiku-4-5-20251001 (FC)
69%
-
7
美国 · Google
Gemini-3-Pro-Preview (FC)
68%
-
8
美国 · OpenAI
o3-2025-04-16 (Prompt)
63%
-
9
美国 · xAI
Grok-4-0709 (Prompt)
63%
-
10
美国 · xAI
Grok-4-0709 (FC)
61%
航司客服多轮工具调用 · 严格策略约束下的通过率 · OpenRouter 自建评测
完整榜 ↗
评测榜
通过率 · %
1
美国 · Anthropic
Anthropic: Claude Fable 5
80%本榜冠军
-
2
美国 · Anthropic
Anthropic: Claude Fable 5.1
79%
-
3
美国 · Anthropic
Anthropic: Claude Opus 5
79%
-
4
美国 · Google
Google: Gemini 3.7 Flash
78%
-
5
美国 · Amazon
Amazon: Nova Micro 1.0
78%
-
6
中国 · 智谱AI
Z.ai: GLM 5
78%
-
7
中国 · 阶跃星辰
StepFun: Step 3.7 Flash
77%
-
8
美国 · Anthropic
Anthropic: Claude Opus 4.5
77%
-
9
美国 · OpenAI
OpenAI: GPT-5.1
77%
-
10
中国 · 阿里
Qwen: Qwen3.8 27B
77%
知识与推理
博士级难题 · 全能力综合
3 个榜
3000 道博士级难题 · % 正确率(最难的通用知识 / 推理基准)
完整榜 ↗
评测榜
正确率 · %
1
中国 · DeepSeek
DeepSeek-V4.1-Flash
64%本榜冠军
-
2
中国 · 智谱AI
GLM-5.3
63%
-
3
OR
国际 · ornith-ai
Ornith-1.5-397B
56%
-
4
中国 · 月之暗面
Kimi-K3
56%
-
5
中国 · 腾讯
Hy4-preview
55%
-
6
中国 · 智谱AI
GLM-5.3-Flash
55%
-
7
中国 · 智谱AI
GLM-5.2
55%
-
8
中国 · 月之暗面
Kimi-K2.6
54%
-
9
中国 · 腾讯
Hy3
53%
-
10
DO
国际 · dots-studio
dots3-note-prev
53%
上海 AI Lab 权威全能力榜 · 官方评测集综合均分(知识 / 推理 / 数学 / 代码)
完整榜 ↗
评测榜
综合均分 · %
1
美国 · Anthropic
Claude Opus 5 (high)
83%本榜冠军
-
2
美国 · OpenAI
GPT-5.6-Sol (high)
81%
-
3
中国 · 阿里
Qwen3.8-Max
81%
-
4
美国 · OpenAI
GPT-5.5 (high)
81%
-
5
美国 · Google
Gemini-3.7-Flash
81%
-
6
中国 · 字节跳动
Doubao-Seed-2.1-Pro-260628 (high)
81%
-
7
中国 · 月之暗面
Kimi-K3 (high)
79%
-
8
美国 · xAI
Grok-4.6 (high)
78%
-
9
中国 · DeepSeek
DeepSeek-V4-Pro
78%
-
10
中国 · 月之暗面
Kimi-K2.6 (high)
76%
198 道博士级科学题 · 正确率 · OpenRouter 自建评测跑次
完整榜 ↗
评测榜
正确率 · %
1
美国 · Google
Google: Gemini 3.8 Flash
96%本榜冠军
-
2
美国 · OpenAI
OpenAI: GPT-6 Astra Pro
95%
-
3
SA
国际 · sakana
Fugu Ultra
95%
-
4
美国 · Google
Google: Gemini 3.1 Pro Preview
95%
-
5
美国 · OpenAI
OpenAI: GPT-6 Astra
94%
-
6
美国 · OpenAI
OpenAI: GPT-6.1 Sol
94%
-
7
TY
国际 · typesafe
TypeSafe: Jev Router
94%
-
8
美国 · OpenAI
OpenAI: GPT-5.6 Sol Pro
94%
-
9
美国 · Google
Google: Gemini 3.7 Flash
94%
-
10
美国 · OpenAI
OpenAI: GPT-5.5
94%
信息检索
联网找答案 · 短答事实
2 个榜
1266 道难找的联网事实题 · 正确率 · llm-stats 汇总(以厂商自报为主)
完整榜 ↗
评测榜
正确率 · %
1
中国 · 上海AI实验室
Atria Dawn Preview
93%本榜冠军
-
2
美国 · OpenAI
GPT-6 Astra
92%
-
3
中国 · 月之暗面
Kimi K3
91%
-
4
美国 · Anthropic
Claude Opus 5
91%
-
5
美国 · OpenAI
GPT-5.6 Sol
90%
-
6
美国 · OpenAI
GPT-5.5 Pro
90%
-
7
美国 · OpenAI
GPT-5.6 Terra
88%
-
8
美国 · Anthropic
Claude Mythos Preview
87%
-
9
中国 · 月之暗面
Kimi K2.6
86%
-
10
中国 · 字节跳动
Seed 2.1 Pro
86%
4326 道短答事实题 · 正确率(答错也算失败,专治「似是而非」)· llm-stats 汇总
完整榜 ↗
评测榜
正确率 · %
1
中国 · DeepSeek
DeepSeek-V3.2-Exp
97%本榜冠军
-
2
美国 · xAI
Grok 4 Fast
95%
-
3
中国 · DeepSeek
DeepSeek-V3.1
93%
-
4
中国 · DeepSeek
DeepSeek-R1-0528
92%
-
5
中国 · 百度
ERNIE 5.0
75%
-
6
美国 · Google
Gemini 3 Pro
72%
-
7
美国 · Google
Gemini 3 Flash
69%
-
8
美国 · OpenAI
GPT-4.5
63%
-
9
中国 · DeepSeek
DeepSeek-V4-Pro-Max
58%
-
10
中国 · 阿里
Qwen3 VL 32B Thinking
55%
综合智能
跨能力综合指数
1 个榜
国际综合智能指数榜 · 覆盖全球主流闭源 + 开源模型(能力 / 价格 / 速度)
完整榜 ↗
评测榜
智能指数 · 无量纲
非百分比
1
美国 · Anthropic
Claude Opus 5.5
58本榜冠军
-
2
美国 · Anthropic
Claude Sonnet 5.5
56
-
3
美国 · Anthropic
Claude Fable 5.1
53
-
4
美国 · OpenAI
GPT-6 Astra
53
-
5
美国 · Google
Gemini 4 Argon
53
-
6
美国 · OpenAI
GPT-6.1 Sol
52
-
7
美国 · Meta
Muse Spark 1.3
48
-
8
美国 · OpenAI
GPT-6 Sol
48
-
9
美国 · xAI
Grok 4.7
46
-
10
中国 · 小米
MiMo-V2.6-Pro
46
各榜前十内没有匹配的模型
完整榜里共有位次可查,进任一榜单页搜索全量。
去完整榜 →
怎么读这些榜单:为什么有的全是海外模型、有的全是国产模型?
这里聚合的榜单分属两类不同的参赛池(卡片标题下有类别标签),并非按国籍筛选:
- 竞技场(DeepSWE / Terminal-Bench / Aider Polyglot / BFCL):闭源 API 模型报名参赛,海外厂商(OpenAI / Anthropic / Google)的 API 生态更成熟,因此清一色海外模型;
- 评测榜(SWE-bench / HLE / 司南 / Artificial Analysis):开放权重模型自由提交或由评测方统一评测,国产模型(DeepSeek / GLM / Kimi / Qwen)密集上榜。
三点读法约定:
- 分组按「测什么能力」划分(代码工程 / 工具使用 / 知识与推理 / 综合智能),与「谁参赛」是两条线;
- 分数不可跨榜比大小:每个榜的口径不同(卡片标签写了主指标),Artificial Analysis 的「智能指数」还是无量纲分值,读作百分比就错了;
- 卡片内条长按本榜榜首归一化,跨卡比较条子长度没有意义。
每行模型旁的彩色首字徽标是厂商缩写(悬停 / 点按可看「地区 · 厂商」全称),配色仍按地区分:国产红、美国蓝、欧洲紫、韩国青;新鲜度小圆点悬停/聚焦可看「上游生成 / 本地抓取 / 页面渲染」三个时刻。