聚合展示多个 AI 模型基准排行榜,实时更新

数据源健康面板 · 站点插件 v1.0.35 · 数据抓取于 26-10-02 16:21 (UTC+8:00)

12 个榜单 12/12 已就绪 936 条榜内位次(同一模型上榜两个榜算两条) 最新 Artificial Analysis · 今天 1 个榜超 14 天未更新(司南 OpenCompass)

卡片内条长按各榜榜首归一化,跨卡比较长度没有意义;各榜主指标口径见卡片标签。

预览

12 个榜 · 936 条位次 · 每榜最多预览前十行

代码工程

改 issue · 多语言编辑 · 长程任务 3 个榜

DeepSWE

长程软件工程基准 · 模型 Pass@1 / 成本 / 输出 Token / Agent 步数
竞技场 Pass@1 · %
1 gpt-6-astra 74%本榜冠军
  • 2 gemini-3-8-flash 74%
  • 3 claude-opus-5 74%
  • 4 gpt-5-6-sol 73%
  • 5 claude-fable-5 70%
  • 6 gpt-5-6-terra 70%
  • 7 glm-5-3 69%
  • 8 kimi-k3 69%
  • 9 grok-4-6 67%
  • 10 gpt-5-6-luna 67%
10 天前 上游生成26-09-22 14:27 (UTC+8:00) 本地抓取26-10-02 16:16 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 28 个模型

SWE-bench Verified

500 个人工校验的 GitHub issue · % 已解决(行业最权威的代码修复基准)
评测榜 已解决率 · %
1 OR Ornith-1.5-397B 86%本榜冠军
  • 2 MI Macaron-V1-Venti 86%
  • 3 MI Macaron-V1-Coding-Venti 86%
  • 4 OR Ornith-1.0-397B 82%
  • 5 DeepSeek-V4-Pro 81%
  • 6 MiniMax-M3 81%
  • 7 Kimi-K2.6 80%
  • 8 Inkling-Small 80%
  • 9 DeepSeek-V4-Flash 79%
  • 10 OR Ornith-1.5-35B-A3B 79%
今天 本地抓取26-10-02 16:06 (UTC+8:00) 本地抓取26-10-02 16:06 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 57 个模型

Aider Polyglot

225 道 Exercism 编程题 · 6 语言代码生成/编辑通过率(Aider 官方多语言基准)
竞技场 通过率 · %
1 gpt-5 88%本榜冠军
  • 2 O3 o3-pro 85%
  • 3 gemini-2.5-pro-preview-06-05 83%
  • 4 O3 o3 81%
  • 5 grok-4 80%
  • 6 o3 (high) + gpt-4.1 78%
  • 7 Gemini 2.5 Pro Preview 05-06 77%
  • 8 DeepSeek-V3.2-Exp 74%
  • 9 Gemini 2.5 Pro Preview 03-25 73%
  • 10 claude-opus-4-20250514 72%
今天 本地抓取26-10-02 16:01 (UTC+8:00) 本地抓取26-10-02 16:01 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 55 个模型

工具使用

终端操作 · 函数调用 3 个榜

Terminal-Bench

真实 Shell 终端任务 · 模型 + Agent 组合 Accuracy(CLI 智能体基准)
竞技场 Accuracy · %
1 GPT-6 Astra 58%本榜冠军
  • 2 Fable 5.1 58%
  • 3 Opus 5 54%
  • 4 Fable 5 45%
  • 5 GLM-5.3 42%
  • 6 Grok 4.7 38%
  • 7 GPT-5.6 Sol 37%
  • 8 Opus 4.8 24%
  • 9 GPT-5.6 Terra 22%
  • 10 Grok 4.6 20%
10 天前 上游生成26-09-22 05:28 (UTC+8:00) 本地抓取26-10-02 16:06 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 15 个模型

Berkeley Function Calling

BFCL V4 · 函数调用(工具调用)综合准确率 · 伯克利 Gorilla 官方榜
竞技场 总体准确率 · %
1 Claude-Opus-4-5-20251101 (FC) 77%本榜冠军
  • 2 Claude-Sonnet-4-5-20250929 (FC) 73%
  • 3 Gemini-3-Pro-Preview (Prompt) 73%
  • 4 GLM-4.6 (FC thinking) 72%
  • 5 Grok-4-1-fast-reasoning (FC) 70%
  • 6 Claude-Haiku-4-5-20251001 (FC) 69%
  • 7 Gemini-3-Pro-Preview (FC) 68%
  • 8 o3-2025-04-16 (Prompt) 63%
  • 9 Grok-4-0709 (Prompt) 63%
  • 10 Grok-4-0709 (FC) 61%
今天 本地抓取26-10-02 15:46 (UTC+8:00) 本地抓取26-10-02 15:46 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 109 个模型

τ²-Bench Airline

航司客服多轮工具调用 · 严格策略约束下的通过率 · OpenRouter 自建评测
评测榜 通过率 · %
1 Anthropic: Claude Fable 5 80%本榜冠军
  • 2 Anthropic: Claude Fable 5.1 79%
  • 3 Anthropic: Claude Opus 5 79%
  • 4 Google: Gemini 3.7 Flash 78%
  • 5 Amazon: Nova Micro 1.0 78%
  • 6 Z.ai: GLM 5 78%
  • 7 StepFun: Step 3.7 Flash 77%
  • 8 Anthropic: Claude Opus 4.5 77%
  • 9 OpenAI: GPT-5.1 77%
  • 10 Qwen: Qwen3.8 27B 77%
今天 上游生成26-10-02 14:00 (UTC+8:00) 本地抓取26-10-02 16:21 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 142 个模型

知识与推理

博士级难题 · 全能力综合 3 个榜

Humanity's Last Exam

3000 道博士级难题 · % 正确率(最难的通用知识 / 推理基准)
评测榜 正确率 · %
1 DeepSeek-V4.1-Flash 64%本榜冠军
  • 2 GLM-5.3 63%
  • 3 OR Ornith-1.5-397B 56%
  • 4 Kimi-K3 56%
  • 5 Hy4-preview 55%
  • 6 GLM-5.3-Flash 55%
  • 7 GLM-5.2 55%
  • 8 Kimi-K2.6 54%
  • 9 Hy3 53%
  • 10 DO dots3-note-prev 53%
今天 本地抓取26-10-02 16:06 (UTC+8:00) 本地抓取26-10-02 16:06 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 59 个模型

司南 OpenCompass

上海 AI Lab 权威全能力榜 · 官方评测集综合均分(知识 / 推理 / 数学 / 代码)
评测榜 综合均分 · %
1 Claude Opus 5 (high) 83%本榜冠军
  • 2 GPT-5.6-Sol (high) 81%
  • 3 Qwen3.8-Max 81%
  • 4 GPT-5.5 (high) 81%
  • 5 Gemini-3.7-Flash 81%
  • 6 Doubao-Seed-2.1-Pro-260628 (high) 81%
  • 7 Kimi-K3 (high) 79%
  • 8 Grok-4.6 (high) 78%
  • 9 DeepSeek-V4-Pro 78%
  • 10 Kimi-K2.6 (high) 76%
39 天 超 14 天 上游生成26-08-24 08:00 (UTC+8:00) 本地抓取26-10-02 16:06 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 15 个模型

GPQA Diamond

198 道博士级科学题 · 正确率 · OpenRouter 自建评测跑次
评测榜 正确率 · %
1 Google: Gemini 3.8 Flash 96%本榜冠军
  • 2 OpenAI: GPT-6 Astra Pro 95%
  • 3 SA Fugu Ultra 95%
  • 4 Google: Gemini 3.1 Pro Preview 95%
  • 5 OpenAI: GPT-6 Astra 94%
  • 6 OpenAI: GPT-6.1 Sol 94%
  • 7 TY TypeSafe: Jev Router 94%
  • 8 OpenAI: GPT-5.6 Sol Pro 94%
  • 9 Google: Gemini 3.7 Flash 94%
  • 10 OpenAI: GPT-5.5 94%
今天 上游生成26-10-02 07:50 (UTC+8:00) 本地抓取26-10-02 16:21 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 155 个模型

信息检索

联网找答案 · 短答事实 2 个榜

BrowseComp

1266 道难找的联网事实题 · 正确率 · llm-stats 汇总(以厂商自报为主)
评测榜 正确率 · %
1 Atria Dawn Preview 93%本榜冠军
  • 2 GPT-6 Astra 92%
  • 3 Kimi K3 91%
  • 4 Claude Opus 5 91%
  • 5 GPT-5.6 Sol 90%
  • 6 GPT-5.5 Pro 90%
  • 7 GPT-5.6 Terra 88%
  • 8 Claude Mythos Preview 87%
  • 9 Kimi K2.6 86%
  • 10 Seed 2.1 Pro 86%
今天 上游生成26-10-02 06:23 (UTC+8:00) 本地抓取26-10-02 15:36 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 67 个模型

SimpleQA

4326 道短答事实题 · 正确率(答错也算失败,专治「似是而非」)· llm-stats 汇总
评测榜 正确率 · %
1 DeepSeek-V3.2-Exp 97%本榜冠军
  • 2 Grok 4 Fast 95%
  • 3 DeepSeek-V3.1 93%
  • 4 DeepSeek-R1-0528 92%
  • 5 ERNIE 5.0 75%
  • 6 Gemini 3 Pro 72%
  • 7 Gemini 3 Flash 69%
  • 8 GPT-4.5 63%
  • 9 DeepSeek-V4-Pro-Max 58%
  • 10 Qwen3 VL 32B Thinking 55%
今天 上游生成26-10-02 06:23 (UTC+8:00) 本地抓取26-10-02 15:36 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 47 个模型

综合智能

跨能力综合指数 1 个榜

Artificial Analysis

国际综合智能指数榜 · 覆盖全球主流闭源 + 开源模型(能力 / 价格 / 速度)
评测榜 智能指数 · 无量纲 非百分比
1 Claude Opus 5.5 58本榜冠军
  • 2 Claude Sonnet 5.5 56
  • 3 Claude Fable 5.1 53
  • 4 GPT-6 Astra 53
  • 5 Gemini 4 Argon 53
  • 6 GPT-6.1 Sol 52
  • 7 Muse Spark 1.3 48
  • 8 GPT-6 Sol 48
  • 9 Grok 4.7 46
  • 10 MiMo-V2.6-Pro 46
今天 本地抓取26-10-02 16:06 (UTC+8:00) 本地抓取26-10-02 16:06 (UTC+8:00) 页面渲染26-10-02 16:23 (UTC+8:00) 187 个模型
怎么读这些榜单:为什么有的全是海外模型、有的全是国产模型?

这里聚合的榜单分属两类不同的参赛池(卡片标题下有类别标签),并非按国籍筛选:

  • 竞技场(DeepSWE / Terminal-Bench / Aider Polyglot / BFCL):闭源 API 模型报名参赛,海外厂商(OpenAI / Anthropic / Google)的 API 生态更成熟,因此清一色海外模型;
  • 评测榜(SWE-bench / HLE / 司南 / Artificial Analysis):开放权重模型自由提交或由评测方统一评测,国产模型(DeepSeek / GLM / Kimi / Qwen)密集上榜。

三点读法约定:

  • 分组按「测什么能力」划分(代码工程 / 工具使用 / 知识与推理 / 综合智能),与「谁参赛」是两条线;
  • 分数不可跨榜比大小:每个榜的口径不同(卡片标签写了主指标),Artificial Analysis 的「智能指数」还是无量纲分值,读作百分比就错了;
  • 卡片内条长按本榜榜首归一化,跨卡比较条子长度没有意义。

每行模型旁的彩色首字徽标是厂商缩写(悬停 / 点按可看「地区 · 厂商」全称),配色仍按地区分:国产红、美国蓝、欧洲紫、韩国青;新鲜度小圆点悬停/聚焦可看「上游生成 / 本地抓取 / 页面渲染」三个时刻。