← 返回排行榜

数据源健康状态

各数据源抓取状态与健康指标一览(用于排查「数据更新不到」问题)

DeepSWE 正常

长程软件工程基准 · 模型 Pass@1 / 成本 / 输出 Token / Agent 步数

  • 数据源live
  • 任务数113
  • 模型数28
  • 数据行数28
  • 数据更新于 26-09-22 14:27 (UTC+8:00)(上游生成)
  • 连续失败 0 次
SWE-bench Verified 正常

500 个人工校验的 GitHub issue · % 已解决(行业最权威的代码修复基准)

  • 数据源huggingface
  • 任务数未提供
  • 模型数57
  • 数据行数67
  • 数据更新于 26-10-02 17:06 (UTC+8:00)(本地抓取)
  • 连续失败 0 次
Humanity's Last Exam 正常

3000 道博士级难题 · % 正确率(最难的通用知识 / 推理基准)

  • 数据源huggingface
  • 任务数未提供
  • 模型数59
  • 数据行数89
  • 数据更新于 26-10-02 17:06 (UTC+8:00)(本地抓取)
  • 连续失败 0 次
Terminal-Bench 正常

真实 Shell 终端任务 · 模型 + Agent 组合 Accuracy(CLI 智能体基准)

  • 数据源tbench.ai
  • 任务数未提供
  • 模型数15
  • 数据行数15
  • 数据更新于 26-09-22 05:28 (UTC+8:00)(上游生成)
  • 连续失败 0 次
司南 OpenCompass 正常

上海 AI Lab 权威全能力榜 · 官方评测集综合均分(知识 / 推理 / 数学 / 代码)

  • 数据源OpenCompass OSS
  • 任务数5
  • 模型数15
  • 数据行数15
  • 数据更新于 26-08-24 08:00 (UTC+8:00)(上游生成) · 超 14 天
  • 连续失败 0 次
Artificial Analysis 正常

国际综合智能指数榜 · 覆盖全球主流闭源 + 开源模型(能力 / 价格 / 速度)

  • 数据源artificialanalysis.ai
  • 任务数4
  • 模型数187
  • 数据行数187
  • 数据更新于 26-10-02 17:06 (UTC+8:00)(本地抓取)
  • 连续失败 0 次
Aider Polyglot 正常

225 道 Exercism 编程题 · 6 语言代码生成/编辑通过率(Aider 官方多语言基准)

  • 数据源aider.chat
  • 任务数225
  • 模型数55
  • 数据行数55
  • 数据更新于 26-10-02 17:01 (UTC+8:00)(本地抓取)
  • 连续失败 0 次
Berkeley Function Calling 正常

BFCL V4 · 函数调用(工具调用)综合准确率 · 伯克利 Gorilla 官方榜

  • 数据源gorilla.cs.berkeley.edu
  • 任务数未提供
  • 模型数109
  • 数据行数109
  • 数据更新于 26-10-02 16:46 (UTC+8:00)(本地抓取)
  • 连续失败 0 次
GPQA Diamond 正常

198 道博士级科学题 · 正确率 · OpenRouter 自建评测跑次

  • 数据源Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings).
  • 任务数191
  • 模型数155
  • 数据行数155
  • 数据更新于 26-10-02 07:50 (UTC+8:00)(上游生成)
  • 连续失败 0 次
τ²-Bench Airline 正常

航司客服多轮工具调用 · 严格策略约束下的通过率 · OpenRouter 自建评测

  • 数据源Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings).
  • 任务数400
  • 模型数142
  • 数据行数142
  • 数据更新于 26-10-02 14:00 (UTC+8:00)(上游生成)
  • 连续失败 0 次
BrowseComp 正常

1266 道难找的联网事实题 · 正确率 · llm-stats 汇总(以厂商自报为主)

  • 数据源llm-stats.com/benchmarks/browsecomp(CC BY 4.0 · 厂商自报汇总)
  • 任务数1266
  • 模型数67
  • 数据行数50
  • 数据更新于 26-10-02 12:37 (UTC+8:00)(上游生成)
  • 连续失败 0 次
SimpleQA 正常

4326 道短答事实题 · 正确率(答错也算失败,专治「似是而非」)· llm-stats 汇总

  • 数据源llm-stats.com/benchmarks/simpleqa(CC BY 4.0 · 厂商自报汇总)
  • 任务数4326
  • 模型数47
  • 数据行数47
  • 数据更新于 26-10-02 14:09 (UTC+8:00)(上游生成)
  • 连续失败 0 次
数据源数量: 12 · 手动刷新:访问任意榜单详情页或后台「刷新」按钮,或等待定时任务(默认 60 分钟)