本地大模型档位选择经验法则(Rule of Thumb)

经验法则(RULE OF THUMB)

参数量

类别

代表模型

解码速度

说明

~1B

自然语言处理(NLP)

Qwen 3.5 0.8B
Qwen 3.5 2B(最低 Q8 量化)

100+ 词/秒

用于会话内(on-thread)语言理解,多用于摘要、命名实体识别(NER)、情感分析等。

1B–9B

问答(QA)

Qwen 9B(E4B)
Ling Tiny

100+ 词/秒

简单的面向用户的问答,通常搭配 RAG 使用。

20B–35B(MoE)

个人助理(PA)

Gemma 4 26B A4B
Qwen 3.6 35B A3B
North Mini Code

75+ 词/秒

个人助理。最低要求是可靠的工具调用能力(例如通过 BFCL 基准测试)。

25–30B(稠密)

编码核心(CODING CORE)

Qwen 3.8 27B

45+ 词/秒

用于交互式编码智能体(agent),这类模型擅长核心编码任务,但在全代码库级别的理解上较弱。

70B(稠密)/ 100–200B(MoE)

代码库级(CODE BASE)

DeepSeek V4 Flash IQ2
Qwen 3.8 Next Flash IQ4

8+ 词/秒

"挂着整夜跑"档位:适合全代码库级别的理解、深度研究和深度分析类工作负载。

200T+(稀疏)

人类(HOMO SAPIENS)

—

0.5 词/秒

我把人类放在这里,是为了直观展示一个真正的人(我)生产内容时有多慢,作为一个参照基准。

以上数值是相对我的系统(1 块 RTX 3090 + 96GB 内存)归一化后的结果。当然,有些系统能跑到 GLM 5 或 MiMo,甚至用 122B+ 的模型也做不到这些档位。

术语说明

  • T/S:tokens/s,每秒生成的词元数

  • MoE:混合专家模型(Mixture of Experts)

  • DENSE:稠密模型(所有参数都参与每次计算,区别于 MoE)

  • Q8 / IQ2 / IQ4:量化精度等级(量化位数越低,模型越省资源,质量损失越大)

  • BFCL:Berkeley Function-Calling Leaderboard,工具调用能力基准测试


本地大模型档位选择经验法则(Rule of Thumb)
https://www.youxihun.top/archives/local-llm-rule-of-thumb
作者
闻君
发布于
2026年09月04日
许可协议