经验法则(RULE OF THUMB)
参数量 | 类别 | 代表模型 | 解码速度 | 说明 |
|---|
~1B | 自然语言处理(NLP) | Qwen 3.5 0.8B Qwen 3.5 2B(最低 Q8 量化) | 100+ 词/秒 | 用于会话内(on-thread)语言理解,多用于摘要、命名实体识别(NER)、情感分析等。 |
1B–9B | 问答(QA) | Qwen 9B(E4B) Ling Tiny | 100+ 词/秒 | 简单的面向用户的问答,通常搭配 RAG 使用。 |
20B–35B(MoE) | 个人助理(PA) | Gemma 4 26B A4B Qwen 3.6 35B A3B North Mini Code | 75+ 词/秒 | 个人助理。最低要求是可靠的工具调用能力(例如通过 BFCL 基准测试)。 |
25–30B(稠密) | 编码核心(CODING CORE) | Qwen 3.8 27B | 45+ 词/秒 | 用于交互式编码智能体(agent),这类模型擅长核心编码任务,但在全代码库级别的理解上较弱。 |
70B(稠密)/ 100–200B(MoE) | 代码库级(CODE BASE) | DeepSeek V4 Flash IQ2 Qwen 3.8 Next Flash IQ4 | 8+ 词/秒 | "挂着整夜跑"档位:适合全代码库级别的理解、深度研究和深度分析类工作负载。 |
200T+(稀疏) | 人类(HOMO SAPIENS) | — | 0.5 词/秒 | 我把人类放在这里,是为了直观展示一个真正的人(我)生产内容时有多慢,作为一个参照基准。 |
以上数值是相对我的系统(1 块 RTX 3090 + 96GB 内存)归一化后的结果。当然,有些系统能跑到 GLM 5 或 MiMo,甚至用 122B+ 的模型也做不到这些档位。
术语说明
T/S:tokens/s,每秒生成的词元数
MoE:混合专家模型(Mixture of Experts)
DENSE:稠密模型(所有参数都参与每次计算,区别于 MoE)
Q8 / IQ2 / IQ4:量化精度等级(量化位数越低,模型越省资源,质量损失越大)
BFCL:Berkeley Function-Calling Leaderboard,工具调用能力基准测试