市面上大模型的名字越来越多,Qwen3-235B-A22B、DeepSeek-V3-671B、GLM-4-Plus、Mistral-Large-Instruct-2407……这些名字背后到底藏着什么信息?本文帮你建立一套"解码"能力,往后看到任何模型名都能快速定位它在什么位置。
1. 模型名拆解:一个通用公式
绝大多数大模型的名字可以拆成这个公式:
[家族]-[版本号]-[总参数量][后缀]-[特殊架构标记]
来看几个例子:
- Qwen3-235B-A22B → 千问系列第3代,总参数量235B,MoE架构下每步激活22B参数
- DeepSeek-V3-671B → DeepSeek系列第3代,总参数量671B
- Llama-3.1-8B-Instruct → Llama系列3.1版本,8B参数,指令微调版
每个部分拆开讲。
2. 家族名称:谁家的孩子
模型名的第一个单词通常是"姓氏"——告诉你它来自哪个团队。
| 家族名 | 所属组织 | 代表性变体 |
|---|---|---|
| Qwen / QwQ | 阿里云(通义千问) | Qwen3, Qwen2.5, QwQ-32B |
| DeepSeek | 幻方(深度求索) | DeepSeek-V3, DeepSeek-R1 |
| GLM / ChatGLM | 智谱AI | GLM-4, GLM-130B |
| Yi | 零一万物 | Yi-34B, Yi-Lightning |
| Llama | Meta | Llama 3, Llama 3.1 |
| Mistral | Mistral AI | Mistral 7B, Mixtral 8x7B |
| Phi | 微软 | Phi-3, Phi-4 |
| Gemma | Gemma 2, Gemma 3 | |
| Falcon | TII(阿联酋) | Falcon-180B |
| Command | Cohere | Command R+, Command R |
| Claude | Anthropic | Claude 3.5 Sonnet, Claude 4 |
| GPT | OpenAI | GPT-4, GPT-4o |
有些模型还有"曾用名"或昵称。比如 QwQ 是 Qwen with Questions 的缩写,定位为"思考型"推理模型。Llama 的全称是 Large Language Model Meta AI。
3. 版本号:第几代,什么水平
版本号通常紧跟在家族名后面,格式不统一,但规律明显:
数字层级
Qwen2 → 第2代
Qwen2.5 → 第2代的小版本升级(改进但非换代)
Qwen3 → 第3代
Qwen3.5 → 第3代的增强版本
同等参数下,代际越高能力越强。Qwen2.5-7B 的能力通常强于 Qwen2-7B。
特殊版本后缀
除了纯数字,OpenAI 的命名自成一派,值得单独说:
- GPT-4o → "o" 代表 omni(全能),多模态(文本+图像+音频)
- GPT-4-turbo → 更快的推理速度,更低的成本
- GPT-4o-mini → 小尺寸、低成本版本
- o1 / o3 → "o" 系列代表推理模型(reasoning),类似 DeepSeek-R1 的定位
角色后缀
很多模型在版本号后加一个角色标记,说明它"受过什么训练":
- Base → 基座模型,未经微调,适合二次开发
- Chat → 对话模型,针对多轮对话优化
- Instruct → 指令微调模型,能更好遵循用户指令
- Math → 数学专项模型
- Code → 代码专项模型
- Vision / VL → 视觉语言模型,能理解图片
举例:Llama-3.1-8B-Instruct 是 Llama 3.1 的 8B 指令微调版。
4. 参数量:体型大小
参数量(Parameters)是大模型最核心的指标之一,直接写在名字里。
基本单位
- B = Billion(十亿),7B = 70亿参数
- M = Million(百万),只在极小模型中出现
- 数字越大,模型理论上能做更复杂的事,但推理成本也更高
常见规模速查
| 参数量 | 典型GPU需求 | 定位 |
|---|---|---|
| 1B~3B | 消费级显卡可跑 | 端侧、移动设备 |
| 7B~14B | 消费级显卡(需量化) | 个人部署主流 |
| 32B~72B | 多卡服务器 | 企业级高精度 |
| 100B+ | 多卡集群 | 最强能力,极高成本 |
大规模推理的真相:不是所有参数都参与
这里有个关键问题:一个 235B 的模型,每次推理真的要用 235B 个参数吗?
传统 Dense 模型:是的,所有参数参与计算。比如 Llama-3-70B,每次推理都跑满 70B 参数。
MoE 模型:不是。总参数量包含所有"专家"(experts),但每次推理只激活一部分。这就是 Qwen3-235B-A22B 中 A22B 的含义——Active 22 Billion,每次推理实际激活 22B 参数。
5. MoE 架构标记:A 代表 Active
MoE(Mixture of Experts)是目前大模型的主流架构,几乎所有 100B+ 模型都在用。它把参数分成多个"专家"模块,每次只叫一部分专家干活。
A 的读法
以 Qwen3-235B-A22B 为例:
Qwen3-235B-A22B
Qwen3 → 千问第3代
235B → 总参数 2350亿(含所有专家)
A22B → Active 22B,每次推理实际激活 220亿参数
为什么要有 A? 因为只看总参数量会误导人。Qwen3-235B-A22B 的推理成本和 22B 的 dense 模型差不多,但能力远强于同成本的 22B dense 模型。A 标记让人一眼知道真实成本。
其他 MoE 命名惯例
有些模型没有显式写 A,但命名中隐含了 MoE 架构:
- Mixtral 8x7B → 8 个专家,每个 7B 参数,总参数量 8×7B=56B,但每次只激活 2 个专家(约 13B 活跃)
- DeepSeek-V2 → 总参数 236B,激活参数 21B(论文中注明,但名字没写 A)
- DeepSeek-V3-671B → 总参数 671B,激活参数 37B
到 DeepSeek-V3 时,名字里直接写 671B(总参数),但你需要知道它其实是 MoE,激活参数远小于这个数。
常见 MoE 模型速查
| 模型名 | 总参数 | 激活参数 | 说明 |
|---|---|---|---|
| Qwen3-235B-A22B | 235B | 22B | 千问最新 MoE |
| Qwen3-30B-A3B | 30B | 3B | 小 MoE,适合端侧 |
| DeepSeek-V3-671B | 671B | 37B | 当前最强开源 MoE |
| DeepSeek-V2-236B | 236B | 21B | V3 的前代 |
| Mixtral 8x7B | 56B | ~13B | 8专家激活2个 |
| Mixtral 8x22B | 176B | ~44B | 8专家激活2个 |
6. 推理模型标记:R / QwQ / o1
2024 年下半年开始,出现了"推理模型"(reasoning model)这个新品类,它们在回答前会进行长链条思考。命名上也出现了新标记:
- R1 → Reasoning 1,DeepSeek 的首个推理模型
- QwQ → Qwen with Questions,千问的推理模型版本
- o1 / o3 → OpenAI 的推理模型系列
- DeepSeek-R1-0528 → 末尾数字是发布日期
推理模型和普通模型的核心区别不在参数量,而在训练方式(强化学习 + 长链思考)。QwQ-32B 虽然只有 32B,但在推理任务上可以超过很多更大的非推理模型。
7. 版本与日期标记
除了语义版本号,还有些模型用日期标记:
- DeepSeek-R1-0528 → 2025年5月28日发布的版本
- Mistral-Large-2407 → 2024年7月发布
- Claude 3.5 Sonnet (20250620) → 2025年6月20日更新的版本
日期比版本号更精确,同一个模型名可能对应多个不同日期的版本。
8. 量化与格式标记
开源社区在模型名后加的后缀,表示模型已经被压缩过:
- GGUF → llama.cpp 的量化格式,可在 CPU 上运行
- Q4_K_M, Q8_0 → 量化精度,Q4 表示 4-bit 量化,内存占用减少约 75%
- AWQ → 另一种量化格式
- GPTQ → 另一种量化格式
举例:Qwen3-32B-Q4_K_M.gguf 表示这是一个 32B 模型、4-bit 量化、GGUF 格式,可以在 24GB 显存上运行原版需要 64GB 的模型。
9. 快速查表:见到名字就能对号入座
模型名解码速查
| 字段 | 含义 | 示例 |
|---|---|---|
| Qwen | 阿里通义千问 | Qwen3-72B |
| DeepSeek | 幻方深度求索 | DeepSeek-R1 |
| Llama | Meta | Llama-3.1-8B |
| GLM | 智谱AI | GLM-4-Plus |
| B | Billion(十亿参数) | 7B, 72B, 671B |
| A | Active(MoE激活参数) | A3B, A22B, A37B |
| MoE | 混合专家架构 | MoE 隐含在 A 标记中 |
| Chat | 对话优化 | Qwen2.5-7B-Chat |
| Instruct | 指令微调 | Llama-3-8B-Instruct |
| Base | 基座模型 | Qwen3-32B-Base |
| Vision / VL | 多模态(视觉) | Qwen2.5-VL-72B |
| R / QwQ | 推理模型 | DeepSeek-R1, QwQ-32B |
| GGUF | CPU量化格式 | Qwen3-32B-Q4_K_M.gguf |
| Turbo | 快速推理版本 | GPT-4-turbo |
| Mini | 小尺寸版本 | GPT-4o-mini |
| Plus | 增强版本 | GLM-4-Plus |
| Lite | 轻量版本 | Yi-Lightning |
实战:快速解码
Qwen3-235B-A22B
→ 千问第3代,总参数 2350亿,MoE架构,每步激活 220亿参数
DeepSeek-R1-0528
→ 推理模型,2025年5月28日发布
Llama-3.1-70B-Instruct
→ Llama 3.1 版本,70B 参数,指令微调版
Mixtral-8x22B-Instruct-v0.1
→ Mistral 的 MoE 模型,8 个专家各 22B,总参数 176B,指令微调,v0.1 版本
Qwen2.5-VL-72B
→ 千问 2.5 代,多模态视觉语言模型,72B 参数
Gemma-2-27B-it
→ Google Gemma 第2代,27B 参数,it = instruct 的缩写
10. 总结
模型命名没有国际标准,但规律已经形成:
- 家族名告诉你谁做的
- 版本号告诉你第几代
- 参数量+B告诉你体型
- A 参数告诉你 MoE 的真实成本
- 后缀告诉你它擅长什么、受过什么训练
下次看到一个新模型,先套公式:[家族]-[版本]-[参数量]-[后缀],再查有没有 A 标记,十有八九能猜中它的底细。随着 MoE 和推理模型成为主流,A 和 R 这些新标记会越来越常见。
版权声明:如无特殊说明,文章均为本站原创,转载请注明出处
本文链接:https://tendcode.com/subject/article/llm-naming-guide/
许可协议:署名-非商业性使用 4.0 国际许可协议