市面上大模型的名字越来越多,Qwen3-235B-A22B、DeepSeek-V3-671B、GLM-4-Plus、Mistral-Large-Instruct-2407……这些名字背后到底藏着什么信息?本文帮你建立一套"解码"能力,往后看到任何模型名都能快速定位它在什么位置。

1. 模型名拆解:一个通用公式

绝大多数大模型的名字可以拆成这个公式:

[家族]-[版本号]-[总参数量][后缀]-[特殊架构标记]

来看几个例子:

  • Qwen3-235B-A22B → 千问系列第3代,总参数量235B,MoE架构下每步激活22B参数
  • DeepSeek-V3-671B → DeepSeek系列第3代,总参数量671B
  • Llama-3.1-8B-Instruct → Llama系列3.1版本,8B参数,指令微调版

每个部分拆开讲。

2. 家族名称:谁家的孩子

模型名的第一个单词通常是"姓氏"——告诉你它来自哪个团队。

家族名 所属组织 代表性变体
Qwen / QwQ 阿里云(通义千问) Qwen3, Qwen2.5, QwQ-32B
DeepSeek 幻方(深度求索) DeepSeek-V3, DeepSeek-R1
GLM / ChatGLM 智谱AI GLM-4, GLM-130B
Yi 零一万物 Yi-34B, Yi-Lightning
Llama Meta Llama 3, Llama 3.1
Mistral Mistral AI Mistral 7B, Mixtral 8x7B
Phi 微软 Phi-3, Phi-4
Gemma Google Gemma 2, Gemma 3
Falcon TII(阿联酋) Falcon-180B
Command Cohere Command R+, Command R
Claude Anthropic Claude 3.5 Sonnet, Claude 4
GPT OpenAI GPT-4, GPT-4o

有些模型还有"曾用名"或昵称。比如 QwQ 是 Qwen with Questions 的缩写,定位为"思考型"推理模型。Llama 的全称是 Large Language Model Meta AI。

3. 版本号:第几代,什么水平

版本号通常紧跟在家族名后面,格式不统一,但规律明显:

数字层级

Qwen2   → 第2代
Qwen2.5 → 第2代的小版本升级(改进但非换代)
Qwen3   → 第3代
Qwen3.5 → 第3代的增强版本

同等参数下,代际越高能力越强。Qwen2.5-7B 的能力通常强于 Qwen2-7B。

特殊版本后缀

除了纯数字,OpenAI 的命名自成一派,值得单独说:

  • GPT-4o → "o" 代表 omni(全能),多模态(文本+图像+音频)
  • GPT-4-turbo → 更快的推理速度,更低的成本
  • GPT-4o-mini → 小尺寸、低成本版本
  • o1 / o3 → "o" 系列代表推理模型(reasoning),类似 DeepSeek-R1 的定位

角色后缀

很多模型在版本号后加一个角色标记,说明它"受过什么训练":

  • Base → 基座模型,未经微调,适合二次开发
  • Chat → 对话模型,针对多轮对话优化
  • Instruct → 指令微调模型,能更好遵循用户指令
  • Math → 数学专项模型
  • Code → 代码专项模型
  • Vision / VL → 视觉语言模型,能理解图片

举例:Llama-3.1-8B-Instruct 是 Llama 3.1 的 8B 指令微调版。

4. 参数量:体型大小

参数量(Parameters)是大模型最核心的指标之一,直接写在名字里。

基本单位

  • B = Billion(十亿),7B = 70亿参数
  • M = Million(百万),只在极小模型中出现
  • 数字越大,模型理论上能做更复杂的事,但推理成本也更高

常见规模速查

参数量 典型GPU需求 定位
1B~3B 消费级显卡可跑 端侧、移动设备
7B~14B 消费级显卡(需量化) 个人部署主流
32B~72B 多卡服务器 企业级高精度
100B+ 多卡集群 最强能力,极高成本

大规模推理的真相:不是所有参数都参与

这里有个关键问题:一个 235B 的模型,每次推理真的要用 235B 个参数吗?

传统 Dense 模型:是的,所有参数参与计算。比如 Llama-3-70B,每次推理都跑满 70B 参数。

MoE 模型:不是。总参数量包含所有"专家"(experts),但每次推理只激活一部分。这就是 Qwen3-235B-A22B 中 A22B 的含义——Active 22 Billion,每次推理实际激活 22B 参数。

5. MoE 架构标记:A 代表 Active

MoE(Mixture of Experts)是目前大模型的主流架构,几乎所有 100B+ 模型都在用。它把参数分成多个"专家"模块,每次只叫一部分专家干活。

A 的读法

以 Qwen3-235B-A22B 为例:

Qwen3-235B-A22B

Qwen3    → 千问第3代
235B     → 总参数 2350亿(含所有专家)
A22B     → Active 22B,每次推理实际激活 220亿参数

为什么要有 A? 因为只看总参数量会误导人。Qwen3-235B-A22B 的推理成本和 22B 的 dense 模型差不多,但能力远强于同成本的 22B dense 模型。A 标记让人一眼知道真实成本。

其他 MoE 命名惯例

有些模型没有显式写 A,但命名中隐含了 MoE 架构:

  • Mixtral 8x7B → 8 个专家,每个 7B 参数,总参数量 8×7B=56B,但每次只激活 2 个专家(约 13B 活跃)
  • DeepSeek-V2 → 总参数 236B,激活参数 21B(论文中注明,但名字没写 A)
  • DeepSeek-V3-671B → 总参数 671B,激活参数 37B

到 DeepSeek-V3 时,名字里直接写 671B(总参数),但你需要知道它其实是 MoE,激活参数远小于这个数。

常见 MoE 模型速查

模型名 总参数 激活参数 说明
Qwen3-235B-A22B 235B 22B 千问最新 MoE
Qwen3-30B-A3B 30B 3B 小 MoE,适合端侧
DeepSeek-V3-671B 671B 37B 当前最强开源 MoE
DeepSeek-V2-236B 236B 21B V3 的前代
Mixtral 8x7B 56B ~13B 8专家激活2个
Mixtral 8x22B 176B ~44B 8专家激活2个

6. 推理模型标记:R / QwQ / o1

2024 年下半年开始,出现了"推理模型"(reasoning model)这个新品类,它们在回答前会进行长链条思考。命名上也出现了新标记:

  • R1 → Reasoning 1,DeepSeek 的首个推理模型
  • QwQ → Qwen with Questions,千问的推理模型版本
  • o1 / o3 → OpenAI 的推理模型系列
  • DeepSeek-R1-0528 → 末尾数字是发布日期

推理模型和普通模型的核心区别不在参数量,而在训练方式(强化学习 + 长链思考)。QwQ-32B 虽然只有 32B,但在推理任务上可以超过很多更大的非推理模型。

7. 版本与日期标记

除了语义版本号,还有些模型用日期标记:

  • DeepSeek-R1-0528 → 2025年5月28日发布的版本
  • Mistral-Large-2407 → 2024年7月发布
  • Claude 3.5 Sonnet (20250620) → 2025年6月20日更新的版本

日期比版本号更精确,同一个模型名可能对应多个不同日期的版本。

8. 量化与格式标记

开源社区在模型名后加的后缀,表示模型已经被压缩过:

  • GGUF → llama.cpp 的量化格式,可在 CPU 上运行
  • Q4_K_M, Q8_0 → 量化精度,Q4 表示 4-bit 量化,内存占用减少约 75%
  • AWQ → 另一种量化格式
  • GPTQ → 另一种量化格式

举例:Qwen3-32B-Q4_K_M.gguf 表示这是一个 32B 模型、4-bit 量化、GGUF 格式,可以在 24GB 显存上运行原版需要 64GB 的模型。

9. 快速查表:见到名字就能对号入座

模型名解码速查

字段 含义 示例
Qwen 阿里通义千问 Qwen3-72B
DeepSeek 幻方深度求索 DeepSeek-R1
Llama Meta Llama-3.1-8B
GLM 智谱AI GLM-4-Plus
B Billion(十亿参数) 7B, 72B, 671B
A Active(MoE激活参数) A3B, A22B, A37B
MoE 混合专家架构 MoE 隐含在 A 标记中
Chat 对话优化 Qwen2.5-7B-Chat
Instruct 指令微调 Llama-3-8B-Instruct
Base 基座模型 Qwen3-32B-Base
Vision / VL 多模态(视觉) Qwen2.5-VL-72B
R / QwQ 推理模型 DeepSeek-R1, QwQ-32B
GGUF CPU量化格式 Qwen3-32B-Q4_K_M.gguf
Turbo 快速推理版本 GPT-4-turbo
Mini 小尺寸版本 GPT-4o-mini
Plus 增强版本 GLM-4-Plus
Lite 轻量版本 Yi-Lightning

实战:快速解码

Qwen3-235B-A22B
→ 千问第3代,总参数 2350亿,MoE架构,每步激活 220亿参数

DeepSeek-R1-0528
→ 推理模型,2025年5月28日发布

Llama-3.1-70B-Instruct
→ Llama 3.1 版本,70B 参数,指令微调版

Mixtral-8x22B-Instruct-v0.1
→ Mistral 的 MoE 模型,8 个专家各 22B,总参数 176B,指令微调,v0.1 版本

Qwen2.5-VL-72B
→ 千问 2.5 代,多模态视觉语言模型,72B 参数

Gemma-2-27B-it
→ Google Gemma 第2代,27B 参数,it = instruct 的缩写

10. 总结

模型命名没有国际标准,但规律已经形成:

  1. 家族名告诉你谁做的
  2. 版本号告诉你第几代
  3. 参数量+B告诉你体型
  4. A 参数告诉你 MoE 的真实成本
  5. 后缀告诉你它擅长什么、受过什么训练

下次看到一个新模型,先套公式:[家族]-[版本]-[参数量]-[后缀],再查有没有 A 标记,十有八九能猜中它的底细。随着 MoE 和推理模型成为主流,A 和 R 这些新标记会越来越常见。