1、简述

        大模型(基础模型 Foundation Model)分类采用多维度正交划分,不同维度可交叉组合定位模型;分为技术底层维度、数据模态维度、规模算力维度、训练范式维度、应用层级维度、部署形态维度、开源版权维度、任务能力维度八大体系,覆盖学术、工程、产业落地全场景。

2、按底层神经网络架构(技术底层,最核心学术分类)

        全部基于 Transformer 衍生,分 4 大类,决定模型能力边界:

2.1  Encoder-only 仅编码器(双向理解型)

  • 原理:双向注意力,MLM 掩码预训练,同时读取上下文左右信息
  • 优势:文本理解、语义匹配、分类、抽取精度极高
  • 短板:不擅长长文本生成
  • 适用:检索、情感分析、NER、文本打分、知识库向量
  • 代表:BERT、RoBERTa、ERNIE-Base、SimBERT

2.2  Decoder-only 仅解码器(自回归生成,当前主流 LLM)

  • 原理:单向从左到右逐 Token 预测,CLM 因果语言建模
  • 优势:开放式长文本生成、对话、逻辑推理、代码写作
  • 适用:聊天机器人、文案、代码、报告、思维链推理
  • 代表:GPT 全系列、Llama3/4、Qwen2/3、GLM、Mistral、DeepSeek

2.3  Encoder-Decoder 编解码(序列转换专用)

  • 原理:编码器理解输入,解码器独立生成输出
  • 优势:翻译、摘要、改写、短序列转换
  • 短板:超长自由生成弱于纯 Decoder
  • 代表:T5、BART、ChatGLM 初代、mT5

2.4  MoE 混合专家稀疏架构(超大参数量旗舰架构)

  • 原理:总参巨大,但每次推理仅激活少量专家模块,算力可控
  • 分类:MoE-Decoder、MoE-Encoder-Decoder、MoE 多模态
  • 优势:万亿级参数、强通用能力、训练成本低于稠密大模型
  • 代表:GPT-4、Qwen3-Max、Gemini Ultra、Mixtral 8x7B

2.5 补充:非 Transformer 传统大模型(边缘小众)

CNN 视觉大模型(ViT 变体)、RNN 系模型(已淘汰)

3、按输入输出模态(产业最常用分类)

3.1  单模态大模型(仅一类数据)

  1. LLM 纯文本大语言模型 输入输出均为文字;擅长逻辑、数学、文书、代码通用对话;代表:GPT-3.5、Llama3、通义千问基础版
  2. Code-LLM 代码专用大模型 文本子集,海量代码语料专项训练;代码补全、漏洞检测、跨语言转换、工程注释;代表:CodeLlama、DeepSeek-Coder、StarCoder
  3. 视觉大模型 LVM 仅图像输入输出:图像分类、分割、检测;代表:ViT、SAM、Stable Diffusion(纯视觉生成)
  4. 音频大模型 LAM 语音识别、语音合成、音乐生成;代表:Whisper、AudioLDM
  5. 视频单模态模型 短视频生成、动作识别;代表:Sora、可灵、Veo

3.2 多模态大模型 MLLM(Any-to-Any 跨模态融合)

        统一语义空间,同时处理文本 / 图像 / 音频 / 视频 / 3D / 文档:

  1. 多模态理解型:图文问答、图表解析、视频摘要、OCR 文档分析;代表:GPT-4V、Qwen-VL、LLaVA
  2. 多模态生成型:文生图、文生视频、图文转音频、3D 生成;代表:GPT-4o、Gemini Omni、Sora、万相、Seedance
  3. 全模态 Omni 模型:实时语音对话 + 视觉 + 视频一体化,端到端音视频交互

4、按参数规模(算力 / 部署分级,工程落地核心)

        以稠密模型标准划分,MoE 标注激活参数而非总参数:

分级 参数量区间 部署场景 典型代表
超轻量端侧模型 <1B 手机、IoT、嵌入式、离线本地 Qwen2-0.5B、Phi-3-mini、Gemma-2B
轻量模型 1B~10B 边缘服务器、个人 PC、低成本私有化 ChatGLM3-6B、Mistral-7B、Baichuan2-7B
中型模型 10B~70B 企业私有化、API 轻量化服务 Llama3-13B/70B、Qwen2-14B、DeepSeek-67B
大型稠密模型 70B~400B 云端旗舰、高推理需求场景 Llama3-400B、Claude 3 Sonnet
超大规模 MoE 模型 总参≥1T,激活 10B~200B 公有云顶级通用模型 GPT-4、Gemini Ultra、Qwen3-Max

5、按训练迭代阶段(模型成熟度分类)

        完整训练流水线 4 级递进:

  1. 预训练底座模型(Base Model) 仅通用海量数据预训练,无指令、无人类对齐;输出自由、无格式约束,不适合直接对话;多用于二次微调
  2. 指令微调模型(SFT Supervised Fine-tune) 加入指令数据集,学会遵循用户指令、结构化输出;可直接做基础对话、工具调用
  3. 人类对齐模型(RLHF/DPO) 人类反馈强化学习 / 直接偏好优化;安全、价值观对齐、降低幻觉、输出符合人类习惯;市面商用对话模型主流形态(ChatGPT、Claude、文心一言)
  4. 工具增强基座(Agent 大模型) 内置工具调用、函数调用、检索增强能力,可联网、调用插件、操作数据库、控制机器人

6、按应用层级(L0/L1/L2 三层产业分层)

L0:通用基础大模型(通用底座)

无行业偏向,覆盖全领域通用知识,具备通用推理、创作、理解能力;是所有垂直模型的底层底座

  • 闭源:GPT-4o、Claude 3、Gemini、文心一言、通义千问
  • 开源:Llama3、Qwen3、GLM4、DeepSeek-V3

L1:行业大模型(单行业通用)

基于 L0 底座,注入全行业通用数据,覆盖行业全场景;不局限单一细分任务

  • 金融大模型、医疗大模型、法律大模型、工业制造大模型、教育大模型、自动驾驶大模型

L2:垂直场景专用模型(细分任务专用)

在行业模型基础上针对单一细分任务专项训练,精度最高、泛化最弱

  • 法律:合同审查模型、裁判文书生成模型
  • 医疗:CT 影像诊断、药品研发分子模型 AlphaFold2
  • 工业:质检视觉大模型、设备故障预测模型
  • 办公:PPT 生成、OCR 文档解析、代码审计专用模型

7、按部署运行形态(运维选型分类)

  • 云端 SaaS 模型:厂商 API 调用,无需本地算力,开箱即用(GPT、通义千问公有云)
  • 私有化本地部署模型:企业机房服务器部署,数据不出内网(开源 7B/13B/70B 系列)
  • 端侧离线模型:手机、平板、边缘硬件本地运行,无网络依赖(<10B 轻量模型)
  • 混合部署模型:轻量端侧做基础交互,云端大模型处理复杂推理

8、按开源 / 版权授权(生态分类)

  1. 闭源商用模型:权重不开放,仅开放 API,无法本地微调;OpenAI GPT、Anthropic Claude。
  2. 完全开源模型:权重、训练代码全开放,商用无限制;Qwen 全系列、DeepSeek。
  3. 受限开源模型:权重开放,商用有营收 / 规模限制;Llama3(Meta 商用许可)、Gemma。
  4. 学术开源模型:仅限科研,禁止商用;LLaVA、早期 BERT 变体。

9、按任务能力范式(功能分类)

1. 判别 / 理解型模型

输入数据做分类、打分、抽取、检索,不生成全新内容;BERT、向量检索模型、风险判别模型

2. 生成式模型(AIGC 核心)

输出全新文本 / 图像 / 音视频 / 代码;GPT、Sora、Stable Diffusion、CodeLlama

3. 推理数学专用模型

强化数理逻辑、符号计算、复杂数学证明;DeepSeek-Math、Qwen-Math、Numina

4. 检索增强 RAG 模型

底座 + 外挂知识库,解决实时信息、私有数据、幻觉问题;企业知识库问答系统专用

5. 机器人 / 具身智能大模型

文本视觉 + 机器人动作控制,物理世界交互;Google Robotics Transformer、特斯拉 FSD 大模型

6. 科学计算基础模型

面向科研:蛋白质结构、气象预测、流体仿真、量子计算;AlphaFold2、风乌气象大模型

10、极简分层总览

        底层架构 → 模态输入 → 参数规模 → 训练阶段 → 应用层级 → 部署方式 → 开源属性 → 任务功能。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐