摘要:本文系统性地介绍了大模型的基础知识、架构演进、训练范式、算力需求以及工程实现方法。首先,从大模型的常识、分类(按功能与模态)以及AIGC与AGI的概念入手,构建了宏观认知。接着,回顾了从RNN到Transformer的架构演进历程,并重点分析了Decoder-Only架构的优势。然后,阐述了现代大语言模型“预训练+后训练”的标准训练范式。最后,从工程实践角度,详细讲解了提示词工程、RAG、微调、续训和智能体开发五大核心模块的应用场景与决策路径,为开发者提供了清晰的技术选型指南。

1.大模型入门

1.1 大模型常识

  1. 参数规模庞大

  2. 训练数据庞大

  3. 能力强大

大模型参数规模通常以B为单位,B是Billion的缩写,即10亿,10^9。
如Qwen3-235B模型参数量为235B,即2350亿。
​
1B token=10^9token=10亿token
1T token=10^3B token=10^12token=1万亿token
​
计算规模是指大模型训练消耗的计算量。
大模型是一系列浮点数的组合,训练过程涉及大量浮点数运算,因此计算规模通常用FLOPs(Floating Point Operations,浮点运算次数)来衡量。
1FLOPs=1次浮点运算
1PFLOPs=10^15FLOPs
1EFLOPs=10^3PFLOPs=10^18FLOPs
​
算力是指“能算多快”,是指计算设备(显卡)单位时间内完成浮点运算的能力。单位通常是FLOPS(Floating Point Operations Per Second,每秒钟完成的浮点运算次数)。
现代GPU性能强大,通常用PFLOPS或TFLOPS作为算力单位。
1"P"=10^3 "T"=10^6 "G"=10^9 "M"=10^12 "K"=10^15。
1"PFLOPS"=10^15 "FLOPS" 。
1"TFLOPS"=10^12 "FLOPS" 。
浮点数有多种规格,如FP64、FP32、TF32等,同一款显卡在不同浮点数规格下的算力不同,因此在描述算力时,通常需要标注对应的浮点数规格。
如英伟达B200显卡的单卡
TF32算力为2.5PFLOPS
FP32算力为80TFLOPS
FP64算力为40TFLOPS

1.1.1 分类

1.1.1.1 按功能分类
  • 生成式模型===>(对话\推理\图像生成)

GPT-5系列 / DeepSeek-V3系列 / Qwen3系列

  • 嵌入模型/向量表征模型===>(语义搜索/RAG 向量检索)

BGE系列 / Qwen3-Embedding系列 / Qwen3-VL-Embedding系列

  • 重排序 / 相关性打分模型===>(RAG的第二阶段(Top-K))

BGE-Reranker系列 / Qwen3-Reranker系列 / Qwen3-VL-Reranker系列

  • 分类器 / 判别模型===>(意图识别/内容审核/路由决策)

通常是经过微调的小模型,如基于BERT微调的分类模型

1.1.1.2 生成模型按照模态分类
  1. 模态是指人或机器感知世界的方式,常见的模态有:文本、图像、音频/语音、视频等。

  2. 根据模态,可以将大模型分为语言大模型、多模态理解大模型和多模态生成大模型。如果没有特别说明,“大模型”通常是指“语言大模型”

  • 大语言模型===>(对话、写作、推理、代码生成)

Qwen3系列 / DeepSeek-V3.2系列 / GPT-5系列(语言模块) / Gemini-3系列(语言模块)

  • 多模态理解模型===>(看图说话(VQA)/文档理解(PDF / 表格 / 图像)/视频理解、音频理解)

GPT-5(图片理解模块) / Qwen3-VL系列 / Gemini-3(图片理解模块)

  • 多模态生成模型===>(文本/图像生成图像/音频/视频)

Stable Diffusion/DALL·E/Nano-Banana

1.1.2 AIGC和AGI

  1. AIGC(人工智能生成内容,Artificial Intelligence Generated Content)是以生成式模型为核心,基于对海量数据分布、模式与关联结构的学习,在人类提示或条件约束下,自动生成文本、图像、音频、视频、代码等多模态内容的生成技术及其应用。===>(用AI生成内容)

  2. AGI(Artificial General Intelligence,通用人工智能)可以理解为一种具备跨领域、跨任务的通用认知能力的人工智能形态,能够在不同环境和目标下进行理解、学习、推理、规划与知识迁移,并在缺乏明确任务定义或规则约束的情况下,自主发现问题并制定解决策略,其整体智能水平接近或超越人类。===>(通用人工智能,可以自主学习并解决大多数人类可以解决的问题)

1.2 LLM的架构演进

  • NLP的架构经历了规则系统->统计方法->机器学习->深度学习的发展

  • 在深度学习之前,NLP的核心是特征工程,即从语料中提取特征后交给模型,根据特征决策。从深度学习开始,NLP的核心成为了表示学习,不再依赖人工设计和提取特征,模型直接接收分词后的文本序列,自主从语料中理解语言结构,学习特征表示或决策。

  • 表示学习(深度学习)经历了RNN->LSTM->GRU->Seq2Seq->Seq2Seq+Attention->Transformer的发展,Transformer正是现代大模型的基石

  1. RNN(Recurrent Neural Network,循环神经网络)是逐个读取句子中的词语,并在每一步结合当前词和前面的上下文信息,不断更新对句子的理解==>(长期依赖建模困难/并行计算难)

  2. LSTM(Long Short-Term Memory,长短期记忆网络)是在RNN基础上的优化,引入了记忆单元和门控机制(遗忘门、输入门和输出门),一定程度上缓解了RNN长期建模困难的问题===>(长期依赖建模依然困难/参数量大,计算开销大/并行计算难)

  3. Gated Recurrent Unit(GRU)在LSTM基础上做出了改进,减少了参数量:去掉了记忆单元。优化门控机制,将三个门改为两个:重置门、更新门===>(长期依赖建模困难/并行计算难)

  4. Seq2Seq是专门为以动态输出为主的NLP任务设计的深度模型架构,这类任务的特征是输入输出均为序列且长度可变,如机器翻译、文本摘要等。基本架构如下,由一个编码器和一个解码器构成。编码器和解码器的主要架构通常是(RNN / LSTM / GRU)。===>(信息压缩困难,语义表达受限/缺乏动态感知,解码难以精准生成)

  5. Seq2Seq+Attention为了解决Seq2Seq的不足,引入了Attention(注意力)机制。核心思想是在解码时动态从编码器的隐藏状态(隐藏状态和源句中的词一一对应)中提取信息,不再仅仅依赖一个固定的上下文向量===>(长期依赖建模困难/并行计算难)

  6. Transformer彻底摒弃了RNN结构,转而使用注意力机制直接建模序列中各位置之间的关系。显著提升了训练效率(支持并行计算),增强了模型对长距离依赖的建模能力(任意两个都可以直接计算注意力,不存在长程间接依赖)Transformer沿用了Seq2Seq的编解码器架构。编码器内部包括自注意力层和前馈层(多个线性层的组合),解码器包含自注意力层、交叉注意力层和前馈层

1.2.1 Transformer架构

  1. 支持并行计算,训练效率高

  2. 全局依赖建模更直接

  3. 工程可扩展性好:规模变大仍能持续受益

  • Transformer架构的三种技术路线===>Decoder-Only(仅解码器架构)

  1. Encoder-Only(仅编码器架构)===>表征学习与判别式任务

  2. Encoder-Decoder(编码器-解码器架构,原版Transformer的架构)===>自回归语言建模,天然契合自回归生成任务

  3. Decoder-Only(仅解码器架构)==>明确区分输入和输出,对于翻译这样输入输出区分明确的任务非常友好

1.2.1.1 Decoder-Only(仅解码器架构)优势
  1. 更适合自由对话/连续生成

  2. 参数利用率更高、性价比更高

  3. 普适性好

1.3 LLM训练范式

范式是指在某一研究或工程领域中,被广泛接受的一整套问题建模方式、基本假设、方法论、技术路线和评价标准,它规定了“问题应该如何被理解、如何被解决”

  • 现代大语言模型(LLM)训练的标准范式 : 预训练(Pre-Training)+后训练(Post-Training)

  • 后训练通常包括:SFT(Supervised Fine-tuning,监督微调)和RLHF(Reinforcement learning from human feedback,人类反馈强化学习)/RLAIF(Reinforcement learning from AI feedback,AI反馈强化学习)两个阶段

1.4 大模型算力

  • 硬件

  1. CPU专为通用计算设计,拥有少量性能强大的运算单元,适合复杂任务串行处理 , 是所有计算机的大脑。

  2. 传统GPU是专用于数字图像处理的电路,最初设计用于加速图形渲染任务(如3D游戏、视频处理)。拥有大量功能单一的运算单元(如FP64、FP32、FP16等),适合大量简单任务并行处理。可用于科学计算和机器学习

  3. 现代GPU增加了专用的矩阵计算单元,逐渐演变为通用并行计算设备,广泛应用于科学计算、人工智能等领域。

  4. NPU(Neural Processing Unit,神经网络处理器),亦称AI加速器或深度学习处理器。是一类专门为加速神经网络计算而设计的芯片,牺牲通用性换取在机器学习任务上的超高性能和低功耗。NPU砍掉了FP64等单一运算单元,通常只保留矩阵运算单元,并引入向量处理单元和标量处理单元。

  5. TPU(Tensor Processing Unit,张量处理器)是谷歌为神经网络机器学习专门开发的专用芯片,适用于谷歌自家的TensorFlow框架。

2.大模型的工程实现

  • 从工程实现角度看,大模型的应用主要可以分为提示词工程、RAG、微调、续训、智能体开发五个模块

  1. 参考资料太多===>RAG

  2. 多步骤复杂流程===>Agent开发

  3. 指令遵循能力不足===>微调

  4. 缺少领域知识===>续训

2.1 提示词

2.1.1提示词五要素

  • 角色/任务、上下文、输入数据、输出要求(输出形式与结构)、约束

# 角色 / 任务
你是一名【角色定位,如:数据分析师 / 业务分析师 / 政策研究员】。
你的任务是基于#输入数据中给定的【运营数据 / 用户评价 / 业务流程】进行【分析 / 总结 / 对比 / 评估】。
​
# 上下文
【参考资料】。
【历史消息明细或摘要】。
​
# 输入数据
【参考资料】
【用户本轮输入】
​
# 输出要求
- 使用**表格**形式输出
- 表格中必须包含以下列:
  1. 关键发现
  2. 支撑数据(来自输入数据的原文或摘要)
  3. 结论
  4. 建议
- 表格下方需给出**整体结论说明**
​
# 约束
- 仅基于输入数据进行分析
- 不得编造、推测或引入外部信息
- 若输入数据不足以支撑结论,必须明确标注为**“信息不足”**
- 不允许为了完整性而补充假设
​

2.1.2 提示词模板

  • 把提示词中反复出现的“信息项”抽象成可替换占位符的一种写法/配置方式。此处特指可参数化的提示词模板

# 角色 / 任务
你是一名{persona}。
你的任务是:基于【输入数据】,完成{task}。
​
# 上下文(可选)
【稳定上下文】
{stable_context}
​
【动态上下文】
{dynamic_context}
​
# 输入数据
{input_data}
​
# 输出要求
- 输出语言:{language}
- 输出形式:{format}
- 表述风格:{style}
- 补充要求:{addition}
​
# 约束
- 信息来源:{source_policy}
- 禁止行为:{prohibited}
- 不确定性处理:{uncertainty_policy}
- 其他约束:{other_constraints}
​

2.2 RAG

  • RAG(Retrieval-Augmented Generation,检索增强生成)是一种结合信息检索(Retrieval)与文本生成(Generation)的技术,AI应用接收到用户请求后,先从外部知识库检索相关资料,并将这些资料与用户请求一并提供给大模型。模型在此基础上生成更准确、更有依据的回答

  • 时间上大模型的知识冻结

  • 专业知识上大模型幻觉

  • RAG技术通过引入`向量数据库(Vector Database)`作为外部知识源,将模型缺失的知识以结构化的形式提供

2.3 微调

  • 在已经训练好的模型上,按照SFT或RLHF/RLAIF的范式训练模型。通常采用SFT的训练范式

    何时需要微调
(1)模型能力不足
模型的指令遵循能力不足、风格/话术不能满足要求,反复调整提示词效果欠佳。
(2)希望固化知识
如果提示词很长,每次调用消耗大量token,长期服务成本高昂。并且不好维护,甚至有可能超出上下文窗口。此时可以通过微调将知识固化在模型权重中。
    何时可以微调
(1)数据充足
微调需要的数据规模通常比提示词示例更大,收集到足够的数据微调才有效果,否则容易过拟合。
(2)硬件资源充足
    全参微调和高效微调PEFT
随着模型规模越来越大,如何低成本地微调模型成为核心问题。
(1)全参微调
对模型的所有参数进行反向传播和更新。
(2)高效微调(PEFT, Parameter-Efficient Fine-Tuning)
冻结大模型的大部分参数,只训练极少量新增或选定参数。

2.4 续讯

  • 在已经训练好的模型上,采用和预训练相同的范式继续训练

    何时需要续训
如果微调效果不理想,且问题来自模型对领域语言/知识分布的系统性缺失,可以考虑续训。
    何时可以续训
(1)数据充足
续训需要大量的高质量文本,通常比微调高一个数量级。
(2)硬件资源充足
续训要求的数据量和硬件资源远高于微调,成本相应更高。

2.5 智能体开发

  • 以大语言模型为推理与决策核心,结合记忆、工具调用与环境交互能力,能够进行规划决策并执行动作以达成目标的软件系统

  • **大模型(LLM)作为“大脑”**:提供推理、规划和知识理解能力,是AI Agent的决策中枢

  • **短期记忆**:存储单次对话周期的上下文信息,属于临时信息存储机制。受限于模型的上下文窗口长度。

  • **长期记忆**:可以横跨多个任务或时间周期,可存储并调用核心知识,非即时任务。

  • 长期记忆,可以通过**模型参数微调(固化知识)**、**知识图谱(结构化语义网络)**或**向量数据库(相似性检索)**方式实现。比如,可以通过外部向量数据库存储历史交互数据,作为长期记忆,支持快速检索与知识积累。

  • **工具使用(Tool Use)**:调用外部工具(如API、数据库)扩展能力边界。

  • **规划决策(Planning)**:通过任务分解、反思与自省框架实现复杂任务处理。例如,利用思维链(Chain of Thought)将`目标拆解为子任务`,并通过反馈优化策略。

  • **行动(Action)**:实际执行决策的模块,涵盖软件接口操作(如自动订票)和物理交互(如机器人执行搬运)。比如:检索、推理、编程等。

2.5.1 何时需要智能体

(1)提示词工程
如果提示词工程效果不好,首先应该尝试优化提示词,如果优化提示词效果也不好,才应该分析原因选择其它开发方式。提示词效果不好可能是因为:
① 缺少工具、需要拆分任务等,这样的场景天然适合Agent开发。
② 指令遵循效果不好,先尝试提供示例,如果效果还不好就需要微调。
③ 缺少参考资料,尝试RAG。
④ 模型缺少对领域语言的系统理解,尝试续训。
(2)RAG
RAG效果不好可能是因为:
① 检索质量不高、文档冲突或者模型未正确引用资料,此时可以结合Agent引入多轮检索、冲突比对以及强制引用检查等,提升结果的可控性和质量。
② 上述情况,也可以尝试调整RAG的文档切分、重排序等策略以提升质量。
③ 模型读不懂语料,即模型拿到了正确的参考资料,但推理不对,缺少领域知识,尝试续训。
(3)微调
微调效果不好可能是因为:
① 规则约束太强(比如强制要求模型输出特定格式,微调无法保证极高的准确率),此时可以考虑通过Agent引入格式校验、多次重写等机制,提升生成质量。
② 数据分布和真实分布不一致(如客服场景中的微调数据经过筛选,线上输入五花八门和训练集不同),可以考虑收集合适的数据重新微调。
③ 如果发现模型读不懂语料,应尝试续训,然后再微调。
(4)续训
只有在系统性缺失领域语言/数据分布时,才需要续训,如果续训不好,有可能是因为:
① 数据分布没有覆盖使用场景,或者发生了灾难性遗忘(失去了续训前的能力,此时应该在续训数据集中混合通用语料),此时都应该收集数据重新续训。
② 续训效果不好时,通常应该分析原因重新训练,Agent很难解决问题,但仍然可以结合Agent开发,补充校验和多次重写等机制提升生成质量。这是无奈之举,质量的提升是有限的,治标不治本。

2.5.2 MCP

  • MCP(Model Context Protocol,模型上下文协议)是一套标准化的通讯协议,旨在规范AI模型和外部工具、数据源的连接方式

2.5.3 工作流(Workflow)

  • 可以看作是一种智能体的设计模式,用于将复杂任务拆解为一系列有序、可控的步骤,并按照预先定义的流程逐步执行

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐