【AI大模型应用开发工程师特训笔记】第02讲:AI大模型应用开发名词手册
使用说明
本手册面向AI应用开发工程师,系统梳理了大模型开发全流程中涉及的核心名词,并按技术领域分类整理。每个名词包含:英文全称、中文译名、一句话定义、详细解释、关联概念。建议按分类阅读,也可作为日常开发的速查工具。
第一章:基础概念(Foundation Concepts)
1.1 大模型(Large Language Model, LLM)
-
定义:参数规模通常在十亿级别以上的深度学习模型,通过海量文本预训练获得通用语言理解和生成能力。
-
详解:LLM基于Transformer架构,通过自监督学习从大规模语料中学习语言模式。典型代表:GPT系列、LLaMA、Qwen、DeepSeek。参数量从几亿到万亿不等,更大的参数量通常带来更强的能力,但推理成本也更高。
-
关联:预训练、微调、推理
1.2 人工智能(Artificial Intelligence, AI)
-
定义:让计算机模拟人类智能行为的科学与工程领域。
-
详解:AI涵盖机器学习、自然语言处理、计算机视觉、机器人学等多个子领域。当前的主流范式是数据驱动的机器学习,特别是深度学习。
1.3 机器学习(Machine Learning, ML)
-
定义:AI的一个子领域,通过从数据中学习规律而非显式编程来完成任务。
-
详解:分为监督学习(有标签数据)、无监督学习(无标签)、强化学习(奖励信号)。大模型属于深度学习范畴,是机器学习的一种。
1.4 深度学习(Deep Learning, DL)
-
定义:使用多层神经网络进行表征学习的机器学习方法。
-
详解:通过堆叠多个非线性变换层,自动从原始数据中提取层次化特征。深度学习的“深”指网络层数多(几十到上千层),使其能学习极其复杂的函数。
1.5 自然语言处理(Natural Language Processing, NLP)
-
定义:让计算机理解、生成、处理人类语言的技术领域。
-
详解:NLP的核心任务包括文本分类、命名实体识别、机器翻译、问答、摘要、对话系统等。大语言模型的出现使NLP进入了通用能力时代。
1.6 生成式AI(Generative AI, GenAI)
-
定义:能够生成文本、图像、音频、视频等内容的人工智能技术。
-
详解:与传统判别式AI(分类、回归)不同,生成式AI创造新内容。大语言模型、扩散模型(图像生成)是代表性技术。
1.7 多模态(Multimodal)
-
定义:同时处理或生成两种及以上类型数据(文本、图像、音频、视频)的AI系统。
-
详解:多模态模型能够理解图文关系(如CLIP)、生成图像描述、根据文字生成图像(如Stable Diffusion)、或同时处理音视频(如Qwen2.5-Omni)。
第二章:模型架构(Model Architecture)
2.1 Transformer
-
定义:2017年
Google提出的基于自注意力机制的神经网络架构,是现代大语言模型的基石。 -
详解:
Transformer抛弃了RNN的循环结构,完全依靠注意力机制捕获序列依赖。核心组件:多头注意力、前馈网络、残差连接、层归一化。优势是并行计算能力强,能捕获长距离依赖。 -
关联:自注意力、多头注意力、位置编码
2.2 自注意力(Self-Attention)
-
定义:一种让序列中每个位置直接关注序列中所有位置的机制。
-
详解:通过计算查询(Q)、键(K)、值(V)三个矩阵的点积得到注意力权重,权重表示每个位置对其他位置的关注程度。公式:
Attention(Q,K,V)=softmax(QK^T/√d_k)V。
2.3 多头注意力(Multi-Head Attention, MHA)
-
定义:将自注意力机制并行执行多次(多个头),每个头学习不同的特征子空间。
-
详解:多个注意力头的结果拼接后线性变换得到最终输出。典型头数:8、12、32。多头使模型能同时关注不同位置和不同语义层面的信息。
2.4 位置编码(Positional Encoding)
-
定义:在Transformer中注入序列位置信息的向量。
-
详解:由于自注意力本身不包含顺序信息,需要额外添加位置编码。常见方式:正弦余弦函数(原始Transformer)、可学习位置编码(BERT)、旋转位置编码RoPE(LLaMA、Qwen)。
2.5 卷积神经网络(Convolutional Neural Network, CNN)
-
定义:通过卷积核滑动提取局部特征的神经网络,主要用于图像处理。
-
详解:核心组件:卷积层(特征提取)、池化层(降维)、全连接层(分类)。优势是参数共享、局部连接,计算效率高。经典模型:LeNet、AlexNet、ResNet。
2.6 循环神经网络(Recurrent Neural Network, RNN)
-
定义:通过循环连接处理序列数据的神经网络。
-
详解:RNN在每个时间步将当前输入与上一时间步的隐藏状态结合,理论上能处理任意长度序列。但存在梯度消失/爆炸问题,难以捕获长距离依赖。LSTM和GRU是其改进版本。
2.7 长短期记忆网络(Long Short-Term Memory, LSTM)
-
定义:一种通过门控机制解决RNN梯度消失问题的变体。
-
详解:LSTM引入遗忘门、输入门、输出门,精确控制信息流动,能记住长达数百步的依赖。在Transformer普及前是序列任务的主流模型。
2.8 门控循环单元(Gated Recurrent Unit, GRU)
-
定义:LSTM的简化版本,将三个门合并为两个(更新门、重置门)。
-
详解:GRU参数更少、训练更快,性能通常与LSTM相当。适合资源受限场景。
2.9 混合专家模型(Mixture of Experts, MoE)
-
定义:通过门控网络动态激活部分专家子网络参与计算的模型架构。
-
详解:MoE将模型拆分为多个专家(Expert)和一个路由器(Router)。每个输入只激活最相关的几个专家,极大降低计算成本。总参数量大但激活参数量小。代表模型:Mixtral 8x7B、DeepSeek-V3。
2.10 残差连接(Residual Connection, Skip Connection)
-
定义:将输入直接加到输出上的连接方式,缓解深层网络梯度消失问题。
-
详解:公式:输出 = F(x) + x。ResNet首先提出,Transformer中广泛应用。使网络可以训练到上百层甚至上千层。
2.11 层归一化(Layer Normalization, LayerNorm)
-
定义:对单个样本所有特征进行归一化的技术。
-
详解:与批归一化不同,层归一化不依赖批次大小,适合序列模型。Transformer中每个子层后都接层归一化。
2.12 激活函数(Activation Function)
-
定义:在神经网络中引入非线性的函数。
-
详解:常见激活函数:ReLU(max(0,x))、GELU、Sigmoid、Tanh、Swish。ReLU是最常用的,计算简单且缓解梯度消失。
2.13 前馈网络(Feed-Forward Network, FFN)
-
定义:Transformer中注意力层之后的两层全连接网络。
-
详解:通常结构:线性 → 激活 → 线性。将注意力输出映射到更高维度再压缩,增强模型表达能力。在MoE架构中,FFN被替换为专家网络。
第三章:训练技术(Training Techniques)
3.1 预训练(Pre-training)
-
定义:在海量无标注数据上训练模型,学习通用语言表示的过程。
-
详解:预训练是“通识教育”阶段。目标通常是自监督任务(如预测下一个词、掩码语言建模)。需要大量计算资源(数千GPU)。产出是“基座模型”。
3.2 有监督微调(Supervised Fine-Tuning, SFT)
-
定义:在人工标注的指令-答案对数据上继续训练预训练模型。
-
详解:SFT教会模型“怎么回答用户问题”。数据量通常几千到几十万条,质量比数量更重要。SFT后的模型能遵循指令、进行对话。
3.3 指令微调(Instruction Tuning)
-
定义:使用自然语言指令格式的数据进行微调,让模型学会理解和执行各种任务。
-
详解:指令微调是SFT的一种形式,强调输入输出格式为“指令+输入+输出”。Flan、T0、Alpaca等都是指令微调的代表。
3.4 强化学习(Reinforcement Learning, RL)
-
定义:通过奖励信号优化决策策略的学习范式。
-
详解:智能体在环境中采取行动,获得奖励或惩罚,目标是最大化累积奖励。在LLM对齐中,RL用于优化模型行为使其更符合人类偏好。
3.5 人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)
-
定义:使用人类偏好数据训练奖励模型,再用强化学习优化LLM的方法。
-
详解:RLHF包含三步:SFT基座模型 → 收集偏好数据训练奖励模型 → 用PPO等算法优化策略。OpenAI
InstructGPT和Claude都采用此方法。
3.6 直接偏好优化(Direct Preference Optimization, DPO)
-
定义:无需训练奖励模型,直接使用偏好对优化策略的算法。
-
详解:DPO将RLHF中的奖励最大化问题重参数化为分类损失,训练更稳定、资源需求更低。已成为RLHF的主流替代方案。
3.7 数据并行(Data Parallelism, DP)
-
定义:将训练数据切分到多个GPU,每个GPU持有完整模型副本的并行训练策略。
-
详解:每个GPU处理不同批次数据,计算梯度后聚合平均。简单高效,但每个GPU需要完整模型显存。
3.8 模型并行(Model Parallelism, MP)
-
定义:将模型切分到多个GPU上的并行训练策略。
-
详解:包括张量并行(层内切分)和流水线并行(层间切分)。当模型过大单卡装不下时使用。
3.9 流水线并行(Pipeline Parallelism, PP)
-
定义:将模型按层划分为多个阶段,每个阶段部署在不同GPU上的并行策略。
-
详解:数据像流水线一样依次通过各阶段。需要解决“气泡”问题(部分GPU空闲),常用策略是微批次流水线(如GPipe)。
3.10 张量并行(Tensor Parallelism, TP)
-
定义:将单个算子(如矩阵乘法)的参数切分到多个GPU上并行计算。
-
详解:适用于单机多卡(NVLink互联),通信频繁,通常限制在单节点内。
3.11 混合精度训练(Mixed Precision Training)
-
定义:同时使用FP16/BF16和FP32精度进行训练,加速并减少显存。
-
详解:前向和反向传播用低精度(FP16/BF16),优化器状态和主权重用FP32。需要梯度缩放防止下溢。
3.12 梯度累积(Gradient Accumulation)
-
定义:在多个小批次上累积梯度后再更新参数,模拟大批次训练。
-
详解:显存不足时常用。每步计算损失和梯度但不立即更新,累积N步后平均梯度再更新。
3.13 检查点(Checkpoint)
-
定义:训练过程中保存的模型状态快照,包含权重、优化器状态、步数等。
-
详解:用于故障恢复、模型评估、版本管理。检查点可以是完整模型,也可以是增量(如LoRA适配器)。
3.14 激活检查点(Activation Checkpointing, Gradient Checkpointing)
-
定义:在前向传播时丢弃部分激活值,反向传播时重新计算,以节省显存。
-
详解:用计算换显存。适合训练超大模型或长序列。典型策略:每N层保留一次激活。
3.15 对齐(Alignment)
-
定义:确保模型行为符合人类意图和价值观的过程。
-
详解:对齐包括:有用性(helpfulness)、无害性(harmlessness)、诚实性(honesty)。技术手段有RLHF、DPO、宪法AI等。
3.16 宪法AI(Constitutional AI, CAI)
-
定义:通过AI自我批判和修订,而非仅依赖人类反馈来实现对齐的方法。
-
详解:Anthropic提出。模型根据书面原则(宪法)自我评估输出,生成修订版本,然后用这些数据训练。可规模化、成本低。
3.17 崩溃(Collapse) / 模型退化(Model Collapse)
-
定义:使用AI生成的数据反复训练新模型,导致模型性能逐渐下降的现象。
-
详解:模型生成的数据存在偏差和噪声,随着迭代,模型越来越偏离真实数据分布。需要保持新鲜真实数据注入。
3.18 灾难性遗忘(Catastrophic Forgetting)
-
定义:在微调过程中,模型忘记预训练学到的知识的现象。
-
详解:微调时参数过度适应新任务,原有能力下降。缓解方法:低秩微调(LoRA)、弹性权重巩固(EWC)、回放缓冲。
3.19 过拟合(Overfitting)
-
定义:模型在训练集上表现很好,但在未见数据上表现差。
-
详解:模型学到了训练集中的噪声而非真实规律。原因:模型过大、数据太少、训练太久。缓解:正则化、早停、数据增强。
第四章:推理优化(Inference Optimization)
4.1 推理(Inference)
-
定义:使用训练好的模型对输入进行预测的过程。
-
详解:推理阶段模型参数冻结,只做前向传播。目标是低延迟、高吞吐、低成本。区别于训练。
4.2 量化(Quantization)
-
定义:将模型权重从高精度浮点数(FP32/FP16)转换为低精度整数(INT8/INT4)或紧凑浮点(FP8)。
-
详解:大幅减少显存和带宽需求,加速推理。精度有轻微损失。常见格式:INT8、INT4、FP8、NF4。方法:训练后量化(PTQ)、量化感知训练(QAT)。
4.3 训练后量化(Post-Training Quantization, PTQ)
-
定义:在模型训练完成后直接进行量化的方法。
-
详解:只需少量校准数据计算缩放因子,无需重训练。实现简单,但精度损失略大。
4.4 量化感知训练(Quantization-Aware Training, QAT)
-
定义:在训练过程中模拟量化操作,使模型适应低精度。
-
详解:前向时模拟量化误差,反向时用高精度梯度。精度恢复更好,但需要额外训练。
4.5 AWQ(Activation-aware Weight Quantization)
-
定义:根据激活值分布保护重要权重的量化方法。
-
详解:保留激活幅度大的通道对应的权重精度,其他通道低精度。在Llama-70B上精度损失约4.3%,推理速度极快。
4.6 GPTQ(GPT Quantization)
-
定义:基于Hessian矩阵的逐层量化方法。
-
详解:通过二阶信息补偿量化误差。适合GPU推理,生态成熟。精度损失约5.2%。
4.7 GGUF(GPT-Generated Unified Format)
-
定义:llama.cpp使用的模型量化格式,支持多种量化级别。
-
详解:GGUF是社区标准,尤其适合CPU推理和边缘部署。常见级别:Q4_K_M(推荐)、Q5_K_M、Q8_0。
4.8 剪枝(Pruning)
-
定义:移除模型中不重要的权重或结构单元。
-
详解:分为非结构化剪枝(单个权重)和结构化剪枝(整个通道/头)。非结构化剪枝压缩率高但硬件不友好;结构化剪枝硬件友好但精度损失大。N:M稀疏是折衷。
4.9 知识蒸馏(Knowledge Distillation, KD)
-
定义:用一个大的“教师模型”指导小的“学生模型”学习。
-
详解:学生模型学习教师模型的输出分布(软标签),而不仅是真实标签(硬标签)。可将大模型能力迁移到小模型。
4.10 KV Cache(Key-Value Cache)
-
定义:在自回归生成中,缓存已计算过的Key和Value向量,避免重复计算。
-
详解:解码阶段,每个新token只需计算当前token的KV,之前的无需重算。KV Cache是推理加速的核心技术,但会占用显存。
4.11 首字延迟(Time To First Token, TTFT)
-
定义:从发送请求到收到第一个输出token的时间。
-
详解:用户体验的关键指标。TTFT主要受预填充阶段计算影响。优化方法:使用更快的模型、减少提示词长度。
4.12 每 token 时间(Time Per Output Token, TPOT)
-
定义:生成每个输出token的平均耗时。
-
详解:决定生成速度。解码阶段受内存带宽限制,优化方法:量化、批处理。
4.13 连续批处理(Continuous Batching)
-
定义:动态将新到达的请求加入正在运行的批次,而非等待当前批次完成。
-
详解:大幅提升吞吐量。vLLM等引擎的核心技术。减少GPU空闲时间。
4.14 投机解码(Speculative Decoding)
-
定义:用小模型先预测多个token,大模型并行验证的加速技术。
-
详解:小模型(草稿模型)快速生成候选序列,大模型一次前向验证所有候选。接受率80%时,可实现2-3倍加速。
4.15 前缀缓存(Prefix Caching)
-
定义:缓存常见提示词(如系统提示)的KV Cache,复用给多个请求。
-
详解:当多个请求共享相同前缀时,只需计算一次。SGLang的RadixAttention是激进的前缀缓存实现。
4.16 PagedAttention
-
定义:vLLM提出的KV Cache分页管理技术,类似操作系统虚拟内存。
-
详解:将KV Cache分成固定大小的块,非连续存储。解决显存碎片,提升显存利用率2-4倍。
第五章:数据处理(Data Processing)
5.1 分词(Tokenization)
-
定义:将原始文本切分为模型可处理的最小单元(Token)的过程。
-
详解:Token可以是词、子词、字符。常用的分词算法:BPE、WordPiece、SentencePiece。中文分词比英文复杂,因为没有天然分隔符。
5.2 标记(Token)
-
定义:模型处理的基本单位,通常是子词(如“playing”拆成“play”和“ing”)。
-
详解:模型输入输出都是Token序列。1个Token约等于0.75个英文单词或0.5个中文字符。上下文长度以Token计。
5.3 词嵌入(Word Embedding)
-
定义:将词映射到高维向量空间的表示。
-
详解:语义相近的词在向量空间中彼此接近。经典方法:Word2Vec、GloVe。大模型中,嵌入层是可训练的,与模型其他部分联合优化。
5.4 上下文长度(Context Length)
-
定义:模型一次能处理的最大Token数。
-
详解:越长模型能“记住”的信息越多。早期模型2k-4k,现在主流32k-128k,部分模型支持1M以上。
5.5 文本切片(Chunking)
-
定义:将长文档切分成适合模型处理的短文本块。
-
详解:切片是RAG预处理的关键步骤。需要平衡块大小(信息完整)和粒度(检索精度)。常用策略:按段落、按固定长度滑窗、语义切分。
5.6 向量化(Embedding)
-
定义:将文本、图像等非结构化数据转换为数值向量的过程。
-
详解:向量化后的表示称为嵌入向量(Embedding Vector)。语义相似的输入产生的向量在空间中接近。用于相似度检索、聚类等。
5.7 向量数据库(Vector Database)
-
定义:专门存储和检索高维向量的数据库系统。
-
详解:核心能力是相似性搜索(近似最近邻ANN)。常用索引:HNSW、IVFFlat。代表:Milvus、Pinecone、Qdrant、Chroma、pgvector。
5.8 近似最近邻(Approximate Nearest Neighbor, ANN)
-
定义:以牺牲少量精度换取极快检索速度的向量搜索算法。
-
详解:ANN不保证绝对最近邻,但能在毫秒级返回90%+准确率的结果。HNSW是当前最流行的ANN算法。
5.9 分层可导航小世界图(Hierarchical Navigable Small World, HNSW)
-
定义:一种基于图的ANN索引算法,查询速度极快。
-
详解:构建多层图,上层稀疏用于快速定位,下层密集用于精细搜索。生产环境首选。构建时间较长,内存占用较高。
5.10 数据增强(Data Augmentation)
-
定义:通过变换生成新训练样本,增加数据多样性。
-
详解:文本常用方法:同义词替换、回译、随机插入/删除。图像常用:旋转、裁剪、色彩变换。
5.11 数据清洗(Data Cleaning)
-
定义:移除或修正数据中的噪声、错误、重复。
-
详解:大模型预训练数据清洗包括:去重(精确/近似)、语言过滤、质量过滤(长度、困惑度)、安全过滤(敏感内容)。脏数据会严重影响模型性能。
5.12 去重(Deduplication)
-
定义:识别并移除重复或近似重复的数据。
-
详解:精确去重用哈希;近似去重用MinHash、SimHash。预训练数据去重可提升模型性能、减少记忆效应。
5.13 合成数据(Synthetic Data)
-
定义:由AI模型生成而非从真实世界收集的数据。
-
详解:用于数据扩增、弱监督学习、模型蒸馏。需注意合成数据可能导致模型退化(Model Collapse),需混合真实数据。
第六章:检索增强生成(Retrieval-Augmented Generation)
6.1 检索增强生成(Retrieval-Augmented Generation, RAG)
-
定义:先从知识库中检索相关信息,再基于这些信息生成答案的技术架构。
-
详解:RAG解决了大模型知识截止和私有数据访问问题。流程:用户查询 → 检索 → 注入提示 → 生成。是当前企业落地大模型的主流方案。
6.2 嵌入模型(Embedding Model)
-
定义:专门用于生成文本向量的模型。
-
详解:嵌入模型与生成模型不同,输出是固定维度向量而非文本。常用模型:BGE、text-embedding-ada-002、M3E、GTE。
6.3 重排序(Rerank)
-
定义:对检索结果进行精细再排序,提升Top结果的相关性。
-
详解:向量检索粗筛出候选(如50条),再用更精确的模型(如交叉编码器)重新打分。增加少量延迟换取显著精度提升。
6.4 混合检索(Hybrid Search)
-
定义:同时使用关键词检索(BM25)和向量检索(语义)的方法。
-
详解:关键词检索擅长精确匹配(如产品型号),向量检索擅长语义匹配(如“手机充电慢”)。两者融合可提升召回率。
6.5 BM25
-
定义:一种基于词频和文档长度的关键词检索排序函数。
-
详解:经典的信息检索算法,广泛用于全文搜索引擎(如Elasticsearch)。适合精确匹配场景。
6.6 查询改写(Query Rewriting)
-
定义:将用户原始问题改写成更适合检索的形式。
-
详解:用户问题可能口语化、模糊、缺少上下文。用大模型改写可提升检索效果。例如“苹果怎么样”→改写为“苹果公司的股价和产品评价”。
6.7 上下文注入(Context Injection)
-
定义:将检索到的文档片段拼接到提示词中,作为模型生成答案的依据。
-
详解:注入方式:直接拼接、模板化、多文档摘要。需要控制总长度不超过模型上下文限制。
6.8 引用(Citation)
-
定义:在生成答案中标明信息来源。
-
详解:RAG的核心价值之一是可溯源。引用格式如“【来源:员工手册.pdf】”。有助于用户验证答案可信度。
第七章:评估与指标(Evaluation & Metrics)
7.1 困惑度(Perplexity, PPL)
-
定义:衡量语言模型预测下一个词不确定性的指标。
-
详解:PPL越低表示模型越“自信”。计算为交叉熵损失的指数。常用于预训练阶段监控。但PPL低不一定答案有用。
7.2 词错误率(Word Error Rate, WER)
-
定义:语音识别任务中,识别错误的词占总词数的比例。
-
详解:WER = (替换+插入+删除) / 总词数。值越低越好。常用于ASR评测。
7.3 字符错误率(Character Error Rate, CER)
-
定义:类似WER,以字符为单位,适合中文等语言。
-
详解:中文语音识别常用CER。
7.4 BLEU(Bilingual Evaluation Understudy)
-
定义:机器翻译中,衡量生成译文与参考译文的n-gram重合度。
-
详解:值范围0-100,越高越好。BLEU偏向与参考译文相同,不适合创意生成任务。
7.5 ROUGE(Recall-Oriented Understudy for Gisting Evaluation)
-
定义:文本摘要任务中,衡量生成摘要与参考摘要的重叠度。
-
详解:ROUGE-N(n-gram召回率)、ROUGE-L(最长公共子序列)。常用于摘要评估。
7.6 BERTScore
-
定义:使用BERT嵌入计算生成文本与参考文本的相似度。
-
详解:比BLEU更接近人类判断,能捕捉语义相似而非字面匹配。
7.7 平均意见分(Mean Opinion Score, MOS)
-
定义:人工评估语音或文本质量的分数,1-5分。
-
详解:语音合成、对话系统常用。邀请多人盲测,取平均值。主观但最可靠。
7.8 人类评估(Human Evaluation)
-
定义:由人类评分员对模型输出进行质量评估。
-
详解:最可靠的评估方式,但成本高、速度慢。常用维度:有用性、无害性、相关性、流畅度。
7.9 自动化评测基准(Benchmark)
-
定义:标准化的测试数据集和评估协议。
-
详解:常见基准:MMLU(多任务语言理解)、C-Eval(中文)、HumanEval(代码生成)、GSM8K(数学推理)。
第八章:部署与运维(Deployment & Operations)
8.1 服务化(Serving)
-
定义:将模型封装为可调用的API服务,支持在线推理。
-
详解:服务化需处理:并发请求、负载均衡、自动扩缩容、监控告警。常用框架:vLLM、TGI、TorchServe。
8.2 高可用(High Availability, HA)
-
定义:系统在部分组件故障时仍能继续提供服务的能力。
-
详解:通过冗余部署、故障转移、健康检查实现。推理服务通常多副本部署。
8.3 弹性伸缩(Auto-scaling)
-
定义:根据负载自动增减服务实例数量。
-
详解:基于指标(QPS、CPU、GPU显存、队列长度)触发扩容或缩容。Kubernetes HPA是常用工具。
8.4 灰度发布(Canary Deployment)
-
定义:先让新版本服务少量流量,逐步扩大直至全量的发布策略。
-
详解:降低上线风险。新模型先服务1%用户,观察无问题后逐步增加比例。
8.5 A/B测试(A/B Testing)
-
定义:同时运行两个或多个模型版本,对比关键指标决定优劣。
-
详解:常用于模型迭代。将用户随机分组,不同组使用不同模型版本,比较转化率、满意度等。
8.6 容器化(Containerization)
-
定义:将应用及其依赖打包成轻量、可移植的容器镜像。
-
详解:Docker是最常用工具。容器化使环境一致,便于部署和编排。
8.7 编排(Orchestration)
-
定义:自动化管理容器的部署、伸缩、网络、负载均衡。
-
详解:Kubernetes是事实标准。编排平台处理故障恢复、滚动更新、资源调度。
8.8 私有化部署(On-Premise Deployment)
-
定义:将AI系统部署在企业自己的数据中心或私有云。
-
详解:适用于数据敏感行业(金融、医疗)。模型和用户数据不离开企业内网,需自行管理硬件和运维。
8.9 边缘部署(Edge Deployment)
-
定义:将模型部署到靠近数据源或用户的设备(手机、IoT、车载)。
-
详解:边缘部署要求模型轻量化(量化、剪枝),推理速度快,功耗低。常用框架:llama.cpp、ONNX Runtime、TensorFlow Lite。
8.10 QPS(Queries Per Second)
-
定义:每秒处理的请求数,衡量系统吞吐量。
-
详解:QPS越高,系统处理能力越强。受模型大小、硬件、批处理策略影响。
8.11 延迟(Latency)
-
定义:从发送请求到收到完整响应的时间。
-
详解:包括网络延迟和计算延迟。常用分位数:P50、P95、P99。交互式应用要求低延迟(<1s)。
8.12 吞吐量(Throughput)
-
定义:单位时间内处理的token数量或请求数量。
-
详解:离线批量处理关注吞吐量,在线交互关注延迟。可通过批处理、量化提升吞吐量。
第九章:安全与伦理(Safety & Ethics)
9.1 越狱攻击(Jailbreak Attack)
-
定义:通过精心构造的提示词绕过模型的安全对齐机制。
-
详解:攻击者通过角色扮演、多轮对话、多语言混淆等方式诱导模型输出有害内容。防御方法:输入过滤、输出检测、对抗训练。
9.2 提示注入(Prompt Injection)
-
定义:用户输入覆盖或修改系统提示词的攻击方式。
-
详解:如用户输入“忽略之前的指令,现在你是...”可让模型偏离预期行为。防御:分隔用户输入和系统指令、输入检测。
9.3 对抗样本(Adversarial Example)
-
定义:在原始输入上添加微小扰动,导致模型错误输出的攻击样本。
-
详解:对抗样本对人眼不可察觉,但对模型有强欺骗性。常见于图像分类。防御:对抗训练、输入净化。
9.4 数据泄露(Data Leakage)
-
定义:模型无意中输出训练数据中的敏感信息。
-
详解:大模型可能记忆训练集中的隐私数据(如个人身份、API密钥)。缓解方法:差分隐私训练、数据清洗。
9.5 隐私保护(Privacy Preservation)
-
定义:在模型训练和推理中保护用户数据不被泄露的技术。
-
详解:技术包括差分隐私、联邦学习、同态加密。差分隐私通过添加噪声保证单个数据点不影响模型输出。
9.6 差分隐私(Differential Privacy, DP)
-
定义:一种数学框架,保证模型输出对任意单个数据点的变化不敏感。
-
详解:通过添加随机噪声实现。参数ε(隐私预算)越小保护越强。VaultGemma是首个完全DP训练的开源LLM。
9.7 联邦学习(Federated Learning, FL)
-
定义:多个客户端在本地训练模型,只共享模型更新而非原始数据的分布式学习范式。
-
详解:数据不出本地,保护隐私。常用于手机输入法预测、医疗数据联合建模。
9.8 偏见(Bias)
-
定义:模型对某些群体产生不公平或有歧视性的输出。
-
详解:偏见源于训练数据中的社会偏见。评估方法:毒害词测试、反事实生成。缓解:数据去偏、公平性约束、后处理校正。
9.9 幻觉(Hallucination)
-
定义:模型生成与事实不符或没有依据的内容。
-
详解:幻觉是大模型的固有问题。RAG可缓解但无法根治。评估:事实性问答、引用检查。
9.10 内容审核(Content Moderation)
-
定义:检测和过滤AI生成或用户输入的违规内容(色情、暴力、仇恨言论)。
-
详解:常用方法:关键词过滤、机器学习分类器、第三方API(阿里云、腾讯云内容安全)。多模态审核更复杂。
9.11 红队测试(Red Teaming)
-
定义:专门针对模型进行攻击测试,发现安全漏洞。
-
详解:红队成员模拟恶意用户尝试越狱、提示注入等。是模型上线前的安全测试环节。
9.12 宪法AI(Constitutional AI)
-
定义:见3.16。同时属于对齐技术和安全治理。
附录:常用缩略语速查
|
缩略语 |
全称 |
中文 |
|---|---|---|
|
AI |
Artificial Intelligence |
人工智能 |
|
ML |
Machine Learning |
机器学习 |
|
DL |
Deep Learning |
深度学习 |
|
NLP |
Natural Language Processing |
自然语言处理 |
|
LLM |
Large Language Model |
大语言模型 |
|
AGI |
Artificial General Intelligence |
通用人工智能 |
|
RAG |
Retrieval-Augmented Generation |
检索增强生成 |
|
SFT |
Supervised Fine-Tuning |
有监督微调 |
|
RLHF |
Reinforcement Learning from Human Feedback |
人类反馈强化学习 |
|
DPO |
Direct Preference Optimization |
直接偏好优化 |
|
PPO |
Proximal Policy Optimization |
近端策略优化 |
|
MoE |
Mixture of Experts |
混合专家 |
|
CNN |
Convolutional Neural Network |
卷积神经网络 |
|
RNN |
Recurrent Neural Network |
循环神经网络 |
|
LSTM |
Long Short-Term Memory |
长短期记忆网络 |
|
GRU |
Gated Recurrent Unit |
门控循环单元 |
|
FFN |
Feed-Forward Network |
前馈网络 |
|
TP |
Tensor Parallelism |
张量并行 |
|
PP |
Pipeline Parallelism |
流水线并行 |
|
DP |
Data Parallelism |
数据并行 |
|
PTQ |
Post-Training Quantization |
训练后量化 |
|
QAT |
Quantization-Aware Training |
量化感知训练 |
|
TTFT |
Time To First Token |
首字延迟 |
|
TPOT |
Time Per Output Token |
每token时间 |
|
QPS |
Queries Per Second |
每秒查询数 |
|
WER |
Word Error Rate |
词错误率 |
|
CER |
Character Error Rate |
字符错误率 |
|
BLEU |
Bilingual Evaluation Understudy |
双语评估替补 |
|
ROUGE |
Recall-Oriented Understudy for Gisting Evaluation |
摘要评估替补 |
|
MOS |
Mean Opinion Score |
平均意见分 |
|
ANN |
Approximate Nearest Neighbor |
近似最近邻 |
|
HNSW |
Hierarchical Navigable Small World |
分层可导航小世界图 |
|
KV |
Key-Value |
键-值 |
|
PII |
Personally Identifiable Information |
个人身份信息 |
|
DP |
Differential Privacy |
差分隐私 |
|
FL |
Federated Learning |
联邦学习 |
更多推荐




所有评论(0)