使用说明

本手册面向AI应用开发工程师,系统梳理了大模型开发全流程中涉及的核心名词,并按技术领域分类整理。每个名词包含:英文全称、中文译名、一句话定义、详细解释、关联概念。建议按分类阅读,也可作为日常开发的速查工具。

第一章:基础概念(Foundation Concepts)

1.1 大模型(Large Language Model, LLM)

  • 定义:参数规模通常在十亿级别以上的深度学习模型,通过海量文本预训练获得通用语言理解和生成能力。

  • 详解:LLM基于Transformer架构,通过自监督学习从大规模语料中学习语言模式。典型代表:GPT系列、LLaMA、Qwen、DeepSeek。参数量从几亿到万亿不等,更大的参数量通常带来更强的能力,但推理成本也更高。

  • 关联:预训练、微调、推理

1.2 人工智能(Artificial Intelligence, AI)

  • 定义:让计算机模拟人类智能行为的科学与工程领域。

  • 详解:AI涵盖机器学习、自然语言处理、计算机视觉、机器人学等多个子领域。当前的主流范式是数据驱动的机器学习,特别是深度学习。

1.3 机器学习(Machine Learning, ML)

  • 定义:AI的一个子领域,通过从数据中学习规律而非显式编程来完成任务。

  • 详解:分为监督学习(有标签数据)、无监督学习(无标签)、强化学习(奖励信号)。大模型属于深度学习范畴,是机器学习的一种。

1.4 深度学习(Deep Learning, DL)

  • 定义:使用多层神经网络进行表征学习的机器学习方法。

  • 详解:通过堆叠多个非线性变换层,自动从原始数据中提取层次化特征。深度学习的“深”指网络层数多(几十到上千层),使其能学习极其复杂的函数。

1.5 自然语言处理(Natural Language Processing, NLP)

  • 定义:让计算机理解、生成、处理人类语言的技术领域。

  • 详解:NLP的核心任务包括文本分类、命名实体识别、机器翻译、问答、摘要、对话系统等。大语言模型的出现使NLP进入了通用能力时代。

1.6 生成式AI(Generative AI, GenAI)

  • 定义:能够生成文本、图像、音频、视频等内容的人工智能技术。

  • 详解:与传统判别式AI(分类、回归)不同,生成式AI创造新内容。大语言模型、扩散模型(图像生成)是代表性技术。

1.7 多模态(Multimodal)

  • 定义:同时处理或生成两种及以上类型数据(文本、图像、音频、视频)的AI系统。

  • 详解:多模态模型能够理解图文关系(如CLIP)、生成图像描述、根据文字生成图像(如Stable Diffusion)、或同时处理音视频(如Qwen2.5-Omni)。

第二章:模型架构(Model Architecture)

2.1 Transformer

  • 定义:2017年Google提出的基于自注意力机制的神经网络架构,是现代大语言模型的基石。

  • 详解Transformer抛弃了RNN的循环结构,完全依靠注意力机制捕获序列依赖。核心组件:多头注意力、前馈网络、残差连接、层归一化。优势是并行计算能力强,能捕获长距离依赖。

  • 关联:自注意力、多头注意力、位置编码

2.2 自注意力(Self-Attention)

  • 定义:一种让序列中每个位置直接关注序列中所有位置的机制。

  • 详解:通过计算查询(Q)、键(K)、值(V)三个矩阵的点积得到注意力权重,权重表示每个位置对其他位置的关注程度。公式:Attention(Q,K,V)=softmax(QK^T/√d_k)V

2.3 多头注意力(Multi-Head Attention, MHA)

  • 定义:将自注意力机制并行执行多次(多个头),每个头学习不同的特征子空间。

  • 详解:多个注意力头的结果拼接后线性变换得到最终输出。典型头数:8、12、32。多头使模型能同时关注不同位置和不同语义层面的信息。

2.4 位置编码(Positional Encoding)

  • 定义:在Transformer中注入序列位置信息的向量。

  • 详解:由于自注意力本身不包含顺序信息,需要额外添加位置编码。常见方式:正弦余弦函数(原始Transformer)、可学习位置编码(BERT)、旋转位置编码RoPE(LLaMA、Qwen)。

2.5 卷积神经网络(Convolutional Neural Network, CNN)

  • 定义:通过卷积核滑动提取局部特征的神经网络,主要用于图像处理。

  • 详解:核心组件:卷积层(特征提取)、池化层(降维)、全连接层(分类)。优势是参数共享、局部连接,计算效率高。经典模型:LeNet、AlexNet、ResNet。

2.6 循环神经网络(Recurrent Neural Network, RNN)

  • 定义:通过循环连接处理序列数据的神经网络。

  • 详解:RNN在每个时间步将当前输入与上一时间步的隐藏状态结合,理论上能处理任意长度序列。但存在梯度消失/爆炸问题,难以捕获长距离依赖。LSTM和GRU是其改进版本。

2.7 长短期记忆网络(Long Short-Term Memory, LSTM)

  • 定义:一种通过门控机制解决RNN梯度消失问题的变体。

  • 详解:LSTM引入遗忘门、输入门、输出门,精确控制信息流动,能记住长达数百步的依赖。在Transformer普及前是序列任务的主流模型。

2.8 门控循环单元(Gated Recurrent Unit, GRU)

  • 定义:LSTM的简化版本,将三个门合并为两个(更新门、重置门)。

  • 详解:GRU参数更少、训练更快,性能通常与LSTM相当。适合资源受限场景。

2.9 混合专家模型(Mixture of Experts, MoE)

  • 定义:通过门控网络动态激活部分专家子网络参与计算的模型架构。

  • 详解:MoE将模型拆分为多个专家(Expert)和一个路由器(Router)。每个输入只激活最相关的几个专家,极大降低计算成本。总参数量大但激活参数量小。代表模型:Mixtral 8x7B、DeepSeek-V3。

2.10 残差连接(Residual Connection, Skip Connection)

  • 定义:将输入直接加到输出上的连接方式,缓解深层网络梯度消失问题。

  • 详解:公式:输出 = F(x) + x。ResNet首先提出,Transformer中广泛应用。使网络可以训练到上百层甚至上千层。

2.11 层归一化(Layer Normalization, LayerNorm)

  • 定义:对单个样本所有特征进行归一化的技术。

  • 详解:与归一化不同,层归一化不依赖批次大小,适合序列模型。Transformer中每个子层后都接层归一化。

2.12 激活函数(Activation Function)

  • 定义:在神经网络中引入非线性的函数。

  • 详解:常见激活函数:ReLU(max(0,x))、GELU、Sigmoid、Tanh、Swish。ReLU是最常用的,计算简单且缓解梯度消失。

2.13 前馈网络(Feed-Forward Network, FFN)

  • 定义:Transformer中注意力层之后的两层全连接网络。

  • 详解:通常结构:线性 → 激活 → 线性。将注意力输出映射到更高维度再压缩,增强模型表达能力。在MoE架构中,FFN被替换为专家网络。

第三章:训练技术(Training Techniques)

3.1 预训练(Pre-training)

  • 定义:在海量无标注数据上训练模型,学习通用语言表示的过程。

  • 详解:预训练是“通识教育”阶段。目标通常是自监督任务(如预测下一个词、掩码语言建模)。需要大量计算资源(数千GPU)。产出是“基座模型”。

3.2 有监督微调(Supervised Fine-Tuning, SFT)

  • 定义:在人工标注的指令-答案对数据上继续训练预训练模型。

  • 详解:SFT教会模型“怎么回答用户问题”。数据量通常几千到几十万条,质量比数量更重要。SFT后的模型能遵循指令、进行对话。

3.3 指令微调(Instruction Tuning)

  • 定义:使用自然语言指令格式的数据进行微调,让模型学会理解和执行各种任务。

  • 详解:指令微调是SFT的一种形式,强调输入输出格式为“指令+输入+输出”。Flan、T0、Alpaca等都是指令微调的代表。

3.4 强化学习(Reinforcement Learning, RL)

  • 定义:通过奖励信号优化决策策略的学习范式。

  • 详解:智能体在环境中采取行动,获得奖励或惩罚,目标是最大化累积奖励。在LLM对齐中,RL用于优化模型行为使其更符合人类偏好。

3.5 人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)

  • 定义:使用人类偏好数据训练奖励模型,再用强化学习优化LLM的方法。

  • 详解:RLHF包含三步:SFT基座模型 → 收集偏好数据训练奖励模型 → 用PPO等算法优化策略。OpenAI InstructGPTClaude都采用此方法。

3.6 直接偏好优化(Direct Preference Optimization, DPO)

  • 定义:无需训练奖励模型,直接使用偏好对优化策略的算法。

  • 详解:DPO将RLHF中的奖励最大化问题重参数化为分类损失,训练更稳定、资源需求更低。已成为RLHF的主流替代方案。

3.7 数据并行(Data Parallelism, DP)

  • 定义:将训练数据切分到多个GPU,每个GPU持有完整模型副本的并行训练策略。

  • 详解:每个GPU处理不同批次数据,计算梯度后聚合平均。简单高效,但每个GPU需要完整模型显存。

3.8 模型并行(Model Parallelism, MP)

  • 定义:将模型切分到多个GPU上的并行训练策略。

  • 详解:包括张量并行(层内切分)和流水线并行(层间切分)。当模型过大单卡装不下时使用。

3.9 流水线并行(Pipeline Parallelism, PP)

  • 定义:将模型按层划分为多个阶段,每个阶段部署在不同GPU上的并行策略。

  • 详解:数据像流水线一样依次通过各阶段。需要解决“气泡”问题(部分GPU空闲),常用策略是微批次流水线(如GPipe)。

3.10 张量并行(Tensor Parallelism, TP)

  • 定义:将单个算子(如矩阵乘法)的参数切分到多个GPU上并行计算。

  • 详解:适用于单机多卡(NVLink互联),通信频繁,通常限制在单节点内。

3.11 混合精度训练(Mixed Precision Training)

  • 定义:同时使用FP16/BF16和FP32精度进行训练,加速并减少显存。

  • 详解:前向和反向传播用低精度(FP16/BF16),优化器状态和主权重用FP32。需要梯度缩放防止下溢。

3.12 梯度累积(Gradient Accumulation)

  • 定义:在多个小批次上累积梯度后再更新参数,模拟大批次训练。

  • 详解:显存不足时常用。每步计算损失和梯度但不立即更新,累积N步后平均梯度再更新。

3.13 检查点(Checkpoint)

  • 定义:训练过程中保存的模型状态快照,包含权重、优化器状态、步数等。

  • 详解:用于故障恢复、模型评估、版本管理。检查点可以是完整模型,也可以是增量(如LoRA适配器)。

3.14 激活检查点(Activation Checkpointing, Gradient Checkpointing)

  • 定义:在前向传播时丢弃部分激活值,反向传播时重新计算,以节省显存。

  • 详解:用计算换显存。适合训练超大模型或长序列。典型策略:每N层保留一次激活。

3.15 对齐(Alignment)

  • 定义:确保模型行为符合人类意图和价值观的过程。

  • 详解:对齐包括:有用性(helpfulness)、无害性(harmlessness)、诚实性(honesty)。技术手段有RLHF、DPO、宪法AI等。

3.16 宪法AI(Constitutional AI, CAI)

  • 定义:通过AI自我批判和修订,而非仅依赖人类反馈来实现对齐的方法。

  • 详解:Anthropic提出。模型根据书面原则(宪法)自我评估输出,生成修订版本,然后用这些数据训练。可规模化、成本低。

3.17 崩溃(Collapse) / 模型退化(Model Collapse)

  • 定义:使用AI生成的数据反复训练新模型,导致模型性能逐渐下降的现象。

  • 详解:模型生成的数据存在偏差和噪声,随着迭代,模型越来越偏离真实数据分布。需要保持新鲜真实数据注入。

3.18 灾难性遗忘(Catastrophic Forgetting)

  • 定义:在微调过程中,模型忘记预训练学到的知识的现象。

  • 详解:微调时参数过度适应新任务,原有能力下降。缓解方法:低秩微调(LoRA)、弹性权重巩固(EWC)、回放缓冲。

3.19 过拟合(Overfitting)

  • 定义:模型在训练集上表现很好,但在未见数据上表现差。

  • 详解:模型学到了训练集中的噪声而非真实规律。原因:模型过大、数据太少、训练太久。缓解:正则化、早停、数据增强。

第四章:推理优化(Inference Optimization)

4.1 推理(Inference)

  • 定义:使用训练好的模型对输入进行预测的过程。

  • 详解:推理阶段模型参数冻结,只做前向传播。目标是低延迟、高吞吐、低成本。区别于训练。

4.2 量化(Quantization)

  • 定义:将模型权重从高精度浮点数(FP32/FP16)转换为低精度整数(INT8/INT4)或紧凑浮点(FP8)。

  • 详解:大幅减少显存和带宽需求,加速推理。精度有轻微损失。常见格式:INT8、INT4、FP8、NF4。方法:训练后量化(PTQ)、量化感知训练(QAT)。

4.3 训练后量化(Post-Training Quantization, PTQ)

  • 定义:在模型训练完成后直接进行量化的方法。

  • 详解:只需少量校准数据计算缩放因子,无需重训练。实现简单,但精度损失略大。

4.4 量化感知训练(Quantization-Aware Training, QAT)

  • 定义:在训练过程中模拟量化操作,使模型适应低精度。

  • 详解:前向时模拟量化误差,反向时用高精度梯度。精度恢复更好,但需要额外训练。

4.5 AWQ(Activation-aware Weight Quantization)

  • 定义:根据激活值分布保护重要权重的量化方法。

  • 详解:保留激活幅度大的通道对应的权重精度,其他通道低精度。在Llama-70B上精度损失约4.3%,推理速度极快。

4.6 GPTQ(GPT Quantization)

  • 定义:基于Hessian矩阵的逐层量化方法。

  • 详解:通过二阶信息补偿量化误差。适合GPU推理,生态成熟。精度损失约5.2%

4.7 GGUF(GPT-Generated Unified Format)

  • 定义:llama.cpp使用的模型量化格式,支持多种量化级别。

  • 详解:GGUF是社区标准,尤其适合CPU推理和边缘部署。常见级别:Q4_K_M(推荐)、Q5_K_M、Q8_0。

4.8 剪枝(Pruning)

  • 定义:移除模型中不重要的权重或结构单元。

  • 详解:分为非结构化剪枝(单个权重)和结构化剪枝(整个通道/头)。非结构化剪枝压缩率高但硬件不友好;结构化剪枝硬件友好但精度损失大。N:M稀疏是折衷。

4.9 知识蒸馏(Knowledge Distillation, KD)

  • 定义:用一个大的“教师模型”指导小的“学生模型”学习。

  • 详解:学生模型学习教师模型的输出分布(软标签),而不仅是真实标签(硬标签)。可将大模型能力迁移到小模型。

4.10 KV Cache(Key-Value Cache)

  • 定义:在自回归生成中,缓存已计算过的Key和Value向量,避免重复计算。

  • 详解:解码阶段,每个新token只需计算当前token的KV,之前的无需重算。KV Cache是推理加速的核心技术,但会占用显存。

4.11 首字延迟(Time To First Token, TTFT)

  • 定义:从发送请求到收到第一个输出token的时间。

  • 详解:用户体验的关键指标。TTFT主要受预填充阶段计算影响。优化方法:使用更快的模型、减少提示词长度。

4.12 每 token 时间(Time Per Output Token, TPOT)

  • 定义:生成每个输出token的平均耗时。

  • 详解:决定生成速度。解码阶段受内存带宽限制,优化方法:量化、批处理。

4.13 连续批处理(Continuous Batching)

  • 定义:动态将新到达的请求加入正在运行的批次,而非等待当前批次完成。

  • 详解:大幅提升吞吐量。vLLM等引擎的核心技术。减少GPU空闲时间。

4.14 投机解码(Speculative Decoding)

  • 定义:用小模型先预测多个token,大模型并行验证的加速技术。

  • 详解:小模型(草稿模型)快速生成候选序列,大模型一次前向验证所有候选。接受率80%时,可实现2-3倍加速。

4.15 前缀缓存(Prefix Caching)

  • 定义:缓存常见提示词(如系统提示)的KV Cache,复用给多个请求。

  • 详解:当多个请求共享相同前缀时,只需计算一次。SGLang的RadixAttention是激进的前缀缓存实现。

4.16 PagedAttention

  • 定义:vLLM提出的KV Cache分页管理技术,类似操作系统虚拟内存。

  • 详解:将KV Cache分成固定大小的块,非连续存储。解决显存碎片,提升显存利用率2-4倍。

第五章:数据处理(Data Processing)

5.1 分词(Tokenization)

  • 定义:将原始文本切分为模型可处理的最小单元(Token)的过程。

  • 详解Token可以是词、子词、字符。常用的分词算法:BPE、WordPiece、SentencePiece。中文分词比英文复杂,因为没有天然分隔符

5.2 标记(Token)

  • 定义:模型处理的基本单位,通常是子词(如“playing”拆成“play”和“ing”)。

  • 详解:模型输入输出都是Token序列。1个Token约等于0.75个英文单词或0.5个中文字符。上下文长度以Token计。

5.3 词嵌入(Word Embedding)

  • 定义:将词映射到高维向量空间的表示。

  • 详解:语义相近的词在向量空间中彼此接近。经典方法:Word2Vec、GloVe。大模型中,嵌入层是可训练的,与模型其他部分联合优化。

5.4 上下文长度(Context Length)

  • 定义:模型一次能处理的最大Token数。

  • 详解:越长模型能“记住”的信息越多。早期模型2k-4k,现在主流32k-128k,部分模型支持1M以上。

5.5 文本切片(Chunking)

  • 定义:将长文档切分成适合模型处理的短文本块。

  • 详解:切片是RAG预处理的关键步骤。需要平衡块大小(信息完整)和粒度(检索精度)。常用策略:按段落、按固定长度滑窗、语义切分。

5.6 向量化(Embedding)

  • 定义:将文本、图像等非结构化数据转换为数值向量的过程。

  • 详解:向量化后的表示称为嵌入向量(Embedding Vector)。语义相似的输入产生的向量在空间中接近。用于相似度检索、聚类等。

5.7 向量数据库(Vector Database)

  • 定义:专门存储和检索高维向量的数据库系统。

  • 详解:核心能力是相似性搜索(近似最近邻ANN)。常用索引:HNSW、IVFFlat。代表:Milvus、Pinecone、Qdrant、Chroma、pgvector。

5.8 近似最近邻(Approximate Nearest Neighbor, ANN)

  • 定义:以牺牲少量精度换取极快检索速度的向量搜索算法。

  • 详解:ANN不保证绝对最近邻,但能在毫秒级返回90%+准确率的结果。HNSW是当前最流行的ANN算法。

5.9 分层可导航小世界图(Hierarchical Navigable Small World, HNSW)

  • 定义:一种基于图的ANN索引算法,查询速度极快。

  • 详解:构建多层图,上层稀疏用于快速定位,下层密集用于精细搜索。生产环境首选。构建时间较长,内存占用较高。

5.10 数据增强(Data Augmentation)

  • 定义:通过变换生成新训练样本,增加数据多样性。

  • 详解:文本常用方法:同义词替换、回译、随机插入/删除。图像常用:旋转、裁剪、色彩变换。

5.11 数据清洗(Data Cleaning)

  • 定义:移除或修正数据中的噪声、错误、重复。

  • 详解:大模型预训练数据清洗包括:去重(精确/近似)、语言过滤、质量过滤(长度、困惑度)、安全过滤(敏感内容)。脏数据会严重影响模型性能。

5.12 去重(Deduplication)

  • 定义:识别并移除重复或近似重复的数据。

  • 详解:精确去重用哈希;近似去重用MinHash、SimHash。预训练数据去重可提升模型性能、减少记忆效应。

5.13 合成数据(Synthetic Data)

  • 定义:由AI模型生成而非从真实世界收集的数据。

  • 详解:用于数据扩增、弱监督学习、模型蒸馏。需注意合成数据可能导致模型退化(Model Collapse),需混合真实数据。

第六章:检索增强生成(Retrieval-Augmented Generation)

6.1 检索增强生成(Retrieval-Augmented Generation, RAG)

  • 定义:先从知识库中检索相关信息,再基于这些信息生成答案的技术架构。

  • 详解:RAG解决了大模型知识截止和私有数据访问问题。流程:用户查询 → 检索 → 注入提示 → 生成。是当前企业落地大模型的主流方案。

6.2 嵌入模型(Embedding Model)

  • 定义:专门用于生成文本向量的模型。

  • 详解:嵌入模型与生成模型不同,输出是固定维度向量而非文本。常用模型:BGE、text-embedding-ada-002、M3E、GTE。

6.3 重排序(Rerank)

  • 定义:对检索结果进行精细再排序,提升Top结果的相关性。

  • 详解:向量检索粗筛出候选(如50条),再用更精确的模型(如交叉编码器)重新打分。增加少量延迟换取显著精度提升。

6.4 混合检索(Hybrid Search)

  • 定义:同时使用关键词检索(BM25)和向量检索(语义)的方法。

  • 详解:关键词检索擅长精确匹配(如产品型号),向量检索擅长语义匹配(如“手机充电慢”)。两者融合可提升召回率。

6.5 BM25

  • 定义:一种基于词频和文档长度的关键词检索排序函数。

  • 详解:经典的信息检索算法,广泛用于全文搜索引擎(如Elasticsearch)。适合精确匹配场景。

6.6 查询改写(Query Rewriting)

  • 定义:将用户原始问题改写成更适合检索的形式。

  • 详解:用户问题可能口语化、模糊、缺少上下文。用大模型改写可提升检索效果。例如“苹果怎么样”→改写为“苹果公司的股价和产品评价”。

6.7 上下文注入(Context Injection)

  • 定义:将检索到的文档片段拼接到提示词中,作为模型生成答案的依据。

  • 详解:注入方式:直接拼接、模板化、多文档摘要。需要控制总长度不超过模型上下文限制。

6.8 引用(Citation)

  • 定义:在生成答案中标明信息来源。

  • 详解:RAG的核心价值之一是可溯源。引用格式如“【来源:员工手册.pdf】”。有助于用户验证答案可信度。

第七章:评估与指标(Evaluation & Metrics)

7.1 困惑度(Perplexity, PPL)

  • 定义:衡量语言模型预测下一个词不确定性的指标。

  • 详解:PPL越低表示模型越“自信”。计算为交叉熵损失的指数。常用于预训练阶段监控。但PPL低不一定答案有用。

7.2 词错误率(Word Error Rate, WER)

  • 定义:语音识别任务中,识别错误的词占总词数的比例。

  • 详解:WER = (替换+插入+删除) / 总词数。值越低越好。常用于ASR评测。

7.3 字符错误率(Character Error Rate, CER)

  • 定义:类似WER,以字符为单位,适合中文等语言。

  • 详解:中文语音识别常用CER。

7.4 BLEU(Bilingual Evaluation Understudy)

  • 定义:机器翻译中,衡量生成译文与参考译文的n-gram重合度。

  • 详解:值范围0-100,越高越好。BLEU偏向与参考译文相同,不适合创意生成任务。

7.5 ROUGE(Recall-Oriented Understudy for Gisting Evaluation)

  • 定义:文本摘要任务中,衡量生成摘要与参考摘要的重叠度。

  • 详解:ROUGE-N(n-gram召回率)、ROUGE-L(最长公共子序列)。常用于摘要评估。

7.6 BERTScore

  • 定义:使用BERT嵌入计算生成文本与参考文本的相似度。

  • 详解:比BLEU更接近人类判断,能捕捉语义相似而非字面匹配。

7.7 平均意见分(Mean Opinion Score, MOS)

  • 定义:人工评估语音或文本质量的分数,1-5分。

  • 详解:语音合成、对话系统常用。邀请多人盲测,取平均值。主观但最可靠。

7.8 人类评估(Human Evaluation)

  • 定义:由人类评分员对模型输出进行质量评估。

  • 详解:最可靠的评估方式,但成本高、速度慢。常用维度:有用性、无害性、相关性、流畅度。

7.9 自动化评测基准(Benchmark)

  • 定义:标准化的测试数据集和评估协议。

  • 详解:常见基准:MMLU(多任务语言理解)、C-Eval(中文)、HumanEval(代码生成)、GSM8K(数学推理)。

第八章:部署与运维(Deployment & Operations)

8.1 服务化(Serving)

  • 定义:将模型封装为可调用的API服务,支持在线推理。

  • 详解:服务化需处理:并发请求、负载均衡、自动扩缩容、监控告警。常用框架:vLLM、TGI、TorchServe。

8.2 高可用(High Availability, HA)

  • 定义:系统在部分组件故障时仍能继续提供服务的能力。

  • 详解:通过冗余部署、故障转移、健康检查实现。推理服务通常多副本部署。

8.3 弹性伸缩(Auto-scaling)

  • 定义:根据负载自动增减服务实例数量。

  • 详解:基于指标(QPS、CPU、GPU显存、队列长度)触发扩容或缩容。Kubernetes HPA是常用工具。

8.4 灰度发布(Canary Deployment)

  • 定义:先让新版本服务少量流量,逐步扩大直至全量的发布策略。

  • 详解:降低上线风险。新模型先服务1%用户,观察无问题后逐步增加比例。

8.5 A/B测试(A/B Testing)

  • 定义:同时运行两个或多个模型版本,对比关键指标决定优劣。

  • 详解:常用于模型迭代。将用户随机分组,不同组使用不同模型版本,比较转化率、满意度等。

8.6 容器化(Containerization)

  • 定义:将应用及其依赖打包成轻量、可移植的容器镜像。

  • 详解:Docker是最常用工具。容器化使环境一致,便于部署和编排。

8.7 编排(Orchestration)

  • 定义:自动化管理容器的部署、伸缩、网络、负载均衡。

  • 详解:Kubernetes是事实标准。编排平台处理故障恢复、滚动更新、资源调度。

8.8 私有化部署(On-Premise Deployment)

  • 定义:将AI系统部署在企业自己的数据中心或私有云。

  • 详解:适用于数据敏感行业(金融、医疗)。模型和用户数据不离开企业内网,需自行管理硬件和运维。

8.9 边缘部署(Edge Deployment)

  • 定义:将模型部署到靠近数据源或用户的设备(手机、IoT、车载)。

  • 详解:边缘部署要求模型轻量化(量化、剪枝),推理速度快,功耗低。常用框架:llama.cpp、ONNX Runtime、TensorFlow Lite。

8.10 QPS(Queries Per Second)

  • 定义:每秒处理的请求数,衡量系统吞吐量。

  • 详解:QPS越高,系统处理能力越强。受模型大小、硬件、批处理策略影响。

8.11 延迟(Latency)

  • 定义:从发送请求到收到完整响应的时间。

  • 详解:包括网络延迟和计算延迟。常用分位数:P50、P95、P99。交互式应用要求低延迟(<1s)。

8.12 吞吐量(Throughput)

  • 定义:单位时间内处理的token数量或请求数量。

  • 详解:离线批量处理关注吞吐量,在线交互关注延迟。可通过批处理、量化提升吞吐量。

第九章:安全与伦理(Safety & Ethics)

9.1 越狱攻击(Jailbreak Attack)

  • 定义:通过精心构造的提示词绕过模型的安全对齐机制。

  • 详解:攻击者通过角色扮演、多轮对话、多语言混淆等方式诱导模型输出有害内容。防御方法:输入过滤、输出检测、对抗训练。

9.2 提示注入(Prompt Injection)

  • 定义:用户输入覆盖或修改系统提示词的攻击方式。

  • 详解:如用户输入“忽略之前的指令,现在你是...”可让模型偏离预期行为。防御:分隔用户输入和系统指令、输入检测。

9.3 对抗样本(Adversarial Example)

  • 定义:在原始输入上添加微小扰动,导致模型错误输出的攻击样本。

  • 详解:对抗样本对人眼不可察觉,但对模型有强欺骗性。常见于图像分类。防御:对抗训练、输入净化。

9.4 数据泄露(Data Leakage)

  • 定义:模型无意中输出训练数据中的敏感信息。

  • 详解:大模型可能记忆训练集中的隐私数据(如个人身份、API密钥)。缓解方法:差分隐私训练、数据清洗。

9.5 隐私保护(Privacy Preservation)

  • 定义:在模型训练和推理中保护用户数据不被泄露的技术。

  • 详解:技术包括差分隐私、联邦学习、同态加密。差分隐私通过添加噪声保证单个数据点不影响模型输出。

9.6 差分隐私(Differential Privacy, DP)

  • 定义:一种数学框架,保证模型输出对任意单个数据点的变化不敏感。

  • 详解:通过添加随机噪声实现。参数ε(隐私预算)越小保护越强。VaultGemma是首个完全DP训练的开源LLM。

9.7 联邦学习(Federated Learning, FL)

  • 定义:多个客户端在本地训练模型,只共享模型更新而非原始数据的分布式学习范式。

  • 详解:数据不出本地,保护隐私。常用于手机输入法预测、医疗数据联合建模。

9.8 偏见(Bias)

  • 定义:模型对某些群体产生不公平或有歧视性的输出。

  • 详解:偏见源于训练数据中的社会偏见。评估方法:毒害词测试、反事实生成。缓解:数据去偏、公平性约束、后处理校正。

9.9 幻觉(Hallucination)

  • 定义:模型生成与事实不符或没有依据的内容。

  • 详解:幻觉是大模型的固有问题。RAG可缓解但无法根治。评估:事实性问答、引用检查。

9.10 内容审核(Content Moderation)

  • 定义:检测和过滤AI生成或用户输入的违规内容(色情、暴力、仇恨言论)。

  • 详解:常用方法:关键词过滤、机器学习分类器、第三方API(阿里云、腾讯云内容安全)。多模态审核更复杂。

9.11 红队测试(Red Teaming)

  • 定义:专门针对模型进行攻击测试,发现安全漏洞。

  • 详解:红队成员模拟恶意用户尝试越狱、提示注入等。是模型上线前的安全测试环节。

9.12 宪法AI(Constitutional AI)

  • 定义:见3.16。同时属于对齐技术和安全治理。

附录:常用缩略语速查

缩略语

全称

中文

AI

Artificial Intelligence

人工智能

ML

Machine Learning

机器学习

DL

Deep Learning

深度学习

NLP

Natural Language Processing

自然语言处理

LLM

Large Language Model

大语言模型

AGI

Artificial General Intelligence

通用人工智能

RAG

Retrieval-Augmented Generation

检索增强生成

SFT

Supervised Fine-Tuning

有监督微调

RLHF

Reinforcement Learning from Human Feedback

人类反馈强化学习

DPO

Direct Preference Optimization

直接偏好优化

PPO

Proximal Policy Optimization

近端策略优化

MoE

Mixture of Experts

混合专家

CNN

Convolutional Neural Network

卷积神经网络

RNN

Recurrent Neural Network

循环神经网络

LSTM

Long Short-Term Memory

长短期记忆网络

GRU

Gated Recurrent Unit

门控循环单元

FFN

Feed-Forward Network

前馈网络

TP

Tensor Parallelism

张量并行

PP

Pipeline Parallelism

流水线并行

DP

Data Parallelism

数据并行

PTQ

Post-Training Quantization

训练后量化

QAT

Quantization-Aware Training

量化感知训练

TTFT

Time To First Token

首字延迟

TPOT

Time Per Output Token

每token时间

QPS

Queries Per Second

每秒查询数

WER

Word Error Rate

词错误率

CER

Character Error Rate

字符错误率

BLEU

Bilingual Evaluation Understudy

双语评估替补

ROUGE

Recall-Oriented Understudy for Gisting Evaluation

摘要评估替补

MOS

Mean Opinion Score

平均意见分

ANN

Approximate Nearest Neighbor

近似最近邻

HNSW

Hierarchical Navigable Small World

分层可导航小世界图

KV

Key-Value

键-值

PII

Personally Identifiable Information

个人身份信息

DP

Differential Privacy

差分隐私

FL

Federated Learning

联邦学习

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐