大模型体系完整科普:LLM、RAG、Agent 概念、产品、落地全解析

目录
前言
很多初学者会混淆大语言模型LLM、检索增强RAG、智能体Agent三者,三者并非并列替代关系,而是底层基础、知识库增强、自主执行应用的层级依赖关系:
LLM是AI核心大脑,
RAG为大脑补充私有资料,
Agent给大脑赋予自主行动与工具调用能力。
本文整合训练原理、技术区别、市面主流工具、完整工程流程,搭配流程图直观梳理。
一、基础核心:LLM大语言模型(AI大脑)
1. 定义与本质
LLM即大语言模型,是所有AI应用的底层基础。
通过投喂海量文本完成训练,内部存储语言逻辑、通用常识,仅具备文字理解、推理、生成能力。
局限性:知识存在时间截止,无法读取私有文件、实时数据;无外部操作能力,缺少信息时容易编造虚假内容(幻觉);仅支持一问一答被动交互,不能自主拆分复杂任务。
2. 大模型训练逻辑:不是简单“存数据”
大模型训练区别于数据库存储,数据库仅原文存储检索,LLM只学习文字规律,不保存原文,完整三阶段流程:
- 预训练:投喂无标注海量干净通用文本(书籍、百科、论文),模型反复学习文字先后逻辑,搭建基础语言能力;
- SFT监督微调:投喂人工标注「指令-标准答案」数据集,教会模型听懂人类提问、规范输出内容;
- DPO/RLHF人类对齐:投喂同一问题多版回答人工优劣排序数据,优化回答风格,减少偏激、错误、生硬输出。
3. 为什么开源/商用模型可以直接拿来使用?
预训练、微调需要巨额显卡算力、数十TB语料、数天至数十天训练周期。
大厂与开源作者已完成全套训练,产出包含全部语言规律的权重文件。
使用者直接下载权重或调用API,无需重复高成本训练;企业也可基于现成模型,投喂少量行业数据二次微调适配垂直场景。
4. 市面主流成熟LLM清单
(1)闭源云端模型(调用API即用,无需本地显卡)
国外:GPT-4o、Claude系列、Gemini
国内:豆包大模型、通义千问、文心一言、GLM-4.5、Kimi
(2)开源本地模型(显卡部署、私有化免费使用)
海外:Llama3/4、Mistral
国产(中文优先):Qwen通义千问开源版、ChatGLM、DeepSeek、百川大模型
二、知识增强层:RAG检索增强生成(专属知识库)
1. 定义与作用
RAG是配套LLM的外挂知识库方案,解决LLM两大痛点:训练截止后新知识缺失、无法读取企业私有文档,大幅降低AI幻觉。
2. RAG标准四步流程
文档切片 → Embedding嵌入向量化 → 向量数据库存储相似度检索 → 参考文档+用户问题拼接送入LLM生成答案
3. 配套核心组件:Embedding嵌入模型
专门将文字转化为数字向量,用于判断文本语义相似度,无法生成文字,是RAG必备工具,轻量化运行。
4. 主流RAG相关工具分类
- 零代码平台(普通人/企业快速搭建知识库):Dify、FastGPT、RAGFlow、LangChain-Chatchat
- 开发框架(程序员自定义RAG链路):LangChain、LlamaIndex、Haystack
- 向量数据库(存储文本向量,检索核心):Chroma、FAISS、Milvus、Qdrant、Pinecone

三、自主执行层:Agent智能体(带手脚的AI助手)
1. Agent与普通LLM核心区别

普通LLM:仅被动单次问答,无外部操作能力,缺少数据就卡顿或编造内容;
Agent:底层依旧依赖LLM,外层增加自主调度循环逻辑,拥有两大独有能力:
- 工具Skill调用:使用开发人员提前编写的外部工具;
- 自主任务规划:自动拆分复杂需求、多轮循环调用工具、校验信息,直至完成任务。
2. Skill技能是什么?谁编写?
Skill是拓展AI能力的代码工具,计算器、文件读取、联网搜索、业务接口都属于Skill;
由后端/AI开发人员手动编写,包含功能执行代码+给LLM识别的参数描述,注册进Agent框架即可自动调用。
3. 主流Agent相关产品与开发框架

(1)开箱即用产品(无代码,普通用户直接使用)
豆包智能体(Coze扣子)、OpenAI GPTs、Kimi Claw、Claude Agent、飞书ArkClaw
(2)开发框架(程序员自定义智能体)
LangChain、LangGraph、AutoGen(微软多智能体)、CrewAI、AutoGPT、Dify(一体化RAG+Agent)
四、完整LLM工程全链路(从原始文本到线上API服务)
完整7大标准化流程:
- 数据采集:抓取书籍、网页、文档等原始文本素材;
- 数据清洗:标准化格式、语种过滤、去重、隐私脱敏、低质文本过滤、质量打分筛选;
- Token编码:文字转为模型可计算的数字Token ID;
- 基座预训练:多卡分布式训练基础大模型;
- 微调对齐:SFT监督微调 + DPO/RLHF人类偏好优化;
- 推理优化:权重量化、PagedAttention优化KV Cache显存、vLLM/TGI加速推理;
- 线上服务封装:搭建OpenAI标准API,容器K8s集群部署,上层搭配RAG/Agent实现业务功能。

配套底层技术概念补充
- 量化:FP32/FP16/INT8/INT4,bit数值越小显存占用越低,轻微损失精度;
- KV Cache:缓存注意力计算数据加速文字生成,上下文越长显存占用越高;
- PagedAttention:分页管理缓存,解决显存碎片浪费,提升并发量;
- 分布式并行训练:数据并行、流水线并行、张量并行,超大模型多卡训练必备;
- 梯度累积:显存不足时,多次累加梯度模拟大批次训练效果;
- Loss损失值:模型预测与标准答案的差距,Loss持续下降代表学习有效;训练Loss下降、验证Loss上升为过拟合(模型只会死记训练数据,泛化差、幻觉变多);
- 学习率:权重更新幅度,过大会震荡不收敛,过小训练速度极慢;
- 幻觉:AI无依据编造虚假信息,缓解方案:RAG检索、微调对齐、输出双层校验;
- 两种对齐方案:RLHF流程繁琐算力消耗高;DPO简化流程、省显存、训练效率更高。
五、层级逻辑流程图(文字结构化流程图,可直接绘制可视化图表)
流程图1:三层依赖层级总图
顶层业务应用:Agent智能体
↓ 内置搭配
中层知识库增强:RAG检索系统(向量库+Embedding)
↓ 底层依赖
底层核心大脑:LLM大语言模型(Qwen/GPT/Claude等)

流程图2:RAG内部执行流程
用户提问
↓
1.私有文档预处理:加载、切片
↓
2.Embedding模型转为向量
↓
3.存入向量数据库
用户提问→提问向量化→向量库相似度检索→取出匹配原文
↓
4.原文+问题拼接Prompt送入LLM
↓
LLM依据参考资料输出答案

流程图3:Agent任务执行循环流程

用户下达复杂目标
↓
LLM思考:需要哪些Skill工具、拆分分步任务
↓
调用开发提前编写的Skill工具(计算器/文件/联网)
↓
获取工具返回结果
↓
判断信息是否充足
├─信息不足:再次规划,重复调用工具
└─信息充足:整合全部数据生成最终完整回答
流程图4:大模型完整训练上线全链路

原始文本素材
↓
数据清洗标准化(去重、脱敏、过滤低质内容)
↓
Tokenizer分词编码
↓
分支1:海量无标注文本 → 多卡分布式预训练基座LLM
分支2:人工标注问答数据 → SFT监督微调
↓
人工偏好排序数据 → DPO/RLHF对齐优化
↓
模型权重文件
↓
推理优化:量化、vLLM、PagedAttention显存优化
↓
封装标准API接口,Docker+K8s线上部署
↓
业务层接入RAG知识库、Agent智能体对外提供服务
六、案例直观区分三者
- 仅LLM(纯Qwen):询问公司产品参数,无内部文档则胡乱编造通用数据;
- LLM+RAG(FastGPT知识库):上传产品手册,精准引用文档回答参数,但无法自动整理对比表格;
- LLM+RAG+Agent(Coze智能体):自动检索手册、调用计算器对比规格、生成Excel表格输出完整报告,全程无需人工分步操作。
总结

- LLM是基础,所有AI问答、生成能力的根源,分开源私有化与商用API两类;
- RAG是知识库插件,解决私有资料、时效性问题,降低幻觉,不能自主执行多步骤任务;
- Agent是自动化业务载体,依托LLM思考、Skill工具操作、可搭配RAG,独立完成复杂连续任务;
- 完整大模型产品需要走完数据清洗、训练、推理优化、API部署整套工程流程,普通使用者无需从零训练,直接选用现成模型、RAG平台、Agent框架快速搭建业务系统。
更多推荐




所有评论(0)