系列文章导航:AI系列文章导航目录-持续更新中

第06课:大模型应用开发概述与发展脉络

📝 本文摘要:本文梳理了大模型应用开发的三个时代(Prompt时代→编排时代→Agent时代),详解从最简架构(Prompt→LLM→Response)到生产架构(Agent+Memory+Guardrails+Observability)的四级演进,对比大模型应用vs传统后端开发的核心差异(确定性vs概率性、语义驱动vs数据驱动),总结大模型应用"第一性原理"三大支柱(信息注入、能力扩展、质量控制),并给出完整技术栈全景。

从这节课开始,你正式进入"大模型应用开发"的核心领域。理解发展脉络,你才能理解今天每一个技术为什么是这样设计的。


一、大模型应用开发的三个时代

时代1: Prompt时代 (2020-2022)
  "只要写好Prompt,模型什么都能做"
  代表: Prompt Engineering, Few-shot Learning
  
时代2: 编排时代 (2023-2024)
  "模型不够,工具来凑"
  代表: RAG, Function Calling, LangChain, Agent框架
  
时代3: Agent时代 (2024-至今) ← 我们在这里
  "让模型自主规划、使用工具、完成复杂任务"
  代表: MCP, Multi-Agent, 推理模型+Agent

二、关键时间线:大模型应用开发技术演进

2020.06  GPT-3发布 → Prompt Engineering诞生
         │  "给模型几个例子,它就能学会新任务"
         │
2022.11  ChatGPT发布 → 对话式AI应用元年
         │  "人人都能和AI对话"
         │
2022.10  LangChain发布 → LLM应用框架
         │  "把Prompt/Chain/Memory/Agent串起来"
         │
2023.03  GPT-4发布 → 最强基础模型
         │  "全面超越GPT-3.5"
         │
2023.06  GPT-4 + Function Calling → 工具调用范式
         │  "模型第一次能'动手'了"
         │
2022.10  ReAct论文(Reasoning+Acting,推理+行动) → 推理+行动框架
         │  "Agent不是纯聊天,而是想清楚再动手"
         │
2022.11  LlamaIndex发布(原名GPT Index) → RAG专用框架
         │  "让模型能查外部知识"
         │
2023.01  Text Embedding模型(OpenAI text-embedding-ada-002) → RAG基础设施
         │  "向量嵌入让语义搜索成为可能,RAG的基石"
         │
2023.03-04  AutoGPT / BabyAGI → 自主Agent探索
         │  "让AI自己给自己定目标"(但不太靠谱)
         │  AutoGPT: 基于GPT-4的自主Agent,能自己搜索、编码、调试(2023.03.16创建仓库)
         │  BabyAGI: 任务驱动的自主Agent,自动规划、执行、学习(2023.04发布)
         │
2023.09-12  Mistral/Mixtral → 开源模型生态
         │
2024.06  Anthropic Tool Use → Claude也能调工具(Claude 3.5 Sonnet含tool use)
         │
2024.05  GPT-4o → 低延迟实时交互
         │
2024.09  o1发布 → 推理模型
         │  "先思考再回答,推理能力质变"
         │
2024.10  Structured Output标准化 → 确保输出格式正确
         │  "从自由文本到可靠JSON,Agent输出的基石"
         │  代表: OpenAI Structured Outputs, Instructor库
         │
2024.11  Anthropic发布MCP(Model Context Protocol,模型上下文协议) → 标准化工具协议
         │  "Agent工具调用不应该每家自己定义"
         │
2024.Q4  Guardrails框架成熟 → 安全护栏成为标配
         │  "没有安全护栏的Agent是危险的"
         │  代表: Guardrails AI, NeMo Guardrails, Llama Guard
         │
2025.01  DeepSeek-R1 → 开源推理模型
         │
2025.02  OpenAI Agent SDK / Google A2A协议(Agent-to-Agent,智能体间通信协议)
 
         │  "Agent之间如何通信?"
         │
2025.03  Code Interpreter普及 → 让模型执行代码
         │  "从生成代码到运行代码,Agent能真正'动手做了'"
         │
2025.03  Skill生态兴起 → 可复用的能力模块
         │  "一次定义,处处复用,Agent的能力积木"
         │  代表: Claude Code Skills, OpenAI Custom GPTs Actions
         │
2025.04  GPT-4.1发布 / MCP正式标准化 → Agent基础设施
         │  "MCP成为Agent连接外部世界的HTTP"
         │  "GPT-4.1专为Agent优化"
         │
2025.05  Claude 4 Opus/Sonnet发布 → Agent原生模型优化
         │  "Claude进入Agent时代"
         │  (注:Computer Use功能于2024.10随Claude 3.5 Sonnet首次发布)
         │
2025.10  Anthropic Computer Use GA → Claude操控电脑正式可用
         │  "Agent不再限于API,可以直接操作UI"
         │
2026.02  Claude Opus 4.6 / Sonnet 4.6 → 当前最新版本
         │
2026.04  Claude Opus 4.7 / Mythos → 持续演进中
         │
2026.Q1  AI Harness工程爆发 → Agent评估/测试标准化
         │  "Harness成为Agent从demo到生产的关键桥梁"
         │  代表: lm-evaluation-harness, Promptfoo, Deepeval, SWE-bench
         │
2026.Q1  OpenClaw发布 → Agent能力标准化框架
         │  "统一Agent工具定义、分发和运行时"
         │
2026.Q1  OpenHuman发布 → 人机协作标准化
         │  "定义Human-in-the-Loop的标准模式"
         │
2026.Q2  Agentic Coding成熟 → Agent辅助编程元年
         │  "Claude Code/Cursor Agent/Devin进入生产"
         │
2026.Q2  Agent Orchestration Engine → 编排引擎标准化
         │  "可视化、可审计、可回滚的Agent工作流"
         │
2026.Q3  Synthetic Data & Self-Play → Agent训练新范式
         │  "用AI生成数据训练AI,自我博弈持续进化"
         │
2026    Agent进入工程化阶段 ← 你正在学习
         "仍emo到生产,从玩具到工具"```


三、大模型应用的核心架构

3.1 最简架构:Prompt → LLM → Response

用户输入 → 构造Prompt → 调用LLM → 返回结果

这就是最简单的"大模型应用"。ChatGPT就是这个架构。

3.2 增强架构:Prompt + Context + LLM

用户输入 → 检索相关知识 → 拼接到Prompt → 调用LLM → 返回结果
           ──────────────
           这就是RAG

3.3 Agent架构:LLM + Tools + Planning

用户输入 → Agent(LLM作为大脑)
            ├── 规划:分解任务
            ├── 决策:选择工具
            ├── 执行:调用工具
            ├── 观察:获取结果
            └── 迭代:循环直到完成

3.4 生产架构:Agent + Memory + Guardrails + Observability

用户输入 → Agent系统
            ├── LLM(推理引擎)
            ├── Tools(能力扩展)
            ├── Memory(长期/短期记忆)
            ├── Guardrails(安全护栏)
            ├── Observability(可观测性)
            └── Orchestration(多Agent编排)

四、大模型应用开发 vs 传统后端开发

作为后端工程师,需要理解的范式转变:

维度 传统后端 大模型应用
逻辑控制 确定性代码 非确定性推理
输入输出 结构化数据 自然语言
错误处理 异常/错误码 模型幻觉/格式错误
测试方式 单元测试 评估集/对比测试
延迟 毫秒级 秒级(生成需要时间)
扩展方式 水平扩容 模型能力提升
核心挑战 并发/一致性 可靠性/可控性

关键认知转变

  1. 从"写逻辑"到"设计行为":你不再写if-else,而是通过Prompt和工具定义来引导模型行为
  2. 从"确定性"到"概率性":模型输出不是100%确定的,你需要设计容错机制
  3. 从"数据驱动"到"语义驱动":核心处理对象从结构化数据变成自然语言
  4. 从"API调用"到"AI编排":从调用确定性的函数到编排不确定的AI行为

五、你需要掌握的技术栈全景

┌──────────────────────────────────────────────────┐
│                  大模型应用开发技术栈              │
├──────────────────────────────────────────────────┤
│                                                  │
│  🧠 LLM基础(Part 1已完成)                      │
│    原理 / 模型选型 / 本地部署 / API调用          │
│                                                  │
│  📝 提示词工程                                    │
│    Prompt设计 / 系统提示 / Few-shot(少样本学习) / CoT(Chain-of-Thought,思维链推理)        │
│                                                  │
│  📦 上下文工程                                    │
│    上下文窗口管理 / 信息检索 / 压缩 / 缓存       │
│                                                  │
│  🔧 工具调用                                      │
│    Function Calling / Tool Use / MCP / Skill     │
│                                                  │
│  🤖 Agent架构                                     │
│    ReAct / Planning / Memory / Multi-Agent       │
│                                                  │
│  📊 RAG                                           │
│    向量数据库 / 嵌入模型 / 检索策略 / 评估      	   │
│                                                  │
│  🏗️ 开发框架                                       │
│    LangChain / LlamaIndex / OpenAI Agents SDK    │
│                                                  │
│  🛡️ 工程化                                         │
│   评估 / 可观测 / 安全 / 对齐 / 部署       	       │
│                                                  │
│  🎯 Harness工程                       			   │
│    评估框架 / 测试框架 / 安全探测 / CI集成   		   │
│    Promptfoo / Deepeval / Garak / SWE-bench      │
│                                                  │
│  🚀 Agent生态前沿            					   │
│    Agentic Coding / 编排引擎 / 合成数据       	   │
│    OpenClaw / Hermes / OpenHuman / MemGPT        │
│                                                  │
└──────────────────────────────────────────────────┘

六、大模型应用开发的"第一性原理"

不管技术怎么变,大模型应用的核心就是这三件事:

6.1 让模型知道更多(信息注入)

Prompt → 告诉模型要做什么
Context → 给模型相关信息
RAG → 让模型能查外部知识
Memory → 让模型记住历史

6.2 让模型能做更多(能力扩展)

Function Calling → 让模型调用API
MCP → 标准化的工具协议
Skill → 可复用的能力模块
Code Interpreter → 让模型执行代码

6.3 让模型更可靠(质量控制)

Structured Output → 确保输出格式正确
Guardrails → 防止输出不当内容
Validation → 验证模型输出
Evaluation → 评估模型表现

所有大模型应用技术,都可以归入这三类。记住这个框架,后面学任何新技术都能快速定位。


📝 作业

作业1:画出你理解的大模型应用架构

根据本课内容,画出从最简架构到生产架构的演进图,标注每个阶段新增了什么组件。

参考答案

Level 0: 纯Prompt
  [User] → [Prompt] → [LLM] → [Response]

Level 1: +知识
  [User] → [Prompt + Context(RAG)] → [LLM] → [Response]
  
Level 2: +工具
  [User] → [Agent(LLM + Tools)] → [Observation] → [Response]
           ↑___循环___↓

Level 3: +记忆+安全
  [User] → [Agent(LLM + Tools + Memory)] 
           → [Guardrails检查] → [Response]
           
Level 4: +多Agent+可观测
  [User] → [Orchestrator]
              ├── [Agent1(LLM + Tools + Memory)]
              ├── [Agent2(LLM + Tools + Memory)]
              └── [Agent3(LLM + Tools + Memory)]
           → [Observability] → [Response]

作业2:思考题

为什么AutoGPT(2023年初)当时很火但最终没有成为主流?它缺了什么?

参考答案

AutoGPT的愿景是"AI自主完成一切",但它有几个致命问题:

  1. 缺乏可靠性:模型经常陷入死循环、重复调用工具、偏离目标——没有好的规划能力
  2. 成本不可控:一个简单任务可能消耗大量token,因为循环次数不可预测
  3. 没有安全护栏:自主Agent可能执行危险操作(删除文件、发送邮件)
  4. 缺少评估机制:不知道任务什么时候算"完成"了,质量如何

核心教训:没有可靠性的自主性是灾难。今天的Agent设计吸取了这个教训——更强调可控性、可观测性、人在回路(Human-in-the-loop),而不是完全自主。


下一篇文章见:AI系列文章导航目录-持续更新中

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐