LLM原理与Prompt工程③-零基础面试保姆级教程
第 8 章:推理模型(Reasoning Model)—— 2025 年后的新物种
8.1 它是什么:先打草稿,再答题
传统对话模型拿到问题就开始往外吐答案。推理模型在正式回答前,先在内部生成一大段"思考过程"(打草稿:拆解、尝试、自我检查、回溯),然后基于草稿给出最终答案。 这套"多花时间换质量"的路线叫 test-time scaling(推理时扩展)。
里程碑:OpenAI o1(2024.9)开创品类 → DeepSeek-R1(2025.1)开源引爆全行业(用第 4 章说的 RLVR 路线训练,并公开了方法)→ 此后各家全面跟进:Qwen 的思考模式、GLM 思考版、Gemini 的 Deep Think、Claude 的 extended thinking 等。2026 年主流旗舰普遍是混合推理模型:同一个模型可开关/调节"思考深度"(快答模式 vs 深思模式)。
8.2 API 层面长什么样
- 调用推理模型时,响应中除了
content(最终回答),通常还有一个思考字段(如 DeepSeek 的reasoning_content)返回或省略思考过程;
- 思考 token 也按输出计费——推理模型"又慢又贵"的原因;
- 部分推理接口不支持/忽略 temperature 等采样参数(第 5 章讲过);
- 多轮对话回传历史时,一般只回传最终回答、不回传思考内容(省钱且官方推荐)。
8.3 什么时候用它(面试高频的选型题)
|
用推理模型 |
用普通快模型 |
|
数学、复杂代码、多约束规划 |
闲聊、客服日常应答 |
|
需要多步逻辑推导的分析 |
信息抽取、格式转换、翻译 |
|
Agent 的规划/反思环节 |
Agent 的简单执行环节 |
|
低频高价值任务(可接受 10s+ 延迟) |
高并发低延迟场景 |
2026 年 Agent 的主流打法是混搭:用推理模型当"大脑"做任务分解与关键决策,用便宜快模型当"手脚"批量执行子任务——一套系统里多个模型各司其职(第 5、6 批会实操这种架构)。
面试可复述版:推理模型通过在回答前生成长思考链(test-time compute)大幅提升复杂推理能力,代价是延迟与成本;由 RLVR 类强化学习训练而来,代表作 o 系列与开源的 DeepSeek-R1;工程上应按任务复杂度混合调度推理模型与普通模型,思考内容计费但通常不回传历史。
第 9 章:2026 年模型地图 —— 主流模型认知与选型
先立规矩:版本号几个月一换,背版本号毫无意义。 要记的是"有哪些厂牌、各自的招牌特长、怎么选"。以下为截至 2026 年中的格局,动手前一律以官网最新为准。
9.1 海外三巨头(+两个熟脸)
|
厂商 |
系列 |
2026 年印象 |
|
OpenAI |
GPT-5 系列(年内已迭代至 5.5/5.6,分大中小档) |
综合能力与生态标杆;推理与对话已融合为自动分配"思考力度"的统一系列 |
|
Anthropic |
Claude(4.x 系列:Opus/Sonnet/Haiku 三档;2026 年推出新一代旗舰 Fable 5) |
代码与 Agent 场景口碑极强,MCP 协议的缔造者;长任务稳定性出名 |
|
|
Gemini(2.5 → 3 → 3.1,2025.11 的 Gemini 3 曾登顶多项评测) |
原生多模态 + 超长上下文是招牌;绑 Google 生态 |
|
Meta |
Llama 系(Llama 4 等) |
开源权重代表,海外自部署生态大 |
|
xAI |
Grok 4.x |
实时信息整合特色 |
国内团队直连海外 API 存在网络与合规门槛,生产环境通常主用国产模型;但接口格式基本都向 OpenAI 规范看齐,所以学一套调用方式全球通用(第 3 批的核心便利)。
9.2 国产主力(Agent 岗日常真正打交道的对象)
|
厂商 |
系列 |
招牌与定位(2026 年中) |
|
阿里 · 通义 |
Qwen3 系列(几 B 到几百 B 全尺寸;Max 闭源旗舰;长上下文版可达 1M) |
开源生态全球第一梯队:尺寸最全、协议友好(Apache 2.0)、多语言强;配套百炼平台。企业私有化部署的首选之一 |
|
深度求索 |
DeepSeek V3/V4 系 + R1 推理系 |
极致性价比 + 开源推理鼻祖:API 价格常年比海外旗舰低 1~2 个数量级,缓存命中再打折;开发者练手与生产降本首选 |
|
智谱 |
GLM 系(GLM-4.x → 5 代) |
代码与 Agent 能力突出,开源积极(MIT 协议),国内 B 端市场活跃 |
|
月之暗面 |
Kimi K2 系(万亿级 MoE 开源) |
长上下文与 Agent/深度研究见长,开源大参数路线代表 |
|
字节 · 豆包 |
Doubao/Seed 系(闭源为主) |
C 端量最大之一;配火山方舟平台与扣子(Coze)低代码生态——字节系岗位必然接触 |
|
百度 |
文心 ERNIE(4.5 起开源部分权重) |
千帆平台,政企市场深 |
|
腾讯 |
混元 |
绑腾讯云与微信生态(元宝、ima) |
|
其它 |
MiniMax(M 系)、阶跃、讯飞星火等 |
各有多模态/语音等特色赛道 |
一个值得知道的行业事实:2025–2026 年中国开源权重模型在全球下载量中已占据过半份额,"用国产开源模型 + 自部署"成为国内企业的主流方案之一——这直接催生了岗位 JD 里"vLLM 部署经验"的需求(第 8 批)。
9.3 选型决策清单(做项目/答面试都按这个走)
依次问五个问题:
- 数据能出域吗? 不能 → 开源模型私有化部署(Qwen/DeepSeek/GLM 开源版 + vLLM);能 → 走 API。
- 任务复杂度? 复杂推理/规划 → 推理模型或旗舰;抽取/分类/闲聊 → 中小模型(便宜 10 倍效果打 9 折)。
- 预算与并发量? 高频调用优先 DeepSeek/Qwen 档价格 + 用好前缀缓存。
- 要合规上线吗? 面向公众的国内产品需使用已备案模型(国产大厂模型均已备案)。
- 别信嘴,跑评测:拿你自己的 3050 条真实任务数据横评 23 个候选(第 7 批教你搭评测),榜单(LMArena、SuperCLUE 等)只做初筛——刷榜与"榜霸实战拉胯"是行业常态。
第 10 章:高频概念速查
参数量(7B/72B/671B):模型内可学习权重的个数,B=十亿。参数越多容量越大,但数据质量与训练方法同样关键——2026 年的 8B 模型吊打 2023 年的 70B 是常态。粗略硬件直觉:FP16 精度下显存需求 ≈ 参数量×2 字节(7B≈14GB),量化可大幅压缩。
Dense vs MoE(混合专家):Dense 模型每次推理全体参数上阵;MoE 把网络拆成众多"专家",每个 token 只激活其中几个(如总参 671B、每次只激活 37B 的 DeepSeek-V3;Qwen3-235B-A22B 的 A22B 就是"激活 22B")。类比:三甲医院不会让全院医生看你一个号,分诊到 2 个对口专家。效果对标大模型、算力接近小模型——这是国产模型"又大又便宜"的核心技术答案,面试高频。
量化(Quantization):把参数从 16 位浮点压到 8 位/4 位整数存储计算,显存减半再减半,精度小幅受损。你在 Ollama 里一键跑 7B 模型,跑的多半是 4bit 量化版(第 8 批实操)。
蒸馏(Distillation):让小模型学习大模型的输出,把能力"浓缩"下来。如 DeepSeek 用 R1 的推理数据蒸馏出 R1-Distill-Qwen-7B 等小尺寸推理模型——手机/边缘设备跑推理模型靠这条路。
多模态(Multimodal):能处理文本以外模态。看图/视频的 VL 模型(Qwen-VL、GLM-4V、Gemini 原生多模态)、生图(即梦、Midjourney 类)、语音(ASR/TTS/实时对话)。Agent 岗最常用的是 VL 理解:截图问答、票据识别、GUI 操控智能体的"眼睛"。
Embedding 模型:专门"文字→语义向量"的另一类模型(不生成文字),RAG 的基石,第 4 批主角。国产常用 BGE 系、Qwen-Embedding 系。
开源 vs 闭源:严格说开的是权重(open-weight)——给你训练好的参数文件可自部署,训练数据和完整流程一般不公开。开源价值:数据不出域、可微调、成本可控;闭源价值:省运维、通常更强、随用随付。
Scaling Law 一句话:模型能力随参数、数据、算力的投入呈可预测提升——它解释了"大力出奇迹"的十年;2025 年后行业重心转向后训练(RL)与推理时扩展,即"预训练之外的第二、第三增长曲线"。
更多推荐



所有评论(0)