AI 额度不够用?从 4 层 Context 看省 Token 的三个实战方法
直接结论:真正烧额度的不只是你当前这句 Prompt,而是每次请求都要重新注入的整包 Context。省 Token 的正确思路是“丢掉用不到的、缩小留下的、让缓存打折”,而不是把 Prompt 写短或换一个便宜的小模型。
本文面向使用 Claude Code、Codex、Cursor 或类似 Agent 工具的开发者。内容覆盖 Context 构成、常见误区、三条可执行方法、FAQ 和检查清单。涉及价格、缓存时长和产品功能的部分,以官方当前文档和定价页为准。
为什么额度总是不够用
很多人在对话框里只看到自己输入的一行字,但请求真正发送时,系统会把以下内容一起打包注入模型:
| Context 层级 | 包含内容 | 典型来源 |
|---|---|---|
| 系统与项目规则 | 系统提示词、CLAUDE.md / AGENTS.md、Git 状态、系统信息 | 项目目录和运行环境 |
| 工具使用说明 | 内置终端、文件读写、搜索,以及外部 MCP Server 的名称和参数描述 | 挂载的工具与插件 |
| 对话历史 | 之前每一轮对话、AI 的长篇分析、写过的代码 | 当前会话 |
| 外部文件与执行日志 | 读过的源码、PDF、终端命令输出 | 文件读取和命令执行 |
底层 API 本身没有跨请求记忆,因此每次按 Enter,这四层内容都会完整重新注入。对话越长,历史记录越大,下一次请求就越贵。到第十轮、第二十轮时,你发的那句“帮我改第二行”可能只占整包输入的 1%,其余都是旧 Context。
两个看似合理但效果有限的误区
误区一:只要把 Prompt 写短
当对话已经累积几万 Token 时,把 50 个字的 Prompt 缩成 5 个字,省下的比例微乎其微。问题不在当前输入,而在整包历史。
误区二:换成更便宜的小模型
小模型理解力不足时,代码写错、答非所问会带来更多来回重试,整趟任务累积下来反而更费额度。先控制 Context,再谈模型选择。
三招控制 Context
第一招:丢掉用不到的
- 换任务就开新对话。任务告一段落就新建会话,不要让上一个项目的代码、报错和工具输出继续背到下一次请求里。
- 打错指令或结果不如意时,优先编辑原消息,或使用工具的 rewind / 分支回溯功能回到出错前,避免把整段失败输出留在历史里。以你当前使用的产品为准,Claude Code 中可参考
Esc + Esc或/rewind。 - 精简 MCP Server 和插件。每个 MCP 工具的说明与参数定义都会进入 Context;只写文章或改小功能时,关掉暂时用不到的网页搜索、数据库等服务。
第二招:缩小留下的
- 先搜索,再喂给模型。问题有明确函数名、错误码或关键字时,先用搜索工具定位最相关的几行,再让模型处理。这一步可以把单次请求从几万 Token 降到几百。
- 给结论,清掉讨论过程。多轮讨论后的最终规格、限制和决策,整理成一份干净的 Markdown,再开新会话喂给模型。自动压缩、摘要功能有帮助,但摘要是有损压缩,重要细节最好由你自己保留。
- 缩小输入格式与输出范围。能用纯文本或代码传递的信息,不要丢几 MB 的截图;只改某个函数时,明确要求只输出修改后的段落。输出 Token 通常比输入更贵,避免模型把整篇内容重写一遍。

第三招:让缓存打折
Claude 和 OpenAI 等主流模型都提供 Prompt Caching(提示词缓存),把重复使用的前缀暂存在服务端,后续请求更快也更便宜。以下是官方文档中的核心规则,具体数字以当前定价页为准:
| 项目 | 说明 |
|---|---|
| 默认缓存时长 | Anthropic 自动缓存默认 5 分钟,使用时会免费刷新;也提供 1 小时 TTL 选项,写入价更高 |
| 缓存读取价 | Anthropic 按基本输入价的 0.1 倍计费;OpenAI 官方文档同样按 0.1 倍计费 |
| 缓存写入价 | Anthropic 5 分钟 TTL 为基本输入价 1.25 倍,1 小时 TTL 为 2 倍;OpenAI 新版模型按 1.25 倍计费 |
| 示例 | Claude Opus 5 基本输入 $5/百万 Token,缓存读取 $0.50/百万 Token,输出 $25/百万 Token |
要让缓存更容易命中,注意两点:
- 同一任务里避免中途换模型、调思考强度或开启加速模式;前缀变化可能让之前写入的缓存失效。
- 长时间不对话会超过缓存 TTL。如果任务是跨 session 复用同一段稳定上下文,主动整理成固定 Markdown 前缀,并参考官方 1 小时 TTL 或手动预热说明。
发送前的两个检查问题
- 回答我当前这句指令,真的需要前面的上下文和旧资料吗?如果不需要,开新对话。
- 如果确实需要背景,中间的讨论过程需要“全部知道”吗?如果不需要,把结论整理成 Markdown,开新会话继续。
FAQ
省 Token 是不是就是少用 AI?
不是。省的是无用 Context,不是省深度思考。把噪音清掉后,额度可以留给真正需要复杂推理的地方。
换任务一定只能开新对话吗?
开新对话是最直接的方法;如果你的工具提供 /clear、/rename 后重新 resume 等会话管理能力,也可以按需组合使用,以当前版本说明为准。
Prompt Caching 能保证省钱吗?
需要满足稳定前缀、缓存 TTL、写入断点等条件。缓存写入本身有成本,未命中的重复写入反而可能更贵;不要把它当成无脑省钱的开关。
检查清单
- 换任务后,旧会话是否已关闭或清理?
- 错误输出是否用编辑、回溯或分支删掉,而不是继续追加“重新来”?
- 挂载的 MCP / 插件是否只保留当前任务需要的?
- 大文件是否先搜索定位,而不是整包丢进对话?
- 结论是否整理成 Markdown,并开新会话继续?
- 输出范围是否明确,避免模型整篇重写?
- 同一任务是否避免了中途换模型或改思考强度?
资源补充
如果你需要,也可以把 llapi.org 作为一个中转入口参考
希望这套方法能帮你在同样额度下做更多事。如果你有自己验证过的省 Token 习惯,欢迎在评论区补充。
更多推荐



所有评论(0)