【提问】烧 Token 之路还能走多久?
AI正在从“免费试用”进入“成本显形”时代
2026年春天,AI用户越来越清楚地感受到一个变化:曾经“白菜价”、甚至近乎免费的AI,开始变得越来越精算。这个变化不是某一家厂商突然想涨价,而是整个行业都在重新给“智能”算账。
从3 月到 5 月,几个信号连续出现。阿里云百炼 Coding Plan Lite 在 3 月 20 日停止新购,并在 4 月 13 日停止续费与升级;智谱GLM Coding Plan 老套餐在 4 月 30 日关闭自动续订;GitHub 在 4 月 27 日宣布 Copilot 将于 6 月 1 日转向 usage-based billing,用 GitHub AI Credits 按输入、输出和缓存 token 计算消耗;Kimi 也把Agent、Office 文件处理、深度研究、Kimi Code 等能力纳入统一额度池,按实际 token 消耗扣减。与此同时,运营商开始推出Token套餐,广东移动、上海电信、湖北联通等把 AI 算力做成类似流量包的产品。
这些事件看似分散,一个在AI编程,一个在会员订阅,一个在运营商套餐,但背后的逻辑是一致的:AI正在从“随便用”的补贴时代,进入“每一次推理都要算账”的精细化时代。过去我们把AI当聊天机器人,现在我们开始把它当数字劳动力;聊天可以便宜,劳动力却不能无限免费。
一、先看现象:不是单点涨价,而是成本边界集体收紧
AI涨价最容易被理解成“厂商开始收割”,但2026年3—5月的变化更像一次行业级的成本边界重画。阿里云百炼Coding Plan Lite的停售与停续费,代表低价固定月费编程套餐开始退出;智谱GLM Coding Plan老套餐关闭自动续订,代表“无周限额”这类高弹性权益正在被新套餐体系替代;GitHub Copilot转向GitHub AI Credits,则把海外主流AI编程工具的定价逻辑从“请求次数”进一步拉回到真实token消耗。
国内AI 应用的会员化也在同一条线上。Kimi 的会员页显示,不同套餐对应不同Agent额度、并行能力和 Kimi Code 调用能力,所有功能共享统一额度池,任务越复杂、上下文越长,消耗越多。豆包在 5 月初被媒体报道出现 68 元、200元、500 元三档付费版本测试信息,官方回应也强调基础服务仍会免费,同时探索面向复杂任务和生产力场景的增值服务。
如果把这些现象放在一起看,结论就很清楚:AI 行业不是简单从“免费”走向“收费”,而是从“用补贴模糊成本”走向“用分层和额度显化成本”。真正变贵的并不是普通闲聊,而是那些需要长上下文、多轮推理、工具调用、文件处理、代码执行和结果校验的复杂任务。
二、账单为什么会失控:从聊天到 Agent,消耗模型变了
要理解“烧Token”为什么烧不动,首先要弄明白 AI 到底在烧什么。Token是大模型处理文本、代码、图片描述和上下文信息的基本计量单位,用户输入、模型输出、系统提示词、历史对话、工具描述、函数调用参数、检索内容和文件解析结果,都可能进入模型上下文,成为消耗的一部分。
早期聊天机器人时代,Token消耗相对直观。用户问一句,模型答一句,输入和输出大致线性增长,厂商也比较容易估算成本。这个阶段的 AI 像一个文字接口,成本结构比较单薄。可一旦 AI 进化成Agent,情况就完全不同了。用户让它修一个 Bug,它可能要读项目结构、理解代码上下文、生成方案、修改文件、运行测试、分析报错,再改一轮;用户让它做一份 PPT,它可能要先梳理资料、设计结构、生成内容、补充图表、调整排版;用户让它做深度研究,它可能要多轮检索、多文档阅读、交叉验证和总结归纳。
用户看到的仍然是一条指令,后台发生的却是一整套工作流。一个普通问答可能只消耗几千token,而一个典型Agent任务可能放大到几十倍甚至上百倍。更重要的是,这种消耗不是稳定线性的,而是会随着任务复杂度、上下文长度、工具调用次数和失败重试轮次不断叠加。账单惊吓并不是因为AI回答太长,而是因为用户看不见后台的多步骤执行。

三、AI 编程工具为什么最先扛不住
“烧Token”走不通,最早集中爆发在AI编程工具上,并不偶然。编程Agent是典型的高消耗场景,它需要读代码、理解项目结构、处理长上下文、生成补丁、运行测试、分析报错和多轮修复。一个Bug修复任务看似只有一句话,实际可能是一条自动化工程链路。
传统包月制默认用户的使用强度受人类时间限制。你订阅一个办公软件,一个月再怎么用,也不可能 24 小时不停操作;你订阅一个视频会员,也不可能一天看 80 小时。人的时间、注意力和精力,本身就是天然限流器。Agent则打破了这个前提。它可以连续运行,可以并发执行,可以自动重试,也可以在无人值守的情况下持续消耗算力。
这就是为什么固定月费最先在编程场景撞上天花板。GitHub在公告中直言,Copilot已经从编辑器里的助手演变为可以运行长时间、多步骤编码会话的agentic platform,而一次快速聊天和一次多小时自主编码会话过去可能花费相同,这让原来的premium request模式难以持续。阿里云、智谱等国内Coding Plan的调整,本质上也在修正同一个问题:包月制按人类使用频率定价,却被机器级执行速度消耗。

四、运营商入场:Token 正在被“流量化”,但它不是流量
运营商开始卖Token,是另一个关键行业信号。过去运营商卖语音,后来卖流量,现在开始卖 AI 算力和 Token 套餐。北京移动面向个人用户推出 24.99 元、含 1000 万Tokens 的月包;湖北联通把 AI 算力套餐分成Token Plan、Coding Plan 和融合套餐;中国电信则发布一站式 Token 服务平台,把 Token 的生产、调度、分发和价值变现纳入智能云体系。
这个动作说明,Token已经不只是开发者API文档里的技术单位,而是正在被包装成普通用户也能理解、能购买、能按月结算的数字资源。从商业路径上看,它很像当年的手机流量包:先把抽象资源标准化、套餐化,再通过渠道和账单能力推向大众市场。
但Token又不是简单的流量。流量是传输资源,1GB流量大体就是1GB流量,差异主要在网速、覆盖和稳定性;Token是智能计算资源,不同模型、不同任务、不同上下文和不同工具调用方式,会让同样数量的Token产生完全不同的成本和价值。1000万个普通问答Token,和1000万个代码Agent Token,不是一回事。运营商入场说明Token正在被“流量化”,但这更像过渡阶段,而不是AI定价的终局。
五、Token 计费的真正问题:它能计量资源,却很难对齐价值
Token计费在大模型发展的初期非常重要。它让开发者可以按量接入模型,也让模型厂商能把输入、输出和模型调用成本对应起来。问题在于,当AI从聊天工具变成生产力系统,尤其是进入Agent时代之后,Token计费的几个结构性矛盾开始集中暴露。

第一重矛盾,是价值和成本错位。用户买AI,本质上想买的是解决问题的结果,而不是底层计算原材料。企业真正关心的是代码有没有跑通、合同风险有没有识别、客服问题有没有解决、PPT 能不能拿去汇报、销售线索有没有转化。Token只是模型内部的消耗单位,用户并不关心AI “想了多少”,只关心它“做成了什么”。如果模型为了一个简单结论反复试错、绕了很多弯路,最后这些成本都进入账单,用户就会觉得自己在为低效买单。
第二重矛盾,是隐藏成本太多。用户以为自己只问了一句话,但后台可能同时消耗系统提示词、角色设定、历史上下文、文件内容、工具描述、JSON schema、函数调用参数、检索结果和多轮重试。尤其在工具调用场景里,为了让模型知道有哪些工具可用、参数如何填写、结果如何回传,系统需要把大量“脚手架”塞进上下文。这些内容对用户不可见,却可能全部反映在消耗里。
第三重矛盾,是深度用户反而最容易被账单劝退。传统商业里,大客户和高频用户通常应该享受更低的边际成本;但Token经济里,越是把AI真正用进工作流的人,越容易遇到成本爆发。代码、数据分析、长文档处理、自动化办公、投研、法务和客服工单,往往都是上下文长、步骤多、重试成本高的任务。技术越进步,单个Token越便宜,用户越敢让AI干更多活,最后总体消耗反而可能上升,这正是AI版的杰文斯悖论。
第四重矛盾,是企业预算不可预测。传统SaaS的成本通常按席位、模块和年费管理,财务可以提前做预算;AI更像云计算账单,大多数请求成本很低,少数复杂任务成本极高。为了避免账单爆雷,企业可能限制输出长度、禁用高阶模型、缩短上下文、减少工具调用,甚至不开放深度研究和代码能力。成本是压住了,但AI本该带来的业务价值也被削弱了。
六、“烧 Token”还能走多久:后台会继续,前台会迁移
回答这个问题,需要分两层看。第一层,作为后台成本单位,Token会长期存在。模型厂商、云厂商、运营商和开发者平台,都需要 Token 来核算推理成本。它就像云计算里的 CPU、GPU、存储和带宽,是基础设施层不可缺少的计量语言。GitHub Copilot 转向 AI Credits,本质上也是把不同模型的输入、输出和缓存 token 统一折算成更方便管理的信用单位;运营商卖 Token 套餐,也是把底层算力消耗前台化、套餐化。
第二层,作为直接面向用户的主要计费方式,Token很难成为终局。当 AI 只是聊天工具时,Token 计费尚可接受,因为任务简单、消耗可控、用户也容易理解;但当 AI 进入代码、办公、客服、销售、投研、法务、财税和工业流程之后,用户不会愿意为模型绕了多少弯路买单,企业也不会愿意为模型试错了多少次买单。他们只会问:问题解决了吗,效率提升了吗,成本下降了吗,收入增加了吗?

所以,“烧Token”的答案不是简单的继续或停止。基础设施层仍会烧Token,因为那是成本核算的底层语言;应用层和用户侧则会逐步把Token藏到后台,把价格表达迁移到动作、任务和结果上。
七、未来 AI 怎么收费:结果、动作和混合模式会并存
最理想的形态,是按结果或成效付费。客服领域可以按一次问题解决收费,销售领域可以按有效线索收费,招聘领域可以按合格候选人筛选收费,财税领域可以按完成票据审核收费,营销领域甚至可以按转化增量分成。这样一来,用户不需要关心Token消耗,只看ROI;厂商也会被倒逼去优化模型能力、工具链、知识库和任务完成率。困难在于,“结果”必须被清晰定义、验证和追踪。客服问题是否解决相对容易判断,一份战略报告是否足够好、一段代码是否足够优雅、一份合同审查是否足够充分,就很难简单量化。
更现实的过渡形态,是按动作或行为付费。很多企业流程未必能立即定义最终结果,但可以定义AI完成了哪些动作,比如发一封邮件、更新一条客户记录、创建一个销售机会、生成一份报告、完成一次代码审查、处理一个工单。按动作计费比Token更粗颗粒度,却比传统订阅制更接近用户理解。用户未必知道100万Token是多是少,但知道“完成一次合同审查”“处理一个客服工单”“生成一份可用报告”值不值。
短期内最可能普及的,仍然是混合模式:固定订阅提供基础体验,弹性用量控制真实消耗,任务包或动作包承接高价值场景。豆包、Kimi这类产品通过会员分层,把高成本功能放入更高档套餐;运营商通过Token套餐,让AI算力进入大众市场;GitHub通过AI Credits,把编程Agent的真实消耗映射到更细的用量体系。这不是最完美的模式,但很现实,因为它同时照顾了用户预算确定性和厂商成本边界。

结语
“烧Token”的粗放时代正在落幕。这并不意味着AI会简单变贵,也不意味着Token计费会消失。真正发生的变化是,AI行业正在从“跑马圈地”的流量战,转向“硬核拼服务”的价值战。
豆包、Kimi 等产品的会员分层,说明 AI 厂商正在把高成本能力从免费体验中拆出来重新定价;运营商入场,说明 Token 正在像流量一样被套餐化、普惠化、规模化;Coding Plan 和 AI 编程工具收紧,说明 Agent 已经改变成本曲线,固定月费很难覆盖无限任务执行带来的算力消耗。
所以,“烧 Token”这条路不是突然走不通了,而是它完成了市场教育的任务。接下来,Token会继续作为后台成本单位存在,但前台计费会逐渐向混合订阅、动作计费和结果计费迁移。虽然“按结果付费”是更理想的终局,但受限于当前分散的数字化基础设施、复杂的结果判定标准,以及不同行业工作流的差异,短期内最可能大行其道的,仍然是“固定订阅 + 弹性用量 + 任务/动作计费”的混合模式。
对普通用户和企业来说,这其实是好事。因为当计费模式从单纯“按量”转向“按动作”或“按结果”时,我们就不再只是为AI的无效试错买单,而是更接近为它真正交付的智力价值付费。这场计费模式的变化,或许正是AI真正融入生产生活、走完商业化最后一公里的关键一步。
更多推荐




所有评论(0)