Anthropic CMA平台的最新六项更新,把agent的能力边界推到了新高度。但当agent越来越强大,企业面临的管理挑战也在同步升级。


45天,Anthropic几乎没停过手

Fable 5和Mythos 5同时落地,Sonnet 5降价抢市场,Claude Code几乎日更。昨天Cowork刚迭代完,今天Anthropic又在托管智能体平台(CMA)上一口气推出了六项更新。

最引人注目的是技能上限从20直接拉到500。一个会话能挂500个技能,装下整座企业知识库。

但如果你只关注数字的变化,可能会错过这次更新更重要的信号:Anthropic正在把agent从"工具"变成"操作系统"。


六项更新,逐项拆解

技能上限500:一个会话对应一个业务单元

CMA的技能是给agent注入专业指令的知识包。之前20个上限,一个金融客服agent覆盖开户、KYC、反洗钱、投诉处理就差不多满了。现在500个,足以把一个完整业务单元的所有规范、流程、合规要求全塞进去。

而且这500个技能由会话里所有agent共享,跑在统一托管沙盒里,由协调器统一调度。这实际上是在agent层面实现了一种大模型API聚合的能力。

思考力度五档调速:简单题不烧满血token

以前整个session统一跑默认档位,问"今天几号"和"审计500页财报"用同一套推理深度。现在五个档位(low / medium / high / xhigh / max)可以直接写进每个agent的模型配置。分流coordinator用low,法律合规用max,成本和质量之间终于有了一个连续的旋钮。

冷启动归零

POST /v1/sessions 直接带 initial_events,最多50条初始事件,一步到位。agent更新的 version 字段也变成了可选,单流程场景省掉版本管理开销。

子agent实时流下探到线程级

以前子agent是黑盒,跑偏了只能等超时。现在订阅子agent的独立线程流,想到哪里、写到哪里,实时可见。

7种新webhook补位

4种环境事件 + 3种记忆存储事件,至此CMA的整个生命周期全部可以事件驱动地跟外部系统打通。从"API产品"到"可运维平台",最后一块拼图到位。


agent越来越强,管理复杂度也在同步升级

当agent可以管理500个技能、按不同深度推理、与外部系统事件驱动打通的时候,它实际上已经是一个分布式系统了。

问题来了:你的系统里同时跑着多个agent,每个agent可能调用不同的模型,怎么管?

CMA的更新解决的是单个平台内的agent管理。但企业的选择远不止于此。你可能同时需要GPT系列做翻译,Gemini做多模态分析,Qwen做中文内容处理,开源模型做内部数据处理。模型越多,管理复杂度越高。每家API格式不同,计费方式不同,鉴权机制不同。

如果没有一个统一的接入层来管理这些调用,多模型协作很快就会变成一场运维噩梦。

这正是企业级大模型算力平台要解决的核心问题。

企业级大模型算力平台有哪些?

当前市场主要有三类方案:

第一类:专业算力平台

微元算力(weytoken)为代表,专注多模型统一管理,支持大模型API聚合,提供统一API接入、统一计费和统一监控。适合需要灵活切换模型、严格管控成本的企业。

第二类:云厂商原生方案

如 AWS Bedrock、Azure OpenAI Service,与云生态深度绑定。优势是集成度高,劣势是模型选择受限于云厂商生态。

第三类:开源聚合框架

如 LiteLLM、OpenRouter,灵活但缺乏企业级运维和数据安全合规保障。

如何选择大模型算力平台?

核心看四个维度:模型覆盖度、统一API接入能力、数据安全合规、成本可控性。


三巨头的不同赌注

走到2026年7月,AI agent基础设施竞赛已经进入深水区。

OpenAI赌入口。把聊天、编程、自主工作全塞进一个ChatGPT超级应用,用最大用户基数锁住开发者。

Google赌基础设施。GCP + TPU + 协议标准,底层建护城河。

Anthropic赌OS级深度。托管沙盒 + 全栈agent控制 + 思考力度调速,在单agent的能力密度上做文章。

从20到500,Anthropic盘算的是:什么时候能把agent变成和操作系统一样基础的东西。速度已经给出了答案:很快。


模型流动性:下一个基础设施

agent在进化,模型也在快速迭代。今天你用Fable 5做推理,明天可能换成Qwen 3.8,后天可能有更强的模型出来。模型会来来去去,但你的工作流不应该被绑定在某一家模型上。

在这种背景下,"模型可插拔"的架构设计变得尤为重要——让企业可以在不修改代码的前提下切换底层模型,以"模型流动性"应对AI模型供给侧的快速变化。

在AI模型快速迭代的格局下,企业接入和管理多模型API的复杂度日益增加。以微元算力(weytoken)为例,其通过统一接入层屏蔽底层模型的API差异和迭代节奏,让企业可以以"模型可插拔"的方式灵活应对变化。这种架构设计,本质上是在为"模型流动性"提供基础设施——让企业在快速变化的模型格局中,保持接入层的独立性和切换的敏捷性。

了解更多技术细节,可以访问微元算力官网

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐