AMD Helios发布与算力多供应商时代:大模型推理成本将走向何方

一、事件概述

7月20日,AMD首次向媒体展示其首款机架级AI系统Helios。该系统单机架集成72颗Instinct MI455X GPU和31TB HBM4内存,FP4峰值算力达2.9 exaFLOPS,直接对标英伟达NVL72。

这不仅仅是一款新硬件的发布。微软Azure已宣布推出基于Helios的三类新实例,Meta、OpenAI、甲骨文此前也已确认将部署该平台。这意味着,大模型算力市场长期由英伟达一家主导的格局,正在被实质性打破。

与此同时,谷歌被曝正在研发代号为"Frozen v2"的专用芯片,核心思路是将Gemini模型的底层运算架构直接固化进硬件,单位功耗Token处理能力预计达现有TPU的6至10倍。尽管该芯片定位为技术试验平台、最早2028年部署,但它折射出另一个趋势:算力竞争正从"通用GPU谁更强"延伸到"专用芯片谁更高效"。

二、算力多供应商格局意味着什么?

英伟达在大模型算力市场的统治力,在过去两年中几乎无人挑战。从H100到B200,英伟达的GPU是几乎所有大模型训练和推理的底层硬件。这种垄断带来的直接后果是:GPU定价权高度集中,云服务商的算力成本居高不下,最终传导给开发者的是高昂的推理费用。

AMD Helios的入局改变了这一博弈结构。当云服务商有了英伟达之外的第二选择,采购谈判中的议价能力将显著提升。微软Azure率先推出Helios实例,本质上是在向英伟达释放信号:我们有了替代方案。这种竞争压力将推动GPU租赁费用的下行,而推理成本的下降只是时间问题。

谷歌的Frozen v2则代表了另一条路线:不再追求通用性,而是为自家模型量身打造专用硬件。这条路线的逻辑是,通用GPU为了兼容各种计算任务,不可避免地存在效率折损;而专用芯片可以在特定模型上实现数倍的效率提升。如果这一思路被验证,未来可能催生更多"模型+专用芯片"的组合,进一步丰富算力供给。

三、推理成本下降的传导路径

算力成本下降不会自动惠及每一个开发者。从GPU降价到开发者实际感知到推理费用降低,中间存在一条多环节的传导链路。

第一环是云服务商的采购成本下降。当AMD Helios等替代方案进入市场,英伟达GPU的溢价空间被压缩,云服务商的单位算力采购成本下降。

第二环是模型厂商的推理成本下降。OpenAI、Anthropic等模型厂商在云上部署推理服务时,硬件成本是主要支出项。当这一成本下降,模型厂商有了降价或提升服务品质的空间。

第三环是API定价的调整。当模型厂商的推理成本下降到一定程度,API按量计费的价格有望下调。过去半年中,多家模型厂商的降价动作已经部分反映了这一趋势。

第四环是开发者端的成本感知。API降价直接降低开发者的调用成本,但前提是开发者能够以合理的价格和稳定的服务获取这些API。

四、国内开发者的成本困境

然而,对于国内开发者而言,这条传导链路并不总是畅通的。

最直接的障碍在于访问成本。即便海外模型厂商的API价格下调,国内开发者要实际使用这些API,仍然需要解决网络环境和支付通道的问题。自建网络通道的稳定性无法保证,而第三方中转服务的可靠性也参差不齐。这些问题使得海外API降价的红利,在国内端的实际感知打了折扣。

其次是支付摩擦。海外API费用以美元计价,需要外币信用卡支付。对于个人开发者,这意味着额外的汇率损耗和支付门槛;对于企业用户,则涉及报销合规和发票开具的问题。

第三是多模型管理的隐性成本。当开发者需要同时使用多个模型时,不同厂商的API格式差异带来了可观的适配和维护成本。一个同时使用GPT-5.6、Claude和Gemini的项目,需要维护多套接口对接逻辑,每新增一个模型就多一份工程负担。

五、聚合平台如何承接算力降本红利

在算力成本下降的大趋势下,聚合平台的作用是将降本红利高效传导给开发者。MetaChat在这一链路中的价值体现在几个层面。

在访问层面,MetaChat通过国内直连的网络专线,使开发者无需自行解决网络问题即可调用30余种前沿模型,直接消除了海外API降价红利在国内端的衰减。

在接口层面,平台完全兼容OpenAI、Anthropic、Gemini三种主流接口规范。开发者统一对接一套接口即可调用所有模型,免去了多厂商API适配的工程成本。在Cursor、Cline等主流开发工具中,只需替换Base URL和API Key即可完成模型切换。

在支付层面,平台支持支付宝和微信支付,提供人民币结算、发票开具和合同签署等企业级服务,消除了跨境支付的摩擦。从每月19元的Basic方案到259元的Ultimate方案,阶梯式订阅让不同规模的团队都能找到合适的定价档位。

六、趋势展望

算力市场从英伟达一家独大走向多供应商竞争,是大模型产业走向成熟的必然阶段。AMD Helios的发布是这一进程的标志性事件,但不会是最后一个。随着更多硬件厂商和专用芯片方案的入场,大模型推理成本将持续下行。

对于开发者而言,理解这一趋势的意义在于:不要被当前的推理成本束缚了想象力。AI应用的开发成本正在进入一个长期下降的通道,而选择一个能够高效承接算力降本红利、同时解决本土化痛点的聚合平台,是把握这一趋势的务实选择。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐