很多人一提"免费大模型",脑子里就蹦出 ChatGPT 网页版。然后真去用了,问得稍微多一点,屏幕上就弹出来"您已达到使用上限,请 X 小时后再试"。再换国内的,以为都得充会员,其实能免费用的可选项比想象多得多。

本文把所有国内外真正可持续免费用的大模型捋一遍。注意定语——“可持续”。注册送十块钱余额、限时七天体验、邀请好友返佣那种,用完就没了,那叫试用,不叫免费。下面只聊能长期用、有明确免费层或者能自己部署的。


一、先把"免费"这个词说清楚

不定义清楚,后面全是鸡同鸭讲。我把市面上的"免费"分成三类,只有这三类算数:

第一类:网页端永久免费层

打开网页或 App 就能用,厂商给你一个速率限制(比如每分钟几条、每天几条),不过期,不收费。ChatGPT 免费版、Gemini 免费版、Kimi、通义千问、豆包、智谱清言都属于这类。门槛最低,但天花板也最低,量大了就撞墙。

第二类:API 持续免费额度

开发者拿 key 调接口,厂商给你一个免费的 tier,要么每天送固定 token 数,要么限制每分钟请求数(RPM)和每天请求数(RPD),但长期免费不收费。Google Gemini API 免费层、智谱 GLM-4-Flash 永久免费、硅基流动 2000 万 Token 永久、百度千帆 ERNIE-Speed 永久免费等都是这种。这是开发者真正该关注的。

第三类:开源权重模型

模型权重直接放出来,你自己找台带显卡的机器部署,用多少都不花钱,除了电费和显卡折旧。Llama、Qwen、DeepSeek、GLM 的开源版都属于这类。门槛最高,但自由度也最高,数据完全在自己手里。

被排除的"伪免费"

  • 新用户注册送几美元额度(用完即止)
  • 限时免费体验券(几天后失效)
  • 邀请返佣抵扣

这些本质是营销获客成本,不是产品策略,不在本文讨论范围。
在这里插入图片描述

二、国外阵营:开源和免费双线作战

Meta Llama 系列 — 开源权重标杆

Llama 3.x / Llama 4 系列权重公开,社区生态是所有开源模型里最全的。配合 Ollama 一行命令拉下来本地跑,vLLM 起服务,LM Studio 给非技术用户做 GUI。

2026 年新增动态:

  • Cerebras 提供免费推理服务:30 RPM,每天 100 万 Token,支持 Llama 4 Scout、Qwen3 235B 等模型,速度可达 2600+ tokens/s。不需要绑卡,注册即用。
  • Groq 免费层提供 Llama 3.3 70B、Llama 4 Scout、Qwen3 32B 等:70B 模型 30 RPM / 每天 1,000 次请求,8B 模型每天 14,400 次请求,速度约 300+ tokens/s,LPU 芯片硬件加速。

Google Gemini — 长上下文杀手锏

网页端 Gemini 免费层给到 Gemini 2.x Flash 级别的模型,日常用够了。API 免费层是目前最慷慨的之一。

2026 年最新额度(重要更新):

  • Gemini 2.5 Pro:5 RPM / 每天 100 次请求 / 250K TPM(2025年12月配额削减前的额度曾更宽松,现在缩减约 50-80%)
  • Gemini 2.5 Flash:10 RPM / 每天 250 次请求 / 250K TPM
  • Gemini 2.5 Flash-Lite:15 RPM / 每天 1,000 次请求 / 250K TPM
  • Gemini 3 Flash / 3.1 Flash-Lite 预览版也在免费范围内
  • 全系支持 100 万 Token 上下文窗口,同价位免费方案无对手
  • 注意: 2026年3月25日起,Gemini 网页端免费层移除 Pro 模型访问权限,仅限 Flash 模型;Pro 模型需订阅 AI Pro(19.99美元/月)或 AI Ultra

OpenAI ChatGPT — 免费层是流量入口

2026 年最新变化:

  • 免费版默认模型升级为 GPT-4o Mini(无限使用),GPT-4o 限约 80 条/3小时
  • 新增 GPT-5.2 思考模型,但免费层限制极严,高峰时段经常排队或不可用
  • 免费版开始出现广告(Ads-supported),这是 OpenAI 的商业化试探
  • 新增 Go 计划(8美元/月),介于免费和 Plus 之间,去广告并提供更多限制
  • DALL-E 图像生成限制为每天 2-3 次
  • API 没有真正意义上的免费层,新用户试用额度用完即止,必须绑卡付费

xAI Grok — 依附 X 平台

X(原 Twitter)免费用户能用 Grok,有每日消息上限。模型能力不错但生态封闭,更像是给 X 用户加的聊天功能,不是独立开发者会优先选的。

Mistral — 欧洲路线

Le Chat 网页端免费,API 在 La Plateforme 上有免费 tier,Codestral 给开发者免费额度。特点是欧洲公司、合规友好,对数据主权敏感的团队是备选。

Claude(Anthropic)— API 没有永久免费层

  • 网页端 Free 计划可用,有每日消息限制,默认模型为 Claude Sonnet 5
  • API 没有永久免费层,新用户注册送约 5 美元试用额度(有效期约 30 天),用完即止
  • 另有 Startup Program(最高 25,000 美元)、Claude for Open Source(约 1,200 美元 6 个月免费 Max 订阅)等特殊渠道
  • 付费层:Pro 20 美元/月,Max 100-200 美元/月

其他值得关注

  • Cohere Trial Key — 偏企业 RAG 场景,免费层有限
  • Cloudflare Workers AI — 免费层每日 10,000 次请求(月 30 万次),模型清单最全
  • OpenRouter — 聚合 50+ 模型,免费层每日约 50 个请求(所有免费模型总计),付费用户 1,000 次/天
  • GitHub Models — GPT-4.1、GPT-4o、Llama 3.3-70B 等模型可在网页端免费试用

三、国内阵营:网页免费 + API 极低价 + 开源激进

DeepSeek — 2025-2026 最大变量

2026 年最新进展:

  • 网页端完全免费使用,不限消息数
  • API 价格在 2026 年 5 月正式降价为原定价的 1/4:V4-Flash 输入 0.02 元/百万 token(缓存命中),输出 2 元/百万 token
  • V4-Pro 输入 1.74 元/百万 token(缓存命中 0.174 元),输出 6.96 元/百万 token
  • 2026 年 7 月中旬计划上线 DeepSeek V4 正式版,首次引入峰谷定价机制(高峰时段价格为平时两倍)
  • V3、R1 等权重已开源,自部署路线可行
  • 2026 年 7 月 24 日 legacy 模型(deepseek-chat / deepseek-reasoner)将退役,迁移到 v4-flash

阿里通义千问 Qwen — 全尺寸开源 + 超大免费额度

2026 年最新变化:

  • 网页端通义免费使用
  • 阿里云百炼平台:新用户注册即送 7000 万 Token 免费额度(之前为 5000-1000 万量级),覆盖 70+ 模型(Qwen3 全系列、DeepSeek 全系等)
  • 每个模型都有独立的免费额度(约 100 万 Token/模型,有效期 90 天)
  • Qwen-Turbo 部分模型 永久免费
  • Qwen3 系列把 Agent 能力、工具调用做得非常扎实,国内做 Agent 开发的首选
  • Qwen Code(编程智能体)每日 2000 次免费运行请求(中国大陆用户)

Kimi(月之暗面)— 超长上下文王牌

2026 年最新变化:

  • 网页端免费,上下文窗口扩展至 256K(之前报道为 200 万字,实际 API 层面约 256K)
  • API 新�免费���度为 15 元代金券(永久有效)
  • 支持 Kimi K2 / K2.5 等模型
  • 并发数上限 3 次,不适合高响应速度要求的场景
  • 处理超长文档、不赶时间的任务非常合适

智谱 GLM — 开源老牌 + 永久免费

2026 年最新变化:

  • 网页端智谱清言免费使用
  • GLM-4-Flash:完全免费且无 Token 数量限制(128K 上下文,30 并发)
  • 新用户赠送 2000 万 Token 永久有效
  • GLM-4.7-Flash 完全免费(200K 上下文,编程能力优秀)
  • GLM-5.1 旗舰模型付费
  • bigmodel 平台给 API 免费 tier
  • 2026 年 2 月 Coding Plan 涨价 30%,取消首购优惠

字节豆包 — 多模态强 + 每日刷新额度

2026 年最新变化:

  • 网页端豆包免费使用
  • 火山引擎平台:完成实名送 50 万 Token,协作奖励计划 每天赠送 200-500 万 Token(按天重置,用不完不累积)
  • 延迟低至 20ms,中文对话质量出色
  • 支持文本、图像、视频等多模态能力
  • 新用户额外送 1000 元代金券

百度文心一言 — 合规首选

  • 网页端基础版免费(涵盖 ERNIE 4.0/4.5 Turbo)
  • ERNIE-3.5-8K 永久免费,不限量,QPS=50
  • ERNIE-Speed 永久免费
  • 千帆平台新用户每个模型 100 万 Token
  • 付费会员标准价 49.9 元/月

讯飞星火 — 教育场景强

  • 网页端基础免费
  • Spark Lite 永久免费,Token 总量不限,QPS=2
  • 中文理解能力强,在教育、办公自动化场景表现突出

腾讯混元 — 生态绑定

  • 网页端免费
  • HY 2.0 系列暂停免费额度,但 混元-Lite 仍永久免费
  • 通用资源包 100 万 Token(有效期 1 年)
  • Embedding 额外 100 万 Token
  • 与微信、腾讯会议、企业微信深度绑定

硅基流动(SiliconFlow)— 聚合平台

  • 新用户赠送 2000 万 Token 永久有效
  • 聚合 100+ 开源模型,省去自己部署的麻烦
  • 9B 参数以下模型 永久免费
  • 国内服务器,延迟低(通常 <100ms)
  • 支持微信/支付宝充值

四、2026 年新增重要平台

Groq(速度之王)

  • 模型:Llama 3.3 70B、Llama 4 Scout、Qwen3 32B、Kimi K2 等
  • 免费额度:30 RPM,70B 模型每天 1,000 次请求,8B 模型每天 14,400 次请求
  • 速度:70B 模型可达 300+ tokens/s,LPU 芯片硬件加速
  • 无需信用卡,完全兼容 OpenAI SDK

Cerebras(额度之王)

  • 模型:Llama 4 Scout、Llama 3.3 70B、Qwen3 32B/235B
  • 免费额度:30 RPM,60K TPM,每天 100 万 Token(免费层最慷慨)
  • 速度:2000+ tokens/s,晶圆级芯片推理
  • 无需绑卡,单次上下文最短 8,192 tokens

五、按场景选型:别看参数看场景在这里插入图片描述

日常聊天问答

推荐:Gemini、ChatGPT、通义千问、Kimi 网页端

  • 哪个顺眼用哪个,差别不大
  • 我主力用 Gemini,长上下文偶尔能救急

长文档、论文、合同

推荐:Kimi(256K)或 Gemini(100 万 Token)

  • Kimi 和 Gemini 的超长上下文是第一梯队
  • 一次性扔一整本书进去问,就这俩能扛

写代码

推荐:DeepSeek-Coder、Qwen-Coder、Codestral、GPT-4o Mini

  • 开源三选一:DeepSeek-Coder、Qwen-Coder、Codestral
  • 免费层里 GPT-4o Mini 和 Gemini 代码能力也够日常
  • 重度写代码建议自部署一个 Coder 模型,不限量

跑 Agent、做工具调用

推荐:Qwen3、DeepSeek、GLM-4 开源版

  • 配合 LangChain 或自研框架
  • Agent 对工具调用稳定性要求高,开源版能自己调 prompt 和参数,比闭源免费层可控
  • Groq / Cerebras 的低延迟天然适合多步 Agent 调用

多模态(看图、语音)

推荐:Gemini、GPT-4o、豆包、通义 VL

  • 识别准确度上 Gemini 和 GPT-4o 略领先
  • 国内豆包和通义 VL 追得很快

极致低延迟 / 实时推理

推荐:Groq、Cerebras

  • LPU 和晶圆级芯片硬件加速,亚秒级响应
  • Groq 70B 模型 300+ tokens/s,Cerebras 2600+ tokens/s

国内合规 / 企业场景

推荐:百度千帆、阿里云百炼、智谱 AI

  • 数据在国内,合规稳定
  • 百度千帆 ERNIE 系列支持 OpenAI SDK 迁移

六、五大坑:踩之前先知道

在这里插入图片描述

第一:免费层随时会变

厂商调整免费层是常态。OpenAI 砍过免费用户的消息数,Google 在 2025 年 12 月大幅削减 Gemini 免费 tier(RPM 和 RPD 都降了 50-80%),智谱 Coding Plan 在 2026 年 2 月涨了 30%。今天能用的免费配置,下个月可能就变了。生产环境别把"免费"当稳定依赖。

第二:免费层数据可能被拿去训练

多数免费层的服务条款里写了,你的对话可能用于模型改进。特别是 Gemini 免费层明确标注"Used to improve our products: Yes"。喂敏感数据、商业代码、客户隐私进去之前,先把隐私条款翻一遍。要安全就上 API 付费层(通常有数据不用于训练的承诺),或者干脆自部署。

第三:API 免费层的 RPM 墙比想象中矮

免费 tier 经常是每分钟几个请求、每天几十个/几百个请求双限制。本地测试没事,一上并发或者批量任务就排队。做产品前先算清楚你的峰值 QPS 够不够免费额度,不够就早点规划付费或多 key 轮换。

第四:开源自部署不一定真省钱

显卡贵、电费贵、运维要人。一个 70B 模型跑起来,电费和折旧算下来可能比直接买 API 还贵。尤其是 DeepSeek 降价后,API 价格已经低到厘级别,自部署的经济优势大幅缩小。 除非你的用量大到 API 账单已经很难看,或者对数据隐私有硬要求。小团队自部署前先算账。

第五(新增):永久免费不等于永久可用

像 GLM-4-Flash"永久免费无限制"、ERNIE-3.5-8K 永久免费这类,听起来很美,但厂商随时可以调整策略。2026 年智谱 Coding Plan 涨价 30%、Gemini 配额砍半 50-80% 都是前车之鉴。建议至少保持一个备用方案。


七、2026 年国内免费 API 平台速查表

在这里插入图片描述

平台 免费额度 有效期 备注
阿里云百炼 7000 万 Token + 每个模型 100 万 永久/90天 覆盖 70+ 模型
智谱 AI 2000 万 Token + GLM-4-Flash 永久免费 永久 30 并发
硅基流动 2000 万 Token + 9B以下永久免费 永久 100+ 模型聚合
百度千帆 ERNIE-3.5-8K 永久免费(QPS=50)+ 100 万 Token/模型 永久 合规首选
火山引擎(豆包) 每天 200-500 万 Token 按天重置 实名后送 50 万
Kimi 开放平台 15 元代金券 永久 并发上限 3
腾讯混元 混元-Lite 永久免费 + 100 万 Token/年 永久 HY2.0 暂停免费
讯飞星火 Spark Lite 永久免费(不限 Token) 永久 QPS=2

八、2026 年国外免费 API 平台速查表

平台 免费额度 备注
Google Gemini 100-1000 RPD / 5-15 RPM 100 万 Token 上下文
Groq 1K-14.4K RPD / 30 RPM 速度最快,LPU 加速
Cerebras 1M Token/天 / 30 RPM 额度最慷慨
Cloudflare Workers AI 10K 请求/天 模型最全
Mistral 2 RPM / 500K TPM/月 欧洲合规
OpenRouter 50 请求/天(免费模型) 聚合 50+ 模型
Cohere Trial Key 企业 RAG 场景

九、一句话结论

  • 日常用: Gemini 或 Kimi 网页端够了
  • 写代码跑 Agent: Qwen3 或 DeepSeek 自部署最稳
  • 长文档: 扔给 Kimi 或 Gemini
  • 极致速度: Groq / Cerebras
  • 要数据不出门: Llama 或 Qwen 开源自部署
  • 开发者零成本起步: 阿里云百炼 + 智谱 + 硅基流动,合计 数亿 Token,足够个人开发者用 1-2 年

免费大模型不是没有,是得按场景挑,别指望一个模型打天下。


本文最后更新于 2026 年 7 月 12 日。免费政策随时可能变动,使用前请以各平台官方页面为准。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐