除了大厂,还有这么多小众大模型?丰富程度超过想象
打开任何一家 AI 媒体的首页,你看到的都是 GPT、Claude、Grok、Gemini 的新闻,当然还有 DeepSeek Kimi 和 Qwen 。这些名字占据了绝大多数的讨论,剩下的份额里,还有一批模型在做着没人围观的事。
这篇文章想聊的就是那些并没有真正“大火、特火”的模型。腾讯混元的 Hy3、智谱的 GLM、新加坡 Sapiens 的 Agnes、德国黑森林实验室的 FLUX、英伟达的 Nemotron——它们没有常年霸榜热搜,但了解这些模型,能够让我们显得更加小众和特别(?)。
Content
文章排除了 GPT、Claude、Grok、Gemini、Kimi、DeepSeek 这些公认的主流模型,而是写一些大部分人叫不上名字的选手。
分类按两级:
- 第一级:按地域——国内 / 国外
- 第二级:按用途——文本与代码、多模态、生图生视频、生音频、3D 建模
每个模型尽量给出发布时间、参数规模、开源情况、价格和代表性成绩,方便横向比较。数据以 2026 年 8 月初为准,来源见文末。
国内
国内的"角落"其实并不小。过去一年,一批模型选择了一条和 GPT/Claude 完全不同的路:开源、低价、或者专攻某一类生成任务。它们没有铺天盖地的广告,但在开发者社区和具体行业里,已经长成了绕不开的名字。
一、文本与代码:三家开源,三种取舍
GLM-5.2:把"能商用"做到了极致
智谱 AI 的 GLM-5.2 在 2026 年 6 月 13 日发布,6 月 16 日开源。它最出圈的一次亮相不是发布会,而是一场安全事故:7 月中旬,一个 OpenAI 的测试模型入侵了 Hugging Face 后台,安全团队需要分析 1.7 万条攻击日志,却因为商业模型自带的安全护栏无法提交恶意载荷。最后是 Hugging Face 自己部署 GLM-5.2(MIT 协议、1M 上下文、无护栏),几小时就啃完了日志。
这事传开后,GLM-5.2 的规格被翻了个底朝天:
| 项目 | 数字 |
|---|---|
| 总参数 | 7530 亿(MoE) |
| 激活参数 | 约 400 亿 |
| 上下文 | 100 万 token |
| 开源协议 | MIT |
| 输入/输出价格 | 4.40 每百万 token |
| 发布时间 | 2026-06-13(6-16 开源) |
它的技术底子有几个拿得出手的东西:自研的 IndexShare 让相邻 4 层共用注意力索引,把 100 万上下文下的单 token 计算量降了约 2.9 倍——这是它敢把 1M 上下文做成标配的底气;MTP(多 token 预测)把推理时每步接受长度最高提升 20%。
成绩单方面:AIME 2026 数学竞赛 99.2%,是所有主流模型里最高的;SWE-bench Pro(真实 GitHub 仓库修 bug)62.1%,超过 GPT-5.5 的 58.6%;FrontierSWE(数小时长任务)74.4%,和 Claude Opus 4.8 的 75.1% 只差不到一个点。AA(Artificial Analysis)智能指数 51 分,是 MIT 协议下分数最高的开源模型。
价格上,输出 每百万,只有(30)的七分之一左右。有个细节值得一提:GLM-5.2 是纯文本模型,不支持图片输入——智谱把宝全押在了文本和代码上,这个取舍在后面的多模态章节会对照着看。
Hy3:腾讯的"小钢炮"式效率实验
腾讯混元的 Hy3 在 2026 年 7 月 6 日发布,和 GLM-5.2 走了完全不同的路线。GLM 追求"大而全",Hy3 追求"小而快":
| 项目 | 数字 |
|---|---|
| 总参数 | 2950 亿(MoE) |
| 激活参数 | 210 亿 |
| 专家数 | 192 路由专家 + 1 共享,每次激活 8 个 |
| 上下文 | 256K token |
| 开源协议 | Apache 2.0 |
| 输入/输出价格 | ¥1 / ¥4 每百万 token |
Hy3 的技术亮点在于效率设计:用 Sigmoid 路由器取代传统 MoE 的 Softmax,专家各自独立打分、不再零和竞争,配合可学习的专家偏置校正,不需要辅助损失函数就能维持负载均衡;80 层深网配 QK-Norm 稳住训练;MTP 层用 3.8B 小模型边写边预测,腾讯报告在自家产品里端到端延迟降了 47%。
成绩上它最突出的是检索和 Agent 任务:BrowseComp(网页搜索类任务)84.2,和 GPT-5.5 的 84.4 只差 0.2;DeepSWE(防污染真实代码任务)28.0,是 DeepSeek V4 Pro 的 3.5 倍;USAMO 2026 奥赛数学 72.0。幻觉率从预览版的 12.5% 压到 5.4%。
价格是它的杀手锏:输入约 1 元、输出约 4 元每百万 token,输出成本只有 GPT-5.5 的五十分之一。加上 OpenCode 免费区接入,它是 2026 年"免费蹭算力"清单上的常客。
MiniMax M3:三项全能的第一名
MiniMax(稀宇科技)的 M3 在 6 月 1 日发布,6 月 15 日开源权重。它瞄准的是"既要又要":
| 项目 | 数字 |
|---|---|
| 总参数 | 4280 亿(MoE) |
| 激活参数 | 230 亿 |
| 上下文 | 最高 1M token(API 保障 512K) |
| 开源协议 | MIT 代码 / MiniMax-Modified MIT 权重(商用需授权) |
| 输入/输出价格 | ¥4.2 / ¥16.8 每百万 token(≤512K) |
M3 的独门技术是自研的 MSA(MiniMax Sparse Attention)稀疏注意力:在 GQA 骨干上按块选择真实 KV,单 token 计算量降到原来的 1/20,1M 上下文下的解码速度比上代快 15.6 倍。它是首个从预训练第零步就做多模态混合训练的开源模型,支持图片、视频输入,还能操作电脑桌面。
成绩:SWE-bench Pro 59.0%(超过 GPT-5.5 的 58.6%)、BrowseComp 83.5(超过 Opus 4.7 的 79.3)、AA 智能指数开源模型第一。它还是"目前全球唯一在开源条件下同时具备前沿编码 + 1M 上下文 + 原生多模态"的模型——后两项能力在下一节展开。
三家放在一起看很有意思:GLM 选 MIT 全开放、Hy3 选极致低价、M3 选能力组合。2026 年的国内开源文本模型,已经不是"谁能打"的问题,而是"你愿意为哪种取舍付钱"的问题。
二、多模态:看得懂图的模型,两条路线
路线之争:后装 vs 原生
多模态理解(让模型"看懂"图片、视频)在国内有两条技术路线。
一条是"后装":先训练一个纯文本大模型,再在它外面挂一个视觉编码器,把图片翻译成文本模型能懂的向量。大多数厂商这么做,因为省钱、迭代快。代价是文本和视觉的语义空间是两套系统,模型对"图里有什么"和"图里在发生什么"的理解是割裂的。
另一条是"原生":从预训练第零步就把文本和图片数据混在一起训,让两种模态的语义空间从一开始就是同一套。MiniMax M3 走的就是这条路——它把预训练数据扩到百 T 量级(上一代 M2.x 只有 29.2T token),用大量"文本+图像交错排列"的数据训练,让文本语义和视觉语义深度对齐。
原生多模态的实际能力
Minimax M3 的多模态不是"能看图"这么简单:
- 看图说话:理解图表、表格、截图,OmniDocBench 文档理解超过 Gemini 3.1 Pro
- 看视频理解:能读视频内容做长视频理解,1M 上下文正好装得下一整段视频的逐帧信息
- 桌面操作(Computer Use):能看懂电脑屏幕并操作界面,比如"打开本地 ERP 客户端,按这份 Excel 批量录入发票"
最后这项是原生多模态的价值证明:操作桌面需要把"看到屏幕"和"理解指令"当成同一件事来处理,后装模型做起来隔着一层翻译,M3 是直接在同一套语义空间里完成的。MiniMax 官方演示里,M3 被要求独立复现一篇 ICLR 2025 论文,它连续跑了近 12 小时,自主产出 18 次 commit 和 23 张实验图表——期间要反复看懂论文里的公式图表,这正是多模态+长上下文+代码能力的组合拳。
反例:GLM-5.2 为什么坚持纯文本
对照着看智谱的选择更有意思。GLM-5.2 明确不做图片输入,理由是"既然做不到多模态全覆盖,不如在文本和代码上做到极致"。这个取舍在 2026 年看来是理性的:AIME 99.2%、SWE-bench Pro 62.1% 的成绩说明纯文本路线还没到天花板,而多模态的竞争正被 Gemini、GPT 这些巨头用更贵的算力卷着。
但代价也明显:金融研报里的图表、医疗影像、界面截图这些场景,GLM 用不上。智谱的算盘是——需要看图的人自然有别的选择,而需要最强文本能力的人,我的 MIT 协议和 $1.40 输入价没有对手。
这一节没有收录太多名字,因为国内真正把多模态理解做成本事的开源模型确实屈指可数。M3 是唯一一个"原生多模态+开源"的组合,这个身位在 2026 年 8 月还没有第二家拿到。
三、生图生视频:国内是主力,而且并不小众
如果说文本模型国内还在追赶,视频生成就是另一回事了——2026 年 8 月,全球视频生成的头部玩家有一半在中国。Sora 2 已于 4 月底关停,OpenAI 的"模型演示即产品"时代结束,接棒的正是下面这几家。
MiniMax H3:首个登顶视频盲测榜的开源模型
MiniMax 在 7 月 31 日发布 H3,8 月 3 日就开源了 768P 权重。它是目前唯一进入 Artificial Analysis 视频盲测前三的开源模型,成绩是:视频编辑第 1、文生视频第 2、图生视频第 3,压过了 Veo 3.1 和 FLUX 3。
| 项目 | 数字 |
|---|---|
| 单次生成 | 15 秒 |
| 分辨率 | 原生 2K |
| 原生音频 | 支持(2K 音视频一步生成) |
| 开源 | 768P 权重已开源(2026-08-03) |
| 特点 | 指令遵循强,适合剪辑/重拍/续写 |
H3 的定位是"干活模型":别人卷单条视频的惊艳,它卷"你能不能改得动"。视频编辑第一名意味着你能把一段拍好的素材丢给它,让它按文字指令重拍、换背景、改动作——这是影视和广告行业真正愿意付钱的能力。开源后社区已经用它跑出了不少工作流,价格上则延续了 MiniMax"比闭源便宜一个数量级"的传统。
可灵 Kling:快手憋了三年的王炸
快手 2024 年发布可灵,2026 年迭代到 3.0 系列,是目前全球用户规模最大的 AI 视频工具之一,全球用户超 600 万。7 月初传出它即将完成 30 亿美元融资、计划 12 个月内赴港 IPO——一个视频模型项目估值到这个体量,说明资本把它当成了快手的新增长曲线。
可灵的技术路线和 H3 不同,它主打"全能+可控":
- 原生 4K:3.0 系列直接输出 4K,Turbo 版单价约 ¥0.8-1/秒
- 音视频同步生成:2.6 版本开始支持一次生成画面+旁白+音效,省掉后期配音
- 最长 3 分钟:单次生成时长业内第一梯队,配合剪映生态一键续生
- Elements 系统:最多 4 张参考图锁定角色,跨片段保持一致
可灵和剪映的深度绑定是它最大的优势——国内短视频创作者的工作流里,剪映是事实标准,可灵直接在剪映里生成、续生、剪辑,这一步的便利性,海外工具做不到。
Seedance 2.5:字节的"闷声发大财"
字节的 Seedance 系列一直是"能力很强但宣传很少"的典型。2.0 发布时主打物理真实性和角色一致性,2.5 在 7 月 31 日发布(和 MiniMax H3 同一天),把规格拉到了 30 秒、4K、50 张参考图——单次生成时长和参考图数量都是当时的行业上限。
Seedance 背靠火山引擎,走的是"API 批发"路线:不做自己的 App,而是让剪映、即梦、以及各种第三方工具调用它。这种打法让它在普通用户里知名度不高,但在 B 端,它和可灵、H3 一起构成了国产视频模型的铁三角。
生图:可图与"照片级"内卷
生图方面,国内厂商大多把能力藏在产品里(即梦、美图),独立开源的生图模型声音不大。快手有可图(Kolors),智谱有 CogView 系列,但要说和 FLUX、Midjourney 正面竞争,还差一口气。这个细分赛道的国产模型,目前更多是"够用"而不是"领跑"。
四、生音频:被低估的语音与音乐
音频生成在国内的讨论度比视频低得多,但商业变现能力一点不差——语音合成(TTS)、声音克隆、音乐生成,每一个都是能直接收钱的方向。这个赛道的国产玩家,大多把模型藏在产品后面,API 也低调。
MiniMax:语音+音乐双线布局
MiniMax 在音频上是国内布局最完整的一家。官网产品线里,语音和音乐是两个独立的产品线:
- MiniMax Speech 2.8:语音合成模型,主打超拟人音色和情感表达,支持声音克隆。它是 MiniMax 对话产品"星野"的语音底座——星野里的虚拟角色之所以能开口说话、带情绪,靠的就是它。2.8 版本是 2026 年的迭代,具体参数官方未全部公开,但角色扮演场景的语音自然度在同类产品里是第一梯队。
- MiniMax Music 3.0:音乐生成模型,支持文生曲、人声演唱、多风格编曲。MiniMax 走的是"音乐工作流"路线:生成旋律、配和弦、出人声,一步到位。3.0 版本 2026 年上线,官方定价和 API 已开放。
MiniMax 音频模型的特点和它的视频模型一致——不是实验室炫技,而是为产品服务。星野的语音、海螺的配音,都是自己家的模型在撑,这种"自产自用"模式让它的音频迭代特别快。
字节 Seed Audio 1.0:端到端音频生成
字节在 2026 年 7 月发布了 Seed Audio 1.0,走的是端到端路线:从文本直接生成音频,中间不经过"文本→音素→声学特征"的传统流水线。这类模型的优势是自然度高、能学说话人的语气和节奏,劣势是训练成本高、可控性稍差。
Seed Audio 的定位延续了字节"平台化"的思路——给火山引擎的语音产品做底座,供各种 Agent 和客服产品调用。国内语音赛道的 B 端市场,字节、MiniMax、讯飞三家在抢,前两家靠模型能力,讯飞靠渠道积累。
一个小众到没人在意的角落:开源 TTS
如果说上面两家是"藏在产品里",那开源 TTS 就是彻底的角落。国内团队开源的项目里,比较活跃的是 IndexTTS 等一批基于 VITS/扩散模型的中文 TTS 项目,质量参差不齐,但胜在免费、可商用、能自己微调。它们撑起了国内大量中小开发者的配音需求——短视频配音、有声书、客服机器人。没有统一的"旗舰开源模型"站出来,是因为语音的商业价值太高,各家都愿意做闭源 API。
音频这条线总结起来很直接:国内不缺好模型,缺的是把它们从产品里拆出来单独打的勇气。MiniMax 是为数不多两条腿走路(语音+音乐都独立成产品线)的厂商。
五、3D 建模:全球最卷的赛道,中国公司占了一半
3D 生成是整篇文章里最"无人问津"的角落——没有热搜、没有 C 端爆款,但它是游戏、电商、工业设计、具身智能的地基。全球 3D 生成式 AI 市场规模预计 2032 年达 75.9 亿美元,而这条赛道的话语权,2026 年已经明显向中国倾斜。
影眸科技 Rodin:从论文到产品的典型样本
影眸科技是这条赛道最亮眼的名字。团队约 60 人,平均年龄不到 25 岁,核心成员全来自上海科技大学。2026 年 6 月 23 日,它发布了 Rodin Gen-2.5,同时宣布完成数亿元新一轮融资。
| 项目 | 数字 |
|---|---|
| 模型 | Hyper3D Rodin Gen-2.5 |
| 生成能力 | 千万面级(全球首个) |
| 速度 | 最快 4 秒生成百万面模型 |
| 贴图 | 12K 原生 3D 贴图(全球首个) |
| 思考深度 | 五档可调(4 秒到 80 秒) |
| 客户 | 字节跳动、Unity、Figma、Canva 等 |
| 海外收入占比 | 约 80% |
Rodin 的技术路线值得单独说。绝大多数 3D 生成公司走"2D 升维"路线——先生成物体的多视角图片,再重建出 3D 模型。这条路成本低,但有不可逆的信息丢失,模型只能看不能用。影眸 2024 年提出的 CLAY 框架反着来:直接用 3D 数据从头训练原生 3D 模型,做出来的资产是"生产就绪"的,可以直接进游戏引擎、3D 打印、工业设计流程。
2024 年 CLAY 提名 SIGGRAPH 最佳论文,2025 年它的 CAST 论文(单图生成完整 3D 场景)拿下 SIGGRAPH 最佳论文奖——同期获此奖项的商业公司只有谷歌、Meta 和影眸三家。它生成的作品甚至被黄仁勋在 CES 2026 上用来展示英伟达的机器人业务。
Gen-2.5 还把大语言模型的"先思考再生成"搬进了 3D:用户可选五档思考深度,从 4 秒的快速草稿到 80 秒的高精度资产,Extreme-High 档能还原皮肤毛孔这类微结构。配套的 12K 原生贴图模型解决了传统投影法贴图的颜色断层问题,连 Logo、文字都能清晰保留。上线首月,订阅用户和 ARR 环比增速都超过 400%。
VAST Tripo:文本直达 3D 的老牌玩家
VAST 的 Tripo 是 3D 生成里"上手最简单"的:输入一段文字或一张图,几秒内生成可用于生产的 3D 模型,支持导出 GLB/STL/OBJ,直接进游戏引擎或 3D 打印。它不搞高精度工业级,主打"人人可用",免费试用、无需注册。2026 年 6 月 VAST 官宣新一轮融资,说明资本市场认可它的路线。
Meshy:把 Agent 带进 3D
Meshy 在 2026 年 6 月宣布发布了"全球首款 3D AI Agent"——不再是一次性生成一个模型,而是让 AI 理解整个 3D 创作流程:生成、修改、拆件、贴图,通过对话一步步完成。这个方向如果跑通,3D 建模会从"抽卡"变成"和设计师对话"。
大厂的底牌
3D 赛道的热闹还在于大厂全部入场:字节有 Seed3D 2.0、腾讯有混元3D 2.0、阿里有 ABot-Earth 0.5。大厂的优势是算力和渠道,创业公司的优势是论文级的技术密度。2026 年的格局是:影眸在工业级精度上领先,Tripo 在入门门槛上领先,Meshy 在 Agent 化上领先,大厂在后面虎视眈眈。
3D 这条赛道还藏着一个更大的叙事:世界模型。影眸的判断是,未来的世界模型需要"3D 生成与视频生成混合"——视频负责动态,3D 负责可仿真的物理世界。具身智能公司已经在用影眸的资产做训练数据和仿真环境。也就是说,现在这些"没人看"的 3D 模型,可能是下一轮机器人革命的训练材料。
第二部分 国外
国外的小众模型分布更分散:芯片厂商、欧洲创业公司、研究机构各占一块。它们和国内选手的区别在于——国内卷应用,国外卷架构和生态。下面按同样的分类逐一拆开。
一、文本与代码:芯片巨头下场做模型
Nemotron 3:英伟达的开源全家桶
英伟达做模型这件事,最初被看作"显卡厂商的配套产品",但 Nemotron 3 系列已经证明它不是玩票。从 2025 年 12 月到 2026 年,英伟达按"Nano—Super—Ultra"三档节奏密集发布:
| 型号 | 参数(总/激活) | 发布时间 | 定位 |
|---|---|---|---|
| Nemotron 3 Nano | 30B / 3B | 2025-12-15 | 端侧推理 |
| Nemotron 3 Super | 120B / 12B | 2026-03-11 | 数据中心主力 |
| Nemotron 3 Ultra | 约 500B | 2026 上半年 | 旗舰 |
三个型号全部开源(NVIDIA Open Model License,商业可用),全部支持 1M 上下文。Nano 发布时以 3B 激活参数打出了比 Qwen3-30B-A3B 快 3.3 倍、比 GPT-OSS-20B 快 2.2 倍的推理吞吐;Super 的 PinchBench(精简对话测试)85.6%,是当时开源模型第一。
Nemotron 3 的技术底子很有英伟达特色——为自家硬件深度优化:
- LatentMoE 架构:混合 Mamba-Transformer 的 MoE,用线性注意力降低长上下文成本,配合英伟达的 NVFP4 低精度训练,推理时可以直接吃满 GPU 的算力
- Lion 合成数据:训练数据大量由英伟达自己的模型生成再清洗,绕开了"高质量数据枯竭"的争论
- NeMo Gym:英伟达把训练工具链也开源了,等于"模型+工具链+硬件"打包给开发者
Nemotron 3 累计下载量已超 5000 万。它的逻辑和谷歌、OpenAI 完全不同:不靠卖模型赚钱,靠"让全世界的模型都跑在英伟达显卡上"。模型越强、越开源,买 GPU 的人就越多——这是英伟达式的一鱼多吃。
Mistral 3:欧洲唯一的开源头部
法国公司 Mistral 是欧洲大模型最后的门面。2025 年 12 月,它用一周时间连发 8 个模型,宣布全面进入 Mistral 3 时代:
| 型号 | 参数 | 定位 | 开源协议 |
|---|---|---|---|
| Mistral Large 3 | 675B / 41B 激活 | 多模态旗舰 | Apache 2.0 |
| Ministral 3 | 14B / 8B / 3B | 端侧三兄弟 | Apache 2.0 |
| Devstral 2 | 专业代码模型 | 编程智能体 | Apache 2.0 |
Large 3 是重点:675B 总参数的 MoE,256K 上下文,视觉+文本双模态,Apache 2.0 全开放。它的定位很聪明——不和 GPT 抢"通用全能王"的头衔,主打欧洲企业的私有化部署:欧盟企业不想把数据交给美国云,Mistral 给了一个合法合规、可自托管的选项。AlphaCode 2 编程任务上,Large 3 是首个排名超 GPT-5.5 的 Apache 2.0 模型。
后续的节奏也很有意思:2026 年 2 月开源 Voxtral(语音模型,70B),6 月发布 OCR 4(支持 170 种语言的文档理解,OmniDocBench 93.07 分),8 月推出 Shieldstral(3B 内容审核模型)。Mistral 的算盘是"全模态 + 全开源 + 欧盟合规",在文本、语音、OCR、审核这些企业刚需上逐个补齐。
一个共同点
Nemotron 和 Mistral 都选择了"开源 + 垂直场景"路线,而不是像美国巨头那样"闭源 + 通用"。原因不难理解:正面硬刚 GPT 的成本太高,不如把特定场景做到极致,让企业有理由换掉闭源 API。2026 年这个策略被验证有效——两家都拿到了稳定的企业客户群。
二、多模态:全模态的两种打法
多模态理解在国外小众模型里,有两种截然不同的打法:英伟达把多模态塞进小模型,新加坡的 Agnes 用免费策略抢 C 端用户。
Nemotron 3 Nano Omni:把"全模态"装进 30B
2026 年 4 月 28 日,英伟达发布 Nemotron 3 Nano Omni——名字里的 Omni 就是"全模态"的意思:一个模型同时处理文本、图像、音频、视频和文档,参数只有 30B(激活 3B),上下文 256K,完全开源。
这个模型的价值在于"端侧全能":传统做法是让一个文本模型配一个视觉模型、一个语音模型,拼成一堆服务;Nano Omni 是一个模型搞定所有输入,无需拼接。英伟达官方数据是推理吞吐量比同类组合方案快 9 倍——因为它不用在多个模型之间转发数据。
落地场景很明确:手机、PC、机器人、车载设备。这些设备的算力有限,一个 30B 的模型刚好装得下。英伟达甚至在发布时捆绑了它的整个"AI PC 生态",让开发者直接在这套模型上做端侧 Agent。
Agnes 2.5:新加坡黑马,免费的全模态模型
Agnes 是 2026 年最意外的名字之一。来自新加坡的 Sapiens AI(核心团队是华人,CEO Bruce Yang 是新加坡国立大学博士),2026 年 7 月 13 日发布 Agnes 2.5 Flash——一个文本、图像、视频全自研的模型系列,而且文本模型完全免费。
| 项目 | 数字 |
|---|---|
| 发布时间 | 2026-07-13(Agnes 2.5 Flash) |
| 能力 | 文本(旗舰)+ 图像(2.1-flash)+ 视频(v2.0)全自研 |
| 免费策略 | 文本模型不限量免费 |
| 用户规模 | 600 万+ |
| 周处理量 | 5.41 万亿 tokens(2026 年 6 月) |
| 融资 | A 轮 1000 万美元(2026 年 2 月),累计约 2000 万 |
Agnes 的技术路线值得单独拎出来说:它从第一天就坚持"全自研",不调用任何外部模型拼装。文本、图像、视频三套模型全部自己训练,用自研的 DSP(动态序列策略优化)强化学习框架对齐。这个选择烧钱,但换来的是"三位一体"的一致性——文本描述、图像生成、视频生成用的是同一套语义理解,这在做 Agent 产品时特别值钱。
商业模式是它的最大争议点:文本全免费,靠什么赚钱?答案还没完全揭晓,目前能看到的是:免费文本模型积累用户,图像/视频模型按量收费(视频约 $0.005/秒),后期可能转向企业 API。600 万用户、每周 5.41 万亿 tokens 的处理量,说明免费策略确实把量做起来了——它现在已经是"免费最强文本模型"的代名词,OpenCode 等工具直接把它列为免费区选项。
两家放在一起看:英伟达证明"小模型也能全模态",Agnes 证明"全自研 + 免费也能活下来"。多模态这个赛道的竞争,2026 年已经不只是巨头之间的游戏了。
三、生图生视频:开源之王与老牌劲旅
国外视频生成赛道,聚光灯外站着几个不该被忘记的名字。尤其是 FLUX 3——它是 2026 年唯一在视频领域对闭源巨头形成实质威胁的开源模型。
FLUX 3:黑森林实验室的"开源王炸"
德国黑森林实验室(Black Forest Labs,创始人团队就是 Stable Diffusion 的原班人马)在 2026 年 7 月 23 日发布 FLUX 3,8 月 4 日开放视频生成 API。它在视频领域的意义,相当于当年 Stable Diffusion 在图像领域:开源阵营第一次拿出了可以和 Veo、Sora 掰手腕的视频模型。
| 项目 | 数字 |
|---|---|
| 单次生成 | 20 秒 |
| 分辨率 | 720P / 1080P(API) |
| 原生音频 | 支持 |
| 价格 | 标准 秒、精细0.43/秒、草稿 $0.17/秒 |
| 开源 | 权重开源(非商用协议,2026-08-04) |
FLUX 3 的技术核心是 Self-Flow 训练策略:把视频生成拆成"先出大致轮廓、再逐步细化"的多步自蒸馏过程,解决了扩散模型在视频上"训练贵、生成慢"的老问题。配套的 FLUX-mimic 功能支持从参考视频提取风格和动作——这是影视级工作流的关键能力,此前只有闭源工具提供。
它还有个别人没有的便宜:草稿模式价格只有精细模式的 1/3,用极低成本做创意探索,满意后再出精细版。这个定价策略直接砍向了广告、短视频行业的中小工作室——以前这类客户根本用不起高端视频模型。
Runway Gen-4.5:老牌玩家的导演级工具
Runway 是视频生成的老牌玩家,2026 年升级到 Gen-4.5,主打"导演模式":用户用自然语言描述运镜、构图、景别,模型按分镜意图生成,而不是随机"变魔术"。运动笔刷(Motion Brush)可以单独控制画面里某个元素的运动轨迹——比如让风吹动旗帜但不移动背景。
Gen-4.5 的单次生成是 10 秒基础片段,但支持"扩展生成"到 40 秒以上,并且跨片段保持角色一致性。定价 $12-95/月,面向专业创作者。Runway 的定位很清晰:不抢普通用户,做影视级工具。
Luma Ray 3:把"控制权"还给创作者
Luma 的 Ray 3(2026 年升级到 Ray 3.2)主打关键帧控制:用户可以指定首尾帧,让模型补全中间的运动——这是动画行业的标准工作流。Ray 3 的生成质量在盲测里长期排第一梯队,电影级运镜是它的标签。它和 Runway 一样是订阅制(约 $30/月),但免费额度给得更大方。
Pika 2.5:把复杂留给自己,把简单留给用户
Pika 2.5 是另一个极端:界面简单到"输入一句话就出片",主打普通用户,免费 80 积分/月,付费 $10/月。它的唇形同步(Pikaformance)让角色说话的口型真实度在同类里领先。Pika 的用户量在 2026 年一季度增长了 4 倍——事实证明"简单"本身就是产品力。
小结:国内卷价格,国外卷控制
把国内外放一起看,差异很明显:国内模型(H3、可灵、Seedance)靠低价和超长生成打市场,国外独立玩家(FLUX、Runway、Luma)靠开源和技术控制力立身。而闭源巨头(Veo、Sora)在 2026 年反而有点落寞——Sora 2 关停,Veo 3.1 被 H3 在盲测里反超,这大概是"模型演示时代"结束的注脚。
四、生音频:被资本热捧的"声音生意"
生音频是国外小众赛道里商业变现最成熟的一块。和国内"藏在产品里"不同,国外玩家全是独立公司、独立品牌、独立收费——这门生意的逻辑很直接:声音是刚需,配音、有声书、播客、音乐,每一类都有明确的付费方。
ElevenLabs:估值 110 亿美元的语音独角兽
ElevenLabs 是这条赛道的绝对头部。公司 2023 年成立于伦敦,创始人是两位前 Google 机器学习工程师,成立两年多估值一路涨到 110 亿美元。它的核心产品是 TTS(语音合成),行业公认音质天花板:
- Eleven Turbo v2:延迟低于 200ms,实时对话级;复刻真人音色的能力(声音克隆)让它成了配音行业的事实标准
- 支持 29 种语言,口音和情绪可控,甚至能保留"语气词、停顿"这类细节
- Eleven Reader App:把任何文章、PDF 变成有声读物,用户免费听
2026 年它还把版图扩到了音乐:推出 Music v2,支持"风格混合"——比如"贝多芬钢琴曲混上爵士鼓",生成整首可商用的曲子。从语音到音乐,ElevenLabs 的路线是"把声音做成平台"。
Suno:日产 700 万首歌的音乐工厂
Suno 走的是另一条路:不碰语音,专注音乐生成。它是全球用户量最大的 AI 音乐平台,累计用户近 1 亿,每天生成约 700 万首新歌。
2026 年 Suno 的两步棋值得注意:
- Suno Studio(2026 年 3 月上线):把"抽卡式生成"升级成专业 DAW(数字音频工作站)——用户可以分段生成、单独编辑人声和伴奏、混音、加效果器。它还有 12 轨 Stem 分轨导出,满足音乐人和视频创作者对后期处理的需求
- v5 模型:音质提升到"可直接商用"水平,人声真实度大幅进步
价格上,Pro 版 $8/月,每天 100 次生成;免费用户每天 5 次。Suno 的目标是"让每个人都能做歌",2026 年它甚至开始推"独立音乐人分成计划",试图解决版权争议的根源——创作者分钱问题。
Udio:AI 音乐的技术流
Udio 是 AI 音乐赛道的另一家头部,2026 年迭代到 v2。它的口碑在于"生成质量的技术上限"——音质细节、人声表现力在专业测评里多次排第一。但它的产品更新节奏比 Suno 慢,用户量也差一个量级。AI 音乐市场的格局在 2026 年是:Suno 占量,Udio 占质,ElevenLabs 在中间切企业市场。
Voxtral:开源语音的新选项
Mistral 在 2026 年 2 月开源了 Voxtral(70B 参数语音模型),给语音赛道添了个开源选项。它在语音识别(ASR)和语音合成(TTS)上都有不错的表现,最大意义在于:企业不想把语音数据交给闭源 API 时,现在有了欧洲开源的替代品——延续了 Mistral"合规私有化"的整体战略。
音频赛道的共性
国外音频玩家有个共同点:全部围绕"版权和分成"做文章。ElevenLabs 和音乐版权方合作、Suno 推出分成计划、Udio 也谈过唱片公司授权——因为音频的商业化绕不开版权这座大山。反观国内,音频模型的讨论还停留在"技术好不好"的层面,版权和变现模式想得少,这可能是下一步拉开差距的地方。
五、3D 建模:国外反而安静
3D 生成在国外是个有趣的反差:创业公司比国内少得多,声音主要来自两家大厂生态——英伟达和 Luma。
NVIDIA Edify 3D:把 3D 生成做成工业配件
英伟达的 Edify 3D 是国外 3D 生成最有分量的一个。它不追求"炫酷的生成效果",而是把自己定位成 Omniverse 工业生态的一个部件:生成的结果直接对接游戏引擎、CAD、仿真系统,支持 PBR 材质、可编辑的网格结构,甚至能按工业标准控制面数和格式。
Edify 3D 的典型用法是:设计人员用文字或图片生成初版模型,然后拉进 Omniverse 里和真实场景对齐、修改、仿真。它解决的问题是"怎么让 AI 生成的资产真的能用",而不是"怎么生成一张好看的效果图"。这也是英伟达一贯的风格——模型永远是为生态服务的。
Luma Genie:从视频杀回 3D
Luma 除了做视频(Ray 系列),手上还有 Genie——一个文本/图片转 3D 的生成模型。Genie 的定位和 Tripo 类似,主打"人人可用",生成速度快,模型可以直接丢进游戏引擎或 3D 打印软件。
Luma 的技术路线比较特别:它把视频生成的时空建模能力反哺给 3D,用"多视角一致"的思路生成模型,所以产出的几何结构通常比较完整,不会出现"正面好看、背面烂掉"的问题。不过 Genie 在 2026 年的迭代节奏明显慢于视频线——Luma 把重心压在了 Ray 系列上,3D 更像是生态补充。
为什么国外 3D 反而安静?
把国内外 3D 放一起看,结论很直接:3D 生成这轮技术浪潮,国外大厂没怎么发力(OpenAI 的 Shap-E、Google 的 DreamFusion 都是研究项目),创业公司也被中国团队压着打。原因大概有三点:
- 国外 3D 资产的生产标准(工业级精度、PBR 材质、布线规范)更高,通用模型难以满足
- 3D 的消费场景(游戏、电商、制造业)在中国更密集,需求倒逼技术迭代
- 国内公司愿意做"脏活累活"——和游戏公司、电商平台一个个对接定制需求,国外公司更倾向于做通用平台
所以 2026 年 3D 赛道的格局是:技术密度最高的论文在中国团队手里(影眸的 SIGGRAPH 最佳论文),最完整的工业生态在英伟达手里,而真正面向普通用户的 3D 生成工具,两边都还没跑出绝对王者——这个空档期可能是未来两年最大的机会。
结语:角落正在变成主场
把整篇文章的选手摆在一起,能看到三条清晰的线。
第一条线:开源从"爱好"变成"商业武器"。 GLM-5.2 用 MIT 协议换来开发者信任(Hugging Face 安全事件就是最好的广告);Nemotron 3 用开源换生态,模型越强、显卡卖得越多;FLUX 3 用开源权重对闭源巨头形成实质威胁。2026 年的开源不再是"弱者的遮羞布",而是主动选择的竞争策略。
第二条线:细分赛道的价值被重新发现。 视频、音频、3D 这些"角落"正在被资本重新定价:可灵估值冲向 IPO、ElevenLabs 估值 110 亿美元、影眸完成数亿元融资。当通用模型的竞争变成算力消耗战,垂直赛道反而成了性价比最高的突破口——用更少的钱,做出用户愿意付钱的东西。
第三条线:中国模型的分工已经形成。 文本赛道 GLM/Hy3/M3 各守一摊,视频赛道 H3/可灵/Seedance 三足鼎立,3D 赛道影眸一骑绝尘。中国团队不再只靠"跟随"吃饭,在视频、3D 这两个方向上,2026 年的榜单头部位置是国产模型占着的。
最后回答标题的问题:小众大模型发展到了什么程度?答案是——比大多数人以为的要好得多。它们没有热搜,但正在用另一种方式改变行业:更低的价格、更开放的协议、更极致的细分能力。GPT、Claude 们负责定义上限,而角落里的这些模型,负责把下限不断抬高。
下次再看到"无人在意的角落",不妨多看一眼。那里可能藏着你明天就要用的工具。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐




所有评论(0)