我实测了千问 3.8 Max:强是真强,但是别着急,看完再决定用不用
2.4 万亿参数、仅次于 Fable 5、即将开源——阿里这次口号喊得震天响。我花了一天时间把它翻了个底朝天,说点大实话。
7 月 19 号,千问团队静悄悄地把 Qwen 3.8 Max Preview 扔上了线。没有发布会,没有预热,就一条推文:「这是除了 Fable 5 外最强大的模型」。
2.4 万亿参数,原生多模态,即将开源。
听上去牛逼得不行。但我这个人比较俗,不看广告看疗效。于是花了一天时间,在 Qoder(千问的编程 IDE)和网页版上,把它里里外外测了个遍。
先说结论:能用,有些场景甚至让人眼前一亮。但别急着把你的主力模型切过来,它还是个预览版,坑不少。
先搞清楚:你现在拿到的是什么?
这是一个 Preview 预览版,不是正式版。
什么概念?没有公开的 Benchmark 跑分表,没有技术报告,没有激活参数量,没有开源权重,连许可证长什么样都不知道——这些官方自己都没拿出来。
官方说的是「正式版出了之后会开放完整权重」。
所以你现在拿到手的,跟最终成品可能会有不小差距。举个例子:之前腾讯 Hy3 的预览版和正式版,时隔三个月简直像两个模型。
但 Preview 也不是完全不能用。它已经在千问官网、Token Plan API、Qoder 和 QoderWork 全量开放了。Qoder 里甚至可以直接把上下文拉到 100 万 token(百万字级别),这一点是实打实的。
哪些场景让我觉得「行啊千问」
- 复杂数据仪表盘——最强的加分项
第三方评测机构 ZPedia 用一套很硬核的题目测了它。其中一道是:给定 28 条多模型 API 运行记录,制作一个运营驾驶舱,包含五项核心指标、四类图表、三级筛选、异常检测规则和成本模拟器。
Qwen 3.8 交出了一个 1203 行的单文件 HTML。柱状图、折线图、气泡散点图、环形图,全部用原生 SVG 生成,没有依赖任何第三方库。五项指标默认视图的数值跟标准答案完全一致。
这说明什么?模型第一反应不是画个好看的壳,而是先把数据层的计算逻辑理顺,再让图表和指标共用同一份状态。 这种「先算对再画好看」的思维方式,在真实业务场景比跑分重要得多。 - 复杂规则仿真系统——逻辑能力到位
同一组测试里还有道变态题:给一个 24×16 的建筑网格,12 个人员、4 扇防火门、2 个出口、1 个烟雾源,要求写一个完整的疏散仿真沙盘。烟雾会扩散,门会在特定时间关闭,人要根据当前状态动态重新规划路线。
Qwen 3.8 用 724 行代码搞定了。不是写死轨迹的那种「伪仿真」,而是建立了网格、门、人员、烟雾、出口六类独立状态,以 0.5 秒为步长推进,用 A* 寻路算法动态计算路径。我们验证了 12 名人员的初始路径长度,全部跟标准答案对得上。 - 数据到视频的端到端生成
还有一道题是:给一组 JSON 格式的服务异常和恢复数据,直接生成一支可播放的复盘视频 MP4。
还别说,Qwen 3.8 真的干出来了——1920×1080、30fps、15 秒、H.264 编码。延迟曲线随时间上升、恢复阶段的指标向改善方向运动、片头片尾文案完整——而且所有文字是程序化绘制的,没有生成式视频常见的跳字和变形问题。
从结构化数据到一支能直接用的视频,这是一个完整的生产闭环。 - 网站和前端开发——基本功扎实
我在 Qoder 里让它做了几个网页。一个个人作品集首页,第一版就带了缓入缓出的过渡动画,审美在线。Qoder 内置了 161 种风格参考(Airbnb、Apple、Figma 等),可以直接套用。
简单前端需求,它是真的能省时间。
哪些场景让我直摇头
- 3D 复杂场景——翻车了
我让它做一个「莫奈吉维尼睡莲花园」的 Three.js 3D 体验场景。提示词写得很详细:整片池塘就是一幅画,水面和花园由漂浮的纯色笔触构成,可以乘船穿行。
结果?第一次交付完全是碎片在旋转,看不出任何花园的样子。第二次让它修正,勉强能看到桥的形状了,但跟「莫奈花园」的关系大概就是几片绿和几个圆圈。
跟 Fable 5 的 3D 能力比,差了一个档次。 - 3D 魔方——直接崩溃
ZLedia 的评测里,同一套题目下的 3D 魔方任务——需要实现真正可玩的 3×3×3 魔方,包括六面旋转、算法队列、撤销重做、25 步确定性打乱。
Qwen 3.8 在分析阶段表现得相当出色:它主动检查了动画速度、非法算法拒绝、撤销重做历史、Promise 语义等。看思考过程,你以为稳了。
结果写到一半直接 Internal error: terminated。
这对于开发者意味着什么?你花了 token、时间,眼看着推理质量很高,结果最后一步崩了,前功尽弃。这种不稳定性,是真没法放进工作流里。 - 视觉还原——八成功力,差两成细节
让它复刻 NASA Webb 太空望远镜的网页——结构识别得很准,双层导航、正文区域、八类图片分类,全对。Logo 用 SVG 重绘、底部天文图用 Canvas 生成,断网也能看。
但整体缩小了一圈。 它知道页面上有什么,但不知道这些东西在屏幕上该占多大。留白不够、对比度偏低、信息密度差了那么一口气。
简单说:能用,但不精致。 - 速度慢
多个评测都提到同一个问题——它比 Kimi K3 慢。一个 3D 任务,深度思考能跑几十秒,出来的结果还不一定对。对需要快速迭代的场景,这个等待成本不小。 - 幻觉率偏高
有评测指出,Qwen 3.8 Preview 的幻觉率不低,尤其长任务中容易出现编造。Kimi K3 的幻觉率虽然也高(51%),但至少基准性能更强,容错空间大一些。
一张表说清楚:Qwen 3.8 vs 竞品

我的真实建议
什么人现在可以试试:
你已经在阿里云生态里,百炼平台上跑着其他千问模型,想看看新旗舰的能力天花板在哪
你做的工作偏数据分析、报表生成、API 数据转可视化,Qwen 3.8 在这个领域确实有新意
你对视频自动生成有需求,5 个 Case 里视频那道表现最完整
你就是好奇,拿 Token Plan 的免费额度玩玩——反正不亏
什么人千万别急着换:
你的生产环境跑了千问 3.7,稳定运行中——别动。3.7 是成熟产品,3.8 是 Preview,两者可能差一个季度以上的打磨。
你做 3D 网页、游戏原型、视觉设计类任务——目前的 3.8 Preview 还不如 Kimi K3
你需要把模型部署在自己服务器上——权重没出来,就算出来了,2.4T 参数你也没法跑
你的工作流有交付截止日期——一次崩溃就够你受的
你在做财务、医疗等对幻觉零容忍的场景——Preview 的幻觉率还不靠谱
最后一句话
Qwen 3.8 Max 不是一个能「平替 Fable 5」的模型,但它确实在某些领域(数据结构化、Agent 长程逻辑、数据到视频)做出了让人愿意继续关注的东西。
问题在于,现在拿到的只是一个 Preview,而且 Preview 和最终版可能差很远。
所以我不会说「赶紧上车」——我会说「再等等,等正式版和权重出来,看独立评测机构的分数,再决定要不要认真用」。
这批国产万亿模型(Kimi K3、Qwen 3.8、DeepSeek V4 正式版)的节奏已经越来越快。再过一两个月,这片天可能又不一样了。
以上数据均采用与芯云token调取www.xinyuntoken.com/sign-up?aff… Kimi K3 或其他模型,欢迎在评论区交流测试方法和结果。
更多推荐




所有评论(0)