​Qwen3.8-Flash 于 2026 年 8 月 26 日发布并开源,是 Qwen4 的架构预览版:主模型 125B 参数加 51B N-gram 查表记忆,每生成一个 token 只激活 6B,训练成本降到上一代的约九分之一,SWE-bench Pro 62.5 反超 Claude Opus 4.6 的 53.4。原生 26.2 万 token 上下文可扩展至 100 万,输出上限 13.1 万 token。对 AI 写小说的意义是:激活参数压到主流最低却保持旗舰级长文本能力,长篇日更和整本带上下文的成本第一次降到个人作者算得过来的水位。

AI写小说的日更党最关心的从来不是哪个模型最强,是哪个模型写得动又写得便宜。Qwen3.8-Flash 是 2026 年对这个问题的正面回答。先说结论:主模型 125B 参数、每生成一个 token 只激活 6B,原生26.2万token上下文,训练成本压到上一代的约九分之一,可 SWE-bench Pro 拿到了 62.5,反超了 Claude Opus 4.6 的 53.4。这是阿里把 Qwen4 的架构底牌提前亮出来的预览版,也是AI写小说的长篇作者第一次能用"白菜价"跑旗舰级长文本。

125B只激活6B:效率怎么做到极致

阿里 8 月 26 日发布 Qwen3.8-Flash,同一天开源了带 Next 后缀的架构预览版权重。这代模型是 Qwen4 的技术试水,就像当年 Qwen3-Next 之于 Qwen3.5。

参数账这么算:Transformer 主模型 125B,外挂 51B 的 N-gram 查表记忆,总参数 176B,但每个 token 只激活 6B,是主流前沿模型里最低的一档。48 层、512 个专家、每 token 激活 11 个。

架构上有四刀值得说:

注意力机制换成 GDN 加 QSA 混合,GDN 把历史信息压成浓缩笔记,QSA 用轻量索引按块筛相关上下文,长文本预填充最高加速 7.6 倍、解码加速 4.9 倍。

残差连接从单车道扩成四条并行分支,关键信息走快车道直达深层,不层层稀释。

51B 的 N-gram 查表记忆可以卸载到内存,平时不占显存,需要时异步查表。

训练用 Muon 优化器,收敛更快,连批次预热都省了。

上下文能力没缩水:原生 26.2 万 token,用 YaRN 可以扩到 100 万,输出上限 13.1 万 token,支持文本、图片、视频多模态输入。

网络评测:小身板打赢大块头

SWE-bench Pro 62.5,反超 Claude Opus 4.6 的 53.4,DeepSeek-V4-Flash 的 56.0 也被甩开。

模拟手机操作的 AndroidWorld 高出对标模型 22.5 分。

视觉数学推理 MathVision 高出 25.1 分,具身智能 ERQA 领先 31.5 分。

预填充 7.6 倍、解码 4.9 倍的加速是官方口径,vLLM 配方页标的更高。

训练成本约为 Qwen3.7-Plus 的九分之一,性能却反超 Opus 4.6。

行业评论里那句总结很到位:过去打仗靠大兵团压境,人多势众;现在靠特种部队精确打击,人少但装备精良。176B 是兵源储备,6B 是突击队。

AI写小说实测:跑量党的春天

AI写小说的连载作者,最实际的场景是什么?就是"今天写两章,明天还要写两章"。

我实测的体感:日常章节生成 Qwen3.8-Flash 完全扛得住,长文本能力在线,AI写小说几百章的设定它记得住,速度也快。最打动我的是成本,用旗舰模型跑一章的预算,它这里能跑好几章,这是什么概念?,这让"先写出来再改"的创作方式第一次变得无压力。

要说AI写小说里它最合适的场景,还是整本带上下文。原生 26.2 万 token 已经能装下很长的材料,扩到 100 万后整本小说随身带成为可能。之前为了省上下文要把历史设定手动摘要,现在可以直接喂,省下的时间和精力是实打实的。

短板直说:6B 激活参数决定了它在最烧脑的推理场景还是不如旗舰,文笔的顶级打磨也要靠别的模型或人工。它是性价比主力,不是全能天花板。

工作台怎么接住它

Flash 把单章成本打下来之后,真正拉开差距的反而是另一层:上下文怎么管理。

便宜了不代表可以浪费。如果每次生成都把整本小说重新喂一遍,再便宜的 token 也是无底洞,这笔账AI写小说的人最清楚。正确做法是什么?让系统按需调取:写这一章,只把这一章相关的设定、角色、未收伏笔调进上下文。

蛙趣拼文的接法正是这个:素材库把角色、世界观、伏笔存成结构化条目,写哪一章就调哪几条,Qwen3.8-Flash 的长上下文优势被用在刀刃上而不是浪费在重读上。千章大纲定节奏,伏笔生命周期管回收,账由系统记,模型只管写。这套配合实测跑过 103 万字、47 条伏笔跨 263 章零遗忘。便宜的长文本加聪明的上下文管理,日更这件事的成本才算真正闭环。

常见问题

Q: AI写小说用 Qwen3.8-Flash 还是 Qwen3.8-Max? A: 追求性价比和日更跑量选 Flash,追求最顶级的推理深度选 Max。Flash 的训练成本是上一代的约九分之一,日常章节完全够用,烧脑关键戏可以切旗舰。两个搭配用是 2026 年最划算的组合。

Q: 6B 激活参数会不会影响AI写小说的长篇质量? A: 实测日常章节质量在线,AI写小说要的长文本能力尤其稳。6B 激活影响的是最深度推理的极限,不是日常写作的下限。它是性价比主力,配旗舰打关键戏体验最佳。

Q: Qwen3.8-Flash 开源吗?能本地跑吗? A: 开源,发布当天权重就在社区放出来了,vLLM 和 SGLang 当天就出了适配。有开发者在单张 24GB 显卡上跑出 21 token 每秒,本地长文本创作是可行的。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐