8月14日晚上,阿里千问把Qwen3.8-27B的模型权重放出来了,Apache 2.0协议,能免费下载、部署、商用。这几天刷到的相关内容不少,有人说家里显卡就能跑,也有人说部分跑分超过了Claude Opus 4.6 Max。这篇把能查到的信息整理一遍,顺便记录一下部署的过程,给准备上手的人做个参考。
在这里插入图片描述

Qwen3.8-27B 是什么

简单说,它是阿里千问团队开源的一个270亿参数的稠密(Dense)模型,原生支持文本、图片、视频输入。跟Qwen3.8系列里那个2.4万亿参数的旗舰版Qwen3.8-2.4T-A95B不是一回事,那个是给云端算力用的,27B这个尺寸才是给普通人本地部署用的。

架构上用的是Gated DeltaNet和标准注意力混合的结构,64层里大部分层用线性注意力,只留少数几层做全量注意力,这样做的直接好处是KV缓存占用比传统全注意力模型少很多,长文本情况下显存压力小不少。模型原生支持262144 token上下文,通过YaRN技术可以外推到大约100万token,另外内置了Multi-Token Prediction,配合推测解码能让生成速度快一截。

权重已经上线Hugging Face和魔搭社区,社区也很快跟进了各种GGUF、NVFP4量化版本。

能帮你做什么

日常用来写代码、改代码、跑终端命令、看图表看文档、处理长文本,基本都能覆盖。官方给的场景包括自动化办公、电脑操作(Computer Use)、手机操作,也就是让模型自己点鼠标、点屏幕去完成一套任务,而不只是聊天回答问题。

对个人开发者来说,可以当本地编程助手,处理私有代码仓库和日志,不用把代码传到云端。对小团队,可以部署在内网服务器上,做合同审核、报表生成、知识库问答这类活。对做内容或者研究的人,长上下文加上能看图看视频,处理扫描件和长文档会方便一些。

Qwen3.8-27B 有什么优点

编程能力怎么样?

比上一代Qwen3.6-27B提升明显。SWE-bench Pro从53.5分涨到61.7分,QwenSWEBench从49.3涨到79.0,竞赛编程LiveCodeBench v6拿到90.3分。日常写前端页面、脚本、小工具基本没问题,复杂一点的项目偶尔还是会有小瑕疵。

能不能自己操作电脑和手机?

可以。这是这一代升级最大的部分。OSWorld-Verified从上一代的63.9分涨到84.3分,一年时间涨了20分,AndroidWorld也有81.9分,说明它接自动化任务、连续操作界面这块的可靠性提高了不少。

长时间跑复杂任务稳不稳?

比之前稳。CoWorkBench(长周期办公协作基准)从61.0分涨到70.7分,DeepSWE 1.1从13.3直接跳到42.2,这项测的是跨文件、跨轮次记住上下文并持续把活干完的能力,涨幅算是比较大的。

上下文能装多少内容?

原生262144 token,差不多能塞进一个中大型代码仓库或者几十万字的文档,不用来回切分。通过YaRN能扩到100万token左右,不过这是外推能力,跟原生窗口不完全是一回事,长上下文下显存开销也会跟着涨。

显存要求高不高?

量化以后门槛不算高。Q4量化大概17GB左右,24GB显卡(比如4090)能装下全部权重跑中等上下文;16GB显卡也能跑,但上下文得压在16K-32K左右,速度和质量要做取舍;8GB显卡基本只能算“能启动”,日常编码助手这种强度用起来会比较吃力。

能不能商用?

可以。Apache 2.0协议,个人、企业、科研机构都能免费下载部署,也允许直接用在商业产品里,用之前建议核对一下模型仓库里最新的许可文件,避免细节上出偏差。

跟前沿闭源模型比,差距也是有的。比如Terminal Bench 2.1它是73.0分,Claude Opus 4.6 Max是78.2分;GPQA Diamond它89.2分,对方91.3分;HLE测试它30.8分,对方40.0分。软件工程、电脑操作这类真实任务它表现突出,科学推理这种偏综合的题目上还是有差距,这点心里要有数,别当成全面超越。

需要的硬件条件

显存 能跑成什么样
8GB 能启动,日常对话凑合,编码助手这种高频使用场景比较吃力
16GB 可以跑,量化选Q3或者Q4,速度大概20-30 tok/s,上下文建议控制在16K-32K以内
24GB 用起来比较舒服,Q4_K_M全GPU运行,速度大概55-80 tok/s
32GB以上 能上Q6/Q8高精度量化,配合长上下文使用体验更好

CPU方面主流平台都够用,内存建议32GB起步,跑长上下文和多任务并发时会更稳。显卡品牌不挑,A卡N卡都有社区适配方案,Ollama和llama.cpp原生支持比较成熟。

和其他同类模型对比

项目 Qwen3.8-27B Qwen3.6-27B(上一代) 同尺寸同类开源模型
参数规模 270亿,稠密架构 270亿,稠密架构 多为270亿-300亿区间
原生上下文 262144 token 较短,需外推 多数不超过128K
多模态 原生支持图片、视频 部分支持 部分为纯文本模型
SWE-bench Pro 61.7分 53.5分 视具体模型而定,普遍低于Qwen3.8-27B
OSWorld-Verified 84.3分 63.9分 多数同尺寸模型未专门优化此项
部署门槛 量化后16-24GB显存可跑 显存需求相近 部分MoE架构模型部署更复杂
开源协议 Apache 2.0,可商用 Apache 2.0 部分模型附加限制条款

跟同期发布的其他开源大模型比,Qwen3.8-27B的差异化在于把偏向前沿模型才有的Agent能力(自动操作电脑手机、长周期任务协作)压进了27B这个能本地部署的尺寸,这也是它这次讨论度比较高的原因。

详细安装教程

用Ollama部署是门槛最低的方式,步骤大致如下:

  1. 先装Ollama客户端,官网下载对应系统的安装包,装完命令行输入ollama -v确认能正常调用。
  2. 拉取模型,命令行输入ollama pull qwen3.8:27b,根据网络情况等模型下载完成,量化版本大概十几GB到二十几GB不等。
  3. 下载完直接运行ollama run qwen3.8:27b,就能在命令行里跟模型对话了。
  4. 如果想要图形界面,装LM Studio,在模型搜索框搜Qwen3.8-27B,选一个GGUF量化版本下载,装好后可以调节上下文长度、reasoning_effort这些参数,模型默认是较高强度的思考模式,用起来偏慢,日常交互场景建议手动调成中等强度。
  5. 想接入自己的项目做二次开发,用transformers或者vLLM,模型卡里有官方给的调用示例代码,照着改改参数就能跑起来。
  6. 显存有限的话优先选GGUF的Q4或者Q5量化版本,社区反馈这两个精度损失不大,速度也过得去;显存够大(48GB以上)可以直接用官方FP8权重,质量最接近原始效果。

装完建议先跑几个日常任务试试手感,比如让它改一段代码、总结一篇长文档,感受一下速度和质量是不是符合预期,再决定要不要进一步做量化调优。

下载链接

网盘链接:https://pan.quark.cn/s/c493bddc7d11

这个是转存的下载渠道,方便国内网络环境获取。想确认版本和权重完整性的话,也可以去Hugging Face或者魔搭社区找官方仓库核对一下文件哈希,多一步核实比较放心。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐