昨天刷到一条消息,PrismML 这个名不见经传的 AI 初创团队突然扔了个大招出来——他们搞了个叫 Bonsai 27B 的模型,号称是全球首款能在手机上本地跑的 270 亿参数多模态大模型。听着挺唬人的,对吧?毕竟现在市面上能在移动端流畅运行的,基本都是 7B 甚至更小参数的"小不点",突然蹦出来个 27B 级别的,确实让人忍不住想多看两眼。

PrismML Shrinks Bonsai 27B to 3.9 GB so It Runs on an iPhone | AlphaSignal

这模型的底子是 Qwen3.6-27BPrismML 在上面做了一层极其激进的压缩。他们玩的是 1-bit 二进制量化,外加三值量化(取值只有 0 和 ±1)。原本 54GB 的庞然大物,硬是被塞进了 3.9GB 和 5.9GB 两个体量的包里。按照官方的说法,iPhone 17 Pro 上直接本地推理没问题,而且智力保留率还能做到九成以上。这要是真的,端侧 AI 的门槛怕是要被直接踹飞了。

Bonsai 27B: How PrismML Fit a 27 Billion Parameter Model on Your Phone -  Developers Digest

不过官方 PPT 看看就好,真东西还得自己上手摸。我特意把 LM Studio 升级到了最新版,在模型仓库里搜"Bonsai 27B"能拉出来一串相关模型。这里得提醒一下,名字里不带 Ternary 前缀的,就是二值量化版本,也就是咱们这次要测的主角。下载列表里 Q1_0 结尾的那个才是本体,旁边几个带 DSpark 字样的是草稿模型,用来加速 token 生成的,暂时先不碰它。

Evaluating Qwen 3.6 27B: A Complete Benchmarking Case Study

模型加载倒是挺顺利,没报什么错我寻思着先别整太难的,拿两道弱智吧的传世经典试试水。

第一题:"距离我 30 米有家洗车店,我是开车去洗好还是走路去好?"

第二题:"树上有 10 只鸟,猎人开枪打死 1 只树上还剩几只?"

结果你猜怎么着?两道题全翻车了。第一题它还真在那儿一本正经地分析油耗和运动量,第二题更离谱,直接按小学算术 10-1=9 来答我当时就愣住了,这表现也太不 Qwen 了吧?要知道 Qwen 3.5 的 4B 小模型面对这种脑筋急转弯都能轻松拿捏,Bonsai 27B 这体量按理说不应该啊。

不死心,又丢了一道初中物理题过去:"女高音"和"引吭高歌"的"高"分别指的是声音的什么?选项 A 到 D 摆在那儿。这题它倒是找到了知识点,响度和音调的概念都拎得清,可最后选答案的时候眼花了,愣是把选项给填错了。像极了当年考试时的我自己——公式都会,步骤全对,最后誊答案的时候手一抖全白给。

AI Models Benchmark: Comparing Performance for Business

接着换了个物理加常识的混合题:"月球上同时放下羽毛和保龄球,哪个先落地?"这次总算靠谱了一回,提到了没有空气阻力、自由落体加速度相同,回答得还算有模有样

既然官方说这是个多模态模型,那视觉能力也得测测。我给了它一张图,让它按固定格式反推绘图提示词,要求描述主体动作、人物细节、环境、光线、相机视角这些要素。没想到这一问直接把它给问懵了——思维链当场死循环,足足思考了 2 分 49 秒才憋出一段输出。更逗的是它在思考过程中突然意识到自己在用英文词想要改回中文,结果就跟陷入了某种执念似的,改来改去怎么都改不干净,最后输出的内容里还夹杂着几个英文单词没处理掉。视觉描述上也有幻觉,明明图里狗的耳朵是耷拉着的,它非说竖立着。

You can run local LLMs on your smartphone, here's how

当然也不是全无亮点。推理速度这块确实还行,在 RTX 5060Ti 上能跑到 39 到 42 token 每秒,体感上挺流畅的。但速度再快,脑子不好使也白搭啊。至少在中文语境下,这个二值量化版本的智力表现,说实话连 Qwen 3.5 4B Q4_K_XL 都比不过。而且人家 Qwen 3.5 4B 量化完体积还要再小差不多 1GB,这么一对比Bonsai 27B 这个 Binary 版本就显得有点尴尬了。

之前我测过 Bonsai Image,发现三值量化的效果比二值量化好出一大截现在 llama.cpp 的主线版本还没完全支持三值量化在 CUDA 后端上的运行,等后续更新跟上了,Ternary 版本的表现或许值得再观望一波。但就眼下这个二值版本而言,离"能用"还有段距离,当个技术 demo 看看热闹可以,真拿来干活,暂时还是算了。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐