把 35B 大模型塞进手机!Termux + 小米眼镜 + Qwen3.5 本地推理实战:把 AI 塞进你的口袋



前言
我们上回说到,基于多模态大模型给现实世界加了一本说明书,后端开了一台服务器做推理服务(只是省了token)。
随着技术的发展,这次我们尝试直接在手机侧运行大模型(把流量也省了)。
本文介绍如何在 OnePlus 12(骁龙 8 Gen 3,24GB RAM)上运行阿里最新的 Qwen3.5-0.8B 模型,通过 llama.cpp 框架实现本地推理。
Prompt 处理速度 33.3 t/s,生成速度 16.9 t/s。无需云端,隐私安全,随时随地享受 AI 加持。
📱 引言:把 AI 塞进口袋
想象一下:没有 API 调用限制,不用担心网络延迟,数据完全本地处理,你的 AI 助手随时待命——这一切,只需要一台安卓手机。
这不是科幻。
别再云端裸奔了,你的数据值得本地运行。
2026 年了,你还在把对话数据发给云端 API?
每次问个问题,隐私就在互联网上裸奔一次。更别提网络延迟、API 限流、服务宕机……
受够了。
我决定把大模型本地化——不是那种"云端 API 套壳"的假本地,是真正的端到端本地推理。
🎯 项目背景:为什么要在手机上跑大模型
-
隐私,没有之一。用户图像上传云端,合规风险高,即使用本地服务器,不可避免还是需要经过运营商。
-
成本,云端的推理,即使上了 code plan 也压不住视频采集级别的token消耗;而在外旅游时,本地服务器也需要消耗大额的流量。
-
延时,在一些需要高速追踪的场合,“外挂”大脑的延时还是太高了。
-
算力,AI眼镜作为第一人称视角,有很强的沉浸感,但续航和算力实在太紧张了。随身设备中,算力最强的只有手机,而且人手一个。
-
离线,地铁、地下停车场、电梯照样工作
凌晨两点,你问了一个难以启齿的问题。
没有服务器记录,没有数据上传,没有第三方窥探。答案只在你的屏幕亮起,然后熄灭,像从未存在过。
我们习惯了把思考外包。
问天气,问路线,问建议,问秘密。每一次提问,都是一次数据迁徙。你的困惑、欲望、焦虑,变成比特流,飞向某个不知名的数据中心。
它们说这是为了"更好的服务"。
但当你深夜搜索"如何缓解焦虑",第二天收到的却是抗抑郁药广告时,你开始怀疑:服务的是你,还是广告商?
曾经,隐私是富人的特权。
富豪请私人医生,不上传病历;请私人律师,不记录咨询;请私人教师,不留存对话。普通人呢?只能在条款里勾选"同意",然后把生活交给算法。
现在,技术把特权变成了权利。
当AI在本地运行时,对话止于设备。没有中间商,没有数据湖,没有"用于模型优化"。你的问题问出去,答案回来,然后消失。
就像从未发生过。
断网的那一刻,现代生活崩塌了。
地图不能导航,音乐不能播放,消息不能发送。我们像被切断脐带的婴儿,惊慌失措。
但本地AI不依赖网络。
地铁隧道里,飞机飞行中,山区露营时,它都在。没有"服务器维护",没有"请求超时",没有"今日配额已用完"。
离线不是缺陷,是自由。
你可以带着AI去任何地方,就像带一本书、一支笔、一个老朋友。它不联网,不汇报,不背叛。
本地AI最迷人的地方,不是性能,是主权。
你可以让它说任何话,问任何问题,探索任何想法。没有内容审查,没有使用政策,没有"根据相关法律法规"。
它是你的工具,不是公司的产品。
你可以微调它,让它学习你的说话方式、你的知识结构、你的价值观。它不会变成通用助手,它会变成你的数字延伸。
就像日记本,就像老照片,就像那把用了十年的吉他。
想象一下三年后的场景:
手机里的AI记得你所有的对话,但不上传任何数据
眼镜捕捉的画面,实时分析,实时反馈
手表监测的健康数据,本地处理,本地建议
所有设备互联,但数据不出你的控制范围
不是物联网,是"我的物"。
不是智能城市,是智能个人。不是大数据,是小数据——只属于你的数据。
这不是劝你放弃云端AI。
云端有云端的优势:更强的模型,更多的数据,更低的成本。有时候你需要它,就像有时候你需要图书馆、需要专家咨询、需要搜索引擎。
但选择权在你。
你可以选择什么时候用云端,什么时候用本地。什么时候分享,什么时候保留。什么时候连接世界,什么时候断开。
自由不是只用一种方式生活,是可以选择。
🔥 Qwen3.5-0.8B 介绍
Qwen3.5 系列是阿里云 2025 年推出的最新一代语言模型,0.8B 版本专为移动端设计:
-
架构:Transformer Decoder-only
-
上下文:32K tokens
-
词表:151,936 tokens
-
训练数据:2.5T tokens
效果的确很惊艳,主要是推理速度极快,AGI 能力优于之前的 LLaVA 太多。天下武功唯快不破,LLM 的速度再提升一些,很多端侧的本地模型就没有必要存在了(泛化能力不能比)。
📸AI眼镜
-
第一人称视角拍摄,轻量化,不影响日常工作
-
小米眼镜对开发者支持不足,没有找到无线获取眼镜上视频流的方案
-
长时间拍摄,眼镜的续航远不如手机,最终采用 USB 方案(顺便可以补电)
为什么没有手机设计2个Type-C接口?
🛠️ Termux 编译 llama.cpp 实战
Termux 是 Android 上的终端模拟器,提供完整的 Linux 环境。可以安装 gcc、python、git 等工具,相当于把手机变成迷你服务器。
采用 termux 方案可以分离大模型和具体应用APP,单机可用 127.0.0.1 访问保证安全,跨机协作可以暴露 IP,提供为本地算力,灵活度和兼容性都是最佳。
https://f-droid.org/en/packages/com.termux/
其他的端侧方案,让龙虾团队也同时测试了一下,目前很多还没有支持 qwen 3.5 新架构(比如ONNX,MNN)
| 排名 | 框架 | Qwen 支持 | 性能 | 推荐度 |
|---|---|---|---|---|
| 1 | MNN | ⭐⭐⭐⭐⭐ 官方支持 | 最优 | ✅ 首选 |
| 2 | MLC LLM | ⭐⭐⭐⭐⭐ 原生支持 | 优秀 | ✅ 备选 |
| 3 | llama.cpp | ⭐⭐⭐⭐ GGUF | 良好 | ⚠️ 需移植 |
| 4 | NCNN | ⭐⭐⭐ 社区 | 一般 | ❌ 不推荐 |
| 5 | ONNX | ⭐⭐⭐⭐ 良好 | 中等 | ⚠️ 包体大 |



前端 APP 采用通用 API 方式接入,按需切换云端,自部署或是手机算力。
量化方案
我们使用 GGUF 格式(llama.cpp 原生支持),由于手机资源足够,当前采用的是F16,还有多种量化精度可选:
| 量化 | 大小 | 精度损失 | 推荐 |
|---|---|---|---|
| Q4_K_M | ~500MB | < 1% | ✅ 平衡 |
| Q5_K_M | ~600MB | < 0.5% | 高质量 |
| Q3_K_M | ~400MB | ~2% | 省空间 |
vibe coding 时代,具体技术细节和代码就不发了(详见开源地址)
https://github.com/bluishfish/AIGlasses-local
懒得折腾的,也可以在公众号末尾链接,直接下载编译好的程序。
好吧,以上场景都是 AI 编的,整篇文章也充满了AI味。当 Agent 在跨领域的时候,比我们表现的更好了。我们应该在专业度上更上一层,才能真正地解决模型幻觉问题。
避雷
这里列出过程中遇到的几个小坑

-
llama-cli 可以直接手机上编译(必须开启跳过测试程序)
-DLLAMA_BUILD_TESTS=OFF
-
llama-server 在termux中编译通不过,可以选ndk交叉编译
-
opencl版本的GPU加速可行,但受限于termux发挥不出作用(开发者选项指定驱动程序)

-
Android中要对termux设置后台不休眠


termux-wake-lock
-
termux中开启共享目录来访问模型文件
termux-setup-storage
-
qwen3.5的架构改动很大,转换格式的时候需要指定
model type=none
-
视频的分辨率过高,直接放入大模型速度太慢(带思考推理1分钟以上),需要加前置预处理
-
高分辨率图片可以当ocr用,低分辨率则不行,而且推测的地点大概率是脑补(幻觉)





-
二维码是无法识别的(幻觉)



-
最后看一下外景实测的图片,感受一下模型能力












0.8b的表现已经足够惊艳,而24g内存的手机最多可以跑35b模型,要速度还是质量,都行。
多人旅游的场景,还能临时当智能热点,给团队的人员提供大模型服务。

若是远程自部署推理,0.8b 图像推理不到1秒。达到接近实时推理,这想象力就很大了。
最后,把这模型接入龙虾,一堆skill加强,有趣的事情开始了...


源码下载

本期相关文件资料,可在公众号“深度觉醒”,后台回复:“aiglasses”,获取下载链接。

更多推荐




所有评论(0)