端侧AI实践者 | 在锁死NPU的旗舰机上,把9B模型跑到10 tok/s
用真机实测数据说话:量化方案、推理性能、部署工具链——每一行结论都来自自己的手机。 已实证:本机 NPU(fastrpc-cdsp)被厂商锁死,第三方无法访问——完整探测记录将整理成文。CPU 推理是我的主场。
- llama.cpp 移动端部署工具链:让 9B 级模型在手机上"一条命令启动"
- 量化方案 benchmark:Q4 vs Q5 的速度/内存/质量三角实测(多模型对比中)
- 端侧AI产品研究:拆解手机厂商的端侧大模型方案(蓝心 / YOYO / Apple Intelligence)
| 项目 | 配置 |
|---|---|
| 设备 | vivo V2505A(骁龙 8 Elite / 16GB RAM) |
| 推理引擎 | llama.cpp(本地编译) |
| 常用模型 | Qwen3.5-9B 系列 · DeepSeek-R1-Distill-7B |
| 量化方案 | Q4_K_M / Q5_K_M 实测对比 |
AI产品经理(端侧方向)· 解决方案 ——最懂端侧部署的AI产品经理,正在路上。
Shenzhen, China
此主页随实验进度持续更新。当前版本:v1(2026.8)
