手机也能跑大模型?从模型选择到部署的完整指南
目录
手机跑大模型?先别急着说不可能
想象一下:你把 ChatGPT 装进手机里,不联网、不收费、不上传任何数据,它依然能陪你聊天、写文案、改代码——这就是端侧大模型的魅力。
2026 年,这不是科幻。参数 1B-4B 的小模型经过量化后,只需要 几百 MB 内存,在旗舰手机上能跑到 每秒 10-30 个 token(约等于"边想边说的语速")。
能跑什么模型?一张表说清楚
| 模型 | 参数量 | 量化后大小 | 内存需求 | 适合 |
|---|---|---|---|---|
| Qwen2.5-0.5B | 0.5B | ~350MB | 1GB | 轻量对话、分类 |
| Qwen2.5-1.5B | 1.5B | ~1GB | 2GB | 通用对话、摘要 |
| Llama 3.2-1B | 1B | ~700MB | 1.5GB | 英文对话 |
| Llama 3.2-3B | 3B | ~2GB | 3GB | 高质量英文对话 |
| Phi-3-mini | 3.8B | ~2.3GB | 4GB | 逻辑推理、代码 |
| Gemma 2B | 2B | ~1.4GB | 2.5GB | 多语言对话 |
选型口诀:内存是硬约束——模型量化后大小 × 2 + 1GB = 安全内存需求。6GB 内存的手机,最多带 2B 模型。
用什么框架?对比之后你会有答案
| 框架 | 平台 | 特点 | GitHub |
|---|---|---|---|
| MLC-LLM | iOS/Android/Web | 有现成 App,NPU 加速最好 | github.com/mlc-ai/mlc-llm |
| llama.cpp | 全平台 | 最活跃,性能极致 | github.com/ggml-org/llama.cpp |
| Ollama | 桌面/服务器 | 一键部署,手机端需借壳 | github.com/ollama/ollama |
怎么选:想最快在手机上跑起来 → 直接用 MLC-LLM 的现成 App;想自己集成到 App 里 → 用 llama.cpp 的 C API 编译进项目;NAS/服务器上跑 → Ollama。
实战:MLC-LLM 跑起来(最快路径)
第一步,在手机上装 MLC Chat App(App Store / 应用商店搜 “MLC Chat”)。
第二步,App 内选择模型下载。以 Qwen2.5-1.5B-Instruct-q4f16 为例,下载约 1GB。
第三步,直接开聊。看右上角的速度指标,一般 8GB 内存的手机能到 15-25 tokens/s。
进阶:量化是什么?为什么模型能变小一半
量化就像把高清照片压成 JPG:模型权重原来用 4 字节(FP32)存,量化成 2 字节(FP16)或 0.5 字节(INT4),体积和内存占用骤降,换来一点点精度损失。
|
|
Q4_K_M:4-bit 量化,体积小、速度快的平衡选择(推荐)Q8_0:8-bit 量化,质量高但更大- 建议直接下社区量化好的 GGUF 文件,不用自己量化
踩坑提醒
- 别在 WebView 里跑——性能差一倍,用原生集成
- 发热是正常的——端侧推理吃 CPU/GPU,跑 10 分钟以上建议暂停
- 中文模型优先 Qwen 系——Llama 系中文能力明显偏弱
- 首 token 慢是通病——长 prompt 预填充慢,短对话体验最好
下一步
手机跑通之后,可以试试把模型接到你 App 里(llama.cpp C API 集成),或者让模型调用本地工具(配合 Agent 框架)——那是下一篇的话题了。