目录

手机也能跑大模型?从模型选择到部署的完整指南

手机跑大模型?先别急着说不可能

想象一下:你把 ChatGPT 装进手机里,不联网不收费不上传任何数据,它依然能陪你聊天、写文案、改代码——这就是端侧大模型的魅力。

2026 年,这不是科幻。参数 1B-4B 的小模型经过量化后,只需要 几百 MB 内存,在旗舰手机上能跑到 每秒 10-30 个 token(约等于"边想边说的语速")。

能跑什么模型?一张表说清楚

模型 参数量 量化后大小 内存需求 适合
Qwen2.5-0.5B 0.5B ~350MB 1GB 轻量对话、分类
Qwen2.5-1.5B 1.5B ~1GB 2GB 通用对话、摘要
Llama 3.2-1B 1B ~700MB 1.5GB 英文对话
Llama 3.2-3B 3B ~2GB 3GB 高质量英文对话
Phi-3-mini 3.8B ~2.3GB 4GB 逻辑推理、代码
Gemma 2B 2B ~1.4GB 2.5GB 多语言对话

选型口诀:内存是硬约束——模型量化后大小 × 2 + 1GB = 安全内存需求。6GB 内存的手机,最多带 2B 模型。

用什么框架?对比之后你会有答案

框架 平台 特点 GitHub
MLC-LLM iOS/Android/Web 有现成 App,NPU 加速最好 github.com/mlc-ai/mlc-llm
llama.cpp 全平台 最活跃,性能极致 github.com/ggml-org/llama.cpp
Ollama 桌面/服务器 一键部署,手机端需借壳 github.com/ollama/ollama

怎么选:想最快在手机上跑起来 → 直接用 MLC-LLM 的现成 App;想自己集成到 App 里 → 用 llama.cpp 的 C API 编译进项目;NAS/服务器上跑 → Ollama。

实战:MLC-LLM 跑起来(最快路径)

第一步,在手机上装 MLC Chat App(App Store / 应用商店搜 “MLC Chat”)。

第二步,App 内选择模型下载。以 Qwen2.5-1.5B-Instruct-q4f16 为例,下载约 1GB。

第三步,直接开聊。看右上角的速度指标,一般 8GB 内存的手机能到 15-25 tokens/s

进阶:量化是什么?为什么模型能变小一半

量化就像把高清照片压成 JPG:模型权重原来用 4 字节(FP32)存,量化成 2 字节(FP16)或 0.5 字节(INT4),体积和内存占用骤降,换来一点点精度损失。

1
2
# 用 llama.cpp 的量化工具(桌面端示例)
./llama-quantize qwen2.5-1.5b-fp16.gguf qwen2.5-1.5b-q4_k_m.gguf Q4_K_M
  • Q4_K_M:4-bit 量化,体积小、速度快的平衡选择(推荐)
  • Q8_0:8-bit 量化,质量高但更大
  • 建议直接下社区量化好的 GGUF 文件,不用自己量化

踩坑提醒

  1. 别在 WebView 里跑——性能差一倍,用原生集成
  2. 发热是正常的——端侧推理吃 CPU/GPU,跑 10 分钟以上建议暂停
  3. 中文模型优先 Qwen 系——Llama 系中文能力明显偏弱
  4. 首 token 慢是通病——长 prompt 预填充慢,短对话体验最好

下一步

手机跑通之后,可以试试把模型接到你 App 里(llama.cpp C API 集成),或者让模型调用本地工具(配合 Agent 框架)——那是下一篇的话题了。