https://www.gravatar.com/avatar/7a0c24f697ea1587001c36d00039b60f?s=240&d=mp

端侧视觉语言模型实战:用 MiniCPM-V 4.6 给 App 装上看图能力

为什么要把看图能力塞进手机

相册问答、无障碍场景描述、离线扫描件转结构化信息、儿童教育里的看图说话……这些任务以前要发云端 API,现在可以整体搬到设备上。端侧视觉语言模型(VLM)的好处很直接:照片不出设备(隐私合规)、无网可用、单次推理成本为零、延迟稳定在几十到几百毫秒。

端侧人脸识别实战:MobileFaceNet 特征向量与 1:N 检索落地指南

为什么人脸识别特别适合端侧

门禁考勤、相册聚类、刷脸支付,人脸识别是端侧视觉里商业价值最高的任务之一。相比云服务,端侧方案把照片留在设备里,离线可用,单次推理成本为零,隐私合规压力也小——这在 2026 年越来越重要。

端侧模型知识蒸馏实战:把大模型的本事教给手机小模型

上次我们用 INT8 量化把 MobileNetV2 从 14 MB 压到 3.5 MB(见端侧模型 INT8 量化实战 )。但量化是事后减肥:模型该多大还多大,该多笨还多笨。今天聊另一种压缩思路——知识蒸馏(Knowledge Distillation),它发生在训练阶段:让小模型拜大模型为师,直接把大模型脑子里的判断力继承下来。

一句话概括:量化管体积,蒸馏管智商。两者不冲突,先蒸馏再量化,是端侧部署的标准组合拳。

端侧唤醒词检测实战:给语音助手装上离线守门员

为什么语音助手需要一个守门员

智能音箱、车载助手、会议耳机——只要涉及语音交互,第一个问题都是:怎么知道用户开始说话了?

最笨的方案是全时跑 ASR。但上一篇里那个 24MB 的 int8 识别模型,全时转写依然会吃掉可观的 CPU 和电量。更聪明的做法是三级接力:

端侧 OCR 实战:RapidOCR 与 Apple Vision 让应用离线读懂图片文字

端侧 OCR 实战:RapidOCR 与 Apple Vision 让应用离线读懂图片文字

OCR(光学字符识别)是把图片里的文字变成可编辑文本的技术,证件识别、票据录入、截图翻译、扫码枪背后都是它。过去主流做法是调云端 API,但端侧 OCR 有三个硬优势:

端侧姿态估计实战:用 MediaPipe Pose Landmarker 给应用装上骨架追踪

为什么要在端侧做姿态估计

健身 App 的深蹲计数、体感游戏的角色控制、运动康复的关节角度分析、儿童体态监测——这些场景的共同点是需要实时追踪人体骨架,而画面里全是敏感的身体信息。把姿态估计模型跑在设备端,视频不出手机,延迟低到能跟上 30fps 的视频流,还不用为每次推理付云服务费。这就是端侧姿态估计(On-Device Pose Estimation)的价值。