端侧实例分割实战:YOLO26-seg 与 MobileSAM 部署到 iPhone
从检测框到像素级轮廓
目标检测输出的是矩形框,实例分割输出的则是物体轮廓的像素级掩码。同一个画面,检测告诉你这里有个人,分割告诉你这个人具体占哪些像素。多出的这层信息,直接解锁三类端侧应用:
目标检测输出的是矩形框,实例分割输出的则是物体轮廓的像素级掩码。同一个画面,检测告诉你这里有个人,分割告诉你这个人具体占哪些像素。多出的这层信息,直接解锁三类端侧应用:
本周 GitHub Trending 最大的看点是 DeepSeek Harness 生态集中爆发:官方框架上线 4 天即破 13 万 star,桌面端、Web UI、插件精选列表同周发布。此外 AI 水印去除工具、MiniMax 新仓库与 macOS Swift 时间追踪应用也值得关注。
相册问答、无障碍场景描述、离线扫描件转结构化信息、儿童教育里的看图说话……这些任务以前要发云端 API,现在可以整体搬到设备上。端侧视觉语言模型(VLM)的好处很直接:照片不出设备(隐私合规)、无网可用、单次推理成本为零、延迟稳定在几十到几百毫秒。
门禁考勤、相册聚类、刷脸支付,人脸识别是端侧视觉里商业价值最高的任务之一。相比云服务,端侧方案把照片留在设备里,离线可用,单次推理成本为零,隐私合规压力也小——这在 2026 年越来越重要。
上次我们用 INT8 量化把 MobileNetV2 从 14 MB 压到 3.5 MB(见端侧模型 INT8 量化实战 )。但量化是事后减肥:模型该多大还多大,该多笨还多笨。今天聊另一种压缩思路——知识蒸馏(Knowledge Distillation),它发生在训练阶段:让小模型拜大模型为师,直接把大模型脑子里的判断力继承下来。
一句话概括:量化管体积,蒸馏管智商。两者不冲突,先蒸馏再量化,是端侧部署的标准组合拳。
模型训练完只是第一步,把它塞进手机、嵌入式设备、NAS 才是真正的考验。推理框架选错,后面转换报错、性能不达标、平台不支持,全部返工。本文用一张对比表加一个决策树,帮你十分钟定下框架选型。
本周 GitHub Trending 共收录 14 个热门项目:AI Agent 技能生态持续爆发(写作润色、PPT 生成、视频制作、增长黑客),Kimi K3 纯 C 实现单 CPU 推理引发关注,还有多款 macOS Swift 工具上榜。
智能音箱、车载助手、会议耳机——只要涉及语音交互,第一个问题都是:怎么知道用户开始说话了?
最笨的方案是全时跑 ASR。但上一篇里那个 24MB 的 int8 识别模型,全时转写依然会吃掉可观的 CPU 和电量。更聪明的做法是三级接力:
OCR(光学字符识别)是把图片里的文字变成可编辑文本的技术,证件识别、票据录入、截图翻译、扫码枪背后都是它。过去主流做法是调云端 API,但端侧 OCR 有三个硬优势:
健身 App 的深蹲计数、体感游戏的角色控制、运动康复的关节角度分析、儿童体态监测——这些场景的共同点是需要实时追踪人体骨架,而画面里全是敏感的身体信息。把姿态估计模型跑在设备端,视频不出手机,延迟低到能跟上 30fps 的视频流,还不用为每次推理付云服务费。这就是端侧姿态估计(On-Device Pose Estimation)的价值。