開發者經常喺手機 app 入面想用上 Segment Anything Model (SAM) 嚟做圖像分割,但原版模型太大太慢,喺移動設備上跑唔起嚟,導致 app 反應遲鈍甚至 crash。MobileSAM 就係專門解決呢個痛點嘅開源項目,將 SAM 壓縮到適合手機運行嘅輕量版,面向 app 開發者同 AI 研究者,讓佢哋可以喺 iOS 或 Android 上即時分割圖像物件,而唔使犧牲太多準確度。
將 SAM 模型大小壓縮到原版 1/20 以下
MobileSAM 嘅最大亮點係透過知識蒸餾 (knowledge distillation) 技術,將原版 SAM 嘅 image encoder 由 93M 參數壓縮到只剩 4.4M,總模型大小由 2.4GB 減到 119MB,相當於原版嘅 1/20。呢個轉變令到模型可以輕鬆裝入手機記憶體,運行速度大幅提升。原本喺桌面 GPU 上先玩得起嘅 SAM,依家喺 CPU 上都可以流暢運作,特別適合資源有限嘅移動環境。

在手機上實現與原版 SAM 相若分割精度
雖然模型大幅瘦身,但 MobileSAM 保留咗原版 SAM 嘅核心能力,喺多個圖像分割基準測試上,精度只掉咗少少,例如喺 SA-1B 數據集上 mIoU 維持喺高水平。呢個平衡係透過師徒訓練模式達成:用完整 SAM 作為 teacher,指導輕量版學生模型學習分割 mask 生成。開發者可以用 prompt 如點擊或框選,快速生成物件遮罩,應用喺 AR 濾鏡、圖像編輯或物件偵測等場景。
實際運行數據顯示,MobileSAM 喺 iPhone 12 上處理一張圖像只需 1.35 秒,遠快過原版嘅數分鐘。呢種速度提升唔單止改善用戶體驗,仲開拓咗新應用,例如即時相機 app 內嘅背景移除或物件追蹤。
開源代碼支援多種部署框架同自訂訓練
項目提供完整 PyTorch 代碼,包括預訓練模型下載、推理 demo 同訓練腳本。開發者可以直接用 ONNX 或 TensorRT 轉換格式,部署到 Android Neural Networks API 或 iOS Core ML。GitHub 頁面仲有詳細 benchmark 表格,比較唔同硬體上嘅速度同精度,讓你快速評估適合自己項目。
對於想微調模型嘅研究者,MobileSAM 支援自訂數據集訓練,只需準備提示點同 mask 標註,就可以生成專屬模型。呢個彈性令到項目唔止係工具,仲係 AI 開發嘅起點,特別喺邊緣計算同移動 AI 領域。
輕鬆整合到移動 app 提升圖像處理能力
用 MobileSAM,app 開發者可以喺幾行代碼內嵌入 SAM 功能,例如喺相機預覽中點擊物件就自動分割。相比傳統圖像處理庫,佢嘅 zero-shot 能力更強,唔使逐個物件訓練偵測器。項目仲提供 assets 資料夾內嘅圖表示例,展示從輸入圖像到輸出 mask 嘅全過程,直觀易上手。
總括嚟講,MobileSAM 將高階圖像分割帶到大眾移動應用時代,解決咗模型部署嘅最大障礙。無論係獨立 app 定係 SDK 整合,都能顯著提升產品競爭力。
產品名稱:MobileSAM
官方網站:https://github.com/ChaoningZhang/MobileSAM

