想像你喺設計圖像或者編輯相片時,要精準選取圖入面嘅「紅色跑車」或者「藍天白雲」,但傳統工具總係要手動畫框或者掙扎咁用魔法棒,浪費好多時間。Grounded SAM 就係專為呢啲痛點而生嘅開源工具,結合咗 Grounding DINO、Segment Anything 同 Stable Diffusion 等頂尖模型,讓你只用文字描述,就能自動偵測、分割甚至生成指定物件。呢個工具特別適合圖像處理開發者、設計師同 AI 愛好者,幫佢哋喺幾秒內完成複雜任務,大大提升工作效率。
GroundingDINO 用文字提示偵測圖像中任何物件
Grounded SAM 嘅基礎來自 Grounding DINO 模型,呢個部分專注於用自然語言文字提示,喺圖像中偵測出你想要嘅物件。例如輸入「一隻貓」或者「停泊嘅船隻」,佢就會自動框出所有符合描述嘅區域,唔使再靠顏色或者形狀手動篩選。呢種 open-vocabulary 偵測方式,比傳統物件偵測器更靈活,因為佢唔限於預定義類別,你可以隨意描述任何東西,從日常物品到抽象概念。
喺實際操作上,你只需載入圖像同輸入提示詞,模型就會即時生成邊界框(bounding box),準確率高達專業級別。對於開發者嚟講,呢個功能透過簡單嘅 Python 指令就能整合落自己嘅 workflow,省卻大量預處理步驟。

Grounded-SAM 結合文字提示實現精準物件分割
偵測完物件之後,Grounded-SAM 會自動銜接 Segment Anything 模型,將邊界框轉化成像素級精準遮罩(mask)。呢個步驟解決咗傳統偵測只給粗略框嘅問題,讓你得到乾淨嘅物件輪廓,例如完美分割出行駛中嘅汽車,而唔會夾帶背景雜物。整個流程只需一次文字提示,模型會自動生成多個候選遮罩,你可以選擇最適合嘅一個。
相比單獨使用 Segment Anything,Grounded-SAM 嘅優勢在於加入咗文字引導,避免咗點擊點選嘅麻煩。呢個功能喺影像編輯軟件或者自動化 pipeline 中特別實用,例如快速移除圖像中嘅不需要元素,或者為後續生成任務準備素材。
內填功能偵測分割後自動生成新內容填補空白
Grounded SAM 最強大嘅延伸係整合 Stable Diffusion 嘅內填(inpainting)功能。完成分割後,你可以指定文字提示,例如「用綠色草地取代」,模型就會智能生成新內容填補空白區域,確保過渡自然無痕。呢個流程從偵測到生成一氣呵成,適用於創意編輯如替換背景或者物件替換。
另外,Recognize Anything 模型進一步提升咗辨識準確度,讓複雜場景下嘅物件更容易被捕捉。對於藝術家或者內容創作者,呢種全自動生成能力意味住可以快速迭代設計原型,而唔使依賴 Photoshop 等專業軟件。
Gradio APP 提供直觀介面快速上手測試
為了方便非開發者,Grounded-SAM 內建 Gradio web 介面,只需幾個指令就能啟動本地 APP。打開瀏覽器,上傳圖像、輸入提示詞,按鈕一 click 就見到偵測、分割同內填結果。支援 Docker 一鍵安裝,即使冇 NVIDIA GPU 環境,都可以用 CPU 模式運行,雖然速度稍慢。
呢個 APP 仲允許調整參數如信心閾值或者遮罩精細度,讓用戶微調輸出。無論係研究 prototype 或者日常實驗,都能即時預覽效果,降低咗 AI 工具嘅入門門檻。
產品名稱:Grounded SAM / Grounded-Segment-Anything
官方網站:https://github.com/IDEA-Research/Grounded-Segment-Anything

