想像你喺剪輯影片時,要逐 frame 手動標記移動物件,特別係複雜場景如人群或動物追逐,呢個過程往往耗時數小時。Segment-and-Track-Anything 就係一款開源工具,專門解決呢個痛點,讓用戶自動或互動式分割同追蹤影片中任意物件。無論係研究員、影片編輯師定 AI 開發者,都可以用佢快速處理 video segmentation 任務,結合 SAM 模型嘅精準關鍵幀分割同 AOT 嘅高效追蹤,大幅提升工作效率。
SAM 關鍵幀分割結合 AOT 高效追蹤
呢個工具嘅核心在於將 Segment Anything Model (SAM) 用喺關鍵幀上,先精準分割出目標物件。之後再透過 Associating Objects with Transformers (AOT) 算法,將分割結果傳播到後續幀,实现高效追蹤。呢種組合方式避免咗傳統方法每幀重複計算嘅低效,特別適合長影片處理。用戶只需喺第一幀點擊或框選,系統就會自動跟蹤物件移動,即使背景變化或物件變形,都能保持準確性。

一鍵啟動 Demo 快速體驗自動分割
打開工具後,用戶可以直接運行 Demo 模式,upload 影片檔案,系統就會自動偵測並分割主要物件。呢個過程唔使複雜設定,適合初學者即時測試效果。例如喺運動賽事影片中,佢能自動追蹤球員或球體,輸出 mask 同 tracking 結果。相比純手動工具,呢種自動化大大縮短咗準備時間,讓你專注喺後續分析或特效應用。
Demo 支援互動調整,如果你對自動結果唔滿意,可以喺關鍵幀手動修正,之後 AOT 會即時更新整個序列。呢個彈性設計,令工具適用於從簡單 demo 到專業製作嘅各種需求。
WebUI 介面簡化模型準備同部署
工具提供 WebUI App,讓用戶透過瀏覽器操作,唔使深入命令列。喺模型準備階段,先 download SAM 同 AOT 預訓練權重,放入指定資料夾,之後啟動 docker 檔或本地腳本,就能運行。呢個流程清晰,即使冇 docker 經驗,都能跟住指引一步步完成。WebUI 內建影片上傳、物件選擇同即時預覽功能,輸出結果可直接 export 為影片或圖像序列。
相比其他開源 segmentation 項目,Segment-and-Track-Anything 喺整合 SAM 與 AOT 上更為流暢,特別係 propagation 階段嘅速度優化,讓高解析度影片追蹤都保持實時性。研究員可以用佢生成 dataset 標註,影片工作者則可用來製作動態 matting。
開源環境下滿足多種部署需求
項目支援標準 requirements 安裝,包括 Python 環境同相關套件,確保跨平台相容。無論係本地 GPU 加速定雲端運行,都能輕鬆適配。關於團隊資訊,項目由 z-x-yang 主導,歡迎貢獻者參與,持續更新演算法同 UI 改進。呢種開源模式,令工具保持活躍發展,未來可能加入更多模型支援。
產品名稱:Segment-and-Track-Anything
官方網站:https://github.com/z-x-yang/Segment-and-Track-Anything

