開發者經常面對一個痛點:想讓 AI 模型直接控制電腦完成任務,例如瀏覽網頁、填寫表單或操作軟件,但傳統 API 限制令模型只能處理文字輸入,無法真正「看見」同「操作」桌面環境。自 Operating Computer 框架就針對呢個問題,提供一個開源解決方案,讓多模態模型如 GPT-4V 能夠透過視覺理解同滑鼠鍵盤控制,自主執行複雜電腦任務。呢個工具特別適合 AI 研究員、自動化工程師同希望建構智能代理嘅開發者,使用佢可以快速原型化 AI 電腦操作,而唔使從零寫低階控制代碼。
多模態模型 -m 模式下直接觀察同控制桌面
Self-Operating Computer 嘅核心在於 -m 參數啟動嘅多模態模型模式,佢會即時截取電腦畫面作為輸入,傳畀模型如 GPT-4V 分析。模型唔單止識別畫面元素,例如按鈕位置同文字內容,仲會生成精準嘅滑鼠點擊或鍵盤輸入指令。呢種設計讓 AI 能夠像真人咁操作系統,處理從簡單導航到複雜工作流程嘅各種任務。例如,想自動化一個網頁註冊流程,框架就會連續捕捉畫面、分析變化,並根據模型指令調整操作,大大減低開發者手動編寫腳本嘅負擔。

Voice Mode –voice 支援語音指令驅動電腦操作
開啟 –voice 模式後,用戶可以用自然語音下達指令,框架會將語音轉換成文字,再結合畫面輸入畀多模態模型處理。呢個功能特別實用喺 hands-free 場景,例如開發者邊講邊示範任務,AI 就會跟住語音即時執行電腦操作。相比純文字輸入,語音模式更流暢自然,適合建構語音助理或遠端控制系統。框架內置語音識別,確保指令準確傳達畀模型,同時畫面反饋讓操作過程透明可追蹤。
實際運作時,打開瀏覽器後輸入自訂指令如「打開 Google 搜尋 AI 框架」,模型就會自動點擊瀏覽器、輸入關鍵字同按 Enter,全部過程由畫面截圖驅動,無需額外插件。呢點喺同類工具中比較少見,因為多數框架只限於單一應用,Self-Operating Computer 則支援全桌面環境。
OCR 模式 -m gpt-4-with-ocr 精準識別畫面文字
對於畫面文字密集嘅任務,啟用 -m gpt-4-with-ocr 模式可以大幅提升識別準確度。呢個模式專門用 GPT-4 配 OCR 技術,先提取畫面所有文字,再結合視覺上下文畀模型決策。比起標準多模態輸入,OCR 模式處理細小字體或模糊畫面更可靠,例如喺 PDF 文件或舊式軟件介面中自動填表或搜尋內容。開發者可以用呢個功能自動化數據提取任務,節省大量手動勞動。
Set-of-Mark Prompting -m gpt-4-with-som 優化複雜任務提示
Set-of-Mark Prompting 模式(-m gpt-4-with-som)係框架嘅進階技巧,透過標記畫面關鍵元素(如用顏色框選按鈕),生成更結構化嘅提示畀模型。呢種方法解決咗多模態模型喺複雜介面中「迷失」嘅問題,例如長表格或多層菜單操作。標記系統自動生成,模型據此產生精準動作序列,適用於需要高可靠性嘅自動化流程。相比傳統提示工程,呢個模式更直觀,開發者只需簡單配置即可應用。
總括嚟講,Self-Operating Computer 提供咗一個靈活框架,讓多模態 AI 真正「自操作」電腦,從語音到視覺 OCR 再到標記提示,各模式互補,形成完整工具鏈。對於想探索 AI 代理嘅開發者,呢個 GitHub 項目值得一試。
產品名稱:Self-Operating Computer / self-operating-computer
官方網站:https://github.com/OthersideAI/self-operating-computer

