TurboFieldfare 評價:自訂 Metal 推理引擎喺 Apple Silicon 8GB MacBook 跑 Gemma 4 26B 大語言模型

2026 年 7 月,獨立開發者 Andrey Mikhaylov 喺 GitHub 開源咗 TurboFieldfare,呢個項目用自訂 Swift + Metal runtime,將 Google 嘅 Gemma 4 26B-A4B 指令微調模型喺 Apple Silicon Mac 上跑,RAM 用量大約只係 2GB。對於只有 8GB 記憶體嘅 M2 MacBook Air 用戶,呢個項目等於將本地 LLM 推理門檻大幅降低。

TurboFieldfare 唔係簡單包裝 MLX 或 llama.cpp,而係完全獨立嘅 Swift + Metal 推理引擎。項目嘅核心思路係用 mixture-of-experts 架構加 SSD streaming:常駐共享部分大約 1.35GB 喺 RAM,每次只有需要嘅 routed experts 從 SSD 串流讀入記憶體。呢個設計將完整模型嘅 14.3GB 重量,壓縮到大約 2GB 嘅 RAM 使用量,降幅大約 7 倍。

TurboFieldfare 技術規格

TurboFieldfare 針對 Apple Silicon 設計,需要 macOS 26、Metal 4、Swift 6.2 或以上。模型採用 Gemma 4 26B-A4B IT 版本,總共 260 億個參數,但每個 token 只啟動大約 38.8 億個 active parameters。權重量化採用 MLX affine 4-bit、group 64,router 用 8-bit,shared 同 routed experts 都係 4-bit。

  • Model: Gemma 4 26B-A4B IT,總計 26B 參數,每 token 約 3.88B active
  • Weights: MLX affine 4-bit、group 64;8-bit router;4-bit shared 同 routed experts
  • 記憶體用量:~2GB 權重 + 4K KV cache
  • 儲存空間:text model 約 14.3GB,optional vision pack 多 1.1GB
  • 硬件需求:Apple Silicon Mac,最低 8GB RAM
  • 系統要求:macOS 26、Metal 4、Swift 6.2 或以上

3 個硬件嘅實際 decode 速度

項目喺 README 詳細列出多個 Apple Silicon 裝置嘅測試結果,顯示速度同硬件強弱成正比。透過 SSD streaming 機制,即使係 8GB 入門級 MacBook Air 都可以跑出接近 5-6 tokens/sec,足以應付一般對話同文字生成需求。

硬件型號RAMDecode 速度 (tokens/sec)備註
M2 MacBook Air8 GB5.1 – 6.3項目驗證嘅最低配置
M5 Pro24 GB31 – 35頂級速度
M3 Max未明可能為 23 (原 clip 示範數字,可能未經項目層級獨立驗證)原始短片數字

M5 Pro 嘅 31-35 tokens/sec 速度屬於項目層級驗證,而 M3 Max 嘅 23 tokens/sec 可能只係來自原始短片,README 並未獨立驗證呢個數字。實際速度受 prompt 長度、生成長度、page-cache 狀態影響,而非單純線性對應硬件等級。

兩層架構:RAM 內 1.35GB + SSD 12.9GB

TurboFieldfare 採用 mixture-of-experts 架構,將 Gemma 4 模型嘅權重切成兩個 pile。常駐嗰 1.35GB 包括共享核心同 FP16 KV cache,呢部分要快取喺 RAM 俾 GPU 直接存取;其餘大約 12.9GB 嘅 routed experts 就放喺 SSD,生成每個 token 時只串流嗰幾個需要嘅 expert 區塊。

呢個設計直接挑戰傳統思維:本來以為 26B 模型一定要 52GB 嘅 VRAM + RAM 先跑得起,TurboFieldfare 證明只要識得 mixture-of-experts 嘅 sparse activation 特性,就可以將 RAM 用量壓到 1.35GB。雖然每個 token 都要去 SSD 攞專家權重,但透過 LFU expert cache 加 chunked prefill 嘅設計,實際效能仍然可以用。

6 個產品介面

TurboFieldfare 唔止係單一 CLI,項目提供 6 個獨立產品俾唔同使用情境,全部共用同一個 .gturbo 模型目錄,但同一時間只應該運行一個 model-owning 產品。

  • TurboFieldfare:Swift library 包含 runtime 同 Metal kernels
  • TurboFieldfareMac:原生 Mac 應用,提供安裝同生成介面
  • TurboFieldfareDecodeService:Mac app 嘅 decode service 部件
  • TurboFieldfareCLI:命令行工具,支援 instruction chat 同 raw completion
  • TurboFieldfareServer:loopback OpenAI-compatible 伺服器,監聽 127.0.0.1:8080/v1
  • TurboFieldfareRepack:streaming 模型安裝器同安裝驗證工具

從 Hugging Face streaming 安裝模型

第一次運行時,Swift Package Manager 會下載並編譯 tokenizer 所需嘅 Swift packages。Mac app 嘅下載流程用 streaming installer 設計,只攞需要嘅 byte ranges,直接 repack 成 .gturbo 格式,避免咗先存完整 checkpoint 再處理嘅雙倍儲存開銷。安裝過程需要大約 15GB 流量透過 Hugging Face range requests,完成後 .gturbo 目錄佔用約 14.3GB 磁碟空間。

Streaming 設計嘅另一個好處係記憶體有界:即使係 8GB RAM 嘅機器,安裝過程都唔會將整個 checkpoint 載入 RAM,而係逐範圍下載並驗證 manifest 同 file hashes。Mac app 嘅圖像支援 vision tower 屬於 optional companion pack,安裝後會多 1.1GB,要求 M2 或更新嘅 Apple Silicon Mac。

本地 OpenAI 相容 API 伺服器

TurboFieldfare 內建 OpenAI-compatible 伺服器,監聽 127.0.0.1:8080/v1,支援 Chat Completions、streaming、function tools 同 single-prefix prompt reuse。用戶端需要自行授權同執行每個 tool call,因為伺服器只負責生成模型嘅 tool calls,實際執行係用戶端嘅責任。文件明顯提醒:keep the server on loopback; it has no remote authentication or TLS,即係伺服器無遠端認證或加密,只應該喺 loopback 用。

與 llama.cpp / MLX 嘅分別

  1. TurboFieldfare 唔係 MLX 或 llama.cpp 嘅包裝,而係完全獨立嘅 Swift + Metal runtime
  2. 針對 Gemma 4 26B-A4B 呢個特定模型度身訂造,而非通用 framework
  3. SSD streaming 透過 .gturbo 格式,直接由 Metal kernel 讀 SSD 數據
  4. cb1/io/cb2 三階段 pipeline 將磁碟讀取隱藏喺 shared expert 運算之後
  5. 16-slot LFU expert cache 處理 cache miss,連續 miss 用 bounded parallel pread
  6. chunked prefill 每次最多 128 tokens,同一個 fetched expert 可以服務多個 rows

使用注意事項

  1. Project 仍然係獨立研究項目,作者明確表示 not affiliated with, sponsored by, or endorsed by Google
  2. Model weights 並未包含喺 repository,要由 Hugging Face 下載,而 weights 仍受 Gemma 原本嘅 license 條款約束
  3. Package 只支援 arm64,舊版 macOS 同 Metal 版本並唔支援
  4. 執行推理前應該關閉其他吃 RAM 嘅 app 並用 memory_pressure -Q 檢查狀態
  5. 同時只應該運行一個 TurboFieldfare app、decode service、CLI、server、test 或其他 local-model process
  6. 文字輸出預設 temperature 0.2、Top-K 64、Top-P 0.95,設定 temperature 0 可得到 deterministic greedy output

觀察與影響:本地 LLM 用戶角度

TurboFieldfare 證明咗只要識得善用 mixture-of-experts 架構嘅 sparse activation 特性,就可以將大模型嘅 RAM 需求大幅降低,讓 8GB MacBook Air 用戶都玩得起 26B 等級嘅本地 LLM。項目雖然仍係獨立研究性質,但對 on-device AI 社群嘅技術示範價值好高,尤其係作者用 Metal 直接寫 kernel,而非依賴 MLX 或 llama.cpp 嘅做法,值得 Metal 同 Swift 工程師參考。

對於追求私隱、低延遲、零 API 成本嘅本地 AI 用戶,TurboFieldfare 係 2026 年下半年度嘅實用選擇,但要留意項目仍然係單一開發者維護,而非大型團隊產品。項目採用 Apache License 2.0 開源,即使 Turb oFieldfare 將來停滯,Gemma 4 嘅 .gturbo 格式思路都可以作為其他本地推理項目嘅參考。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)