2026 年 7 月,獨立開發者 Andrey Mikhaylov 喺 GitHub 開源咗 TurboFieldfare,呢個項目用自訂 Swift + Metal runtime,將 Google 嘅 Gemma 4 26B-A4B 指令微調模型喺 Apple Silicon Mac 上跑,RAM 用量大約只係 2GB。對於只有 8GB 記憶體嘅 M2 MacBook Air 用戶,呢個項目等於將本地 LLM 推理門檻大幅降低。
TurboFieldfare 唔係簡單包裝 MLX 或 llama.cpp,而係完全獨立嘅 Swift + Metal 推理引擎。項目嘅核心思路係用 mixture-of-experts 架構加 SSD streaming:常駐共享部分大約 1.35GB 喺 RAM,每次只有需要嘅 routed experts 從 SSD 串流讀入記憶體。呢個設計將完整模型嘅 14.3GB 重量,壓縮到大約 2GB 嘅 RAM 使用量,降幅大約 7 倍。
TurboFieldfare 技術規格
TurboFieldfare 針對 Apple Silicon 設計,需要 macOS 26、Metal 4、Swift 6.2 或以上。模型採用 Gemma 4 26B-A4B IT 版本,總共 260 億個參數,但每個 token 只啟動大約 38.8 億個 active parameters。權重量化採用 MLX affine 4-bit、group 64,router 用 8-bit,shared 同 routed experts 都係 4-bit。
- Model: Gemma 4 26B-A4B IT,總計 26B 參數,每 token 約 3.88B active
- Weights: MLX affine 4-bit、group 64;8-bit router;4-bit shared 同 routed experts
- 記憶體用量:~2GB 權重 + 4K KV cache
- 儲存空間:text model 約 14.3GB,optional vision pack 多 1.1GB
- 硬件需求:Apple Silicon Mac,最低 8GB RAM
- 系統要求:macOS 26、Metal 4、Swift 6.2 或以上
3 個硬件嘅實際 decode 速度
項目喺 README 詳細列出多個 Apple Silicon 裝置嘅測試結果,顯示速度同硬件強弱成正比。透過 SSD streaming 機制,即使係 8GB 入門級 MacBook Air 都可以跑出接近 5-6 tokens/sec,足以應付一般對話同文字生成需求。
| 硬件型號 | RAM | Decode 速度 (tokens/sec) | 備註 |
|---|---|---|---|
| M2 MacBook Air | 8 GB | 5.1 – 6.3 | 項目驗證嘅最低配置 |
| M5 Pro | 24 GB | 31 – 35 | 頂級速度 |
| M3 Max | 未明 | 可能為 23 (原 clip 示範數字,可能未經項目層級獨立驗證) | 原始短片數字 |
M5 Pro 嘅 31-35 tokens/sec 速度屬於項目層級驗證,而 M3 Max 嘅 23 tokens/sec 可能只係來自原始短片,README 並未獨立驗證呢個數字。實際速度受 prompt 長度、生成長度、page-cache 狀態影響,而非單純線性對應硬件等級。
兩層架構:RAM 內 1.35GB + SSD 12.9GB
TurboFieldfare 採用 mixture-of-experts 架構,將 Gemma 4 模型嘅權重切成兩個 pile。常駐嗰 1.35GB 包括共享核心同 FP16 KV cache,呢部分要快取喺 RAM 俾 GPU 直接存取;其餘大約 12.9GB 嘅 routed experts 就放喺 SSD,生成每個 token 時只串流嗰幾個需要嘅 expert 區塊。
呢個設計直接挑戰傳統思維:本來以為 26B 模型一定要 52GB 嘅 VRAM + RAM 先跑得起,TurboFieldfare 證明只要識得 mixture-of-experts 嘅 sparse activation 特性,就可以將 RAM 用量壓到 1.35GB。雖然每個 token 都要去 SSD 攞專家權重,但透過 LFU expert cache 加 chunked prefill 嘅設計,實際效能仍然可以用。
6 個產品介面
TurboFieldfare 唔止係單一 CLI,項目提供 6 個獨立產品俾唔同使用情境,全部共用同一個 .gturbo 模型目錄,但同一時間只應該運行一個 model-owning 產品。
- TurboFieldfare:Swift library 包含 runtime 同 Metal kernels
- TurboFieldfareMac:原生 Mac 應用,提供安裝同生成介面
- TurboFieldfareDecodeService:Mac app 嘅 decode service 部件
- TurboFieldfareCLI:命令行工具,支援 instruction chat 同 raw completion
- TurboFieldfareServer:loopback OpenAI-compatible 伺服器,監聽 127.0.0.1:8080/v1
- TurboFieldfareRepack:streaming 模型安裝器同安裝驗證工具
從 Hugging Face streaming 安裝模型
第一次運行時,Swift Package Manager 會下載並編譯 tokenizer 所需嘅 Swift packages。Mac app 嘅下載流程用 streaming installer 設計,只攞需要嘅 byte ranges,直接 repack 成 .gturbo 格式,避免咗先存完整 checkpoint 再處理嘅雙倍儲存開銷。安裝過程需要大約 15GB 流量透過 Hugging Face range requests,完成後 .gturbo 目錄佔用約 14.3GB 磁碟空間。
Streaming 設計嘅另一個好處係記憶體有界:即使係 8GB RAM 嘅機器,安裝過程都唔會將整個 checkpoint 載入 RAM,而係逐範圍下載並驗證 manifest 同 file hashes。Mac app 嘅圖像支援 vision tower 屬於 optional companion pack,安裝後會多 1.1GB,要求 M2 或更新嘅 Apple Silicon Mac。
本地 OpenAI 相容 API 伺服器
TurboFieldfare 內建 OpenAI-compatible 伺服器,監聽 127.0.0.1:8080/v1,支援 Chat Completions、streaming、function tools 同 single-prefix prompt reuse。用戶端需要自行授權同執行每個 tool call,因為伺服器只負責生成模型嘅 tool calls,實際執行係用戶端嘅責任。文件明顯提醒:keep the server on loopback; it has no remote authentication or TLS,即係伺服器無遠端認證或加密,只應該喺 loopback 用。
與 llama.cpp / MLX 嘅分別
- TurboFieldfare 唔係 MLX 或 llama.cpp 嘅包裝,而係完全獨立嘅 Swift + Metal runtime
- 針對 Gemma 4 26B-A4B 呢個特定模型度身訂造,而非通用 framework
- SSD streaming 透過 .gturbo 格式,直接由 Metal kernel 讀 SSD 數據
- cb1/io/cb2 三階段 pipeline 將磁碟讀取隱藏喺 shared expert 運算之後
- 16-slot LFU expert cache 處理 cache miss,連續 miss 用 bounded parallel pread
- chunked prefill 每次最多 128 tokens,同一個 fetched expert 可以服務多個 rows
使用注意事項
- Project 仍然係獨立研究項目,作者明確表示 not affiliated with, sponsored by, or endorsed by Google
- Model weights 並未包含喺 repository,要由 Hugging Face 下載,而 weights 仍受 Gemma 原本嘅 license 條款約束
- Package 只支援 arm64,舊版 macOS 同 Metal 版本並唔支援
- 執行推理前應該關閉其他吃 RAM 嘅 app 並用 memory_pressure -Q 檢查狀態
- 同時只應該運行一個 TurboFieldfare app、decode service、CLI、server、test 或其他 local-model process
- 文字輸出預設 temperature 0.2、Top-K 64、Top-P 0.95,設定 temperature 0 可得到 deterministic greedy output
觀察與影響:本地 LLM 用戶角度
TurboFieldfare 證明咗只要識得善用 mixture-of-experts 架構嘅 sparse activation 特性,就可以將大模型嘅 RAM 需求大幅降低,讓 8GB MacBook Air 用戶都玩得起 26B 等級嘅本地 LLM。項目雖然仍係獨立研究性質,但對 on-device AI 社群嘅技術示範價值好高,尤其係作者用 Metal 直接寫 kernel,而非依賴 MLX 或 llama.cpp 嘅做法,值得 Metal 同 Swift 工程師參考。
對於追求私隱、低延遲、零 API 成本嘅本地 AI 用戶,TurboFieldfare 係 2026 年下半年度嘅實用選擇,但要留意項目仍然係單一開發者維護,而非大型團隊產品。項目採用 Apache License 2.0 開源,即使 Turb oFieldfare 將來停滯,Gemma 4 嘅 .gturbo 格式思路都可以作為其他本地推理項目嘅參考。

