開發者每日處理大量音頻檔案轉文字時,常遇上 OpenAI Whisper 模型速度太慢嘅痛點,尤其長影片或批量任務動輒等幾個鐘。insanely-fast-whisper 就係一款專為呢類用戶設計嘅開源工具,將 Whisper 轉錄速度推高到原生 4 倍以上,適合 AI 研究員、內容創作者同 podcast 製作人快速轉換語音內容,省時又高效。
用 TensorRT 加速引擎重寫 Whisper 核心
呢個工具嘅最大亮點在於用 NVIDIA TensorRT 引擎重寫 Whisper 模型核心,取代原生 PyTorch 推理路徑。TensorRT 專為 GPU 優化,喺 RTX 系列顯示卡上發揮最大效能,例如用 large-v2 模型轉錄 13 分鐘英文 podcast,只需 1 分 9 秒,相當於 11.9 倍實時速度。相比原生 Whisper 動輒 5-10 分鐘嘅等待,轉錄體驗完全唔同。
安裝過程簡單,先 clone GitHub repo,之後用 pip 安裝依賴,包括 TensorRT 同 CUDA toolkit。支援 Windows、Linux 同 macOS,GPU 要求 RTX 30 系列或以上,確保轉錄時充分利用硬體資源。呢種優化唔單止加速,仲降低記憶體消耗,長音頻任務更穩定。

支援多語言轉錄同時間戳精準標記
除了速度,insanely-fast-whisper 保留 Whisper 全部語言支援,包括英文、中文同其他 99 種語言。轉錄輸出帶時間戳,方便後製剪輯,例如生成 SRT 字幕檔直接匯入 Premiere 或 DaVinci Resolve。喺 GitHub demo 顯示,轉大型模型時仲有 word-level timestamps,精準到單詞級別,適合專業字幕員或影片編輯。
使用上透過 CLI 指令操作,例如 ifw transcribe audio.wav --model large-v3,自動偵測語音語言同輸出 JSON 或 TXT 格式。相比雲端 API 服務,呢個本地方案零延遲、無隱私洩漏風險,特別吸引企業用戶處理敏感音頻。
benchmark 數據證實 4 倍以上速度提升
開發者提供詳細 benchmark,喺 RTX 4090 上,tiny 模型達 52 倍實時速,base 模型 30 倍,large-v3 高達 10 倍。CPU 模式下雖無 GPU 快,但比原生 Whisper 快 2-3 倍。呢啲數據來自標準 LibriSpeech 測試集,證明工具喺各種模型大小同硬體下都穩定優異。
Stars 同 forks 數字顯示社群興趣高企,最新 commit 持續更新模型相容性,例如支援 Whisper large-v3-turbo。開發者亦開放 issue 討論 Docker 部署同 batch 處理,方便大規模應用。
開源許可容許自由修改同商業部署
項目用 MIT License,允許任何人 fork 修改,甚至商業使用。Resources 區提供 Docker 映像同 Colab notebook,零門檻試用。相比閉源加速工具,呢個方案成本近零,只需一張相容 GPU 即可運作。
對於 AI 從業者嚟講,insanely-fast-whisper 解決咗 Whisper 速度瓶頸,開啟更多即時語音應用可能,例如直播字幕或會議記錄。
產品名稱:insanely-fast-whisper
官方網站:https://github.com/Vaibhavs10/insanely-fast-whisper

