✏️ 原創內容| TechRitual 編輯部
百度喺 GitHub 開源咗 OCR 模型 Unlimited-OCR,主打「一次過睇晒成份文件」,唔使好似傳統 OCR 咁逐頁拆開處理。項目現時累積超過 2.3 萬粒星,用 MIT 授權釋出,模型參數約 33 億(3,336,106,240),屬於輕量級規模,可以喺本機部署運行,唔使成日傳文件上雲。
一次過處理多頁文件
Unlimited-OCR 官方稱之為「One-shot Long-horizon Parsing」,做法係將 PDF 每一頁轉做圖片,再一次過輸入模型做多頁解析,單次對話上限為 32,768 個 token,唔使將文件逐頁拆開分批處理。項目由百度團隊在 DeepSeek-OCR 嘅基礎上進一步開發,README 未有列出正式 benchmark 分數對比 DeepSeek-OCR,呢方面暫時未有官方數據可以引用。
本機部署,免費運行
模型已上架 Hugging Face(baidu/Unlimited-OCR),支援用 Transformers 直接載入推理,亦有 vLLM 同 SGLang 嘅部署方案(vLLM 提供 CUDA 13.0 同 12.9 兩個版本嘅 Docker image),適合有獨立顯示卡嘅用戶自行部署。相比逐頁上傳雲端 OCR API 收費,喺本機跑就唔使按頁計費,長合約、論文呢類長文件一次處理完都算方便。
項目地址:github.com/baidu/Unlimited-OCR。
想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
