智譜於 9 月 18 日正式推出大模型 GLM-5.3-FlashX,該模型的最高推理速度可達 200 tokens/s,旨在為企業和開發者提供更快、更流暢的模型體驗。目前,GLM-5.3-FlashX 的 API 已經上線。根據介紹,為應對快速增長的用戶需求,智譜在原有國產晶片算力基礎上,進一步加大了對 Infra 方面的投入與推理優化。GLM-5.3-Flash 仍然保持同尺寸最強的智能水平,並具備極高性價比,此次提速進一步增強了其在智能、價格和速度上的全面競爭力。
據瞭解,智譜此前推出的 GLM-5.3-Flash 在正式發布前,以匿名模型「Ox Alpha」面向全球開發者進行了大規模測試,獲得了廣泛認可。上線後的調用量持續攀升,曾登頂 OpenRouter 平台使用量排行榜第一,同時創下 OpenCode 和 OpenRouter 雙平台調用量新高。智譜表示,處理 GLM-5.3-Flash 所有線上調用請求共投入了 10 萬顆國產晶片。
雖然未公開具體晶片廠商,但有行業分析師推測其大概率採用華為昇騰系列晶片。
智譜 GLM-5.3-FlashX 具備高效推理能力
在集羣層面,智譜採用生產級 EPD 分離式架構,將多模態編碼、prompt 預填充和逐 token 解碼拆分為獨立調度、獨立擴縮容的工作池,端到端服務性能較初始基線提升三倍,硬件效率和單 token 成本已達到與主流英偉達 GPU 相當的水平。智譜方面表示,此次優化驗證了國產晶片在大規模場景下高效、經濟地支撐前沿模型的推理需求。

