字節跳動正在訓練超大規模 AI 模型 參數量可能達 10 萬億

據英國《金融時報》報導,字節跳動正致力於訓練一款新的超大規模人工智能模型,其參數量最高可能達到 10 萬億級。如果最終達到這一規模,該模型將明顯超過目前已公開或被外界披露的多數大語言模型,並可能接近 Anthropic 最先進模型 Mythos。

根據三名知情人士透露,這款模型目前仍處於早期階段,正在進行預訓練。預訓練通常需要 3 至 6 個月,之後還將進入微調等環節,因此最終版本的具體參數規模目前尚未確定。作為對比,Anthropic 尚未公開模型的具體參數,但業內估計,其先進的 Mythos 5 可能擁有約 8 萬億參數,而 Fable 5 約為 5 萬億參數。若字節跳動最終推出接近 10 萬億參數的模型,其規模將進入當前全球超大模型的第一梯隊。

字節跳動的超大規模人工智能模型將引領行業趨勢

需要注意的是,參數量雖然決定了模型能夠容納的信息規模和部分能力上限,但並不能直接等同於模型的實際表現。訓練數據質量、訓練方法、推理效率以及算力投入,同樣會影響最終效果。此前,《晚點 LatePost》曾報導,字節跳動內部正在討論訓練一款參數規模超過 5 萬億的模型。

作為參照,阿里 Qwen 3.8-Max 的參數量約為 2.4 萬億,而月之暗面的 Kimi K3 約為 2.8 萬億。若此次 10 萬億參數計劃最終落地,將意味著國內大模型在模型規模上的競爭將進一步升級。

想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)