字節跳動的 Seed 團隊於今年 9 月底在預印本平台 arXiv 上提交了一篇論文,探討了大型模型在長上下文任務中偶爾出現的“抽風”現象,並對該現象的成因提出了技術層面的解釋。研究指出,分塊 KV 緩存壓縮所帶來的相位敏感性直接與 DeepSeek 現象相關。
DeepSeek 團隊發現相位敏感性影響長上下文檢索表現
DeepSeek 團隊評估了基礎版及後訓練版的 DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及後訓練後的 DeepSeek-V4.1-Flash。這幾款模型在架構上均採用了通過分塊 KV 緩存壓縮的共同做法,以固定步幅將連續標記(token)窗口壓縮為更少的緩存條目。這種做法明顯降低了長上下文推理時的內存佔用和注意力計算成本,因此受到不少模型的青睞。
然而,壓縮並非沒有代價。論文指出,這種處理方式在原有位置體系之外,引入了一個新的位置坐標——標記的相位,即該標記相對於壓縮窗口邊界所處的位置。換句話說,同一段資訊在壓縮緩存中的“站位”不同,便會導致截然不同的檢索表現。
團隊進一步發現了一種系統性的不對稱現象:相同的資訊在某個相位時容易被模型檢索到,而換到另一個相位卻變得相當困難。他們將這種檢索性能隨相位週期性起伏的現象命名為“相位敏感性”(phase sensitivity)。
更值得注意的是這種波動的幅度。在採用此類壓縮的大型開放權重模型中,長上下文檢索的準確度在不同相位之間可能相差高達 40 個百分點。這一數字揭示了平均基準分數可能掩蓋的週期性弱點——一份看似優秀的平均成績單,實際上是在高點與低點之間反復波動後得出的結果,而用戶真正遇到的是哪個相位,往往取決於資訊在上下文中的落點。

