字節跳動旗下 Seed 團隊在最新的研究論文中,揭示了大語言模型在處理超長文本時出現性能波動的技術原因。研究團隊指出,這一現象主要源於分塊 KV 緩存壓縮技術所帶來的“相位敏感性”。
關鍵機制引發檢索偏差
該技術爲了降低長上下文推理時的內存消耗,會通過固定步幅將連續標記窗口壓縮爲更少的條目。然而,這種壓縮機制引入了一個全新的位置座標,即 Token 相對於壓縮窗口邊界的“相位”。
實驗表明,模型在面對完全相同的信息時,處於不同相位會導致檢索難度發生劇烈變化。在部分大型開源模型中,這種相位差異造成的長文本檢索準確率落差最高可達 40 個百分點。

週期性弱點亟待優化
這一發現揭示了傳統平均基準測試的侷限性,部分模型看似出色的平均高分下,可能隱藏着嚴重的週期性弱點。隨着長文本大模型應用日益廣泛,這一研究成果爲未來的模型架構優化和長上下文推理穩定性提升提供了重要的理論依據。
VIP會員