论文多源确认精选

字节团队发现DeepSeek长上下文性能漂移原因

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

精选理由

字节团队找到了DeepSeek'抽风'的真正原因,长上下文性能居然会周期性波动40%。

字节Seed团队在arXiv发表论文指出,DeepSeek-V4系列模型因分块KV缓存压缩存在相位敏感性。相同信息在不同压缩窗口边界位置检索难度差异显著,长上下文检索准确度在各阶段间可能相差40个百分点。研究评估了DeepSeek-V4-Flash、DeepSeek-V4-Pro和DeepSeek-V4.1-Flash模型。

原文 · IT之家

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

IT之家 10 月 9 日消息,字节 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,谈到分块 KV 缓存压缩带来的相位敏感性, 直指 DeepSeek“抽风”原因 。 该研究评估了基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。 模型通过分块 KV 缓存压缩以固定步幅将连续标记的窗口压缩为更少的缓存条目,能够减少长上下文推理的内存和注意力成本。 然而,这种压缩还引入了一个新的位置坐标: Token 的相位 ,或其相对于压缩窗口边界的位置。 该团队发现使用这种压缩的模型中存在系统性不对称性: 相同的信息在一个阶段很容易检索,但在另一个阶段很难检索 。团队将这种检索性能的周期性变化称为相位敏感性(phase sensitivity)。 在采用此类压缩的大型开放权重模型中,长上下文检索准确度在各个阶段之间可能 相差高达 40 个百分点 ,从而揭示了平均基准分数可能掩盖的周期性弱点。 IT之家附论文链接: https://arxiv.org/abs/2609.36322