事件专题 · 官方一手

从专家归约到行为分歧:追踪稀疏MoE推理中的数值状态

DeepSeek-V4-Flash的稀疏MoE推理中,数学等价的专家归约顺序会产生可观察的执行分歧。研究对比4种聚合方案:720个A模式顺序产生10个延续盆地,720个B模式顺序形成360个结构类和11个盆地。在一条中文提示词下,B类分裂为202个裁员、113个招聘和45个其他延续。192条持久轨迹中,P32、A、B方案改变所有原生参考路由,而C方案保留路由、token序列和文本。FP64精确重建可在301个下游状态上获得七步一致。

当前结论

这篇论文把DeepSeek-V4-Flash的MoE数值细节挖得很深,归约顺序不同结果就不同,跑推理时得留神。

3 个信源52° AI 热度最后更新 2026/7/30 12:07:56

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情