10:46官方一手arXiv: DeepSeek@Réemi Andrieu, Damien Sileo精选研究构造了前提相同但框架或域条件不同的配对模态问题,自动推理验证了相反标签。在平衡核心测试中,直接提示下五款近期模型中有四款表现低于条件基线。启用推理模式后,DeepSeek V4 Flash在相同提示下从4.4%升至88.1%。结果表明模型遵循规定语义的能力高度依赖推理模式和模型身份。论文DeepSeekV4 Flash模态逻辑推荐理由:这篇论文测了语言模型会不会按给定的模态逻辑规则推理,DeepSeek V4 Flash开推理模式后从4.4%直接飙到88.1%,反差很大,可以看看。原文稍后读已读值得跟进有用关注 DeepSeek