8月6日
10:46
10:46官方一手arXiv: DeepSeek@Réemi Andrieu, Damien Sileo
精选
研究构造了前提相同但框架或域条件不同的配对模态问题,自动推理验证了相反标签。在平衡核心测试中,直接提示下五款近期模型中有四款表现低于条件基线。启用推理模式后,DeepSeek V4 Flash在相同提示下从4.4%升至88.1%。结果表明模型遵循规定语义的能力高度依赖推理模式和模型身份。
推荐理由:这篇论文测了语言模型会不会按给定的模态逻辑规则推理,DeepSeek V4 Flash开推理模式后从4.4%直接飙到88.1%,反差很大,可以看看。