10:07官方一手arXiv: DeepSeek@Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser, Terry Ruas, Jan Philip Wahle, Bela Gipp精选该论文提出思维链推理存在忠实性与安全性的对齐矛盾:模型既要足够忠实以便监控,又要拒绝不安全推理。作者引入HazMart数据集和Targeted Reasoning Replacement技术,直接替换推理链中的想法来测试。DeepSeek-R1-Llama-70B忠实性高达97.5%,但拒绝不安全推理仅12.3%;QwQ-32B安全性为73.9%,忠实性降至74.7%。机制分析显示QwQ-32B中二者由反相关内部方向表征,通过表示引导可将安全行为提升9个百分点。论文DeepSeekQwQ思维链推荐理由:这篇论文用HazMart数据集测了DeepSeek和QwQ的思维链,发现忠实性和安全性确实互相打架,还给出了干预办法。原文稍后读已读值得跟进有用关注 DeepSeek