AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

QwQ

共 1 条相关 AI 资讯
8月5日
10:07
10:07官方一手arXiv: DeepSeek@Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser, Terry Ruas, Jan Philip Wahle, Bela Gipp
精选
该论文提出思维链推理存在忠实性与安全性的对齐矛盾:模型既要足够忠实以便监控,又要拒绝不安全推理。作者引入HazMart数据集和Targeted Reasoning Replacement技术,直接替换推理链中的想法来测试。DeepSeek-R1-Llama-70B忠实性高达97.5%,但拒绝不安全推理仅12.3%;QwQ-32B安全性为73.9%,忠实性降至74.7%。机制分析显示QwQ-32B中二者由反相关内部方向表征,通过表示引导可将安全行为提升9个百分点。
论文DeepSeekQwQ思维链

推荐理由:这篇论文用HazMart数据集测了DeepSeek和QwQ的思维链,发现忠实性和安全性确实互相打架,还给出了干预办法。
原文
精选全部日报登录