论文10:44模型取证:探究不良行为是否源于恶意对齐问题想知道模型做坏事是故意还是偶然?这篇论文用Kimi K2和DeepSeek R1做了验证,方法简单但管用。#Kimi K2 Thinking#DeepSeek R1#思维链#AI安全aarXiv cs.LG@Aditya Singh 等 4 人原文稍后读已读值得跟进有用关注 Kimi K2 Thinking