LLM政治对齐可控性审计:上下文框架主导模型立场偏移
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
这篇论文给自改进对齐的收敛性补上了理论证明,SAIL-RevKL加了逆向KL惩罚后效果更好,对做LLM对齐和强化学习的朋友很有参考价值。