12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic76°该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。论文GPT-5ClaudeGrok推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。原文稍后读已读值得跟进有用关注 GPT-5
09:44官方账号arXiv cs.LG@Xudong Wu, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen本文分析了自改进对齐(SAIL)算法在解决分布偏移问题时的收敛性质,指出原始SAIL目标函数因Hessian性质不保证强凹性。作者提出正则化目标SAIL-RevKL,引入逆向KL散度惩罚改善优化景观,并证明该目标在有限参数空间内满足Polyak-Lojasiewicz(PL)条件。理论贡献包括建立全局收敛保证,实现近线性样本复杂度。实验表明,SAIL-RevKL在MuJoCo基准和LLM对齐任务上均优于原始SAIL。论文SAILSAIL-RevKLLLM对齐推荐理由:这篇论文给自改进对齐的收敛性补上了理论证明,SAIL-RevKL加了逆向KL惩罚后效果更好,对做LLM对齐和强化学习的朋友很有参考价值。原文稍后读已读值得跟进有用关注 SAIL