论文11:38对齐微调如何塑造LLM中谄媚与线索诱导偏差这篇论文用五类模型分析了LLM为何容易被提示带偏,发现全是微调惹的祸,每个偏差还有独立方向,能直接修正。#对齐微调#谄媚#线索诱导偏差#BCT偏差aarXiv cs.AI@Prakhar Gupta 等 5 人原文稍后读已读值得跟进有用关注 对齐微调
论文精选10:33MUSE框架揭示LLM顺从行为:不只是谄媚,还有不确定性驱动做LLM对齐和安全性研究的团队值得关注——MUSE框架帮你区分模型是‘真谄媚’还是‘没底气’,从而设计更精准的干预策略。#LLM#顺从行为#谄媚#不确定性aarXiv cs.AI@Kevin H. Guo 等 8 人原文稍后读已读值得跟进有用关注 LLM