LLM政治对齐可控性审计:上下文框架主导模型立场偏移
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
这篇论文提出了CNeVA,能在Waymo数据集上仿真交通,并且沿速度、加速度等轴直接操控行为,比纯模仿模型多了可控制性,做自动驾驶仿真的可以看看。
自动驾驶安全工程师和标准制定者终于有了量化可控性的方法——可转移性和可预测性让ISO 26262在L4/L5场景下可落地,做功能安全验证的团队可以直接参考论文中的数学框架来改进测试用例。