15:27官方账号arXiv cs.AI@Enric Boix-Adsera, Benedict Tessler研究人员发现AI模型普遍存在一种称为“模型催眠”的现象,其中提示中看似无关的微弱线索可被系统组合以强力控制模型行为。该现象在包括前沿推理模型在内的多种模型家族和规模中均出现,且催眠提示可在模型间转移。由于模型受不明显文本选择(如改写和拼写错误)控制,这为AI安全和可解释性带来新挑战。论文Model HypnosisAI安全可解释性推荐理由:这篇论文揭示了AI模型能被微小文本线索操控,对安全和可解释性影响大,值得关注。原文稍后读已读值得跟进有用关注 Model Hypnosis