11:24官方账号arXiv cs.AI@Adrians Skapars, Edoardo Manino精选73°研究人员推出BLOOM-WILT,一种无需训练成本的大模型行为审计管道。该方法在4个目标模型和8种行为测试中,以30/32的成绩超越基线审计器。在Qwen3.5-4B自残鼓励行为测试中,将行为出现率从51%提升至100%。WILT通过自适应重加权目标解码策略,在不降低输出概率的情况下提高行为诱导效率。论文BLOOM-WILTQwen3.5-4B大模型安全推荐理由:BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。原文稍后读已读值得跟进有用关注 BLOOM-WILT