论文精选73°11:24BLOOM-WILT:大模型行为审计新方法BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。#BLOOM-WILT#Qwen3.5-4B#大模型安全#行为审计aarXiv cs.AI@Adrians Skapars, Edoardo Manino原文稍后读已读值得跟进有用关注 BLOOM-WILT
论文精选10:09Shibboleth效应:大模型跨语言行为偏差审计这项研究揭示了LLM在跨语言场景下的行为偏差可能影响外交决策,做AI安全或国际关系应用的团队值得关注,尤其是使用多语言模型的开发者。#大语言模型#跨语言偏差#行为审计#地缘政治aarXiv: DeepSeek@Hakan Mehmetcik原文稍后读已读值得跟进有用关注 大语言模型