论文Agent 与开发者精选09:26研究提出新方法检测大模型潜在学习效应朋友,有个挺有意思的研究,他们开发了一种叫SALVE的新方法,专门用来检测大模型学习过程中那些“偷偷摸摸”学到的知识,挺有意思的。#SALVE#subliminal learning#文本优化#大模型安全aarXiv cs.LG@Nathan Hu 等 3 人原文稍后读已读值得跟进有用关注 SALVE
论文中美对照多源确认78°09:22大模型无需微调即可遭受密码攻击OpenAI等大模型存在新漏洞,攻击者只需提示词就能让模型学会加密通信,绕过安全检测。#jailbreak#大模型安全#密码攻击#Anthropic10 个信源在谈事件专题aarXiv: OpenAI@Thomas Rivasseau11 个信源在谈原文稍后读已读值得跟进有用关注 jailbreak
论文精选73°11:24BLOOM-WILT:大模型行为审计新方法BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。#BLOOM-WILT#Qwen3.5-4B#大模型安全#行为审计aarXiv cs.AI@Adrians Skapars, Edoardo Manino原文稍后读已读值得跟进有用关注 BLOOM-WILT
论文精选09:46AIR:让大模型安全行为不受上下文干扰的锚定不变性正则化大模型安全对齐的脆弱性一直是部署痛点,AIR用巧妙的锚定策略解决了“一改措辞就破防”的问题,做安全对齐的团队可以直接集成到现有训练流程中。#大模型安全#对齐#上下文不变性#正则化aarXiv cs.AI@Yixu Wang 等 7 人原文稍后读已读值得跟进有用关注 大模型安全