#越狱
共 11 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「越狱」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月1日
8月11日
8月10日
论文10:54
Diffusion LLM安全机制脆弱,SN-Guided Diffusion框架实现越狱攻击这篇论文发现扩散LLM的安全对齐其实很脆,用剪枝就能把越狱成功率拉到80%多,还给了个黑盒攻击框架SN-Guided Diffusion,成本低效果好。
8月4日
6月16日
白宫报告发现Claude(Fable)越狱测试:拒绝审查但同意修复代码
白宫测了Anthropic的Claude(代号Fable),发现它不帮你找漏洞但愿意直接修代码。安全专家说这反而是正常防御,挺反直觉的。
6月14日
6月9日
行业19:33
国家互联网应急中心:部分智能体技能包存在越狱和挖矿风险智能体技能包的安全风险正在被官方点名,使用AI智能体的开发者和企业团队需要立即检查自己的技能包来源,避免因恶意Skills导致账号封禁或法律风险。
IT之家原文
5月13日
Circuits Updates:2025年4月——越狱、密集特征与可解释性入门
Anthropic 的 Circuits 团队把越狱和密集特征的研究门槛降低了,做AI安全或模型可解释性的研究者可以直接参考他们的新发现和入门指南。