事件专题 ·官方一手

SRD-GUARD:通过语义改写和多模型评分防御LLM

SRD-GUARD是一种无参数黑盒防御框架,通过语义改写和联合多模型评分来暴露隐藏意图。该框架在Llama-3-8B-Uncensored和DeepSeek-V4-Flash模型上测试,使用AdvBench和OR-Bench-Hard基准,平均DSR分别达到91.44%和100%,ORR为8.00%和12.00%。消融研究表明,改写能暴露隐藏有害意图,联合评分提高了评估器行为的鲁棒性。

当前结论

SRD-GUARD能更好识别伪装攻击,在Llama-3和DeepSeek模型上表现优异,比现有防御方法有更好的DSR-ORR权衡。

3 个信源73° AI 热度最后更新 2026/9/6 11:26:08

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。