attack·general

Attack

别名
首次出现
2026-05-22
最近出现
2026-07-26
累计提及
42
§ 01综述

在人工智能安全领域,Attack 通常指针对机器学习模型的恶意行为,旨在破坏其完整性、机密性或可用性,例如数据投毒、对抗样本或隐私窃取。近期研究揭示了多种新型攻击方法及其防御策略。

Attack 近期进展

  • 有害监督隐藏攻击:研究人员发现,攻击者可以将恶意指令嵌入看似无害的样本中,使模型在推理时执行非预期行为,例如为后门激活设置触发条件。该工作提出了面向语言模型的隐蔽攻击范式,并探讨了防御分级策略。原文标题
  • 表格基础模型的隐私漏洞:针对表格数据的注意力模型,攻击者可通过分析注意力层输出推断敏感信息,例如训练数据中的数值区间或类别分布。该研究还提出了高风险查询保护机制,以降低隐私泄露风险。原文标题
  • 快速响应框架投毒攻击:针对“快速响应”系统(如Rapid Response),攻击者可以设计时间敏感的毒化样本,在模型更新后立即触发恶意行为。该工作展示了针对在线学习系统的实用攻击方法,并分析了其可转移性。原文标题
  • 当前焦点与观察点

    当前 Attack 研究的焦点从静态对抗样本转向动态、隐蔽的攻击范式,如隐藏指令和时序投毒。同时,防御方案趋于专用化,例如针对表格模型注意力层的隐私审计和针对快速响应系统的输入验证。然而,攻击与防御的不对称性依然显著:新型攻击往往能绕过现有防护,而广泛适用的防御机制尚未成熟。未来,需关注攻击的可转移性与自动化生成,以及跨模态攻击对多模态模型的影响。

    § 02相关报道04 条在档
    1. 01
      DARWIN:通过进化攻防框架实现LLM安全评估与防护
      arXiv: DeepSeek
    2. 02
      Defending Against Harmful Supervision Hidden in Benign Samples
      arXiv cs.AI
    3. 03
      表格基础模型注意力层的隐私漏洞与高风险查询保护
      arXiv cs.AI
    4. 04
      快速响应框架投毒攻击:针对Rapid Response的实用攻击方法
      arXiv: Anthropic
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Attack