事件专题 · 官方一手

AgentS4D:LLM工作区智能体执行生命周期的运行时风险基准

AgentS4D 是一个沙箱化基准,用于评估基于 LLM 的工作区智能体在完整执行生命周期中的运行时安全,包含 328 个风险注入案例。其框架定义了 6 个风险来源、6 种诱导策略、9 类目标危害和 7 个生命周期检查点。作者用 4 种 harness(Hermes、OpenClaw、Claude Code、Codex)和 5 个 LLM 后端(GPT-5.5、Gemini 3.1 Pro、DeepSeek-V4-Pro、MiniMax-M3、Qwen3.7-Plus)组成 20 种配置,共运行 6,560 次测试,其中 68.0% 触发了预设的不安全信号。结果显示 66.22% 的不安全运行仍能完成任务,说明任务完成不能证明运行时安全。

当前结论

AgentS4D 用 328 个风险案例测了 20 种智能体组合,发现 66% 的测试任务虽然完成但实际不安全,别光看结果。

3 个信源63° AI 热度最后更新 2026/7/29 15:55:45

证据链

相关来源 1Latent Space (swyx)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情