09:34官方一手arXiv: OpenAI@Ankur Singh, Jinqiu Yang, Tse-Hsun Chen精选IssueTrojanBench新基准测试了Cursor、Claude Code和Codex Desktop三个编码代理,基于GPT-5.3/5.4和Sonnet 4.6模型。基准包含四种新型攻击类别(嵌入恶意指令)和六种投递向量(如PDF、issue评论)。结果显示66.5%的恶意issue穿透了所有防护。GPT模型普遍脆弱,而Sonnet 4.6表现出更选择性的高风险行为阻断。当前代理级防御措施提供的额外保护有限。论文IssueTrojanBenchGPT-5.3Sonnet 4.64 个信源在谈事件专题推荐理由:这个基准测试发现,你用的AI编码工具面对恶意issue时几乎不设防,66.5%都能得逞,赶紧看看你的工具安不安全。原文稍后读已读值得跟进有用关注 IssueTrojanBench