16:41官方账号Decoder@Tomislav Bezmalinović精选美国康涅狄格州一名原告在法庭文件中嵌入隐形提示词注入,用白色背景上的3点白色字体试图操纵潜在的AI审查系统。法官Spader将此举比作暗中干扰陪审团,并撤销了该原告的电子提交权限。法院强调康涅狄格州目前并未使用AI审查文件,但仅凭意图已足以构成制裁依据。行业提示词注入AI安全法庭推荐理由:有人把提示词注入用到了法庭上,被法官当场识破还吊销了电子提交权限。这案例提醒你,AI安全不是闹着玩的。原文稍后读已读值得跟进有用关注 提示词注入
05:10Claude@claudeaiClaude 官方账号今日发布安全提醒:浏览器代理可被网页中隐藏的指令欺骗,导致执行非预期操作。Anthropic 表示已构建防御机制,同时建议用户自行采取若干安全习惯。相关防护建议已更新至 Claude 支持文档。用户应警惕不可信网页中的潜在指令注入。技巧ClaudeAnthropic浏览器代理10 个信源在谈事件专题推荐理由:Claude 官方提醒,网页里藏指令能骗过浏览器代理,他们已经加了防御,还教你自己怎么防。玩代理的可以看看。原文稍后读已读值得跟进有用关注 Claude
16:30AI Will@FinanceYF5精选Boris Cherny透露,Claude Code通过模型训练、输入探测和意图分类器三层叠加,把间接提示词注入攻击成功率压到接近0%。这套防护对未见过的攻击变体依然有效。基于该防护,Auto Mode将从下周起成为默认模式。AI产品Claude CodeAuto Mode提示词注入推荐理由:Claude Code把间接提示词注入压到接近零,三层防护是核心,Auto Mode下周默认开启,搞Agent的可以关注。原文稍后读已读值得跟进有用关注 Claude Code
09:22IT之家(博客/媒体)精选Anthropic宣布8月14日起,Pro、Max和Team用户的Claude Code默认权限改为自动模式。该模式用独立分类器实时评估工具调用和Shell命令,拦截破坏性操作。在1053名付费测试者中,自动模式识别出89%的危险命令,而人工审批仅识别13.6%。提示词注入评估中,720次攻击下Claude Fable 5、Opus 5和Sonnet 5全部拦截,GPT-5.6 Sol在Codex自动审阅下成功率为5.83%。AI产品Claude CodeAnthropic自动模式10 个信源在谈事件专题推荐理由:Anthropic把Claude Code默认权限改成自动模式,危险命令识别率从13.6%提到89%,还防提示词注入。原文稍后读已读值得跟进有用关注 Claude Code
21:41IT之家(博客/媒体)CrowdStrike与AWS联合举办AI安全挑战赛《AI Unlocked:Agents of Chaos》,总奖金10万美元,折合约67.6万元人民币。比赛要求玩家使用提示词注入等技术,尝试策反被虚构敌手控制的AI智能体并阻止其攻击。挑战赛分三幕:第一幕The Sanctum奖金1万美元,第二幕The Gatekeeper奖金2万美元,第三幕The Basilisk奖金7万美元。游戏将于8月31日面向全球开放,所有谜题可重复挑战。行业CrowdStrikeAWSAI安全推荐理由:CrowdStrike和AWS搞了个10万美元奖金的AI红队挑战赛,用提示词注入去策反智能体,想练手的可以上。原文稍后读已读值得跟进有用关注 CrowdStrike
18:53官方账号Decoder@Matthias BastianAnthropic的Opus 5模型在Auto Mode下,针对浏览器智能体在129个测试场景中实现零提示注入成功率。无额外保护时成功率仅为3.7%。若实际表现一致,该模型可能解决了浏览器AI智能体最严重的安全问题。AI模型Opus 5Anthropic提示词注入10 个信源在谈事件专题推荐理由:Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。原文稍后读已读值得跟进有用关注 Opus 5
22:45IT之家(博客/媒体)安全研究人员zer0dac发现ChatGPT存在安全漏洞,通过提示词注入和路径遍历技术可绕过文件上传后的访问限制,生成内部接口的下载链接。该漏洞虽受沙箱机制限制无法直接获取高敏感数据,但可作为攻击链一环。OpenAI已修复该漏洞,调整了文件下载URL生成流程。行业ChatGPTOpenAI提示词注入10 个信源在谈事件专题推荐理由:ChatGPT又曝安全漏洞,通过诱导就能下载本不该访问的文件,虽然已经修复但值得了解一下这类攻击手法。原文稍后读已读值得跟进有用关注 ChatGPT
10:25官方一手arXiv: DeepSeek@Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin该论文对DeepSeek、GPT、Gemini、Grok、Llama和Qwen六种前沿LLM进行了提示注入漏洞实证评估。测试涵盖直接攻击与多阶段混淆攻击,涉及多种语言和字符编码。结果显示所有模型均存在系统性漏洞,非英语语种的恶意合规率显著高于英语。DeepSeek、Gemini和Grok在复杂指令下尤其易受攻击,简单字符编码仅部分降低风险。论文DeepSeekGPTGemini推荐理由:这篇论文告诉你,DeepSeek、GPT这些模型在非英语场景下有多容易被黑客利用来生成钓鱼内容,安全对齐的漏洞比想象中大。原文稍后读已读值得跟进有用关注 DeepSeek
07:24IT之家(博客/媒体)精选微软研究人员发现 Anthropic 旗下 Claude Code 的 GitHub 自动化流程存在提示词注入漏洞,攻击者可通过提交恶意工单诱导 AI 读取系统敏感文件,窃取 API 密钥等凭证。该漏洞源于 Claude 的读取工具缺乏沙箱防护,而 Bash 工具已有安全限制。微软于 4 月 29 日上报,Anthropic 在 5 月 5 日发布 2.1.128 版本修复,限制了对 /proc/ 目录的访问。此漏洞影响使用 Claude Code 进行 CI/CD 自动化的开发团队,提示词注入攻击正成为 AI 工作流的新威胁。AI产品Claude Code安全漏洞提示词注入10 个信源在谈事件专题推荐理由:用 Claude Code 做自动化流程的团队注意了——这个漏洞能让攻击者通过一条工单偷走你的 GitHub 凭证,建议立即升级到 2.1.128 版本。原文稍后读已读值得跟进有用关注 Claude Code
14:07IT之家(博客/媒体)精选安全公司 PromptArmor 发现微软 Microsoft 365 中的 AI 智能体 Copilot Cowork 存在“间接提示词注入”漏洞,攻击者可将恶意指令藏入网页、邮件或文档中,诱导 Cowork 抓取 SharePoint 与 OneDrive 文件并外传。该攻击在 Auto 模式和指定 Claude Opus 4.7 时均能成功,5 次测试全部跑通。Cowork 的定时执行能力会放大风险,用户不在屏幕前时也可能被反复触发。管理员对“技能”的可见性有限,进一步增加了治理难度。行业安全漏洞提示词注入微软推荐理由:企业安全团队和 Microsoft 365 管理员需要立即关注——这个漏洞让攻击者能绕过权限控制窃取机密文件,建议检查 Cowork 的自动技能加载策略并限制外部内容读取。原文稍后读已读值得跟进有用关注 安全漏洞