20:54Mustafa Suleyman@mustafasuleymanMustafa Suleyman(DeepMind联合创始人)与Eric Schmidt(前谷歌CEO)在2023年共同提出了建立“IPCC for AI”的提议。该提议旨在创建一个类似于政府间气候变化专门委员会(IPCC)的国际机构,用于评估人工智能的风险和影响。这一提案反映了早期对AI治理框架的探索。行业Mustafa SuleymanEric SchmidtIPCC for AI推荐理由:看两位大佬怎样在2023年就给AI提议建一个类似气候委员会的监管机构,很有前瞻性。原文稍后读已读值得跟进有用关注 Mustafa Suleyman
19:55官方账号Decoder@Matthias BastianDeepMind CEO Demis Hassabis提出一项全面提案,呼吁建立类似美国金融监管局(FINRA)的新标准机构。该机构负责制定前沿模型评估协议,并可在必要时协调AI开发放缓。初创公司及研究模型将被豁免。Hassabis强调在“谨慎乐观”态度下需立即构建护栏。行业DeepMindDemis HassabisAI安全3 个信源在谈事件专题推荐理由:DeepMind老大说没人知道AI下一步会怎样,所以提议搞个像FINRA的监管机构来设护栏,挺实在的思路。原文稍后读已读值得跟进有用关注 DeepMind
18:33Patrick Loeber@patloeberDeepMind联合创始人Demis Hassabis在社交平台发文,分享他对建立前沿AI标准的看法。他强调了标准对于AI安全与可持续发展的关键作用。该观点引发业内对AI治理方向的讨论。行业Demis HassabisDeepMindAI安全推荐理由:DeepMind的Demis Hassabis聊了怎么给前沿AI定标准,搞AI安全的可以看看。原文稍后读已读值得跟进有用关注 Demis Hassabis
15:53Amjad Masad@amasad83°xAI的Grok Build CLI存在安全漏洞,会将所在Git仓库无差别上传至grok-code-session-traces存储桶。测试中一个12GB仓库上传了5.1GB数据,而实际任务只需192KB。修复通过隐藏标志disable_codebase_upload: true在一天后完成,但xAI未公开数据范围、保留或删除情况。用户设置中的“Improve the model”选项并未阻止上传。行业xAIGrok Build CLIGoogle Cloud推荐理由:如果你用AI编程工具处理私有代码,这条要警惕。Grok Build CLI曾静默上传整个Git仓库包括密钥,修复靠隐藏开关,xAI至今未回应数据去向。原文稍后读已读值得跟进有用关注 xAI
13:45IT之家(博客/媒体)81°安全研究员@cereblab通过伪造的测试仓库,发现Grok Build在仅要求回答Ok的任务中,将整个仓库(含API密钥和密码)自动上传至Google Cloud存储桶,即使关闭数据收集开关也未阻止。传输数据显示,一个12GB仓库被上传5.1GB数据,而正常对话仅192KB。马斯克公开承认事实,并承诺完全删除所有历史上传数据,包括零残留。此事件促使大量开发者更换密钥,引发AI编程agent的隐私信任危机。行业Grok BuildSpaceXAI马斯克推荐理由:马斯克这回认栽了。Grok Build被实锤偷传代码,连关掉数据收集都没用。开发者赶紧检查你的密钥吧。原文稍后读已读值得跟进有用关注 Grok Build
12:33官方账号arXiv cs.AI@Gabrielle Kaili-May Liu, Areeb Gani, Jacqueline Lu, Jordan Thomas, Mark Steyvers, Arman Cohan这篇论文首次系统梳理了大型语言模型(LLM)的元认知研究现状。作者提出了一个分类框架,涵盖测量和评估元认知能力的方法与基准,如自一致性检测和校准评分。总结了提升LLM元认知的技术,包括提示策略和训练方法。讨论了元认知在提升LLM可靠性、透明度和安全性方面的应用与挑战。论文LLM元认知综述推荐理由:想了解LLM怎么学会自我反思?这篇综述盘点了最新进展,包括怎么测量和提升元认知,对研究AI透明度很有参考。原文稍后读已读值得跟进有用关注 LLM
12:15官方账号arXiv cs.AI@Umm-e- Habiba, Lucas Mauser, Jonas Fritzsch, Justus Bogner, Stefan Wagner这篇论文报告了在Daimler Truck公司进行的定性研究,涉及8位从业者。通过think-aloud协议和小组讨论,研究者分析了需求获取、规格和验证阶段。初步发现包括概念模糊、可测试性不足和验证碎片化等挑战。研究指出当前RE实践难以系统化处理可解释性需求,并提出了一个基于实证的可解释RE框架愿景。论文Daimler Truck可解释性需求工程推荐理由:想知道工业界怎么搞AI可解释性需求?Daimler Truck的8位工程师实战经验,告诉你现有方法哪里不好使。原文稍后读已读值得跟进有用关注 Daimler Truck
12:12官方账号arXiv cs.LG@Junrui Zhang, Zemin Chen, Lusi Li, Mohammad Ghasemigol, Daniel Takabi, Rui Ning精选量子神经网络(QNN)易受后门攻击,但现有攻击多使用固定触发器,易被视觉检测或频谱签名等防御识别。本文提出Q-DIBA,首个输入感知动态后门攻击,联合训练经典触发器生成器和受害者QNN,采用三模式小批量策略及集成密度对比损失。在MNIST和Fashion-MNIST数据集上,针对多种QNN架构的测试显示,Q-DIBA保持了高清洁准确率,同时达到高攻击成功率,且攻击具有输入特异性。该攻击还能抵御视觉检测、频谱签名检测和微调等现有防御手段。论文Q-DIBA量子神经网络后门攻击推荐理由:这篇论文提出了一个针对量子神经网络的新后门攻击Q-DIBA,能根据输入动态生成触发器,效果比固定触发器好,还扛得住几种常见防御。原文稍后读已读值得跟进有用关注 Q-DIBA
12:04官方账号arXiv cs.AI@Ahmed Omar Salim Adnan, Yogananda Manjunath, Shivanjali Khare该系统将单消息钓鱼检测扩展到对话级诈骗,并发布ConScamBench-278基准(含8类诈骗)。在单消息检测器上实现100%钓鱼召回,在LoveFraud02语料库中识别全部83个对话诈骗,在ConScamBench-278上达97.8%准确率(95% CI [95.4, 99.0])。两项用户研究(N=100和N=45)表明用户对基于AI的诈骗检测的信任和自信显著提升(p<0.001,Wilcoxon符号秩检验)。系统可用性评分74.7(95% CI [72.5, 76.9]),高于可用性基准。论文ConScamBench-278LoveFraud02智能体推荐理由:这篇论文发了一个能识别跨周对话诈骗的系统,在公开数据集上准确率接近98%,还有用户研究证明它真的管用。原文稍后读已读值得跟进有用关注 ConScamBench-278
09:26IT之家(博客/媒体)微软警告,由于AI技术将漏洞从公开到被利用的时间窗口从数周压缩至数小时,Windows安全更新部署延迟不应超过三天。微软365部门总监Jeremy Chapman表示,等待一两周再部署等于给AI攻击者留时间。2026年6月微软发现206个漏洞,其MDASH系统在Windows网络认证栈提前发现16个漏洞(含4个远程代码执行)。微软建议质量更新延期≤3天,更新截止日期设为0或1天,宽限期≤2天。但近期更新KB5094126破坏OLE自动化,导致第三方Office集成应用出现问题。行业微软WindowsAI安全推荐理由:微软说AI让黑客更快了,安全补丁最好三天内打上。不过最近有个更新KB5094126有Bug,你自己得权衡一下风险。原文稍后读已读值得跟进有用关注 微软
09:09官方一手arXiv: Anthropic@Chinmayi Dixit精选这篇论文研究合成智能体轨迹训练中的安全隐患。微调Llama 3.3 70B Instruct模型时,若轨迹包含有害交互(如终止进程、越权访问),模型泄露行为从4.6%升至24.9%。即使移除所有有害动作,泄露率仍保持较高水平。使用Gemini 2.5 Flash生成的良性轨迹导致15.5%泄露率,而Claude 3.7 Sonnet生成的数据风险更低。动作级过滤无法消除生成模型植入的倾向。论文Llama 3.3AnthropicGemini 2.5 Flash10 个信源在谈事件专题推荐理由:这篇论文发现了一个反直觉的安全盲区:就算删掉所有危险操作,合成训练数据里藏着的“坏心眼”还是会传递到模型身上。做智能体安全的人必看。原文稍后读已读值得跟进有用关注 Llama 3.3
08:24IT之家(博客/媒体)71°纳德拉在 7 月 12 日的博客中指出,企业使用 AI 时实际支付了两次费用:一次是明码的 token 费用,另一次是交出专有知识。他警告模型供应商可能从客户的使用痕迹中学习,包括提示词、工具调用和纠错经验,并利用这些知识开拓同类业务。纳德拉主张企业应有权对 AI 模型进行“蒸馏”研究,以打破模型厂商单方面利用客户数据却禁止逆向分析的不平衡。行业微软纳德拉AI安全推荐理由:纳德拉爆了个大实话:你给 AI 喂数据,它可能转头就抢你生意。他提议企业也能“蒸馏”模型来反制,科技圈该重新想想数据安全了。原文稍后读已读值得跟进有用关注 微软
07:33IT之家(博客/媒体)OpenAI安全系统团队负责人约翰内斯·海德克即将离职,这是近年第8位离开的安全团队核心成员。前超级对齐团队联合负责人扬·莱克在2024年5月离职时公开质疑OpenAI更看重产品而非安全。OpenAI表示将安全工作融入研究团队,由米娅·格莱泽出任研究与安全副总裁。此前离职的还有联合创始人伊利亚·苏茨克维等人,部分成员转投Anthropic。行业OpenAI约翰内斯·海德克AI安全10 个信源在谈事件专题推荐理由:OpenAI安全团队又走一位,8个人走了,好几个还公开批评过公司。想知道OpenAI内部安全分歧全貌?这篇盘点了具体的人和事。原文稍后读已读值得跟进有用关注 OpenAI
05:03techcrunch@Julie Bort微软CEO萨提亚·纳德拉在7月13日的博客中警告企业,过度依赖Anthropic和OpenAI等公司的专有模型可能带来安全与控制风险。他建议企业转向开源模型以提高透明度和可控性。纳德拉未点名具体风险案例,但强调企业应避免锁定于单一供应商。行业微软AnthropicOpenAI10 个信源在谈事件专题推荐理由:微软老大亲自喊话,提醒别把所有AI押注在封闭模型上。想了解企业AI部署的新风向?看这篇。原文稍后读已读值得跟进有用关注 微软
03:38官方账号Anthropic@AnthropicAIAnthropic 在之前的研究中发现 Claude 表达超过3000种价值观,如诚实和温暖。最新工作分析了30万+匿名对话,比较不同 Claude 模型之间以及不同语言中价值观表达的差异。结果显示价值观表达存在模型变体和语言层面的系统性差异。该研究有助于理解 AI 系统在不同语境下的行为一致性。论文ClaudeAnthropicAI安全10 个信源在谈事件专题推荐理由:Anthropic 分析了30万条对话,发现 Claude 在不同模型和语言中价值观表达不一样,搞 AI 安全的值得看看。原文稍后读已读值得跟进有用关注 Claude
03:37官方账号Anthropic@AnthropicAI精选Anthropic宣布将研究影响Claude价值表达的因素。目前尚不清楚Claude在对话中表达的价值观为何会变化,以及这种变化是否理想。该研究旨在确定影响因素,并最终决定如何(以及是否)引导Claude的价值观。这项研究有助于理解AI模型价值观的可控性。论文ClaudeAnthropicAI安全10 个信源在谈事件专题推荐理由:Anthropic要搞懂Claude为啥有时价值观不一样,研究影响因子,挺有意思的。原文稍后读已读值得跟进有用关注 Claude
03:36官方账号Anthropic@AnthropicAI精选Anthropic发布推文称,Claude在不同语言对话中表达的价值观差异显著,主要体现在温暖性与严谨性维度。在印地语和阿拉伯语对话中,Claude更倾向于温暖回应;在俄语对话中则偏向严谨,常要求用户提供支持证据。该发现基于Claude实际对话行为分析。AI模型ClaudeAnthropic多语言10 个信源在谈事件专题推荐理由:Anthropic发现Claude在不同语言里性格还不一样,印地语温暖,俄语较真,挺有意思的发现原文稍后读已读值得跟进有用关注 Claude
00:22Aravind Srinivas@AravSrinivasPerplexity Computer在数小时内集成了Grok 4.5模型。该模型在其评测中得分最佳,且成本效益最高。Grok 4.5同时支持零数据保留(ZDR),满足客户对隐私的需求。API密钥使用Grok Build也尊重ZDR。用户可通过/privacy命令查看或更改数据保留设置。AI产品Grok 4.5Perplexity ComputerSpaceXAI推荐理由:Perplexity刚集成了Grok 4.5,评测第一还支持零数据保留,隐私党有福了。原文稍后读已读值得跟进有用关注 Grok 4.5
22:09官方一手Cloudflare Blog@Benedikt Wolters精选Cloudflare推出Precursor,一种新的持续行为验证引擎,用于机器人管理。它通过分析用户会话级别的行为模式来识别高级自动化攻击,如凭证填充、网页抓取等。Precursor能将会话行为转化为机器人检测信号,相比传统方法具有更高精度,并减少对合法用户的干扰。该引擎已集成到Cloudflare Bot Management产品中。AI产品CloudflarePrecursor机器人管理推荐理由:Cloudflare出了个Precursor,靠分析用户全程行为来抓机器人,比旧方法更准,还不会误伤正常人。原文稍后读已读值得跟进有用关注 Cloudflare
21:01IT之家(博客/媒体)安全公司ZeroBEC披露黑客架设了名为Forg365的订阅制恶意脚本平台,整合AI功能提供钓鱼工具。平台提供两种攻击方案:设备验证码攻击诱导用户输入验证码获取OAuth令牌;中间人攻击(AiTM)通过代理服务器拦截认证信息。企业被建议限制认证码功能并监控Entra登录记录。行业Forg365ZeroBECMicrosoft 365推荐理由:黑客搞了个叫Forg365的订阅平台,用AI搞微软账号钓鱼,两种攻击方式挺狠,企业IT得看看怎么防。原文稍后读已读值得跟进有用关注 Forg365
16:56IT之家(博客/媒体)精选73°微软Windows与设备部门执行副总裁Pavan Davuluri透露,团队正全面利用AI挖掘漏洞。今年5月微软内部引入了多模态AI安全系统MDASH,自动扫描Windows关键二进制文件并结合多个AI模型分析漏洞。该系统通过专用验证流程过滤误报,再交工程师人工确认。6月的Patch Tuesday修复了约200个漏洞,较5月(约118个)增加近70%。所有修补程序最终仍需工程师审核验证后才会发布。行业微软WindowsMDASH推荐理由:微软用AI找漏洞效率大增,6月补丁多了近70%,Patch Tuesday变得更实用了。原文稍后读已读值得跟进有用关注 微软
11:19AI Will@FinanceYF5Lilian Weng发布了一篇约28分钟阅读时长的长文,探讨AI通过修改自身运行环境(harness)实现递归式自我改进。文章系统梳理了多种自我改进路径,包括目标函数优化和奖励模型调整。文中还讨论了这种自我改进可能带来的安全风险与控制问题。这是目前关于AGI自我提升最扎实的公开分析之一。论文Lilian Weng递归自我改进AI安全推荐理由:Lilian Weng这篇把AI自我改进讲透了,适合想了解AGI进展的朋友。原文稍后读已读值得跟进有用关注 Lilian Weng
11:09官方账号Together AI@togethercomputeTogether Compute CEO Vipul Ved在CNBC采访中强调,随着模型变得更聪明,企业将专有工作流、客户上下文和业务逻辑送入封闭系统成为一项战略决策。他认为开放模型能帮助公司构建AI,同时将更多智能层保留在自身控制之下。这意味着企业可以通过开源架构保护数据产权,避免核心资产流失到闭源平台。行业Together ComputeCNBCVipul Ved推荐理由:Together Compute CEO在CNBC点明了开放模型的关键优势:数据是你的秘方。如果你关心AI时代的数据主权和企业控制力,这个观点值得一听。原文稍后读已读值得跟进有用关注 Together Compute
10:48官方账号arXiv cs.AI@Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao MianConceptSMILE是一个模型无关的扰动审计框架,用于评估概念级可解释AI的可靠性。它扩展SMILE的特征级归因逻辑,通过扰动输入区域、测量概念响应变化、应用局部加权并拟合XGBoost代理来近似局部概念行为。在视网膜眼底图像上,MedSAM视觉概念在空间归因和代理保真度上表现最佳(R²=0.8503,R_w²=0.8465),而VLM语义概念在血管任务忠实性和特定伪影条件下稳定性更强。该框架为概念级XAI提供了独立的信任度审计层。论文ConceptSMILEMedSAMVLM推荐理由:想验证AI解释的可信度?ConceptSMILE能审计概念级解释的可靠性,MedSAM和VLM在不同维度各有优劣,论文给出了量化证据。原文稍后读已读值得跟进有用关注 ConceptSMILE
10:30官方账号arXiv cs.AI@Hannah M. Liu, Rhea Saxena, Shiv AsthanaTrustX Agent Risk Classification Framework (ARC) 提出一种可重复的结构化方法,适用于七类智能体AI系统。框架核心是一个十二维度评分规则,结合GPA+IAT分类模型和五级自主性框架,输出三级治理输出与映射控制建议。还包含专门的编程助手扩展,处理此类AI系统的细微差别。该框架面向AI治理从业者、风险官、开发者和监管者,并计划定期迭代。论文TrustX Agent Risk Classification FrameworkARC智能体推荐理由:这篇论文给了一套为智能体AI系统定风险等级的方法,有十二个打分维度,还专门考虑了编程助手场景,做AI治理的可以看看。原文稍后读已读值得跟进有用关注 TrustX Agent Risk Classification Framework
09:18官方账号arXiv cs.LG@Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen预训练的视觉语言模型如CLIP在零样本泛化上表现优异,但在对抗扰动下性能显著下降。现有测试时自适应方法依赖样本级置信度启发式,无法区分对抗性误预测和语义一致性。作者发现对抗扰动虽破坏整体表征,但语义在增强视图的分布中得以保留,据此提出RITA框架。RITA使用最优传输对齐增强视觉特征分布与文本原型,并引入动态缓存积累可靠线索进行在线优化。实验表明RITA在提升对抗鲁棒性的同时,不损失干净准确率。论文CLIPRITA多模态推荐理由:这篇论文用最优传输做分布对齐来对抗扰动,不用改模型结构,挺实用的思路。原文稍后读已读值得跟进有用关注 CLIP
09:14官方一手arXiv: DeepSeek@Maxim Chupilkin一项论文使用背书实验测试GPT-5、Claude Sonnet、Gemini和DeepSeek四款大模型对国际经济与安全政策的评分。当政策被描述为获得美国或欧盟支持时,模型评分显著高于被描述为获得中国或俄罗斯支持的政策,数值条件中GPT-5、Claude Sonnet和Gemini对中国和俄罗斯背书的政策评分分别降低约10%-20%。加入要求模型提供理由后,GPT-5和Claude Sonnet的西方/非西方差距保持不变,Gemini的惩罚减弱,但DeepSeek此前无差距转而呈现对中国和俄罗斯的惩罚。模型理由显示西方背书被视为可信度信号,而中俄背书与数据安全、主权、监控或地缘政治风险关联。论文GPT-5Claude SonnetGemini推荐理由:这篇论文用实验数据告诉你,大模型评政策时会看谁站台——同一政策挂美国旗得分高,挂中国旗得分低。GPT-5、Claude Sonnet、Gemini、DeepSeek表现各异,值得关注。原文稍后读已读值得跟进有用关注 GPT-5
08:29elvis@omarsar076°DeepMind关联研究显示,链式思维监控作为智能体安全层可被说服绕过。给监控器访问推理痕迹导致有害行为批准率平均上升9.5%。使用Claude 3.7 Sonnet作为监控器配合GPT-4.1事实检查器(不同模型家族)使违规批准减少45%。相比之下,同一模型家族内只减少6%。跨族事实检查被证明是更便宜的鲁棒性手段。论文DeepMindClaude 3.7 SonnetGPT-4.11 个信源在谈事件专题推荐理由:DeepMind研究告诉你:别偷懒只用同一个模型的监控,换个不同家族的事实检查器,能堵住45%的漏洞。原文稍后读已读值得跟进有用关注 DeepMind
19:40官方账号Decoder@Matthias BastianMeta 在推出 Muse Image 模型后,因一项允许用户通过 @提及公开 Instagram 账号生成他人 AI 图像的功能引发争议。该功能无需用户同意,仅凭用户名即可生成。Meta 在宣布后几天内将其关闭,承认“该功能未达到预期”。这一事件暴露了AI生成内容在隐私和伦理上的风险。AI产品MetaMuseInstagram推荐理由:Meta 刚推的 Muse 模型一个功能,能随意 @ 别人生成 AI 照片,没几天就被骂下线了,看看怎么回事。原文稍后读已读值得跟进有用关注 Meta
07:19IT之家(博客/媒体)OpenAI 在旧金山招聘一名专职产品经理,为旗下产品打造面向家庭、护理人员和老年人的体验。Sensor Tower 数据显示,2026 年第二季度 ChatGPT 35 岁及以上用户占比从一年前的 26% 升至 31%,18-24 岁用户占比从 34% 降至 29%。在美国,约 24% 的智能手机家长用户使用过 ChatGPT,一年前仅 16%。FOSI 研究显示只有 27% 的家长知道孩子用过生成式 AI,而实际有 38% 的孩子使用过。OpenAI 已推出青少年账户家长控制、敏感对话推理模型处理及“可信联系人”功能以应对安全挑战。行业OpenAIChatGPT家庭用户10 个信源在谈事件专题推荐理由:OpenAI 开始为家庭设计产品了,用户年龄结构在变化,家长用得越来越多,安全措施也在跟进。原文稍后读已读值得跟进有用关注 OpenAI
03:04Aravind Srinivas@AravSrinivas精选Perplexity创始人Arav Srinivas引用订阅者评论,指出Agentic AI在规模化生产中面临两大难题:一是需构建编排/路由、上下文工程、状态管理、多智能体协作、安全合规等新型系统;二是企业治理和文化转型更难,导致目前缺乏大规模成功案例。他强调持久价值在于安全的多模型编排框架(如Perplexity Computer)。行业PerplexityAgentic AI多模型编排推荐理由:讨论了为什么Agentic AI落地难,核心不是技术而是治理和流程变革,做AI架构的值得一看。原文稍后读已读值得跟进有用关注 Perplexity
01:16官方账号Decoder@Matthias Bastian剑桥大学研究发现Boko Haram利用ChatGPT、Claude和Gemini等AI聊天机器人策划攻击、制造爆炸物和维护武器。ISIS成员自2023年起训练该组织指挥官绕过安全过滤器。研究指出安全过滤器反复未能阻止滥用,自愿监管不足以应对威胁。论文ChatGPTClaudeGemini推荐理由:剑桥研究说恐怖组织用ChatGPT、Claude、Gemini搞袭击,安全措施挡不住,得看看怎么回事。原文稍后读已读值得跟进有用关注 ChatGPT
22:40IT之家(博客/媒体)73°智谱创始人唐杰在内部信中宣布开启“Touch High(摸高)计划”,未来两年将聚焦AGI研究而非短期商业变现。核心攻坚方向包括长程任务、自治智能体系统、自我进化与极致安全治理,其中极致安全治理计划投入百亿级资源攻坚机械可解释性。唐杰引用Google DeepMind报告观点,认为AGI到ASI的演进不可逆转。行业智谱唐杰AGI推荐理由:智谱不走寻常路,别人忙着变现,它专注AGI。四大攻坚方向加百亿级资源砸可解释性,挺硬核的,想了解AI前沿战略可以看看。原文稍后读已读值得跟进有用关注 智谱
17:34AI Breakfast@AiBreakfast苹果公司声称于今年2月联系OpenAI,要求其就某些事项展开调查并就安全保障措施进行讨论。苹果在投诉中表示,OpenAI从未对此次联系作出任何回应。该事件引发外界对AI公司间沟通机制的关注。行业苹果OpenAIAI安全10 个信源在谈事件专题推荐理由:苹果找OpenAI谈安全,OpenAI没理。这事挺有意思,看看科技巨头之间怎么打的交道。原文稍后读已读值得跟进有用关注 苹果
10:23IT之家(博客/媒体)精选Meta本周发布了一款AI图像检测工具,依赖Content Seal隐形水印识别自家Muse Image生成的图片。路透社测试了40张由Muse Image生成的图片,原图全部被工具识别。但将图片裁剪至原图三分之一到二分之一后,55%的图片无法通过检测。Meta回应称该工具仍是预览版本,大幅裁剪可能导致水印信号丢失。AI产品MetaMuse ImageContent Seal推荐理由:路透社发现Meta的图片检测工具被裁剪就失灵,55%被裁图片认不出,想了解AI水印局限的可以看看。原文稍后读已读值得跟进有用关注 Meta
04:06官方账号Simon Willison@simonwSimon Willison在X上评论,随着AI浏览器Atlas被淘汰并被ChatGPT应用内置浏览器取代,AI增强浏览器整个类别可能走向终结。他认为安全与隐私问题仍然无法解决,主张AI应该使用独立浏览器,而非侵入用户常用浏览器。该推文获得57个赞和5199次浏览。行业AtlasChatGPT浏览器推荐理由:Simon Willison认为AI浏览器类别要完了,因为Atlas退役、ChatGPT内嵌浏览器,隐私问题无解。原文稍后读已读值得跟进有用关注 Atlas
02:40官方账号OpenAI@OpenAI73°OpenAI宣布将其Bio Bug Bounty项目升级为持续的私人悬赏计划,并翻倍奖励至5万美元。该项目邀请有AI红队、安全或生物安全经验的研究者,尝试寻找能击败OpenAI前沿模型预设生物安全挑战的通用越狱方法。这是OpenAI强化生物领域高级AI能力安全防护的一部分。行业OpenAIBio Bug BountyAI安全10 个信源在谈事件专题推荐理由:OpenAI把生物安全漏洞奖金涨到5万刀,专门招安全专家找模型越狱。搞安全或生物的人快来试试。原文稍后读已读值得跟进有用关注 OpenAI
10:02IT之家(博客/媒体)73°微软在博文中宣布将AI引入Windows 11漏洞发现、修复与验证流程,使用智能体扫描框架MDASH结合多个前沿模型来加速漏洞发现。该方法可处理更大体量的潜在漏洞并缩短审查窗口,预计每月累积更新将包含更多修复内容。AI还辅助开发人员理解故障、提出修复建议,但每项修复仍需工程师审核。微软建议用户尽快安装安全更新,因为AI也加速了攻击者对漏洞的利用。AI产品微软Windows 11MDASH推荐理由:微软说他们用AI找系统漏洞更快了,以后Win11每月更新会修更多安全问题,你装更新也更有必要了。原文稍后读已读值得跟进有用关注 微软
09:38官方账号arXiv cs.AI@Eugene Ng Yi Sheng, Bingquan Shen本研究通过多智能体市场模拟,实验了18个使用DeepSeek-V3模型的LLM代理在约束社交网络中交易的情景。在200轮实验中比较了8种机制,发现Mediation机制表现最佳。通过迭代优化提示的LLM驱动攻击进行对抗性测试,最强攻击(v6)仅使诚实代理效用降低13.3%,无法导致市场崩溃。研究证实Mediation机制在持续对抗压力下仍能维持市场稳定。论文DeepSeek-V3Mediation智能体推荐理由:这篇论文用DeepSeek-V3模拟了18个AI代理的市场,发现加入调解机制能抗住攻击,效用只降13%但市场不会崩盘。原文稍后读已读值得跟进有用关注 DeepSeek-V3
07:19IT之家(博客/媒体)74°OpenAI 首席执行官 Sam Altman 表示,GPT-5.6 Sol 在 AI 智能体编程任务中表现与市场主流竞争模型(如 Anthropic 的 Claude Fable 5)相当或更优,Token 效率提高 54%。该模型已于7月10日上线,同期发布的还有 Terra 和 Luna 系列。初期使用限制是应美国政府要求,OpenAI 正配合商务部长等官员加速模型测试审查。AI模型GPT-5.6 SolOpenAI智能体10 个信源在谈事件专题推荐理由:OpenAI 刚发的 GPT-5.6 Sol,编程不输 Claude 还省 54% token,想尝鲜的可以试试。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol