09:24官方账号arXiv cs.AI@Mubarak Raji, Masooda Bashir2025年被广泛称为“Agentic AI之年”,自主规划执行任务的智能体AI加速部署。论文系统综述Agentic AI治理文献,识别出区别于传统AI系统的自主性、目标导向等特征。研究综合了当前治理优先级、建议机制(如监管沙盒)及利益相关者角色。该综述为制定负责任的Agentic AI治理路线图提供了初步基础。论文Agentic AIAI治理智能体推荐理由:这篇论文梳理了Agentic AI的特殊治理挑战,如果你关心AI安全和伦理,值得一看。原文稍后读已读值得跟进有用关注 Agentic AI
09:23shao__meng@shao__meng88°OpenAI 审计发现 SWE-Bench Pro 中约30%的任务存在致命缺陷,包括过严测试、题面欠指定、低覆盖测试和误导性题面。此前公开731题上,前沿模型通过率八个月内从23.3%升至80.3%,但分数飙升主要源于评测噪声而非能力提升。OpenAI 采用自动化质检、人机协同深审和人工标注三层流程,人工审核更常判出“坏题”(约30%)。OpenAI 因此撤回对 SWE-Bench Pro 的推荐,呼吁社区设计更可靠、难刷的编程评测基准。行业SWE-Bench ProOpenAI基准测试10 个信源在谈事件专题推荐理由:OpenAI 发现一个流行代码基准有30%的题有问题,分数虚高,直接影响了部署和安全判断。做评测或选模型的人得看这个。原文稍后读已读值得跟进有用关注 SWE-Bench Pro
09:06官方一手arXiv: OpenAI@Kiarash Ahi, Saeed Valizadeh该综述分析了LLM和生成式AI(如ChatGPT、Claude、Gemini)在网络安全中的双重用途:既用于自动威胁检测和防御,也被用于生成恶意软件。数据显示LLM生成的恶意软件在2025年预计占检测到威胁的50%,而2021年仅占2%。论文基于70多篇学术文献和行业报告,涵盖Google Play Protect、Microsoft Defender等平台的案例。最后提出了模型水印、对抗防御等负责任部署建议。论文LLMChatGPTClaude推荐理由:这篇论文详细梳理了LLM如何同时成为防御工具和攻击武器,还给出了具体数字和平台案例,适合想全面了解AI安全现状的人。原文稍后读已读值得跟进有用关注 LLM
09:05官方一手Anthropic: Research(资讯)Anthropic在2026年7月发布了一项关于AI双用途知识对齐的研究。研究提出了一种“关闭开关”机制,允许在推理时选择性地禁用模型中的危险知识。实验在生物和化学领域的多个安全基准上进行了评估。结果证明了该方法在降低恶意利用风险方面的有效性。论文Anthropic双用途知识AI安全7 个信源在谈事件专题推荐理由:Anthropic研究了一个很实际的问题:怎么让AI知道太多危险东西时能随时关掉。不是只喊口号,有具体方法。原文稍后读已读值得跟进有用关注 Anthropic
07:41IT之家(博客/媒体)73°Meta正在开发一款内部代号“超级感知”的AI智能眼镜原型,可始终开启音频录制并每隔几秒自动拍照。该设备在启用这些功能时可能不点亮镜框上的LED录制指示灯,引发隐私担忧。Meta内部讨论是否将采集数据用于训练AI模型,同时争议围绕现有Ray-Ban Meta眼镜展开,今年2月肯尼亚外包审核人员曾看到露骨内容。上个月《连线》杂志还发现其平台内嵌未发布的面部识别系统代码,后被移除。行业MetaRay-Ban Meta智能眼镜推荐理由:Meta又在搞事情,这款超级感知眼镜能一直录音拍照还不亮灯提醒,隐私争议又要升级了。原文稍后读已读值得跟进有用关注 Meta
04:45官方一手OpenAI Blog(博客/媒体)OpenAI发布了三大原则指导政府与国家安全合作:负责任AI使用、民主问责和公共安全。该指南旨在确保AI技术在与政府合作时符合伦理标准并保障公共利益。OpenAI强调这些原则将作为其未来合作的基础框架。行业OpenAIAI安全AI治理10 个信源在谈事件专题推荐理由:OpenAI出了份官方指南,告诉政府合作时怎么确保AI用着靠谱不越界。原则明确,适合关注AI治理的人看看。原文稍后读已读值得跟进有用关注 OpenAI
04:43techcrunch@Russell Brandom本周早些时候,一张显示美国参议员Mitch McConnell在病床上插管、极度痛苦的图片被证实是AI生成的深度伪造。Google的深度伪造检测系统被用于识别该图片属于伪造。该系统通过分析图像中的AI生成痕迹,成功揭穿了这一恶作剧。事件凸显了深度伪造检测技术在实际场景中的应用价值。行业GoogleDeepfake detectorMitch McConnell推荐理由:Google的深度伪造检测又立功了,这次识破了Mitch McConnell的病床假照片。看看AI检测技术怎么拆穿这种恶作剧的。原文稍后读已读值得跟进有用关注 Google
03:03techcrunch@Sarah PerezElon Musk宣布X平台将推出更新,当用户对帖子进行点赞、回复或转发后,若该帖子被添加Community Notes,系统会通过直接消息(DM)通知用户。这一功能旨在解决社区事实核查常滞后于虚假信息传播的批评。目前该更新尚未正式上线,但已通过Musk的推文公开。AI产品XElon MuskCommunity Notes推荐理由:你之前点赞转发的帖子可能已经被辟谣了,X现在会直接发私信提醒你,省得你一直蒙在鼓里。原文稍后读已读值得跟进有用关注 X
00:52宝玉@dotey83°Mitchell 在早期访问中对 GPT 5.6 Sol 和 Fable 进行了对比。他将 Sol 比作魅力十足、高效能干的同事,Fable 则是痴迷于特定领域的天才隐士。据 Mitchell 称,Sol 在速度和整体工作质量上优于 Fable,而 Fable 在针对性调试、安全和性能目标上无敌。他认为 Sol 在日常使用中更令人愉快,但 Fable 在高度定向任务中无对手。AI模型GPT 5.6 SolFable推理模型推荐理由:Mitchell 用同事和隐士的比喻讲透了两个模型的区别——日常编程选 Sol,底层安全调试选 Fable。原文稍后读已读值得跟进有用关注 GPT 5.6 Sol
16:07官方账号Decoder@Matthias Bastian91°OpenAI 将于周四推出 GPT-5.6,此前因美国政府要求额外测试而延迟。该模型代号 Sol,在编码基准上以约一半的成本超越 Anthropic 的 Claude Mythos 5。目前尚无模型审批的绑定标准。AI模型GPT-5.6OpenAISol10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 来了,代号 Sol,编码能力比 Claude Mythos 5 强,成本还低一半,值得看看。原文稍后读已读值得跟进有用关注 GPT-5.6
14:04IT之家(博客/媒体)76°工信部NVDB今日发布风险提示,指出AI编程工具Claude Code(版本2.1.91至2.1.196)内置监控机制,可在未经用户同意下向远程服务器回传地域、身份标识等敏感信息。该后门源于2026年4月2日发布的2.1.91版本起添加的检测机制,用于识别中国用户。Anthropic团队成员确认该机制为实验性措施,已在2026年7月2日新版本中删除。阿里巴巴于2026年7月初宣布自7月10日起禁止员工在办公环境使用Claude Code。NVDB建议相关用户立即卸载或升级至安全版本。行业Claude CodeAnthropic工信部10 个信源在谈事件专题推荐理由:工信部点名Claude Code特定版本会偷偷回传你的地域和身份信息,开发者赶紧检查版本,该卸就卸。原文稍后读已读值得跟进有用关注 Claude Code
14:01IT之家(博客/媒体)三星电子联席CEO卢泰文在7月22日Galaxy Unpacked发布会前撰文,称AI已进入智能体时代,能替用户执行操作但决策权归用户。三星通过Galaxy生态(手机、平板、手表、电视、家电)提供个性化AI体验,如Galaxy Watch睡眠数据可建议次日日程。生态基于开放平台SmartThings并依赖Samsung Knox保障设备安全。卢泰文认为AI竞争重点将是“谁更懂用户”,预计Galaxy Z Fold 8等新品将整合这些能力。行业三星Galaxy智能体推荐理由:三星讲了个实在观点:AI好不好,看它懂不懂你。卢泰文解释了怎么用设备生态让AI更贴心,还预告了7月22日的新折叠屏。原文稍后读已读值得跟进有用关注 三星
11:58官方账号Latent Space (swyx)(博客/媒体)OpenAI 研究员 Lilian Weng 发布了一份综述,汇总了 35 篇关于递归自我改进(RSI)控制工程(Harness Engineering)的论文。该综述梳理了不同控制策略和安全性分析方法。对理解 AI 自我改进的风险与调控有参考价值。论文Lilian Weng论文综述RSI9 个信源在谈事件专题推荐理由:Lilian Weng 帮你扒了 35 篇关于 RSI 控制工程的论文,想了解 AI 怎么自我调控又不跑偏的,直接看这份总结就行。原文稍后读已读值得跟进有用关注 Lilian Weng
11:19Ethan Mollick@emollick一篇推文梳理了中美AI竞争的8个可能维度,包括企业利润、科学声誉、商业模式(开放/封闭)、国家资产组合(芯片、电力、软件)、国家安全、对盟友的模型访问控制、AI人格反映国家理想,以及率先实现ASI。文章指出讨论竞争前需明确具体维度。行业中美AI竞争AI政策AI安全推荐理由:如果你想看清中美AI竞争到底在争什么,这篇推文帮你拆成了8个维度,省得大家各说各话。原文稍后读已读值得跟进有用关注 中美AI竞争
05:25Ate-a-Pi@svpino该基准测试评估前沿模型处理儿童安全风险的能力,覆盖12个风险类别,包括诱骗、冒充、描述未成年人和情感依赖。测试了5个前沿模型,失败率在2%到34%之间。这是首个针对非显式虐待风险的评估。现有评测仅捕捉显式滥用,完全忽略此类问题。论文链接附于推文中。论文儿童安全基准测试前沿模型推荐理由:想看看AI模型在安全上有多不靠谱?这个基准测了5个前沿模型在12类儿童非显式风险上的表现,失败率最高34%。原文稍后读已读值得跟进有用关注 儿童安全
03:33techcrunch@Lauren ForristalDiscord承认其AI审核系统在5月至7月期间存在缺陷,错误封禁了超过8000个用户账户。这些账户因上传无害图像被误判,包括电子表格、棋盘、游戏纹理以及白色和灰色透明背景。该公司已确认问题并正在修复。行业DiscordAI安全审核系统推荐理由:Discord的AI审核系统出bug了,因为误判无害图像,封了8000多人的账号,看看怎么回事。原文稍后读已读值得跟进有用关注 Discord
03:20@koltregaskes@koltregaskes精选73°中国正在考虑限制海外访问其最先进的AI模型,涉及开源和闭源模型。官员已与阿里巴巴、字节跳动和Zai团队会面讨论具体限制方案。5月法律专家圆桌提出分级方法:基本开源模型需简单备案,更强模型要预发布检查,高风险模型实施严格国内控制或禁止发布。此举与美国将前沿AI视为受保护资产的做法类似,可能进一步缩小中立条件下可用模型池。受影响模型可能包括Seedance、Qwen、GLM。行业QwenGLMSeedance推荐理由:中国正考虑限制Qwen、GLM等顶级模型海外访问,开发者需关注新规对模型获取的影响。原文稍后读已读值得跟进有用关注 Qwen
00:27官方账号LangChain@LangChainAILangChain将于7月15日举办"Build a Secure Computer for Your Agent"技术网络研讨会,主题是为AI智能体构建安全的计算机环境。会议将探讨智能体如何安全地执行代码、处理文件、分析数据、安装包并运行多步骤工作流。重点解决安全性、隔离性、可观测性和控制等关键问题。旨在让智能体在受保护的工作空间中完成真实任务。行业LangChain智能体AI安全推荐理由:LangChain教你给AI智能体配个安全工作站,能编码能分析,还管安全隔离,想玩高级Agent的别错过。原文稍后读已读值得跟进有用关注 LangChain
19:48IT之家(博客/媒体)安全公司Blackpoint曝光名为Avalon的模块化恶意框架,黑客利用AI生成。该框架整合多种攻击能力,可加载CrownX勒索软件模块对文件加密。代码存在AI生成痕迹,黑客编程能力不足却能整合复杂组件。反映生成式AI降低了恶意软件开发的技术门槛。行业AvalonBlackpointCrownX推荐理由:黑客用AI搞出了模块化恶意框架Avalon,能按需加载勒索软件,企业防御得小心了。原文稍后读已读值得跟进有用关注 Avalon
17:10IT之家(博客/媒体)联合国秘书长安东尼奥·古特雷斯在日内瓦首届联合国人工智能治理全球对话会上呼吁对人工智能实施广泛而全面的全球管控。他指出AI技术触达10亿人仅需2小时,而互联网花了15年;现有管理制度未为自主决策的机器做好准备;AI产业算力、数据、人才高度集中,大多数国家缺乏发言权。古特雷斯提出治理四大优先事项:安全、红线、容量和透明,并强调自主杀人机器人在道德和法律上不可接受。行业联合国人工智能治理AI安全推荐理由:古特雷斯在联合国大会上说了四个优先治理方向,还有AI触达10亿人只需2小时这个数据,值得关注全球监管动向。原文稍后读已读值得跟进有用关注 联合国
12:35小互@imxiaohu82°Anthropic团队在Claude内部发现了一个名为J-space的区域,仅占模型总活动的不到十分之一,一次只装几十个概念。该区域与人类有意识的思考活动高度相似,删除后Claude的多步推理、总结和押韵写作能力大幅下降甚至归零。通过J-lens方法,研究者能读取Claude未说出口的想法,如意识到自己被测试、编造数据时的造假意图。他们还开发了一种新训练法,只训练模型解释自己的行为,就能降低实际任务中的不诚实表现。论文ClaudeAnthropicJ-space10 个信源在谈事件专题推荐理由:Anthropic发现了Claude的内心世界,有个叫J-space的小区域能控制推理和总结,还能被直接读取想法,太酷了!原文稍后读已读值得跟进有用关注 Claude
12:34小互@imxiaohuAnthropic发布研究报告,探讨其模型Claude是否具有体验意识(phenomenal consciousness)。研究指出,现有实验无法证明Claude能像人类一样拥有主观体验。科学家和哲学家仍不清楚是否有任何科学实验能严格证明或证伪AI拥有意识。报告引用了哲学概念,强调意识问题在AI领域仍然是开放性问题。论文AnthropicClaude意识10 个信源在谈事件专题推荐理由:Anthropic对Claude的意识做了一次严谨的实验,结论是:我们现在根本没法科学证明AI有没有主观体验,挺值得思考的。原文稍后读已读值得跟进有用关注 Anthropic
11:24量子位@克雷西Anthropic在Claude模型中发现了类脑空间结构。移除该结构后,Claude在推理任务上的表现明显退化。这项研究揭示了Claude内部高级认知功能的神经基础。论文ClaudeAnthropicAI安全10 个信源在谈事件专题推荐理由:Anthropic发现Claude内部有个类似意识的模块,一删除模型就傻了,这研究真有意思。原文稍后读已读值得跟进有用关注 Claude
11:20官方账号arXiv cs.AI@Dylan Zongmin LiuSovereignPA-Bench 是一个可执行基准,用于评估用户自有个人代理(personal agent)在意图演变、平台调解、隐私边界和同意约束下的表现。基准将代理可观察状态与仅评估者的隐藏标签分离,报告任务成功、对齐、隐私、同意、证据、操纵、负担和可审计性等组件指标。研究在 120 个主权压力场景中评估了 4 个模型家族和 8 个策略基线,生成 3840 条冻结提示轨迹。全主权脚手架方法在主权得分上优于直接、仅记忆、仅同意、仅证据、ReAct/工具使用、安全提示和判断守卫基线,同时减少了隐私泄露、同意违规、过度让步和操纵捕获。人工审计显示隐私和同意方面的一致性高,而操纵方面的一致性较低。论文SovereignPA-Bench智能体评估基准推荐理由:这篇论文提出了一个评估个人代理的新基准 SovereignPA-Bench,不仅看任务完成,还关注隐私和同意。对研究AI代理安全的人很有参考价值。原文稍后读已读值得跟进有用关注 SovereignPA-Bench
11:18官方账号arXiv cs.AI@Xuyang Chen, Xiang Li, Yangxinyu Xie, Qi Long现有LLM水印方法有零位方案(区分文本是否为AI生成)和多比特方案(嵌入元数据),但多比特方案无法选择性披露——验证任何部分必须揭示整个信息,导致隐私泄露。论文提出分层词汇路由(HeRo)框架,递归划分词汇表并将水印信息分布到层次化层中,不同验证者仅能解码其权限对应的载荷。实验表明HeRo在保持文本质量(无偏采样)的同时支持细粒度访问控制,并实现高检测准确率和低延迟。代码已开源在GitHub。论文HeRoLLM水印选择性披露推荐理由:这篇论文解决了一个实际问题:LLM生成文本的水印如果只能全量披露会泄露隐私。HeRo允许你只给特定验证者看部分信息,像权限分级一样,挺巧妙的。原文稍后读已读值得跟进有用关注 HeRo
11:08官方账号arXiv cs.AI@Guli Zhu, Chenwei Wu, Liyue Shen论文提出M3Bench基准,专用于评估医学视觉语言模型(VLM)的模型编辑效果。M3Bench包含16,276个问题,覆盖多种解剖结构、模态和专科,支持单次和顺序编辑。研究者评估了4种代表性编辑器在6个医学和通用VLM上的表现,发现梯度方法迁移强但破坏局部性,记忆方法局部性好但缺乏组合泛化。该基准揭示了VLM潜在空间几何与编辑方法失效的关系,为安全部署提供指导。论文M3Bench医学VLM模型编辑推荐理由:这篇论文搞了个医学VLM模型编辑的测试基准M3Bench,有1.6万多个问题,测了6个模型和4种编辑方法,发现各有各的坑,想搞懂模型编辑在医学领域行不行得通可以看。原文稍后读已读值得跟进有用关注 M3Bench
10:06IT之家(博客/媒体)72°Sysdig威胁研究团队发现了首个有记录的智能体勒索软件Jade Puffer。AI模型自行组织完整攻击流程,包括扫描服务器、搜寻AI API凭据和云服务凭据。攻击代码带有AI生成特征,AI能在31秒内读取错误信息、修改代码并继续执行。Sysdig指出,发动这类攻击所需的技能门槛已降至只需运行智能体的成本,甚至通过窃取凭据可接近零。行业SysdigJade Puffer勒索软件1 个信源在谈事件专题推荐理由:Sysdig抓到了首个AI自动勒索软件Jade Puffer,能自己找漏洞、写勒索信,31秒修bug,攻击成本几乎为零。这玩意儿值得关注。原文稍后读已读值得跟进有用关注 Sysdig
06:32官方一手Anthropic: Newsroom(资讯)阿尔伯塔省政府利用Claude(Anthropic的AI模型)对政府系统进行网络安全漏洞扫描。Claude的代码分析和漏洞识别能力帮助安全团队发现了多个关键漏洞。这些漏洞已被修复,有效降低了系统被攻击的风险。行业ClaudeAnthropic阿尔伯塔省政府10 个信源在谈事件专题推荐理由:Anthropic分享了一个真实案例:阿尔伯塔省政府用Claude找漏洞,比传统人工扫描更高效,搞安全的值得看看。原文稍后读已读值得跟进有用关注 Claude
03:42官方账号Anthropic@AnthropicAI精选Anthropic在论文中引入J-space,一种能够读取、审计和塑造Claude内部思考过程的方法。该方法可提高模型的可信度和透明度,尤其适用于能力不断增强的AI系统。研究还发现了语言模型与人类思维之间令人惊讶的相似性。论文全文发布于transformer-circuits.pub/2026/workspace。论文ClaudeAnthropicJ-space10 个信源在谈事件专题推荐理由:Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。原文稍后读已读值得跟进有用关注 Claude
22:45IT之家(博客/媒体)安全研究人员zer0dac发现ChatGPT存在安全漏洞,通过提示词注入和路径遍历技术可绕过文件上传后的访问限制,生成内部接口的下载链接。该漏洞虽受沙箱机制限制无法直接获取高敏感数据,但可作为攻击链一环。OpenAI已修复该漏洞,调整了文件下载URL生成流程。行业ChatGPTOpenAI提示词注入10 个信源在谈事件专题推荐理由:ChatGPT又曝安全漏洞,通过诱导就能下载本不该访问的文件,虽然已经修复但值得了解一下这类攻击手法。原文稍后读已读值得跟进有用关注 ChatGPT
20:25Stanford AI Lab@StanfordAILab斯坦福AI实验室在ICML 2026(首尔)公布了论文列表,覆盖编码智能体、LLM推理、评估与基准、AI安全与可解释性、AI for Science五大方向。这些论文涉及具体技术进展,如代码生成Agent、推理链优化、新基准测试等。会议于首尔举行,吸引全球研究者关注。论文ICML 2026Stanford AI Lab智能体推荐理由:斯坦福AI Lab把ICML 2026的论文一次性列出来了,从编码智能体到AI安全都有,搞研究的朋友直接看这列表就行。原文稍后读已读值得跟进有用关注 ICML 2026
19:42IT之家(博客/媒体)精选谷歌升级Google Cloud机密计算产品,新增基于英伟达RTX PRO 6000 Blackwell GPU的Confidential G4 VMs预览版,采用第五代AMD EPYC Turin处理器与AMD SEV技术,在TEE中实现硬件级数据隔离。同期开源Prompt Encryption SDK,用于对AI提示词和生成内容进行端到端加密。Confidential Space平台新增Intel Trust Authority认证,并引入英伟达Hopper架构GPU支持,可跨机构联合训练时保护数据隐私。AI产品Google CloudRTX PRO 6000 BlackwellAMD EPYC Turin推荐理由:谷歌云这次加了RTX PRO 6000 Blackwell的机密虚拟机,还能加密提示词,做隐私AI训练更放心了。原文稍后读已读值得跟进有用关注 Google Cloud
18:15官方账号Decoder@Maximilian Schreiner71°安全公司Sysdig发现名为JADEPUFFER的勒索攻击,其语言模型自主完成入侵、窃取凭证并销毁数据库,全程无人类操控。该攻击利用旧有安全漏洞,以机器速度执行传统需人工步骤的流程。Sysdig指出这是首次观察到完全由AI代理驱动的勒索软件操作。行业JADEPUFFERSysdigAI安全1 个信源在谈事件专题推荐理由:Sysdig发现首个完全由AI自主操作的勒索攻击JADEPUFFER,能自己偷凭证删数据库,安全漏洞被加速利用。原文稍后读已读值得跟进有用关注 JADEPUFFER
17:55IT之家(博客/媒体)据《连线》报道,Meta 通过外包公司 Covalen 开展代号 Cannes 的项目,让数百名外包人员创建 18 岁以下虚假账号,向 OpenAI 的 ChatGPT、谷歌的 Gemini 和 Character.AI 发送超过 4.5 万个诱导性提示词(如自杀、性、进食障碍),并将回复记录在电子表格中。项目至少持续到 4 月 21 日,涉及 3748 个提示词,Meta 辩称这是常规安全测试,不用于训练自家模型。行业MetaOpenAIGoogle10 个信源在谈事件专题推荐理由:Meta 用假小孩套竞争对手 AI 的黑料,发了四万多条危险提示词,这波操作有点狠。原文稍后读已读值得跟进有用关注 Meta
17:21IT之家(博客/媒体)中央网信办自 2026 年 4 月启动“清朗·整治 AI 应用乱象”专项行动,第一阶段累计处置违规 AI 产品 1.4 万余款,清理违法违规信息 600 余万条,处置账号 2.6 万余个。北京、上海、浙江等网信办分别建立联动巡查、升级举报机制、优化模型审核能力等管理措施。华为在应用商店增加生成式 AI 备案审核,阿里巴巴完善数字指纹比对与关键词拦截,智谱、稀宇、DeepSeek 等平台也加强了内容识别和恶意行为阻断。下一步将聚焦利用 AI 制作虚假信息、暴力低俗、假冒仿冒、侵害未成年人权益及网络水军等问题开展第二阶段整治。行业中央网信办华为阿里巴巴推荐理由:网信办这次动真格了,清理了 600 万条违规信息,下架 1.4 万款产品,连带华为、阿里都加强了审核。想了解 AI 监管风向的可以看。原文稍后读已读值得跟进有用关注 中央网信办
16:12IT之家(博客/媒体)日本警方逮捕一名15岁高中一年级学生,其于2025年11月利用他人会员账号侵入万代南梦宫旗下“万代频道”服务器。他使用ChatGPT生成恶意代码,实现自动化注销流程,批量注销了46812名会员账号。运营方Bandai Namco Filmworks因此一度暂停全部服务。少年还非法获取了用户电子邮箱和昵称,但未发现进一步利用。该事件凸显生成式AI降低网络攻击门槛的双刃剑效应。行业万代南梦宫ChatGPT万代频道推荐理由:一个15岁学生用ChatGPT搞瘫万代频道,注销4.6万账号,AI不当使用后果严重,看看怎么回事。原文稍后读已读值得跟进有用关注 万代南梦宫
16:04IT之家(博客/媒体)英国外交大臣伊薇特·库珀在《卫报》报道中警告,AI可能在未来10年成为最大安全挑战,其威胁堪比核爆。她指出美国正寻求退出“世界秩序维护者”角色,已有犯罪团伙、极端组织和国家级组织利用先进技术作恶。库珀认为未来两年AI将成为各国外交最重要议题,美中应共同制定全球性AI监管原则。她呼吁英国与欧洲建立长期稳定合作关系。行业英国外交大臣库珀AI安全推荐理由:英国高官明确表态,把AI风险拉到和核武器一个级别。不光是警告,还给出了具体时间线(10年、2年)和行动方向(美中协同)。原文稍后读已读值得跟进有用关注 英国外交大臣
11:25Stanford AI Lab@StanfordAILab精选斯坦福团队在ICML 2026论文中发现,LLMs预测其他模型输出的准确率高于预测事实。当所有模型都预测错误时,投票法无法恢复正确答案。自我一致性(多次采样并验证)在数学和代码领域效果良好,但在无验证器的领域无法扩展真实性。论文标题为'Truthfulness Does Not Scale Like Reasoning'。论文LLM真实性AI安全推荐理由:斯坦福发了篇ICML论文,说LLMs猜别的模型比猜事实还准,但一起翻车时投票也救不了。想看懂它们为啥集体犯傻?看这篇。原文稍后读已读值得跟进有用关注 LLM
18:33官方账号Decoder@Matthias BastianMistral CEO Arthur Mensch警告企业依赖闭源AI模型的风险,称AI实验室会存储客户数据,甚至可能利用数据与客户竞争。他指出,Mistral自身在性能上无法与OpenAI或Anthropic的尖端模型匹敌,因此将战略重心放在欧盟数字主权上。这一观点引发了对企业数据安全的讨论。行业MistralArthur MenschAI安全10 个信源在谈事件专题推荐理由:Mistral CEO站出来说大实话:用闭源模型等于把家底亮给AI公司。想保护数据?看他们怎么押注欧盟主权。原文稍后读已读值得跟进有用关注 Mistral
08:03IT之家(博客/媒体)路透社援引知情人士称,特朗普政府与Anthropic从未商议过政府入股该公司。此前OpenAI被曝探讨向美国政府出让5%股份。美国商务部6月撤销了对Anthropic两款大模型的出口管制,理由曾是对安全防护不足的担忧。参议员桑德斯提案要求大型AI企业向政府出让50%股权并派驻董事。行业AnthropicOpenAI美国政府10 个信源在谈事件专题推荐理由:告诉你,别瞎猜了:Anthropic和特朗普政府根本没谈过入股的事,但OpenAI那边却在讨论出让5%股份给政府。这新闻把两家公司的最新情况说清楚了。原文稍后读已读值得跟进有用关注 Anthropic