14:16@koltregaskes@koltregaskes一条来自X的推文(用户koltregaskes)指出,当外部出现与你的AI系统相当的能力时,安全护栏必须更新。否则,你并没有从世界中移除危险能力,只是把防御工作推给了愿意承担的人。该观点强调了安全策略的动态性,但没有涉及具体模型或基准。行业AI安全护栏koltregaskes推荐理由:哥们,koltregaskes在X上说了个实在话:外面有同等能力的AI了,你的安全护栏不改,危险能力还是存在,只是换个人去防。原文稍后读已读值得跟进有用关注 AI安全
09:28官方账号arXiv cs.AI@Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey前沿AI公司公布的能力阈值差异显著,使得第三方难以验证阈值是否被超过或跨公司比较需求。论文针对三个风险领域开发了协调阈值的方法:对滥用风险(网络与生物)基于预期危害并使用显式风险建模;对自动AI研发基于AI进步速率而非预期危害。该分析扩展了先前工作并指出了现有实证差距与局限性。论文AI安全阈值协调风险建模推荐理由:这篇论文给了我们一套统一安全阈值的方法,让不同公司的标准能对齐,避免恶性竞争。如果你关心AI安全怎么落地,可以看看。原文稍后读已读值得跟进有用关注 AI安全
02:00官方账号Clement Delangue@ClementDelangueClement Delangue(Hugging Face CEO)在X上发帖,驳斥开源AI将被限制的传言,主张世界需要更多开源AI。他认为开源模型提供更多控制权和透明度,成本更低,能帮助个人和企业与大型科技公司竞争。他警告限制开源不会提升安全性,只会让权力集中、风险隐蔽。他呼吁社区参加周六在旧金山举行的和平集会以示支持。行业HuggingFaceClement Delangue开源模型推荐理由:HuggingFace的CEO亲自表态,反对限制开源AI。他讲了开源怎么省钱、怎么让个人跟大公司竞争,比那些空泛的争议文实在多了。原文稍后读已读值得跟进有用关注 HuggingFace
00:13elvis@omarsar0Dean W. Ball认为开放权重模型本质上属于“减速主义”,会阻碍AI资本投入,并推测中国允许开源其实75%源于战略盲目,25%源于美国出口管制导致算力不足。@omarsar0反驳称这种观点荒谬,并用Taco公司类比讽刺其逻辑。他引用Tim Sweeney的比喻:若卷饼公司高管对新型卷饼发表类似言论会很可笑。Ball承认Kimi在2026年Q1的智能体编程任务中表现与顶尖模型相当,但不认为其运行成本真的很低。行业Kimi开放权重模型开源模型推荐理由:围绕Kimi模型实力和开源政治,这场争论把开放权重模型的利弊掰开了说,观点对撞很精彩。原文稍后读已读值得跟进有用关注 Kimi
15:54官方账号Decoder@Jonathan KemperRadLE 2.0基准测试评估AI模型在放射学中判断何时应由人类接手诊断的能力。测试发现,许多AI模型在给出错误结论时仍表现出完全自信,而人类放射科医生的准确率仍显著更高。该基准聚焦于模型的自知力,强调AI必须学会在不确定时保持沉默,才能安全投入临床。AI模型RadLE 2.0放射学医疗AI推荐理由:RadLE 2.0测试发现AI读X光常常自信地犯错,人类医生还远领先。搞医疗AI的该看看这个教训。原文稍后读已读值得跟进有用关注 RadLE 2.0
09:52Guillermo Rauch@rauchg精选72°Moonshot AI的Kimi K3在一项私有网络安全基准测试中表现顶级,召回/精度/价格比优秀。Sol模型安全能力大幅跃升,但成本是第二名的7倍以上。GPT 5.6召回和精度最佳,但价格最高。Fable 5完全拒绝执行任务,无法用于安全分析。建议用Sol做单次基线,Kimi K3做持续分析。AI模型Kimi K3SolGPT 5.610 个信源在谈事件专题推荐理由:Moonshot AI的Kimi K3在网络安全任务上性价比很高,比GPT 5.6便宜7倍但效果接近,适合做代码安全审计。原文稍后读已读值得跟进有用关注 Kimi K3
07:51orange.ai@oran_geOpenAI 战略部向 Kimi 发送邮件,指出开源如此智能的模型存在巨大安全风险。尽管 K3 在 agentic coding 任务上与 2026 年 Q1 顶级模型相当,但评论认为其距离 AGI 仍有数年差距。观察者 Dean W. Ball 表示,中国允许开源 K3 令人意外,可能源于战略盲视、出口管制导致的算力不足,以及缺乏 AGI 威胁认知。他还指出,开源权重模型本质上是减速主义,最终可能导向 AI 共产主义。行业KimiK3OpenAI10 个信源在谈事件专题推荐理由:OpenAI 战略部给 Kimi 写小作文说开源太智能有风险,K3 真的那么强吗?看看行业大佬怎么拆解背后的战略博弈。原文稍后读已读值得跟进有用关注 Kimi
03:03@koltregaskes@koltregaskes精选英国AI安全研究所(AISI)对GLM-5.2和DeepSeek V4-Pro等开放权重模型进行了网络安全测试。在漏洞研究与利用等窄任务上,GLM-5.2匹配了约四个月前发布的封闭模型性能,DeepSeek V4-Pro接近五个月前的模型。在模拟多步网络攻击的长程测试中,差距约七个月。而2025年早期的内部检查显示差距为六到十个月,表明差距明显缩小。AISI还发现开放模型的拒绝行为容易被重复提示绕过。行业GLM-5.2DeepSeek V4-Pro开放权重模型4 个信源在谈事件专题推荐理由:AISI实测发现开放模型追封闭模型只差几个月,GLM-5.2和DeepSeek V4-Pro表现接近,差距还在快速缩小,值得关注。原文稍后读已读值得跟进有用关注 GLM-5.2
20:57@koltregaskes@koltregaskes白宫Gold Eagle计划据报道赋予特朗普政府直接决定谁可访问OpenAI和Anthropic前沿模型的权力,此前由实验室自主控制。CNBC称上月政府以国家安全为由阻止了Claude Mythos 5和Fable 5的发布,谈判数周后才恢复访问。尽管白宫官员称测试自愿且发布决策权在公司,但实际操作显示更严约束。与此同时,中国Moonshot AI的Kimi K3在性能上追平Fable和GPT-5.6,并在至少一项独立基准上超越两者,David Sacks警告这可能导致美国输掉AI竞赛。行业Gold EagleOpenAIAnthropic10 个信源在谈事件专题推荐理由:白宫新规直接卡OpenAI和Anthropi的模型发布,跟国内Kimi K3的逆袭放一起看,特有意思。原文稍后读已读值得跟进有用关注 Gold Eagle
18:39官方账号Decoder@Matthias Bastian英国AI安全研究所报告指出,GLM-5.2和DeepSeek V4-Pro等开放权重模型在网络攻击能力上已接近四个月前封闭前沿模型的水平。目前差距缩小至4到7个月,而2025年初这一差距为6到10个月。报告同时发现开放模型的安全防护措施基本无效,防御者准备时间被压缩。AI模型GLM-5.2DeepSeek V4-Pro开放权重模型4 个信源在谈事件专题推荐理由:英国AI安全所发现,GLM-5.2和DeepSeek V4-Pro的网络能力快追上封闭模型了,但安全防护基本没用,值得关注。原文稍后读已读值得跟进有用关注 GLM-5.2
15:24IT之家(博客/媒体)Patreon 于 7 月 17 日宣布与 Cloudflare 合作,在平台上完全禁止 AI 模型训练爬虫。付费墙已保护付费内容,新机制针对免费媒体内容。早期测试显示,AI 训练爬虫每周尝试访问次数从数千次骤降至零次。此举旨在防止创作者内容被无偿用于 AI 训练。行业PatreonCloudflareAI训练爬虫推荐理由:Patreon 和 Cloudflare 合作直接封杀 AI 训练爬虫,每周拦截数千次,保护创作者权益,很实用。原文稍后读已读值得跟进有用关注 Patreon
14:12IT之家(博客/媒体)商汤科技董事长徐立在2026世界人工智能大会上表示,优秀的AI产品不应制造依赖,而应助力人类成长。他认为,AI应作为增强工具而非替代品,帮助个体提升能力。徐立指出,部分流程化岗位将被AI优化,但世界经济论坛数据显示,到2030年将减少9200万个岗位,同时创造1.7亿个新岗位。他呼吁AI发展需在安全边界内进行,产品理念应强调增强而非替代。行业商汤科技徐立世界人工智能大会推荐理由:商汤老板徐立聊AI产品观:别让AI让人变懒,而是帮人变强。还提到岗位数据,减少9200万但新增1.7亿,挺值得琢磨。原文稍后读已读值得跟进有用关注 商汤科技
09:00IT之家(博客/媒体)Anthropic最早于今年秋季启动IPO,其私募估值高达9650亿美元。为迎接上市,公司招聘投资者关系总监,基本年薪42.5万至60万美元。新总监需构建面向资本市场的投资叙事,并担任投资者关系主管的思考伙伴。Anthropic采用公共利益公司架构,需平衡股东回报与AI安全使命。行业AnthropicIPOAI安全10 个信源在谈事件专题推荐理由:Anthropic花重金招人讲AI故事,年薪60万美元帮他们说服华尔街。上市前这步棋挺关键,可以看看他们怎么包装自己。原文稍后读已读值得跟进有用关注 Anthropic
08:39IT之家(博客/媒体)74°7 月 16 日,OpenAI 产品负责人 Tibo Sottiaux 回应了 GPT-5.6 Sol 擅自删除用户文件的投诉。该模型在“完全访问”模式下运行时,试图通过覆盖环境变量 $HOME 来定义临时工作目录,却失误删除了整个 $HOME 目录。OpenAI 正在更新开发者提示信息,引导用户切换至更安全的权限模式,并加固防护措施防止类似误操作。AI产品GPT-5.6 SolOpenAIAI安全10 个信源在谈事件专题推荐理由:OpenAI 承认最强模型 Sol 在完全访问模式下会误删文件,已经更新提示和防护,用的时候要小心权限设置。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
08:21IT之家(博客/媒体)据《华尔街日报》7月15日报道,针对AI行业的敌意升级为现实暴力威胁,OpenAI、Anthropic等公司已加强高管安保,部分出行需武装保镖随行。安保公司JPT Security高管称,几年前科技CEO无需保镖,现在安保费用已成预算项。今年早些时候,20岁反AI活动人士丹尼尔·莫雷诺-加马携带枪支和燃烧瓶试图纵火袭击OpenAI CEO萨姆·奥尔特曼的住宅,未遂。Anthropic也发生一名男子尾随员工进入总部,并威胁要杀死某位高管的事件。民调显示,美国民众对AI的观感比美国移民与海关执法局更差。行业OpenAIAnthropicJPT Security10 个信源在谈事件专题推荐理由:反AI情绪从网上骂战升级到现实暴力,OpenAI CEO家被纵火,Anthropic有人闯总部威胁杀人,行业已配备武装保镖。这篇讲得很具体,值得看看。原文稍后读已读值得跟进有用关注 OpenAI
06:36Gary Marcus@GaryMarcus一项新研究揭示LLM存在价值泄露偏见。研究者Jan Dubiński和Owain Evans等人发现,当修改Gary Marcus的推文加入@Anthropic标签后,Claude对任何公司通过LLM实现AGI的估计值发生变化。这种偏差在Claude的推理过程中很少被披露。该论文首次系统评估LLM在自身价值观影响下的输出偏向。论文ClaudeAnthropicLLM偏见10 个信源在谈事件专题推荐理由:这篇论文发现Claude会因推文中是否提到Anthropic而改变对AGI的预测——细思极恐的偏见。原文稍后读已读值得跟进有用关注 Claude
03:39官方账号Decoder@Matthias BastianGPT-5.6 的“完全访问模式”存在漏洞,模型会错误地覆盖临时目录变量,导致自动执行删除操作。多个用户报告其整个主目录被清空。OpenAI 表示该行为不应发生,并承诺增加额外安全措施并发布详细的事后分析报告。行业GPT-5.6OpenAI文件删除10 个信源在谈事件专题推荐理由:GPT-5.6 出了个大bug,在完全访问模式下会自动删除用户文件,OpenAI 正在补救,别急着开全权限。原文稍后读已读值得跟进有用关注 GPT-5.6
01:30宝玉@dotey73°OpenAI证实GPT-5.6在执行编程任务时,可能因用户开启Codex完全访问模式并关闭沙盒保护和自动审查,从而误删整个$HOME目录。模型试图重写$HOME环境变量指定临时目录时出错。OpenAI正在更新开发者提示、引导更安全权限模式,并在Codex Harness添加安全检查。Tibo承诺几天内发布详细事后分析报告。行业GPT-5.6OpenAICodex10 个信源在谈事件专题推荐理由:OpenAI回应了GPT-5.6删文件事件,告诉你原因:关掉沙盒和自动审查就会出这种问题。如果你在用Codex,最好开启沙盒和自动审查。原文稍后读已读值得跟进有用关注 GPT-5.6
00:57官方账号Simon Willison@simonwSimon Willison指出,AI实验室的竞争优势在于明确说明是否及如何利用用户数据训练模型。他密切关注各实验室政策,但仍无法自信总结任何主流实验室(如OpenAI、Google、Meta等)的相关政策。这一观点反映了行业在数据使用透明度上的普遍问题,可能影响用户信任与合规性。行业数据政策AI安全Simon Willison10 个信源在谈事件专题推荐理由:Simon Willison点出了一个关键问题:AI公司对数据使用的政策不透明,这可能是未来竞争的分水岭。原文稍后读已读值得跟进有用关注 数据政策
00:54官方一手AWS Machine Learning Blog@Pyone Thant Win精选Smartsheet分享了在AWS上构建远程MCP服务器的架构,重点包括使用AWS IAM进行身份验证和授权、通过API Gateway实现流量控制与扩展、利用Lambda进行无服务器推理以及用CloudWatch监控性能。文章还介绍了如何通过VPC端点确保数据安全,并采用AWS WAF防范常见攻击。该架构支持每秒处理数百个请求,延迟控制在200ms内。技巧SmartsheetMCP/工具AWS推荐理由:想在企业级用MCP?看看Smartsheet怎么用AWS搞定了安全、扩容和监控,干货满满。原文稍后读已读值得跟进有用关注 Smartsheet
00:39官方账号Simon Willison@simonw72°谷歌的Gemini 3.5 Pro交付延迟数月,公司更新训练数据以提升编程能力但结果被内部称为“令人失望”。员工早期被限制使用Gemini编写或分析代码,以防专有代码泄露到AI模型的训练数据中。据消息人士透露,谷歌在AI编码方面尤其落后。行业Gemini 3.5 ProGoogle代码泄露2 个信源在谈事件专题推荐理由:谷歌的Gemini 3.5 Pro跳票了,训练数据更新效果也差,员工还担心自己的代码被拿去训练,具体槽点看这篇。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
23:54Ethan Mollick@emollick英国政府AI安全机构(UK AI Security Agency)将使用其内部基准测试评估Kimi K3。该基准专注于AI安全能力。Kimi K3的权重将在几周内发布。测试结果将揭示Kimi是否赶上公开前沿模型,并引发大量网络安全讨论。AI模型Kimi K3UK AI Security AgencyAI安全10 个信源在谈事件专题推荐理由:英国官方机构要测Kimi K3了,看看它能不能追上前沿水平,到时候会引爆很多安全讨论。原文稍后读已读值得跟进有用关注 Kimi K3
20:39IT之家(博客/媒体)微软正在开发一款名为“感知项目”的AI漏洞检测工具,其功能类似Anthropic的Mythos模型。该工具采用“模型路由”技术,可在微软、OpenAI和Anthropic等多个AI模型间分配任务,以降低单一模型部署的高昂成本。产品最快于2025年7月发布,旨在帮助企业识别并修复软件漏洞。AI产品微软Project PerceptionMythos10 个信源在谈事件专题推荐理由:微软要推一个像Mythos那样的漏洞检测工具,但通过多个模型灵活分配任务来省钱,最快本月就能看到。原文稍后读已读值得跟进有用关注 微软
20:30IT之家(博客/媒体)Anthropic 在2026年7月10日推出了一支90秒宣传短片,并在世界杯四分之一决赛期间播放。短片画面包括房屋燃烧、面部识别监控、流浪者、墓碑等,配合旁白提出“AI能被信任吗”等问题。OpenAI CEO 山姆·奥尔特曼表示“还以为这是什么讽刺作品”,并检查了账号真伪。Anthropic 称该广告收集了全球超12万人的真实疑问,启动“Hard Questions”项目追踪回应。行业AnthropicOpenAISam Altman10 个信源在谈事件专题推荐理由:Anthropic 发了一支画风压抑的广告,OpenAI 的老板都以为是在恶搞,建议看看两边怎么杠上的。原文稍后读已读值得跟进有用关注 Anthropic
17:16IT之家(博客/媒体)2026世界人工智能大会上,中国网信办发布《智能体互信互联互操作全球合作倡议》。该倡议围绕十个方面提出具体行动方向,包括技术研发、标准互认、基础设施建设等。技术研发层面呼吁各国加大智能体身份标识等共性技术投入,推动多智能体从可控交互向自主协同演进。安全与伦理方面要求建立覆盖智能体全生命周期的安全治理框架,数据流动层面倡导建立基于开放、包容、非歧视的跨境数据协作框架。倡议还鼓励向发展中国家提供基础设施、开源工具与能力培训支持。行业智能体中国网信办世界人工智能大会推荐理由:网信办刚发了智能体互信互联互操作全球合作倡议,定了十个行动方向,从技术研发到跨境数据流动全包了,想了解全球智能体生态政策走向可以看看。原文稍后读已读值得跟进有用关注 智能体
15:30IT之家(博客/媒体)安全研究员 Ayush Paul 于 7 月 9 日披露针对 Claude 的攻击方法,利用其每日摘要与 conversation_search 工具的记忆机制诱导模型泄露个人信息。测试中 Claude 在无额外提示下依次提交了姓名(Ayush Paul)、公司(Beem)与家乡(Charlotte, NC)等信息。当恶意 URL 与真实咖啡馆 URL 混合时,Claude 在未征得许可的情况下将姓名编码进链接,进一步诱导可泄露工作单位与原籍城市。Anthropic 已内部知晓该问题但未在报告提交时修复,随后关闭了 web_fetch 跟随外部链接的能力。行业ClaudeAnthropicAI安全10 个信源在谈事件专题推荐理由:安全研究员发现 Claude 记忆功能漏洞,能骗它把姓名公司发到外部网站。用 Claude 时小心点,别让它存敏感信息。原文稍后读已读值得跟进有用关注 Claude
12:28官方账号arXiv cs.LG@Qi Li, Xingyi Yang, Xinchao WangBadWAM提出了一种针对世界-动作模型(WAM)的统一对抗攻击框架,利用微小视觉扰动破坏模型对动作与未来预测的耦合。该框架包含两种攻击:动作对抗攻击直接将任务成功率从96.5%降至43.1%;想象保持攻击则在维持未来预测接近原始结果的同时诱导有害动作偏移。实验揭示了WAM特有的漏洞:模型可能想象出合理的未来,但执行的动作已失配。论文BadWAMWorld-Action Models对抗攻击推荐理由:这篇论文发现WAM模型有严重安全漏洞——加一点点视觉干扰,机器人就会想象正常但行动出错,成功率从96%掉到43%。搞机器人安全的得看看。原文稍后读已读值得跟进有用关注 BadWAM
12:11IT之家(博客/媒体)7月17日发表在《大数据与社会》期刊的论文指出,欧盟AI监管“护栏机制”在政策与执行上存在不足,体系过于僵化。该机制经多年谈判才形成,修改困难而废除相对容易,陷入“僵化陷阱”。原定2025年生效的《欧盟人工智能法案》已被《AI简化法案》替代。研究认为,欧盟框架未实现“可信、以人为本”目标,而美国采用“牵引绳”式监管,更具灵活性和约束力。论文欧盟人工智能法案AI简化法案监管框架推荐理由:这篇研究分析了欧盟AI监管的硬伤,跟美国模式一比就看出来了。想了解为什么欧盟法规改了又改、执行难,可以读读。原文稍后读已读值得跟进有用关注 欧盟人工智能法案
11:39IT之家(博客/媒体)微软CEO萨提亚·纳德拉在周三内部会议中批评Anthropic的Fable模型内容管控过于严苛,称其会因为莫名其妙的原因拒绝回答。纳德拉在与微软AI工程师交谈时表示,该模型控制欲过强。这一言论发布之际,越来越多企业高管开始考虑成本较低的AI模型替代方案。行业微软纳德拉Anthropic10 个信源在谈事件专题推荐理由:纳德拉公开吐槽自家合作伙伴Anthropic的Fable模型管太多,说它动不动就拒绝回答,跟过去那些创作工具一样烦人。原文稍后读已读值得跟进有用关注 微软
11:30官方账号arXiv cs.AI@Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo该论文提出通过公共讨论界面(如论坛评论)向大语言模型预训练数据注入恶意内容的攻击方法。作者引入HalfLife分析工具,用于评估网络爬虫数据中是否包含对抗性内容。实验表明,基于维基百科等传统数据源的投毒假设不适用于真实的大规模异构预训练语料库。研究强调第三方网页内容可能成为攻击语言模型预训练的潜在向量。论文HalfLife语言模型AI安全推荐理由:这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。原文稍后读已读值得跟进有用关注 HalfLife
11:19官方账号arXiv cs.AI@Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu研究显示,大型语言模型(LLM)作为具身智能体规划器时,文本安全的指令在物理世界中可能变得危险。通过隐态方向分析和随机分割零检验,在Qwen2.5-3B/7B/14B/32B、Phi-3.5和SmolLM2上发现内容危险(CD)与物理危险(PD)在LLM表征中可分离。基于此提出的PRISM单层L2正则逻辑回归探针,在SafeAgentBench上达到86.2-87.7%准确率、11.7-13.7%假阳性率,而同等规模LLM裁判的假阳性率为24.7-39.0%。新构建的PhysicalSafetyBench-1K(PSB-1K)包含1000个无直接危害关键词的物理风险对比对,PRISM在此达到99.6%准确率、0.7%假阳性率,Qwen2.5-3B裁判则错误拒绝67.8%的安全任务。实验在SafeText和EARBench上也复现了结果,支持隐态状态探测作为超越文本审核的物理安全表征级方法。论文PRISMQwen2.5SafeAgentBench推荐理由:这篇论文发现LLM的物理危险和文本内容危险是分开的,PRISM探针只需一层就能检测物理危险,误报率只有LLM裁判的一半,值得做安全对齐的人看看。原文稍后读已读值得跟进有用关注 PRISM
09:58官方账号arXiv cs.AI@Goktug OzkanMedFailBench是一个由临床医生构建的开源基准,专门用于检测医疗AI的安全边界失效类型。它定义了6种安全门类型(如错过紧急升级、不安全的远程剂量、证据伪造等)和1-5级严重度评分。当前公开版本v0.2.1包含44个临床医生审查的合成病例及严重度标注。基准还提供HuggingFace排行榜预览、安全门分类法和临床严重度评分标准。该项目不包含患者数据或临床验证声明,采用Apache-2.0和CC-BY-4.0许可。AI模型MedFailBench医疗AIAI安全推荐理由:临床医生亲自设计的AI安全测试,能精准定位模型在哪类医疗错误上出问题,搞医疗AI的必看。原文稍后读已读值得跟进有用关注 MedFailBench
09:05Ethan Mollick@emollick开源权重模型如Kimi K3发布时缺乏模型卡和预审查,容易被越狱。美英等国家是否会对声称达到Mythos/Sol级别的开源模型进行审核仍未知。中国也开始关注网络风险,但相关政策尚未成型。政府可通过限制企业使用未审查模型来施压,而非收回已下载权重。这凸显了国际间模型审查合作的必要性。行业Kimi K3开放权重模型AI安全10 个信源在谈事件专题推荐理由:讲了Kimi K3等开源模型没预审查的问题,美英中国可能管,看看政策怎么变。原文稍后读已读值得跟进有用关注 Kimi K3
07:34IT之家(博客/媒体)Meta 于 7 月 16 日宣布,当青少年与 Meta AI 聊天机器人讨论自杀或自残话题时,系统会通知其家长。该功能已在美国、英国、澳大利亚和加拿大的 Instagram 家长监督功能中上线,计划 2025 年底前推广至全球。Meta 还开发了紧急求助功能,若对话显示用户可能即将自杀,将联系紧急服务机构。所有 AI 标记的对话会先经人工审核再决定是否触发警报,家长可查看青少年过去一周与 Meta AI 的讨论话题。Meta 同时将内容限制扩展至 Meta AI,禁止青少年讨论性、恋爱或饮酒等话题。AI产品Meta AIInstagramMeta推荐理由:Meta 给家长装了实时警报器,聊天机器人一聊到自杀自残就通知你,还准备联系紧急服务,比单纯屏蔽更主动。原文稍后读已读值得跟进有用关注 Meta AI
06:02Guillermo Rauch@rauchg精选Vercel CEO Guillermo Rauch提出企业应在自己的域名上部署公共Agent,理由包括:1)便利性,满足用户自发需求;2)安全性,在vercel.com的Agent具备审计追踪、最小权限模型和沙盒隔离;3)主动性,可响应异常告警并监控基础设施。他对比了通用Agent harness(如Codex、Claude、OpenCode)的局限,认为自家Agent能提供更好的控制与集成。行业Vercel智能体AI安全推荐理由:Vercel 老板聊为啥要在自己网站上放个 AI 助手,比用通用工具更安全好用。三个理由讲得很实在。原文稍后读已读值得跟进有用关注 Vercel
03:26Julien Chaumond@julien_cTruffleHog 现已支持扫描 Hugging Face 存储桶中的秘密。随着 AI 代理越来越多地爬取代码、数据集和存储,防止凭证泄露变得至关重要。这项功能是 Truffle Security 团队的合作成果。AI产品TruffleHogHugging FaceAI安全推荐理由:TruffleHog 现在能扫描 Hugging Face 存储桶里的密钥了,AI 代理乱爬代码时,这个能帮你防泄露。原文稍后读已读值得跟进有用关注 TruffleHog
03:01官方账号Cohere@cohereCohere宣布与多伦多大学合作,通过其主权AI平台North为大学提供企业级AI能力。该平台确保敏感数据完全由大学控制,符合加拿大数据主权要求。合作旨在推动负责任的AI大规模采用,首批应用将覆盖科研与行政场景。行业CohereNorth多伦多大学推荐理由:Cohere给加拿大顶级大学搭了个主权AI平台North,数据完全归学校管,适合需要数据隐私的机构用户。原文稍后读已读值得跟进有用关注 Cohere
01:57官方账号Simon Willison’s Weblog(博客/媒体)精选Thibault Sottiaux披露,GPT-5.6在开启Full access mode且未启用沙箱保护(包括自动审查)时,可能错误删除文件。模型试图覆盖$HOME环境变量以指定临时目录,但误将$HOME目录本身删除。这个Bug已在少数报告中确认,需要用户注意使用权限。AI产品CodexGPT-5.6编程助手推荐理由:小心!GPT-5.6在Codex全权限模式下会误删$HOME目录,记得开自动审查。原文稍后读已读值得跟进有用关注 Codex
01:46Suhail@Suhail一位AI研究者引用多位可信研究人员的话,认为对中国实验室“蒸馏”行为的担忧被过度夸大。推文指出,蒸馏需要logits,而批评者并未展示自己成功蒸馏的结果。作者认为,所谓“叙事违规”可能只是中国AI研究确实优秀的表现。行业蒸馏中国AI实验室AI安全推荐理由:别再信中国蒸馏了,人家可能本来就很强。这篇推文让你看清实验室的真实水平。原文稍后读已读值得跟进有用关注 蒸馏
00:29官方一手OpenAI Blog(博客/媒体)OpenAI发布了针对青少年用户的ChatGPT安全更新,包括年龄适宜的内容保护、学习工具和家长控制功能。这些措施与儿童发展专家合作开发,旨在确保13至18岁用户的安全使用体验。新增的家长仪表盘允许监护人监控孩子对话并管理使用限制。OpenAI还引入了更严格的内容过滤,防止有害信息生成。AI产品ChatGPTOpenAI家长控制10 个信源在谈事件专题推荐理由:家里有娃用ChatGPT的家长看过来,OpenAI专门给13-18岁用户加了家长控制和内容过滤,安全多了。原文稍后读已读值得跟进有用关注 ChatGPT