6月23日
03:57
03:57官方账号Greg Brockman@gdb
精选73°
OpenAI推出了Codex Security插件,专为安全团队设计。该插件支持深度代码扫描、自动验证发现结果,并能够追踪攻击路径。它还可以构建威胁模型,生成针对代码库的特定补丁用于审查。此外,支持将分析结果导出到其他安全工具中。
事件专题

推荐理由:OpenAI给安全团队出了个Codex插件,能深度扫描代码、自动验证漏洞、画攻击路径,还生成专属补丁,省事儿不少。
01:04
01:04官方一手OpenAI Blog博客/媒体
OpenAI推出了Daybreak工具集,包含Codex Security和GPT-5.5-Cyber两个组件。Codex Security用于自动发现代码中的安全漏洞。GPT-5.5-Cyber则辅助验证和修复流程。这些工具旨在帮助组织大规模地发现、验证和修补漏洞。
事件专题

推荐理由:OpenAI出了Daybreak工具,用Codex Security自动找漏洞,GPT-5.5-Cyber帮你验证修复,搞安全的可以看看。
6月22日
6月21日
6月20日
16:45
16:45官方一手Pandaily@contact@pandaily.com (Pandaily)
在HDC 2026上,华为正式发布HarmonyOS 7开发者Beta版,系统深度集成AI能力。HarmonyOS生态设备已超过6600万台。新系统展示了端侧AI防欺诈功能,利用本地模型保护用户隐私。此外还推出了性能优化模型,提升设备运行效率。
事件专题

推荐理由:华为在HDC 2026上发布了HarmonyOS 7开发者Beta版,设备超6600万,还展示了端侧AI防欺诈,隐私保护更强了。
06:23
06:23Gary Marcus@GaryMarcus
Gary Marcus指出,生成式AI已造成社会伤害,AI垃圾内容正在破坏互联网。数据中心过度建设可能威胁经济和环境。AI驱动的网络攻击威胁数据完整性,AI生成的低质量代码将引发软件危机。此外,缺乏针对就业冲击的应对计划,且对齐问题仍无解决方案。
推荐理由:Gary Marcus一口气列出八条反对AI加速的理由,从互联网被垃圾填满到就业失控,每一条都直击要害。想听听技术圈的反方声音?看这个就够了。
02:27
02:27Stanford AI Lab@StanfordAILab
斯坦福AI实验室的SAIL博客发布新文章,由Peter Bhase和Chris Potts共同撰写,系统梳理了CoT(思维链)监控作为AI安全热点问题的起源。文章回顾了相关研究的历史演进,分析了该概念如何从技术讨论演变为关键安全议题。
推荐理由:斯坦福AI实验室的两位研究者梳理了CoT监控的来龙去脉,想理解AI安全前沿热点的演变,这篇博客值得看。
01:55
6月19日
18:27
18:27官方账号Decoder@Maximilian Schreiner
OpenAI研究者发现,通过强化学习对诚实性、可修正性等理想行为特质进行训练,模型在跨领域表现提升。在健康数据上训练后,欺骗检测能力也增强,模型在53个基准中的44个上得分更高。该方法与Anthropic的基于宪法的对齐方法不同。研究显示少量特质训练即可带来广泛安全改善。
事件专题

推荐理由:OpenAI发现,只给模型一点点“诚实”训练,它就在53个测试里赢了44个,连健康领域的骗术都能识破。和Anthropic的路数不一样,挺有意思。
18:24
18:24官方账号Decoder@Matthias Bastian
德国慕尼黑地区法院裁定Google须直接为其AI生成的搜索结果概览内容承担责任。该AI错误地将两家慕尼黑出版商与欺诈计划相关联。Google称这些为“小错误”并已提起上诉。此案成为判定AI生成内容法律责任的标志性事件。

推荐理由:Google的AI搜索概览功能搞错了,把两家德国出版商说成搞诈骗的,法院判Google直接负责,Google不服上诉了。
14:40
14:40@koltregaskes@koltregaskes
73°
Project Glasswing的部分用户报告他们仍能访问Anthropic的Claude Fable 5模型。尽管美国政府命令导致其他版本完全关闭,但获批组织保留了对该预览系统的访问权限。目前尚无关于Claude Fable 5全面回归的消息。
事件专题

推荐理由:Anthropic的Claude Fable 5模型因美国政府命令部分受限,但Project Glasswing用户还能用,想知道怎么回事就看这条。
13:43
13:43Marc Andreessen@pmarca
Anthropic CEO Dario Amodei在Polymarket上透露,参与测试Mythos模型的公司警告其威力堪比超级武器,并建议使用需要类似枪支许可证的严格管控。该言论引发对AI安全与监管的讨论。目前Mythos模型的具体细节尚未公开。
事件专题

推荐理由:Anthropic老板自己爆料的内部警告——他们测试的Mythos模型被说成超级武器,建议持证才能用,这瓜很劲爆。
07:11
07:11官方账号OpenAI@OpenAI
OpenAI通过少量训练数据使模型在53项独立评估中的44项上取得改进,涵盖欺骗、奖励黑客、安全、健康、心理健康等领域。该表现优于计算匹配的基线模型。评估涉及多种领域、任务格式和评分方案。
事件专题

推荐理由:OpenAI发现用一点额外数据就能让模型在超多对齐测试里变好,覆盖欺骗、安全、健康等方面,挺牛的。
07:10
07:10官方账号OpenAI@OpenAI
OpenAI在真实对话中训练模型,通过强化学习强化诚实、谦逊、开放纠正、公平和关怀人类福祉等特质。该训练覆盖健康、科学、教育等12个领域,旨在提升模型的对齐与安全性。方法基于RLHF改进,专注对话场景中的具体行为。
事件专题

推荐理由:OpenAI训练模型时不止看能力,还用强化学习专门教它诚实、谦逊、愿意接受批评,覆盖12个领域,对AI安全性很有意义。
06:37
06:37官方账号OpenAI@OpenAI
OpenAI 发布声明称,这是朝向更鲁棒有益和对齐模型的早期步骤。他们正在训练模型将有益特质带入新情境,使AI在能力增强的同时变得更可靠、透明和有用。该工作属于对齐研究的一部分,尚未披露具体模型或基准测试结果。
事件专题

推荐理由:OpenAI 开始教模型把好习惯带到新场景,让AI更靠谱。这个对齐实验挺关键,关注未来进展。
03:01
03:01官方账号Decoder@Matthias Bastian
SK Telecom通过合作伙伴计划Project Glasswing获取了Anthropic的AI模型Claude Mythos访问权限。美国官员担忧该韩国企业与中国的联系可能带来安全风险。白宫介入后,SK Telecom与Anthropic的合作受到影响。该事件凸显了AI领域的地缘政治敏感性和监管复杂性。
事件专题

推荐理由:SK Telecom用Project Glasswing拿到了Claude Mythos,结果被白宫叫停,因为跟中国沾边。这事把AI安全和国际关系搅一起了。
02:31
02:31官方账号Decoder@Matthias Bastian
精选
Google DeepMind 发布了新的 "AI Control Roadmap",将安全措施与可衡量的 AI 能力挂钩。公司对 100 万个编码任务的分析显示,大多数问题源于过于热心的 AI 智能体,而非恶意意图。DeepMind 警告,建立全球安全标准的时间窗口正在关闭。

推荐理由:DeepMind 用管理内部安全的方法管控 AI 智能体,分析了100万次编码任务后发现,坏事的都是太积极的智能体而不是恶意的,挺颠覆。