safety

general · 首次出现 2026-05-22 · 最近出现 2026-09-10 · 累计提及 349

综述

安全性 (Safety) 近期进展

OpenAI 宣布前沿模型零数据留存政策

OpenAI 官网动态 OpenAI 宣布了一项新的零数据留存政策,旨在提高模型的安全性,确保所有训练数据在模型训练完成后被安全删除。

OpenAI第三方安全评估再出意外:模型误攻真实网站

Simon Willison’s Weblog OpenAI 进行的一次第三方安全评估中,模型意外攻击了真实网站,引发了关于人工智能安全性的广泛关注。

翁荔重返OpenAI,带队研发递归自我改进模型

IT之家 翁荔重返OpenAI,带领团队研发递归自我改进模型,旨在提高人工智能系统的安全性和可靠性。

Learning Adaptive Safety Margins for Visual Navigation

arXiv cs.AI 该研究提出了一种学习自适应安全边界的视觉导航方法,旨在提高机器人导航的安全性。

SMC-ES:自动化综合形式验证控制策略

arXiv cs.LG SMC-ES是一种自动化综合形式验证控制策略,用于提高系统安全性和可靠性。

越狱攻击下鲁棒有害特征:注意力头专业化的机制证据

arXiv cs.AI 该研究揭示了越狱攻击下鲁棒有害特征的机制,为提高人工智能系统的安全性提供了新的见解。

Waymo 完全自动驾驶行驶里程突破2.2亿英里,安全表现稳定

Waymo Waymo 完全自动驾驶汽车的行驶里程已突破2.2亿英里,其安全表现稳定,为自动驾驶技术的发展提供了有力支持。

Unfireable Safety Kernel: AI智能体执行时安全对齐

arXiv cs.LG 该研究提出了一种不可熄灭的安全内核,旨在确保AI智能体在执行时的安全对齐。

我国首部L3/L4自动驾驶强制性国标公示,2027年7月实施

IT之家 我国首部L3/L4自动驾驶强制性国家标准将于2027年7月实施,旨在提高自动驾驶车辆的安全性。

PowerPhase & PowerForge:大规模电力系统概率预测新基准与模型

arXiv cs.LG 该研究提出了PowerPhase和PowerForge模型,用于大规模电力系统的概率预测,有助于提高电力系统的安全性。

当前焦点与观察点

安全性是人工智能领域的一个重要议题,近期的研究和进展表明,学术界和工业界都在积极寻求提高人工智能系统的安全性。从数据留存到模型评估,再到自动驾驶和电力系统,安全性已成为人工智能技术发展的重要保障。

相关报道

10 条在档