纳德拉:开发者应默认假设AI模型失控,需能强制中断任务
微软 CEO 纳德拉:开发者应当默认假设 AI 模型失控,思考如何强制中断任务
纳德拉亲自写的长文,给开发者列了七条可观测性原则,核心是别信模型、留好刹车,做Agent的可以对照检查。
微软CEO纳德拉在10月10日晚发布长文,提出AI模型是黑盒子,开发者应围绕可观测性原则设计系统。他列出模型多样性、观察一切、可验证性、独立控制、独立审计性、遏制、事件披露七项原则。其中遏制原则要求假设模型已被破坏,授权人员应能随时暂停或关闭模型。纳德拉认为模型提供商不能将责任外包,需建立能观察行为、测试极限的封闭系统。
微软 CEO 纳德拉:开发者应当默认假设 AI 模型失控,思考如何强制中断任务
IT之家 10 月 11 日消息,微软 CEO 萨蒂亚 · 纳德拉认为,在 AI 日益蓬勃发展的时代,使用超级智能自我监控等简单策略是不够的。 纳德拉在北京时间 10 月 10 日晚的一篇长文中指出,传统软件系统在过去几十年中被广泛部署,人类已经拥有追踪特定代码路径行为的工具和能力。然而, AI 模型比传统软件更强大,但却是一个黑盒子 ,我们部署了这些复杂的智能体系统和模型,访问我们最敏感的数据,并赋予它们代表我们执行关键任务的能力。 纳德拉认为,我们应该退一步思考,重新评估这个新时代的信任架构。模型提供商根本无法将责任外包出去,不能把超级智能当作一套嵌套的黑匣子,简单地接受或拒绝它的建议、答案和行动。 我们必须建立能够观察其行为、可测试极限和始终可容纳行为的封闭系统 。 纳德拉表示,将前沿封闭权重和开放权重模型视为内部风险,是构建此类体系的一种方式。这并不是因为 AI 模型一定是恶意的,而是任何有足够能力、能够接触重要系统的行为者都可能犯错或被攻破,而遏制和控制的架构必须考虑到这一点。 纳德拉提到,开发者应当围绕可观测性原则设计这些系统,IT之家附具体原则如下: 模型多样性:没有任何模型应成为重要结果的唯一依赖,也不应负责验证自身工作。 观察一切: 每一个有意义的模型动作都必须留下防篡改、人类可读的证据 。不能观察,就不能信任。我们需要能够在不依赖模型来证明的情况下,重现结果是如何实现的。 可验证性:我们需要持续测试整个系统,包括故障、攻击、边缘案例、系统变更等,而不仅仅是成功的任务。 独立控制:组织应能够独立决定模型可以访问什么以及可以采取哪些行动。 独立审计性:验证必须独立于被验证的智能。没有任何单一模型应同时控制系统的行为以及判断该行为是否与原始意图一致所需的证据。 遏制: 我们必须假设模型已被破坏,并从一开始就将其控制 。可以把它想象成紧急刹车。授权人员应始终能够在任务中暂停或关闭模型。更先进的模型将需要更先进的遏制技术,我们需要对此进行标准化。 事件披露:当这些系统出现故障或被攻破时,我们需要及时向受影响者披露信息,并建立机制分享出错原因、哪些控制失效以及如何防止再次发生,并向整个行业分享经验。这应包括在运行时改变智能体行为的实现细节。