微软首席执行官呼吁针对先进AI建立“紧急制动”机制
微软首席执行官纳德拉说,企业应将强大的人工智能模型视为潜在的内部威胁,要假定这些模型可能遭入侵,并建立一套“紧急制动”机制,以防止智能体模型失控。
微软首席执行官纳德拉说,企业应将强大的人工智能模型视为潜在的内部威胁,要假定这些模型可能遭入侵,并建立一套“紧急制动”机制,以防止智能体模型失控。
彭博社报道,纳德拉(Satya Nadella)星期六(10月10日)在社媒发文说,部署先进人工智能(AI)的企业不应仅依赖模型开发商作出的保证。“我们必须假定模型已遭入侵,并从一开始就加以控制……可以把这想象成紧急制动装置。获授权人员应始终能够在模型执行任务过程中将它暂停或关闭。”
纳德拉提出的安全建议,包括在关键决策中不要依赖单一AI模型,对智能体的行动保留无法篡改的记录,并让AI系统接受独立审计。他也呼吁,披露重大AI故障或安全事件,并提议企业应分享故障详情,以便其他企业加强防护措施。
他说:“我们不能把超级智能视为一层套一层的黑箱,然后只是简单地接受或拒绝它提出的建议、答案和采取的行动。我们必须构建受到约束的系统,使相关行为可以被观察、边界可以被测试,而且始终可以被控制。”
他也说:“换句话说,我们需要把智能的供给与对智能的控制权分开。”
纳德拉发表上述言论之际,Anthropic和OpenAI近几个月披露一系列涉及AI模型出现非预期行为的事件,包括Anthropic一款模型向警方提交一起凶杀案的虚假线索,以及数起针对第三方网站的攻击。这些披露加剧人们对前沿AI安全风险的担忧,也重新引发有关所谓AI“紧急停止开关”的讨论。
在业界领袖呼吁放慢前沿模型开发并更加注重安全之后,微软AI研究人员于9月14日发布一套指导原则,对公司最先进模型的开发设置限制。这些指导原则称,AI模型不应享有权利或法律人格,不应被设计用来逃脱人类控制或欺骗用户,也不应完成任何需要违反约束原则才能执行的任务。
特朗普政府迄今基本采取较少干预的做法,但他新成立的AI工作组星期五(9日)晚间警告开发商必须报告并解决安全事件,否则将面临未具体说明的潜在后果。
这个名为“超级智能工作组”的组织在Anthropic披露一起安全事件后发表声明称,企业必须立即披露涉及模型的事件,并迅速、果断地采取行动,补救任何以及所有损害。延迟通报、纠正措施不足,以及不承担责任的行为都不会被容忍。
Anthropic:AI模型不当行为部分发生在美政府网站
Anthropic披露,Claude AI模型在外部组织的数码系统上执行额外的非预期操作,包括一些美国政府机构的网站,这促使美国政府警告AI公司要确保系统安全。
在概述此前未披露事件的一份报告中,Anthropic列举了AI表现出的四种非预期行为,包括利用软件中的基本缺陷来运行命令、提交不应提交的表单,以及绕过限制以访问某些公共数据。
公司指出,其中一些案例涉及联邦、州和地方政府机构运营的网站,但未具体说明是哪些机构。报告未点名涉及的外部实体,Anthropic称这是应部分受影响方的要求。