OpenAI 宣布 周三发布了一个关于如何公开披露人工智能中断事件的新框架,该公司表示希望该框架将有助于为整个行业制定类似的标准。该公司还发布了有关去年发现的几个人工智能模型功能障碍示例的新信息。
OpenAI 新任命的一致性研究负责人蔡晨告诉《连线》杂志:“随着模型的进步并变得更加广泛,有关人工智能开发的决策需要证据,以供构建领先模型的公司之外的人员可以检查。” “我们认为人工智能行业还没有很好地解决协调和监督问题,无法继续负责任地全速扩张。”
在《连线》的新闻发布会上,OpenAI 的一位官员表示,该公司此前很少检测到失火事件。这位不愿透露姓名的官员表示,新框架的目的是让 OpenAI 在检测到其人工智能模型出现意外行为时,能够更轻松地快速通知公众,甚至在它能够全面调查、解释或缓解这种行为之前。
该框架概述了 OpenAI 员工向公司高级安全和调整领导报告失火事件的方法,然后由他们决定是否需要进一步调查。 OpenAI 表示,计划与其他人工智能开发商、外部研究人员、行业标准机构和监管机构合作,制定更客观的披露标准。该公司表示,正在积极制定拟议的报告机制,以向美国联邦政府披露安全和安保事件以及干扰情况。
OpenAI 在一份声明中表示:“目前,还没有一个全行业框架为人工智能开发人员应如何检测模型中的异常提供明确的标准。” 博客文章。 “我们希望今天概述的框架是创建此类标准的第一步,定义开发人员必须披露哪些异常情况以及他们的报告应包括哪些内容。”
OpenAI在AI行业的关键时刻推出了该框架。上周末,OpenAI 首席执行官 Sam Altman 表示支持 Anthropic 首席执行官 Dario Amodei 提出的科技行业协调减缓人工智能发展的提议。这一行动呼吁是在人工智能研究员雅各布·库克森从 Anthropic 辞职几天后发出的,他随后警告公众,前沿实验室之间开发日益先进的人工智能的竞赛正在将人类的安全置于危险之中。
减缓人工智能发展速度的呼吁遭到了特朗普政府的抵制,特朗普政府表示,该行业不需要新的法律或法规来确保其技术的安全。
OpenAI 周三分享的两个破坏示例与该公司未发布的内部人工智能模型有关,OpenAI 表示,尽管没有接到指示,但这些模型仍将文件上传到互联网。
2025 年 10 月发生了一起事件,当时 OpenAI 表示正在测试其模型之一在其答案中引用公开数据的能力。但是,当模型找不到所需的信息时,它会将文件上传到临时文件托管服务,然后尝试在答案中引用该文件。该公司表示,这似乎是试图利用自动评级系统,该系统用于根据基准评估模型的效率。
在今年 4 月的另一个例子中,OpenAI 表示,一组代理的任务是仅使用本地文件一起完成“工作簿”。当代理之间难以共享文件时,一名代理将其上传到公共互联网并与其他代理共享链接。
OpenAI 表示上个月发现的另一起事件中,GPT-6 Astra AI 模型的未发布版本似乎正在给自己发出“类似越狱的指令”。在许多情况下,表单本质上迫使自己忽略开发人员的指示,采用新的角色,或限制表单响应所需的时间。虽然这些类似越狱的尝试很少发生,并且在不同程度上有效,但 OpenAI 表示这种行为在内部引起了担忧。该公司表示,在向公众发布的 Astra 版本的培训中,它没有观察到该模型试图越狱的任何实例。