请阅读下面我们与 Coxon 的对话,为了清晰和简洁,该对话经过了轻微编辑。
连线:你不是第一个对人工智能模型可能导致灭绝事件提出担忧的人。人们多年来一直在谈论这个问题,有些人已经讨论了几十年。您认为您的消息为何被传达?
我认为这主要是一个时间问题。许多人感觉能力的步伐正在上升。我们已经在许多领域从人类转变为超人,例如编程、黑客和数学,我认为人们已经意识到了这一点。即使媒体上有很多关于事情被夸大的言论,我认为人们也看到事情并没有放缓。
这是一个原因,两个原因是最近发生的安全事件,这些事件让很多人对听起来像科幻小说的担忧产生了新闻,但实际上根本不是科幻小说。这两种趋势在过去几年中都是渐进的。在测试模型时识别模型之类的事情已经很常见了。也许在三年前,这还只是科幻小说中的问题。然后,大约一年前,它变成了现实。
这两件事都意味着人们非常容易接受从事人工智能工作的人说:“是的,明年,事情可能会变得非常糟糕,很快。”
你提到了最近发生的事件。您能否更具体地说明您所指的内容以及为什么促使您现在公开发言?
我认为这里最典型的例子是一群 OpenAI 代理对 Hugging Face 的攻击。令人震惊的是,特工们将这次黑客攻击作为总体策略的一部分,以更多地了解分级机。他们试图了解自己所处的世界,试图了解进行分类的事物。他们认为继续齐心协力破解某些基础设施是有意义的,并且他们成功了。
这曾经看起来像是科幻小说。两年前,评估人工智能只是针对一些数学问题运行模型。现在我们遇到这样的情况:在评估人工智能时,它会工作数天,提出自己的各种想法,并决定攻击第三方并使其基础设施面临风险。它们似乎是自愿这样做的,人类没有任何准备。这只是我测试时发生的。
一些人认为“抱脸”事件表明人工智能公司正在不计后果地前进,另一些人认为这是人工智能模型现在非常擅长黑客攻击的标志,还有一些人认为两者兼而有之。我很好奇你从中得到的具体收获是什么。
我不想过多关注“抱脸”攻击,因为我还认为有很多证据表明我们不知道如何正确对齐模型。当我们训练模型时,我们将它们推入这套训练环境,然后希望最终的表现相当合理,但我们仍然无法精确控制人工智能的表现。