跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 5 小时前AI 评分36

我们太相信 AI 说“不”的能力了

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 文章指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应“有用、诚实、无害”,如今模型经过大量拒绝训练,却仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。

来源:MIT Technology Review · AI · technologyreview.com