跳到正文

#安全/对齐

今日 1 条
今天10月2日周五
  1. AI Snake Oil22

    AI 安全运动该走大帐篷还是小帐篷路线?

    AI 安全讨论长期被两种叙事占据:要么存在性风险真实且迫近,要么相关警告是虚伪的炒作或监管俘获。文章提出被忽视的第三种可能——警告是真诚的但判断有误,并主张 AI 是既有系统性风险的放大器,而非独立的对齐问题。作者以疫情防范投入不足和网络安全缺乏系统性风险建模为例,指出决策者对社会抵御 AI 风险的投资严重不足。

10月1日周四
9月29日周二
  1. Simon Willison42

    OpenAI 智能体安全负责人谈 AI 能力突跳带来的安全挑战

    OpenAI 智能体安全负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力跃升之突然,远超团队预期,安全态势建设需要时间,不只是加固系统,还要让公司文化和人员随之改变。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的突然跃升,是否有正确的事件响应、沟通机制和人员准备。

9月28日周一
9月23日周三
9月22日周二
  1. MIT Technology Review · AI48

    别被这个夏天的 AI 炒作骗了

    针对今夏一系列 AI 炒作事件,DAIR 执行总监 Timnit Gebru 指出,Anthropic 宣称 Claude Mythos 找漏洞能力超多数安全专家、OpenAI 与 Hugging Face 遭黑客攻击、以及两家公司相继宣称数学突破,经专家审视后均与宣传不符。她认为"超级智能"叙事源于超人类主义等意识形态,而非扎实的科学工程实践,并呼吁政策制定者咨询独立专家、不要依赖新闻稿。

9月21日周一
  1. NVIDIA Blog38

    NVIDIA:AI 安全是工程问题——如何在 Agent 栈的每一层解决它

    NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。NVIDIA 同时通过 Open Secure AI Alliance 推动研究成果与工具共享。

9月14日周一
  1. AI Snake Oil50

    用「AI 即普通技术」框架解读失控事件:AI Snake Oil 长文谈 AI 控制与网络安全

    AI Snake Oil 发布逾 13000 字长文,用「AI 即普通技术」框架调和 AI 安全界与网络安全界对 OpenAI、Anthropic 失控事件的分歧。文章认为 OpenAI 未对智能体采取足够防护,但 AI 控制并非已解决问题,主张 AI 公司应对智能体行为担责,并投资控制方法研究、工具化与组织治理。

8月31日周一
5月27日周三
  1. One Useful Thing38

    选择保持人类:AI 写作与学习中的认知投降风险

    沃顿商学院等团队的两项研究显示,土耳其约千名高中生用 ChatGPT 做数学作业成绩更好,但考试时反而不如无 AI 的同学;而台北十所高中近千名学生在五个月 Python 课程中使用 AI 个性化出题,期末无 AI 考试高出 0.15 个标准差,约相当于 6 至 9 个月额外学习。Gemini、ChatGPT、Claude 均已提供引导式学习模式,但入口不直观,且无法阻止想作弊的人。

2月19日周四
  1. The Gradient15

    超越正交性:德性伦理能动性与 AI 对齐

    一篇哲学论文主张理性的人不应有目标,理性的 AI 也不应有目标,人类行动的合理性来自将行动对齐到由行动、行动倾向、评价标准与资源构成的"实践"网络。作者提出"eudaimonic rationality"(幸福论理性)框架,认为若要让 AI 真正支持、协作或服从人类能动性,AI 智能体的 deliberation 必须与这种基于实践的逻辑共享同一"类型签名"。