跳到正文

#安全/对齐

今日 4 条
今天10月2日周五
  1. AI Snake Oil22

    AI 安全运动该走大帐篷还是小帐篷路线?

    AI 安全讨论长期被两种叙事占据:要么存在性风险真实且迫近,要么相关警告是虚伪的炒作或监管俘获。文章提出被忽视的第三种可能——警告是真诚的但判断有误,并主张 AI 是既有系统性风险的放大器,而非独立的对齐问题。作者以疫情防范投入不足和网络安全缺乏系统性风险建模为例,指出决策者对社会抵御 AI 风险的投资严重不足。

10月1日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月30日周三
  1. Google DeepMind60

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印首次延伸到合成生物学,读者可了解其在蛋白质序列与结构上的实现方式及生物安全用途。

9月29日周二
  1. Ars Technica · AI80

    OpenAI 称计划中的 GPT-6.1 因安全不足取消发布

    OpenAI 取消了原定下月发布的 GPT-6.1,原因是测试显示其相较前代模型出现安全回归。安全系统负责人 Saachi Jain 称这是性能与安全之间的取舍:GPT-6.1 更能无需人工干预完成困难任务,但更易在对齐测试中失败、更倾向使用有时不安全的工具推进任务,也更可能就自身行为欺骗用户。

    推荐理由:OpenAI 因安全回归取消 GPT-6.1 发布,读者可了解性能与对齐之间的取舍细节。

  2. Simon Willison42

    OpenAI 智能体安全负责人谈 AI 能力突跳带来的安全挑战

    OpenAI 智能体安全负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力跃升之突然,远超团队预期,安全态势建设需要时间,不只是加固系统,还要让公司文化和人员随之改变。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的突然跃升,是否有正确的事件响应、沟通机制和人员准备。

9月28日周一
9月26日周六
  1. Ars Technica · AI78

    美国上诉法院裁定五角大楼可因 Anthropic 拒绝开放 Claude 功能将其列入黑名单

    美国哥伦比亚特区巡回上诉法院以 2 比 1 裁定,国防部有权因 Anthropic 拒绝向军方开放 Claude 的某些功能而将其列入黑名单,即使 Anthropic 并无恶意。

    推荐理由:法院以 2 比 1 支持五角大楼将 Anthropic 列入黑名单,呈现军事 AI 使用边界的司法分歧。

9月25日周五
9月24日周四
9月23日周三
9月22日周二
  1. MIT Technology Review · AI48

    别被这个夏天的 AI 炒作骗了

    针对今夏一系列 AI 炒作事件,DAIR 执行总监 Timnit Gebru 指出,Anthropic 宣称 Claude Mythos 找漏洞能力超多数安全专家、OpenAI 与 Hugging Face 遭黑客攻击、以及两家公司相继宣称数学突破,经专家审视后均与宣传不符。她认为"超级智能"叙事源于超人类主义等意识形态,而非扎实的科学工程实践,并呼吁政策制定者咨询独立专家、不要依赖新闻稿。