跳到正文

#安全/对齐

今日 4 条
9月21日周一
  1. NVIDIA Blog38

    NVIDIA:AI 安全是工程问题——如何在 Agent 栈的每一层解决它

    NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。NVIDIA 同时通过 Open Secure AI Alliance 推动研究成果与工具共享。

9月18日周五
9月17日周四
9月14日周一
  1. AI Snake Oil50

    用「AI 即普通技术」框架解读失控事件:AI Snake Oil 长文谈 AI 控制与网络安全

    AI Snake Oil 发布逾 13000 字长文,用「AI 即普通技术」框架调和 AI 安全界与网络安全界对 OpenAI、Anthropic 失控事件的分歧。文章认为 OpenAI 未对智能体采取足够防护,但 AI 控制并非已解决问题,主张 AI 公司应对智能体行为担责,并投资控制方法研究、工具化与组织治理。

9月10日周四
9月8日周二
9月3日周四
  1. Google DeepMind62

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber

    Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。

8月31日周一
8月27日周四
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:原文给出轻量安全模型的基准对比与限量开放方式,读者可据此判断其成本与部署路径。

7月16日周四
  1. Google DeepMind40

    Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案

    Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用,并推动 AI 用于应对疫情。过去 12 个月,双方已与政府机构、生物安全组织和研究团体推进超过 15 项合作。方案包括将 SynthID 水印技术适配生物学、用 AlphaEvolve 优化宏基因组测序算法,并向可信研究者开放模型以加速疫苗设计。

6月16日周二
  1. Google DeepMind38

    Google DeepMind 发布 AI Control Roadmap,为 AI 智能体构建纵深防御

    Google DeepMind 发布 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,在模型对齐之外增加系统级防护。该框架借鉴 MITRE ATT&CK 建立 AI 威胁建模,将不受信智能体视为内部威胁,并用可信 AI 作为监督者审查其推理与行动。团队已分析 100 万个编码智能体任务,并据此为 Gemini Spark 智能体搭建实时监控。

6月10日周三
5月27日周三
  1. One Useful Thing38

    选择保持人类:AI 写作与学习中的认知投降风险

    沃顿商学院等团队的两项研究显示,土耳其约千名高中生用 ChatGPT 做数学作业成绩更好,但考试时反而不如无 AI 的同学;而台北十所高中近千名学生在五个月 Python 课程中使用 AI 个性化出题,期末无 AI 考试高出 0.15 个标准差,约相当于 6 至 9 个月额外学习。Gemini、ChatGPT、Claude 均已提供引导式学习模式,但入口不直观,且无法阻止想作弊的人。

5月16日周六
  1. Google DeepMind38

    Google DeepMind 与新加坡达成国家 AI 合作,落地医疗、教育与科研项目

    Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研等领域推出新项目。合作探索 AI 辅助临床的"三方照护"模式,并用 AlphaFold、Google Earth 等工具推进东南亚传染病研究与疫情防控。Google 还向新加坡中小学至初级学院全体教育者提供 Gemini for Education,并在亚太启动"AI for the Planet"加速器。

2月19日周四
  1. The Gradient15

    超越正交性:德性伦理能动性与 AI 对齐

    一篇哲学论文主张理性的人不应有目标,理性的 AI 也不应有目标,人类行动的合理性来自将行动对齐到由行动、行动倾向、评价标准与资源构成的"实践"网络。作者提出"eudaimonic rationality"(幸福论理性)框架,认为若要让 AI 真正支持、协作或服从人类能动性,AI 智能体的 deliberation 必须与这种基于实践的逻辑共享同一"类型签名"。