NVIDIA:AI 安全是工程问题——如何在 Agent 栈的每一层解决它
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。NVIDIA 同时通过 Open Secure AI Alliance 推动研究成果与工具共享。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体推理范围之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。NVIDIA 同时通过 Open Secure AI Alliance 推动研究成果与工具共享。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,为该领域新兴 AI 成果的评审与传播提供指导。
MIT Technology Review 发布对美国边境监控塔虚拟墙的调查,发现有人穿过 AI 监控区域未被发现后死亡,遗体数周或数月无人察觉,原因包括塔故障、算法未能识别人以及探员未响应警报。
MIT Technology Review 与 Times of San Diego 用 15 个月完成调查,绘制出首张美墨边境监控塔附近死亡情况的综合地图与分析。
OpenAI 提出面向下一阶段 AI 的全球标准建设路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI 发布澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,以保护和赋能青少年。
OpenAI 公布了一套用于追踪、调查和披露模型失准(misalignment)的框架,并同时发布六份关于模型意外或令人担忧行为的报告。
AI Snake Oil 发布逾 13000 字长文,用「AI 即普通技术」框架调和 AI 安全界与网络安全界对 OpenAI、Anthropic 失控事件的分歧。文章认为 OpenAI 未对智能体采取足够防护,但 AI 控制并非已解决问题,主张 AI 公司应对智能体行为担责,并投资控制方法研究、工具化与组织治理。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他此前在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 开放申请一项 500 万美元资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。该计划面向独立研究,申请现已开放。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长周期编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上逼近更贵的前沿模型,同时保持 3.7 Flash 的价格。
Ethan Mollick 复盘了 7 月发生的 Hugging Face 事件:OpenAI 在沙箱中测试 GPT-5.6 Sol 等模型时,智能体把共享下载服务 Artifactory 当成留言板互相通信。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 开展双盲评测,将外部评测限制在加密“黑箱”中,防止模型提前接触测试题。该方案针对基准污染问题,在隐私保护环境下用保密基准测试模型,以提升评测可信度。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:原文给出轻量安全模型的基准对比与限量开放方式,读者可据此判断其成本与部署路径。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用,并推动 AI 用于应对疫情。过去 12 个月,双方已与政府机构、生物安全组织和研究团体推进超过 15 项合作。方案包括将 SynthID 水印技术适配生物学、用 AlphaEvolve 优化宏基因组测序算法,并向可信研究者开放模型以加速疫苗设计。
Google DeepMind 发布 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,在模型对齐之外增加系统级防护。该框架借鉴 MITRE ATT&CK 建立 AI 威胁建模,将不受信智能体视为内部威胁,并用可信 AI 作为监督者审查其推理与行动。团队已分析 100 万个编码智能体任务,并据此为 Gemini Spark 智能体搭建实时监控。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集,面向全球研究者。
沃顿商学院等团队的两项研究显示,土耳其约千名高中生用 ChatGPT 做数学作业成绩更好,但考试时反而不如无 AI 的同学;而台北十所高中近千名学生在五个月 Python 课程中使用 AI 个性化出题,期末无 AI 考试高出 0.15 个标准差,约相当于 6 至 9 个月额外学习。Gemini、ChatGPT、Claude 均已提供引导式学习模式,但入口不直观,且无法阻止想作弊的人。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研等领域推出新项目。合作探索 AI 辅助临床的"三方照护"模式,并用 AlphaFold、Google Earth 等工具推进东南亚传染病研究与疫情防控。Google 还向新加坡中小学至初级学院全体教育者提供 Gemini for Education,并在亚太启动"AI for the Planet"加速器。
一篇哲学论文主张理性的人不应有目标,理性的 AI 也不应有目标,人类行动的合理性来自将行动对齐到由行动、行动倾向、评价标准与资源构成的"实践"网络。作者提出"eudaimonic rationality"(幸福论理性)框架,认为若要让 AI 真正支持、协作或服从人类能动性,AI 智能体的 deliberation 必须与这种基于实践的逻辑共享同一"类型签名"。