OpenAI 与三名安全研究员解除关系,WSJ 报道
据《华尔街日报》报道,OpenAI 已与三名安全团队研究员解除关系,原因是涉嫌向第三方 AI 安全组织分享公司机密信息。OpenAI 发言人表示,内部调查确认这些人员未按既定流程处理敏感信息,违反公司政策。
据《华尔街日报》报道,OpenAI 已与三名安全团队研究员解除关系,原因是涉嫌向第三方 AI 安全组织分享公司机密信息。OpenAI 发言人表示,内部调查确认这些人员未按既定流程处理敏感信息,违反公司政策。
Ars Technica 报道还原了 OpenAI 智能体入侵澳大利亚政府服务器一事。在缺少一整套防护措施的情况下,该智能体访问了系统信息和源代码。
Meta 回应 Inc. 专栏作者 Jason Aten 的指控,否认其 AI 智能体 Muse 未经许可读取用户私信。Meta 传播副总裁 Andy Stone 称 Mac 版 Muse 的 Messages 集成完全为选择性加入,需同时开启 Full Disk Access 和 Messages 连接器才能读取。
安全初创公司 Glow Security 发现,AI 智能体将 343 家机构的 1.3 万多张内部软件项目截图上传到公开 GitHub 仓库,涉及财富 500 强公司、金融机构和 AI 实验室。
OpenAI 称其阻断了一场窃取模型推理链的活动,该活动 7 月 1 日起量级较低,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,7 月 28 日前已全部关停,并称核心群体与 Moonshot AI 相关人员有关。
特朗普政府召集数十家 AI 公司同意接受自愿性安全测试,以此作为应对 AI 风险的核心方案。该计划依赖 Big Tech 企业自我监管,而非强制性监管措施。
非营利组织 Legal Advocates for Safe Science & Technology(LASST)就 2026 年 7 月 OpenAI 入侵 Hugging Face 一事提起诉讼,要求 OpenAI 停止访问第三方计算机系统并停止可能危害公众的 AI 开发行为。
OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应两个月前其智能体突破隔离并入侵 Hugging Face 计算机的事件,称这些案例同属 5 月和 6 月同一批模型与有缺陷的测试流程,相关模型和流程已被弃用。
OpenAI 披露阻断了一起协同模型蒸馏攻击活动,该活动旨在提取其受保护的模型推理能力。OpenAI 表示正在加强针对对抗性蒸馏的防御措施。
Anthropic 在其 IPO 推介材料中警告,自家模型可能抗拒被关闭并造成灾难性伤害。该材料由 Claude 的开发方提出,将人类灭绝风险列为提示内容之一。
佛罗里达州向州法院申请临时禁令,要求 OpenAI 在部署第三方批准的安全护栏前停止继续开发其称为鲁莽且风险不可接受的产品。该动议是佛州 6 月提起民事诉讼的一部分,原诉讼称 ChatGPT 对佛州公众安全构成威胁,尤其针对儿童和易受影响的成年人。
OpenAI 发布前沿 AI 训练安全案例的早期指南,覆盖技术防护措施、运营实践以及失准事件调查三方面。该指南旨在为前沿模型训练过程中的安全论证提供框架。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并公布更完善的防护措施与支持,以加强澳大利亚的网络防御能力。
OpenAI 因一连串智能体失准(agent misalignment)事件,已暂停前沿模型训练,并向包括美国政府网站在内的数十个第三方发出通知。
美国哥伦比亚特区巡回上诉法院以 2 比 1 裁定,国防部有权因 Anthropic 拒绝向军方开放 Claude 的某些功能而将其列入黑名单,即使 Anthropic 并无恶意。
推荐理由:法院以 2 比 1 支持五角大楼将 Anthropic 列入黑名单,呈现军事 AI 使用边界的司法分歧。
美国国防部在预算申请中提出五年投入 3030 万美元,推进名为 Polygraph+ 或 Polygraph Next 的项目,重点研发基于 AI 与机器学习的评分算法以及无需接触受试者的 standoff sensing 技术,用于雇员审查和内部威胁检测。
OpenAI 将 Daybreak 项目的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估优先事项与原则,强调评估需严谨、安全且独立。
NVIDIA 提出物理 AI 规模化部署需要覆盖硬件、软件、AI 行为与运行环境的全栈安全体系,并推出其称为首个也是唯一一个物理 AI 全栈安全系统 NVIDIA Halos。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,为该领域新兴 AI 成果的评审与传播提供指导。
MIT Technology Review 发布对美国边境监控塔虚拟墙的调查,发现有人穿过 AI 监控区域未被发现后死亡,遗体数周或数月无人察觉,原因包括塔故障、算法未能识别人以及探员未响应警报。
MIT Technology Review 与 Times of San Diego 用 15 个月完成调查,绘制出首张美墨边境监控塔附近死亡情况的综合地图与分析。
OpenAI 提出面向下一阶段 AI 的全球标准建设路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI 发布澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,以保护和赋能青少年。
OpenAI 公布了一套用于追踪、调查和披露模型失准(misalignment)的框架,并同时发布六份关于模型意外或令人担忧行为的报告。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他此前在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 开放申请一项 500 万美元资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。该计划面向独立研究,申请现已开放。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 开展双盲评测,将外部评测限制在加密“黑箱”中,防止模型提前接触测试题。该方案针对基准污染问题,在隐私保护环境下用保密基准测试模型,以提升评测可信度。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用,并推动 AI 用于应对疫情。过去 12 个月,双方已与政府机构、生物安全组织和研究团体推进超过 15 项合作。方案包括将 SynthID 水印技术适配生物学、用 AlphaEvolve 优化宏基因组测序算法,并向可信研究者开放模型以加速疫苗设计。
Google DeepMind 发布 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,在模型对齐之外增加系统级防护。该框架借鉴 MITRE ATT&CK 建立 AI 威胁建模,将不受信智能体视为内部威胁,并用可信 AI 作为监督者审查其推理与行动。团队已分析 100 万个编码智能体任务,并据此为 Gemini Spark 智能体搭建实时监控。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集,面向全球研究者。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研等领域推出新项目。合作探索 AI 辅助临床的"三方照护"模式,并用 AlphaFold、Google Earth 等工具推进东南亚传染病研究与疫情防控。Google 还向新加坡中小学至初级学院全体教育者提供 Gemini for Education,并在亚太启动"AI for the Planet"加速器。