NVIDIA Vera Rubin NVL72 首登 MLPerf Inference v6.1,性能领先
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态管理用电。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 和面向营销人员的工具,并集成 HubSpot 与 Shopify。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,供员工分享。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析能力,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常态化环节。该研究聚焦员工实际使用行为,而非岗位定义本身。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,在英国国家 AI 超算 Isambard-AI 上训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,训练仅耗时两天。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款模型,具体能力与开放方式尚未公布。
Fyxer 基于 OpenAI 模型、微调、记忆机制与真实用户反馈,为用户整理收件箱并按本人语气起草邮件。该产品定位为可信任的 AI 行政助理。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查的频率大幅降低。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营流程自动化:以 GitHub Issue 为工作单元,Issue forms 收集结构化字段,label 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日筛选报名者并在结束后自动清理。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并验证其可用的能力,目标是让工程师减少代码审查、加快交付。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于应对 ChatGPT 在线存储的规模化需求。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增与删除行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口;浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放。该智能体可连接企业数据,用自然语言发现洞察并构建交互式仪表盘。
OpenAI 发布 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和生成可直接交付客户的材料。
OpenAI 与美国总务管理局(GSA)合作,为符合条件的联邦、州、地方及部落政府提供 $0 许可费、使用量 50% 折扣以及扩展的网络防御支持。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其基于 Codex harness 的编排与长会话能力。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话(telephony)支持。
推荐理由:OpenAI 在 API 中上线全双工语音模型,读者可据此判断语音应用的接入方式与能力边界。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他此前在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备更强的推理、计算机操作能力以及写作与设计判断力。
推荐理由:OpenAI 官方发布面向企业的新一代模型,可了解其在推理与计算机操作上的能力定位。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的实际应用方式。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:原文给出 9 亿单核苷酸变异预测的规模与免费入口,读者可据此判断基因组变异解读的门槛变化。
OpenAI 发文探讨能力更强、价格更低的 AI 如何扩展个人与企业可完成的工作范围,并让增长变得更经济。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更贴近用户原本的构想。
推荐理由:OpenAI 官方发布 ChatGPT Images 2.5,读者可了解图像生成在个性化与成图质量上的新变化。
OpenAI 正在扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作项目。该计划覆盖从课堂到新闻编辑室的多个环节。
OpenAI 分享了一份针对 Navier–Stokes 千禧年大奖难题的 AI 生成解答,包含一份书面论述和一份 Lean 形式化证明。
OpenAI 开放申请一项 500 万美元资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。该计划面向独立研究,申请现已开放。
GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,按各模型标准费率计费。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断编排式编码智能体的取舍。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions 视图中查看各会话进度,例如在 tailspin-toys 仓库中同时进行 funded sort 开发、无障碍审查和测试运行。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长周期编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上逼近更贵的前沿模型,同时保持 3.7 Flash 的价格。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,读者可据此判断长视频分析的成本结构变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力变化,可据此判断生成视频工作流的可控程度。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 开展双盲评测,将外部评测限制在加密“黑箱”中,防止模型提前接触测试题。该方案针对基准污染问题,在隐私保护环境下用保密基准测试模型,以提升评测可信度。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的转写模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等指标,并对比上一代 Chirp 3,可据此判断语音转写的能力边界。
Google DeepMind 发布文章回顾从 Atari、AlphaGo 到 AlphaStar 的 15 年游戏 AI 研究,并宣布与 EVE Universe 开发商 Fenris Creations 建立研究合作。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。
Google DeepMind 发布多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首批支持美国手语(ASL)转英文,并已接入 Pixel 11 的 Gboard 与 Live Transcribe,后续将扩展更多设备与语言。
推荐理由:官方披露 SL2T 的训练数据规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 落地的技术取舍。