Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印首次延伸到合成生物学,读者可了解其在蛋白质序列与结构上的实现方式及生物安全用途。
NVIDIA 加入 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
Google DeepMind 为 Private AI Compute 引入私密的服务端内存,用于个人 AI 场景。该能力以安全方式在服务端保存内存数据,具体参数与可用性未在原文披露。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态管理用电。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款模型,具体能力与开放方式尚未公布。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:原文给出 9 亿单核苷酸变异预测的规模与免费入口,读者可据此判断基因组变异解读的门槛变化。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长周期编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上逼近更贵的前沿模型,同时保持 3.7 Flash 的价格。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,读者可据此判断长视频分析的成本结构变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力变化,可据此判断生成视频工作流的可控程度。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 开展双盲评测,将外部评测限制在加密“黑箱”中,防止模型提前接触测试题。该方案针对基准污染问题,在隐私保护环境下用保密基准测试模型,以提升评测可信度。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的转写模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等指标,并对比上一代 Chirp 3,可据此判断语音转写的能力边界。
Google DeepMind 发布文章回顾从 Atari、AlphaGo 到 AlphaStar 的 15 年游戏 AI 研究,并宣布与 EVE Universe 开发商 Fenris Creations 建立研究合作。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。
Google DeepMind 发布多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首批支持美国手语(ASL)转英文,并已接入 Pixel 11 的 Gboard 与 Live Transcribe,后续将扩展更多设备与语言。
推荐理由:官方披露 SL2T 的训练数据规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 落地的技术取舍。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出一天预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出模型在气旋路径与强度预测上的精度提升幅度,并说明代码与权重已开源,读者可据此判断气象预报的可用性变化。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时原生支持调用 Google Search 等工具。
推荐理由:官方给出进度分类、时刻定位与多机协作的具体指标,可据此判断机器人高层推理的当前水位。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更丰富自然的旋律结构、提示词遵循度和结构感知更好的歌词、更具情感表达和发音改进的人声,以及对输出节奏和时长的更易控制。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:原文给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款模型。
推荐理由:原文给出三款新模型的效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:原文给出轻量安全模型的基准对比与限量开放方式,读者可据此判断其成本与部署路径。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用,并推动 AI 用于应对疫情。过去 12 个月,双方已与政府机构、生物安全组织和研究团体推进超过 15 项合作。方案包括将 SynthID 水印技术适配生物学、用 AlphaEvolve 优化宏基因组测序算法,并向可信研究者开放模型以加速疫苗设计。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Atal Tinkering Labs 教育者提供 24/7 备课与培训助手。
Google DeepMind 与 A24 宣布达成首个此类研究合作,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。合作将跨越多个项目,让 A24 及其电影人直接参与塑造新技术,同时为 Google DeepMind 提供艺术家反馈。Google 还对 A24 进行了投资,具体目标与技术产出将随时间演进。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、价格与能力边界,便于评估多模态工作流成本。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它只作为独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文给出 computer use 从独立模型并入 Gemini 3.5 Flash 的变化,读者可据此判断智能体跨平台自动化的可用性。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发一款基于 Gemini 的 AI 规划原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。
推荐理由:原文给出英国政府与 Google DeepMind 共建规划原型的目标、试点范围与上线时间,可据此判断 AI 进入公共审批流程的落地方式。
Google DeepMind 发布 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,在模型对齐之外增加系统级防护。该框架借鉴 MITRE ATT&CK 建立 AI 威胁建模,将不受信智能体视为内部威胁,并用可信 AI 作为监督者审查其推理与行动。团队已分析 100 万个编码智能体任务,并据此为 Gemini Spark 智能体搭建实时监控。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次性生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存占用与质量取舍,便于判断本地低并发场景是否适用。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集,面向全球研究者。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。官方称其基准表现接近 26B MoE 模型,内存占用不到后者一半,可在 16GB VRAM 或统一内存上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的取舍。
Google DeepMind 推出为期 3 个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,本周在伦敦启动,可获得其 AI 技术栈、技术指导和 Gemini 机器人模型支持。入选公司覆盖物流、制造、医疗、气候和导航等领域,包括挪威 3D-Components、法国 Bubble Robotics、英国 Touchlab 等。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进展。
推荐理由:塞拉利昂预注册随机对照试验给出了 Guided Learning 的量化增益与师生互动数据,可了解 AI 辅助教学的实证路径。
Google DeepMind 在亚太地区启动首届加速器计划,聚焦“AI for the Planet”,面向该地区初创公司、研究团队和非营利组织,为期三个月。入选机构将获得专家指导,以及 Google AI 专家协助将前沿 AI 和科学 AI 模型集成到其项目或产品中,覆盖自然、气候、农业、能源等领域。计划以在新加坡举办的线下训练营启动,现已开放注册意向。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,可了解 AI 辅助科研的实际落地方式。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 场景锚定能力,可基于美国真实地点生成可交互世界,并支持 Ocean World、Desert Sands、Stone Age、B&W film 等风格。
推荐理由:Google 把 Genie 的世界模型与 Street View 真实影像打通,读者可了解智能体训练环境如何从纯生成走向现实锚定。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,可了解其能力边界与首发落地渠道。