自适应并行推理:高效推理扩展的下一个范式
自适应并行推理让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,而非由外部框架强加固定的并行结构。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!
自适应并行推理让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,而非由外部框架强加固定的并行结构。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这一由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可看算法智能体的跨领域边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:Google DeepMind 公开医疗 AI 智能体的多模态评测结果,读者可了解 AI 在临床场景中的能力边界与协作定位。
Google DeepMind 与韩国科学技术信息通信部(MSIT)宣布建立合作,将在首尔办公室设立 AI Campus,向韩国科研机构开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练任务拆分为异步通信的"计算孤岛",在硬件故障下仍能持续训练并自动恢复。该架构用 Gemma 4 模型验证,ML 性能与传统方法持平,并在美国四个区域以 2-5 Gbps 网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,还支持 TPU v6e 与 TPU v5p 混合训练。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型"状态输入"梯度脆弱等问题。
Google DeepMind 推出 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数。
推荐理由:官方给出 Elo 1211 与多语言、音频标签等能力细节,可据此判断语音生成的可控性进展。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并新增仪表读数能力,可据此判断机器人高层推理的进展。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
伯克利 AI 研究团队提出基于互信息的成像系统评估与优化框架,仅用含噪测量和噪声模型即可量化系统信息量,在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。