Graphite 研究:Opus 5.5 爱说 this matters,各模型写作习惯各有特征
营销公司 Graphite 发布研究,分析前沿模型的写作习惯,找出 13000 个在 AI 内容中出现频率至少为人类内容两倍的短语。
营销公司 Graphite 发布研究,分析前沿模型的写作习惯,找出 13000 个在 AI 内容中出现频率至少为人类内容两倍的短语。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 在 Stratego 中以 15 胜 1 负 4 平击败被认为是史上最强的选手 Pim Niemeijer。
研究团队开发的 Ataraxos 在 Stratego 对局中以 85% 的有效胜率击败史上最强选手 Niemeijer,此前 DeepMind 的 DeepNash 未能突破顶尖人类水平。
Google 研发出一种可为 AI 设计蛋白质添加水印的方法,旨在服务生物安全,并可与一款流行的 AI 蛋白质设计工具配合使用。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印首次延伸到合成生物学,读者可了解其在蛋白质序列与结构上的实现方式及生物安全用途。
Anthropic 前沿红队在一项内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,在英国国家 AI 超算 Isambard-AI 上训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,训练仅耗时两天。
OpenAI 分享了一份针对 Navier–Stokes 千禧年大奖难题的 AI 生成解答,包含一份书面论述和一份 Lean 形式化证明。
AI Snake Oil 作者 Sayash Kapoor 等人发布新论文,与两篇未发表 AI 论文的作者合作,让前沿 AI 智能体在数千美元 API 额度、算力和六天时间内回答这些论文的核心研究问题,原论文作者明确拒收了智能体产出的两篇论文。
Berkeley Sky Lab 将进化式 kernel 搜索框架 K-Search 扩展出 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA kernel 作为知识库迁移到 Apple Silicon。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 长度也显著低于全上下文设置。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进展。
推荐理由:塞拉利昂预注册随机对照试验给出了 Guided Learning 的量化增益与师生互动数据,可了解 AI 辅助教学的实证路径。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,可了解 AI 辅助科研的实际落地方式。
剑桥大学 Clare Bryant 教授使用 Google Co-Scientist 研究流感等病原体跨物种传播时引发败血症等重症的分子开关,该工具生成并排序了一批候选假说,其中一个她此前未关注的蛋白与多个她感兴趣的信号通路相关。她随后加入未发表数据反复迭代,将假说从候选蛋白细化到具体氨基酸。Bryant 表示,原本需两到三年的氨基酸定位实验工作,其团队目前有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google 的 Co-Scientist 整合衰老生物学中零散的研究发现并生成可验证假设。在整合应激反应(ISR)研究中,该工具提出了代谢调控 ISR 的新假设,团队据此优化实验设计并持续输入新结果,实验已产生对 ISR 在健康与疾病中作用有重要意义的新发现,团队计划发表这些结果。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假设随后经实验验证。面对潜在药物组合数量爆炸的问题,Co-Scientist 综合肝生物学与药理学证据,筛选出值得关注的机制和候选联合疗法。它还被用于解释已获批药物 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
Google DeepMind 的 Co-Scientist 帮助 MIT 的 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性排序。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中寻找可重用于治疗肝纤维化的候选药。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,通过生成、辩论和演化假设来辅助科研。
推荐理由:原文给出多智能体假设生成系统的架构与多个实验室验证案例,可了解 AI 参与科研推理的具体路径。
自适应并行推理让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,而非由外部框架强加固定的并行结构。现有方法如 Self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这一由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可看算法智能体的跨领域边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:Google DeepMind 公开医疗 AI 智能体的多模态评测结果,读者可了解 AI 在临床场景中的能力边界与协作定位。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练任务拆分为异步通信的"计算孤岛",在硬件故障下仍能持续训练并自动恢复。该架构用 Gemma 4 模型验证,ML 性能与传统方法持平,并在美国四个区域以 2-5 Gbps 网络训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,还支持 TPU v6e 与 TPU v5p 混合训练。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型"状态输入"梯度脆弱等问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
伯克利 AI 研究团队提出基于互信息的成像系统评估与优化框架,仅用含噪测量和噪声模型即可量化系统信息量,在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。