跳到正文

#Agent

今日 3 条
9月3日周四
9月2日周三
8月27日周四
8月21日周五
8月14日周五
8月4日周二
  1. Microsoft Research62

    微软研究院开源 Orchard:面向可扩展智能体 AI 的开放框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务复用同一套环境、数据管线与评测流程,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,可复用其方法搭建智能体训练环境。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时原生支持调用 Google Search 等工具。

    推荐理由:官方给出进度分类、时刻定位与多机协作的具体指标,可据此判断机器人高层推理的当前水位。

7月28日周二
7月26日周日
  1. Berkeley AI Research22

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 长度也显著低于全上下文设置。

7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:原文给出轻量安全模型的基准对比与限量开放方式,读者可据此判断其成本与部署路径。

7月7日周二
6月25日周四
6月17日周三
  1. Google DeepMind60

    Google DeepMind 与英国政府共建 AI 规划原型,目标将审批时间减半

    Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发一款基于 Gemini 的 AI 规划原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。

    推荐理由:原文给出英国政府与 Google DeepMind 共建规划原型的目标、试点范围与上线时间,可据此判断 AI 进入公共审批流程的落地方式。

6月16日周二
  1. Google DeepMind38

    Google DeepMind 发布 AI Control Roadmap,为 AI 智能体构建纵深防御

    Google DeepMind 发布 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,在模型对齐之外增加系统级防护。该框架借鉴 MITRE ATT&CK 建立 AI 威胁建模,将不受信智能体视为内部威胁,并用可信 AI 作为监督者审查其推理与行动。团队已分析 100 万个编码智能体任务,并据此为 Gemini Spark 智能体搭建实时监控。

6月10日周三
5月19日周二
  1. Google DeepMind62

    Google DeepMind 用 Co-Scientist 加速逆转细胞衰老的基因线索发现

    Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。

    推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,可了解 AI 辅助科研的实际落地方式。

5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 场景锚定能力,可基于美国真实地点生成可交互世界,并支持 Ocean World、Desert Sands、Stone Age、B&W film 等风格。

    推荐理由:Google 把 Genie 的世界模型与 Street View 真实影像打通,读者可了解智能体训练环境如何从纯生成走向现实锚定。

5月17日周日
5月16日周六
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断其速度与成本取舍。

5月12日周二
5月6日周三
  1. Google DeepMind71

    Google DeepMind 回顾 AlphaEvolve 一年跨领域落地成果

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这一由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可看算法智能体的跨领域边界。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

    推荐理由:Google DeepMind 公开医疗 AI 智能体的多模态评测结果,读者可了解 AI 在临床场景中的能力边界与协作定位。

4月21日周二
  1. Google DeepMind24

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。