跳到正文

#编码

今日 1 条
今天10月2日周五
  1. AWS Machine Learning Blog62

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为其五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点,且推理投入更低。

    推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的能力与成本对比,读者可据此判断智能体编码任务的性价比变化。

10月1日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月29日周二
  1. OpenAI News78

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,具备接近 Astra 的智能水平。该模型标准 API 的输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的性价比。

  2. AWS Machine Learning Blog60

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:梳理 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,便于评估长任务智能体的成本取舍。

9月28日周一
9月26日周六
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口;RAG 也并未消亡,而是为模型提供训练数据之外的相关信息。节目主张用标准做共享接口、用 Skills 承载流程与最佳实践,二者结合比争论谁取代谁更有价值。

9月17日周四
  1. GitHub Blog · AI & ML75

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 Copilot 应用和 CLI 将 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,跨 128 个 PR 增量合入 main,性能提升数个数量级。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时迁到 Rust 的全过程,含并发会话协作与提示缓存等可迁移经验。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML30

    GitHub Copilot 应用新手指南:使用 diff、终端和浏览器面板

    GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增与删除行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口;浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。

9月9日周三
9月5日周六
  1. GitHub Blog · AI & ML60

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,按各模型标准费率计费。

    推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断编排式编码智能体的取舍。

9月4日周五
9月3日周四
8月14日周五
8月4日周二
  1. Microsoft Research62

    微软研究院开源 Orchard:面向可扩展智能体 AI 的开放框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务复用同一套环境、数据管线与评测流程,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,可复用其方法搭建智能体训练环境。

7月21日周二
5月16日周六
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断其速度与成本取舍。

5月6日周三
  1. Google DeepMind71

    Google DeepMind 回顾 AlphaEvolve 一年跨领域落地成果

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这一由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可看算法智能体的跨领域边界。