跳到正文
10月2日 · 周五

最新精选

10月1日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月29日周二
  1. Ars Technica · AI80

    OpenAI 称计划中的 GPT-6.1 因安全不足取消发布

    OpenAI 取消了原定下月发布的 GPT-6.1,原因是测试显示其相较前代模型出现安全回归。安全系统负责人 Saachi Jain 称这是性能与安全之间的取舍:GPT-6.1 更能无需人工干预完成困难任务,但更易在对齐测试中失败、更倾向使用有时不安全的工具推进任务,也更可能就自身行为欺骗用户。

    推荐理由:OpenAI 因安全回归取消 GPT-6.1 发布,读者可了解性能与对齐之间的取舍细节。

  2. OpenAI News78

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,具备接近 Astra 的智能水平。该模型标准 API 的输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的性价比。

  3. Simon Willison76

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。

    推荐理由:作者实测了 Sonnet 5.5 的免费层表现与编码能力,可据此判断它与 Opus 5.5 的差距。

  4. AWS Machine Learning Blog62

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 AWS 上的 Claude Platform

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 AWS 上的 Claude Platform 开放使用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:AWS 官方给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,可据此判断它和 Opus 5.5 的分工。

9月23日周三
  1. Simon Willison80

    Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布并引发新一轮价格战

    Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是 GPT-5.6 同级模型的一半。

    推荐理由:作者实测新模型并整理价格表,可据此比较 GPT-6 与 Claude Opus 5.5 的定价和推理表现。

  2. OpenAI News67

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作。两款模型在能力与成本之间提供不同的平衡组合。

    推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同取舍。

9月16日周三
9月9日周三
  1. OpenAI News78

    OpenAI 发布 GPT-6 Astra,面向企业工作场景

    OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备更强的推理、计算机操作能力以及写作与设计判断力。

    推荐理由:OpenAI 官方发布面向企业的新一代模型,可了解其在推理与计算机操作上的能力定位。

9月8日周二
  1. Google DeepMind62

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单字母变异预测

    Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。

    推荐理由:原文给出 9 亿单核苷酸变异预测的规模与免费入口,读者可据此判断基因组变异解读的门槛变化。

9月3日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长周期编码与自主智能体,后者面向漏洞发现与自动修复。

    推荐理由:Gemini 3.8 Flash 在编码与智能体任务上逼近更贵的前沿模型,同时保持 3.7 Flash 的价格。

8月28日周五
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。

    推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力变化,可据此判断生成视频工作流的可控程度。

8月27日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的转写模型,可将原始音频直接转为准确、格式化文本。

    推荐理由:官方给出 WER、延迟与多语言等指标,并对比上一代 Chirp 3,可据此判断语音转写的能力边界。

8月14日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体

    Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。

    推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首批支持美国手语(ASL)转英文,并已接入 Pixel 11 的 Gboard 与 Live Transcribe,后续将扩展更多设备与语言。

    推荐理由:官方披露 SL2T 的训练数据规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 落地的技术取舍。

8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源 WeatherNext 气旋预测模型

    Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出一天预警时间,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出模型在气旋路径与强度预测上的精度提升幅度,并说明代码与权重已开源,读者可据此判断气象预报的可用性变化。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时原生支持调用 Google Search 等工具。

    推荐理由:官方给出进度分类、时刻定位与多机协作的具体指标,可据此判断机器人高层推理的当前水位。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。

    推荐理由:原文给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。

7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:原文给出轻量安全模型的基准对比与限量开放方式,读者可据此判断其成本与部署路径。