跳到正文

#模型发布

今日 0 条
10月1日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月29日周二
  1. OpenAI News78

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,具备接近 Astra 的智能水平。该模型标准 API 的输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的性价比。

9月28日周一
9月23日周三
  1. OpenAI News67

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作。两款模型在能力与成本之间提供不同的平衡组合。

    推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同取舍。

9月16日周三
9月9日周三
9月3日周四
8月28日周五
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。

    推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力变化,可据此判断生成视频工作流的可控程度。

8月27日周四
8月14日周五
8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首批支持美国手语(ASL)转英文,并已接入 Pixel 11 的 Gboard 与 Live Transcribe,后续将扩展更多设备与语言。

    推荐理由:官方披露 SL2T 的训练数据规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 落地的技术取舍。

8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源 WeatherNext 气旋预测模型

    Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预测上达到 SOTA,平均多出一天预警时间,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出模型在气旋路径与强度预测上的精度提升幅度,并说明代码与权重已开源,读者可据此判断气象预报的可用性变化。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时原生支持调用 Google Search 等工具。

    推荐理由:官方给出进度分类、时刻定位与多机协作的具体指标,可据此判断机器人高层推理的当前水位。

  2. Google DeepMind58

    Google DeepMind 在 Flow Music 发布音乐生成模型 Lyria 3.5

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更丰富自然的旋律结构、提示词遵循度和结构感知更好的歌词、更具情感表达和发音改进的人声,以及对输出节奏和时长的更易控制。

7月28日周二
7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:原文给出轻量安全模型的基准对比与限量开放方式,读者可据此判断其成本与部署路径。

7月1日周三
6月11日周四
  1. Google DeepMind66

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次性生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。

    推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存占用与质量取舍,便于判断本地低并发场景是否适用。

6月9日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。官方称其基准表现接近 26B MoE 模型,内存占用不到后者一半,可在 16GB VRAM 或统一内存上运行,也是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的取舍。

5月18日周一
5月16日周六
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断其速度与成本取舍。

4月16日周四
4月13日周一
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并新增仪表读数能力,可据此判断机器人高层推理的进展。