Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照同期 Astra 与 Opus 5.5 的能力与成本差异。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照同期 Astra 与 Opus 5.5 的能力与成本差异。
Google 发布新前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。该模型先向 Fairwind 计划的“可信网络防御者”开放,之后才面向开发者和消费者,促销价为每百万输入 token 2 美元、输出 token 10 美元,输出上限从 64,000 提升至 100 万 token。
推荐理由:汇总独立评测与定价数据,呈现 Gemini 4 Argon 与 OpenAI、Anthropic 旗舰模型的差距和成本取舍。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是 GPT-5.6 同级模型的一半。
推荐理由:作者实测新模型并整理价格表,可据此比较 GPT-6 与 Claude Opus 5.5 的定价和推理表现。
TypeSafe AI 发布 Jev,这是其称为 System One 模型的新类别模型,输入文本后不返回文本,而是返回对应类别、是/否问题、评分及置信度的浮点数。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次性生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存占用与质量取舍,便于判断本地低并发场景是否适用。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。官方称其基准表现接近 26B MoE 模型,内存占用不到后者一半,可在 16GB VRAM 或统一内存上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的取舍。