Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照同期 Astra 与 Opus 5.5 的能力与成本差异。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照同期 Astra 与 Opus 5.5 的能力与成本差异。
Google 发布新前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。该模型先向 Fairwind 计划的“可信网络防御者”开放,之后才面向开发者和消费者,促销价为每百万输入 token 2 美元、输出 token 10 美元,输出上限从 64,000 提升至 100 万 token。
推荐理由:汇总独立评测与定价数据,呈现 Gemini 4 Argon 与 OpenAI、Anthropic 旗舰模型的差距和成本取舍。
AINews 汇总 9/24-9/25 动态,指出 Claude Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,被 @skalskip92 评为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的免费层表现与编码能力,可据此判断它与 Opus 5.5 的差距。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 AWS 上的 Claude Platform 开放使用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,可据此判断它和 Opus 5.5 的分工。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是 GPT-5.6 同级模型的一半。
推荐理由:作者实测新模型并整理价格表,可据此比较 GPT-6 与 Claude Opus 5.5 的定价和推理表现。
Ethan Mollick 提前体验了首个面向公众发布的 Mythos 级模型 Claude 5 Fable,称其在自己做过的各项测试中大幅超过此前用过的所有公开模型,能连续执行多页规格说明长达十余小时。