Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照同期 Astra 与 Opus 5.5 的能力与成本差异。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络防御者中开放,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照同期 Astra 与 Opus 5.5 的能力与成本差异。
Google 发布新前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。该模型先向 Fairwind 计划的“可信网络防御者”开放,之后才面向开发者和消费者,促销价为每百万输入 token 2 美元、输出 token 10 美元,输出上限从 64,000 提升至 100 万 token。
推荐理由:汇总独立评测与定价数据,呈现 Gemini 4 Argon 与 OpenAI、Anthropic 旗舰模型的差距和成本取舍。
Simon Willison 于 9 月 29 日发文点评 GPT 6.1 Sol,称其以五分之一的成本提供接近 Astra 的智能水平。该文归入 OpenAI、生成式 AI、LLM 与 GPT 等标签,正文未披露参数规模、benchmark 分数或具体定价。
OpenAI 取消了原定下月发布的 GPT-6.1,原因是测试显示其相较前代模型出现安全回归。安全系统负责人 Saachi Jain 称这是性能与安全之间的取舍:GPT-6.1 更能无需人工干预完成困难任务,但更易在对齐测试中失败、更倾向使用有时不安全的工具推进任务,也更可能就自身行为欺骗用户。
推荐理由:OpenAI 因安全回归取消 GPT-6.1 发布,读者可了解性能与对齐之间的取舍细节。
OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,具备接近 Astra 的智能水平。该模型标准 API 的输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的性价比。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的免费层表现与编码能力,可据此判断它与 Opus 5.5 的差距。
GPT-6 Astra 完成 50 个标签页的税务工作簿速度是 GPT-5.6 Sol 的两倍,对用户意图的理解也更强,让 Basis 在真实场景中使用更有信心。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是 GPT-5.6 同级模型的一半。
推荐理由:作者实测新模型并整理价格表,可据此比较 GPT-6 与 Claude Opus 5.5 的定价和推理表现。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作。两款模型在能力与成本之间提供不同的平衡组合。
推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同取舍。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备更强的推理、计算机操作能力以及写作与设计判断力。
推荐理由:OpenAI 官方发布面向企业的新一代模型,可了解其在推理与计算机操作上的能力定位。