OpenAI 推出 MentalHealthBench 心理健康评测基准
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 开展双盲评测,将外部评测限制在加密“黑箱”中,防止模型提前接触测试题。该方案针对基准污染问题,在隐私保护环境下用保密基准测试模型,以提升评测可信度。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实测表现,读者可了解 AI 天气模型如何辅助官方预警决策。