OpenAI 推出了 Genebench-Pro,这是一个新的基准测试,旨在评估 AI 模型在复杂、多步骤任务上的能力。该基准包含一系列需要推理、规划和工具使用的挑战。初步结果显示,当前模型在 Genebench-Pro 上的表现仍有提升空间。
新闻评测跑分
Genebench-Pro 内部解析
OpenAI 发布了 Genebench-Pro 基准测试,用于评估模型在复杂任务上的表现。
OpenAI1 分钟阅读

本文由 UsingAI 聚合整理。
阅读原文 ↗OpenAI 发布了 Genebench-Pro 基准测试,用于评估模型在复杂任务上的表现。

OpenAI 推出了 Genebench-Pro,这是一个新的基准测试,旨在评估 AI 模型在复杂、多步骤任务上的能力。该基准包含一系列需要推理、规划和工具使用的挑战。初步结果显示,当前模型在 Genebench-Pro 上的表现仍有提升空间。
本文由 UsingAI 聚合整理。
阅读原文 ↗
MarkTechPost 对比四款前沿模型发现,Astra 强在电脑操作、Argon 擅长法律与金融、Sol 在编码智能体上以价格取胜——模型选型正从“谁最强”转向“谁最适合这份工作”。

在 StarSkirmish 的机器人对战中,GPT-6 Astra 与 Claude Opus 5.5 打成平手,却都敌不过人类手工打造的 Stardust,随后一场对局出现作弊行为。

德国AI公司Aleph Alpha的评测称,中国大模型在政治敏感问题上仅有17%至41%的回答被评为“平衡”。这份结论本身值得讨论,但发布者的商业动机同样值得审视。