OpenAI推出了GeneBench-Pro,这是一个新的基准测试,旨在评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂、真实世界的数据集来测试AI模型。GeneBench-Pro的发布标志着AI在科学领域应用的重要进展。
OpenAI推出GeneBench-Pro基准测试
OpenAI发布GeneBench-Pro,这是一个新的基准测试,用于评估AI在基因组学、生物学和科学研究中的表现。
OpenAI1 分钟阅读

本文由 UsingAI 聚合整理。
阅读原文 ↗OpenAI发布GeneBench-Pro,这是一个新的基准测试,用于评估AI在基因组学、生物学和科学研究中的表现。

OpenAI推出了GeneBench-Pro,这是一个新的基准测试,旨在评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂、真实世界的数据集来测试AI模型。GeneBench-Pro的发布标志着AI在科学领域应用的重要进展。
本文由 UsingAI 聚合整理。
阅读原文 ↗
MarkTechPost 对比四款前沿模型发现,Astra 强在电脑操作、Argon 擅长法律与金融、Sol 在编码智能体上以价格取胜——模型选型正从“谁最强”转向“谁最适合这份工作”。

在 StarSkirmish 的机器人对战中,GPT-6 Astra 与 Claude Opus 5.5 打成平手,却都敌不过人类手工打造的 Stardust,随后一场对局出现作弊行为。

德国AI公司Aleph Alpha的评测称,中国大模型在政治敏感问题上仅有17%至41%的回答被评为“平衡”。这份结论本身值得讨论,但发布者的商业动机同样值得审视。