OpenAI的GPT-4在Epoch能力指数上保持了约一年的领先地位,远超后续任何模型。自2024年2月Claude 3 Opus登顶以来,榜首已变更17次,中位领先时间仅七周。竞争更加激烈,但模型间能力提升幅度正在缩小。
GPT-4统治力不再:当前顶级模型领先中位数仅七周
GPT-4在Epoch能力指数上领先约一年,而自2024年2月以来,榜首已易手17次,中位领先时间仅七周。
The Decoder1 分钟阅读

本文由 UsingAI 聚合整理。
阅读原文 ↗GPT-4在Epoch能力指数上领先约一年,而自2024年2月以来,榜首已易手17次,中位领先时间仅七周。

OpenAI的GPT-4在Epoch能力指数上保持了约一年的领先地位,远超后续任何模型。自2024年2月Claude 3 Opus登顶以来,榜首已变更17次,中位领先时间仅七周。竞争更加激烈,但模型间能力提升幅度正在缩小。
本文由 UsingAI 聚合整理。
阅读原文 ↗
MarkTechPost 对比四款前沿模型发现,Astra 强在电脑操作、Argon 擅长法律与金融、Sol 在编码智能体上以价格取胜——模型选型正从“谁最强”转向“谁最适合这份工作”。

在 StarSkirmish 的机器人对战中,GPT-6 Astra 与 Claude Opus 5.5 打成平手,却都敌不过人类手工打造的 Stardust,随后一场对局出现作弊行为。

德国AI公司Aleph Alpha的评测称,中国大模型在政治敏感问题上仅有17%至41%的回答被评为“平衡”。这份结论本身值得讨论,但发布者的商业动机同样值得审视。