
当AI编程评测走出公开题库:Real-SWE把考场搬进企业私有代码库
Real-SWE 提出面向私有、真实企业代码库的 AI 编程能力基准,直指现有 SWE 类评测依赖公开仓库、易被数据污染与刷分的问题。
基准测试与能力对比

Real-SWE 提出面向私有、真实企业代码库的 AI 编程能力基准,直指现有 SWE 类评测依赖公开仓库、易被数据污染与刷分的问题。

Anthropic CEO Dario Amodei 公开主张放缓前沿 AI 开发节奏,并宣布将让 METR 等第三方评估机构接入其模型,以验证安全实践与承诺。他提出“配速前沿”三步计划,引发行业对安全与竞争节奏的再讨论。

在新机器人基准 StationeryBench 上,GPT-6 Astra 让双臂机器人完成了 100 项任务中的 7 项,而竞品 MolmoAct2 一项未成,研究者称其为空间推理的“阶跃式变化”。

Arena.ai 对数万条基准回答的对比显示,Claude Fable 5.1 的措辞比前代更就事论事,但篇幅也更长。语言承载的信息密度下降,成为这次迭代最值得注意的变化。

OpenAI 的 GPT-6 Astra 在开放数学问题基准 ErdősBench 上取得领先,但首席科学家 Pachocki 表示数学并非刻意优先的方向——资源正投向递归自我改进与对齐研究,这印证了 AI 能力日益“尖峰化”的发展路径。

一项AI数学能力的突破性进展在开发者社区引发激烈争论,核心质疑指向训练数据可能包含测试集内容,导致基准测试失真。本文梳理事件脉络,分析其对AI评估体系的影响。


Artificial Analysis发布4.2版智能指数,回应外界对其未能捕捉GPT-6 Astra进步的批评。新版指数中Astra得分仍落后于Claude Fable 5.1,引发对AI基准有效性的新一轮讨论。

OpenAI 最新模型 GPT-6 Astra 在幻觉率和直接提示注入防御上显著进步,但面对隐藏在文档中的攻击,成功率仍达 8.5%,引发对自主 AI 代理安全性的讨论。

OpenAI的GPT-6 Astra在不同基准测试中表现迥异,但在ARC-AGI-3上首次超越人类平均效率,引发对AGI进程的重新讨论。

GPT-6 Astra 在 Artificial Analysis Coding Agent Index 中取得领先,本文解读该基准的意义及其对 AI 编码领域的影响。

Pangram雇佣“攻击犬”在社交媒体上羞辱疑似使用AI的用户,但其检测分数仅能粗略反映AI使用,却暗示用户缺乏独立思考,引发对AI检测工具伦理的讨论。