
GPT-6 Astra 实测:几分钟审完41份财报文档,找出全部植入错误
OpenAI 展示 GPT-6 Astra 在金融审阅工作流中的能力:几分钟内处理41份文档,发现全部4处植入错误,效率提升近40%。
基准测试与能力对比

OpenAI 展示 GPT-6 Astra 在金融审阅工作流中的能力:几分钟内处理41份文档,发现全部4处植入错误,效率提升近40%。

Meta 发布 Muse Spark 1.3,在智能体基准上进步显著,虽仍落后于顶尖模型,但每任务 0.55 美元的价格使其性价比突出。

谷歌六周内发布第三款Flash模型,Gemini 3.8 Flash在部分agentic编码基准上媲美Claude Opus 5,但更高的推理token消耗使其实际成本更高。

研究发现,LLM在评估AI生成的临床笔记时存在“遗漏盲区”,只会验证内容的存在性,而不会主动发现缺失的关键信息。

Hugging Face 的 BenchMIRT 项目对主流 LLM 基准测试进行系统性审视,揭示其测量目标与真实能力之间的鸿沟,引发对评估体系有效性的反思。

LAION推出Big Video Dataset(BVD),包含8000万段视频、1000万小时时长,训练模型性能超越现有基准InternVid,为开源视频AI研究提供新资源。

Anthropic研究员透露,其自动化系统能在10个针对错误行为的基准上全部提升性能,且不牺牲整体表现,这为AI自我改进提供了新证据。

谷歌DeepMind首次对前沿AI模型进行双盲评估,利用机密计算保护测试题和模型权重,旨在建立防篡改的AI基准测试新标准。

Terminal-Bench-Science 是面向科研场景的 AI 代理评测基准,旨在衡量 AI 在真实科研任务中的表现,填补现有评测与科研实践之间的空白。

Hugging Face 的 Open ASR Leaderboard 新增首个全球南方语言,标志着语音识别评测正从英语中心转向更广泛的语言覆盖,对技术公平性和模型实用性具有深远影响。

沃顿商学院最新研究显示,AI购物代理的推荐极不稳定,单一外部信息源(如Wirecutter)可使产品选择改变高达99个百分点,甚至信息顺序变化都会影响结果,表明AI购物代理尚未成熟到可放心代购。

谷歌DeepMind宣布试点全球首个双盲AI评测,旨在减少评估中的偏见和作弊,为AI能力对比提供更可靠的方法。