
Google 更新 Android Bench 引入新 LLM,但 Gemini 仍落后
Google 为 Android Bench 基准测试添加了更多大语言模型,但自家 Gemini 模型表现仍不及竞品,开发者可参与测试标准制定。
基准测试与能力对比

Google 为 Android Bench 基准测试添加了更多大语言模型,但自家 Gemini 模型表现仍不及竞品,开发者可参与测试标准制定。

Anthropic 的 Claude Fable 5 在金融、法律、医学等六项行业性能指标中排名第一,但单次任务成本高达 3.48 美元,是 DeepSeek V4 Pro 的百倍以上,引发了关于性能与成本平衡的讨论。

OpenAI最新分析指出,流行的编码基准测试SWE-Bench Pro存在可靠性问题,可能影响AI模型评估的准确性。

OpenAI将于周四发布GPT-5.6,此前因美国政府要求额外测试而推迟。新模型在编码基准测试中优于Anthropic的Claude Mythos 5,成本仅为其一半。



百度推出“无限OCR”技术,通过改进注意力机制使内存占用恒定,单次可处理数十页文档,在OCR基准测试中排名第一。

新基准DiscoBench显示,AI搜索代理在多步研究中失败的主因是不向用户澄清模糊查询,而非搜索能力不足。即使最佳模型准确率也仅43%,而消除歧义后准确率可提升40个百分点。

ScarfBench是一个新基准,用于评估AI代理在企业级Java框架迁移中的表现。它包含多个真实世界的迁移任务,旨在衡量代理的代码理解和重构能力。


