
微软MAI Code 1.1 Flash遭DeepSeek碾压:性能与价格双输
微软发布MAI Code 1.1 Flash,声称成本降低四分之一且效率提升,但基准测试显示其性能远逊于更便宜的DeepSeek V4 Flash,凸显微软在开源与闭源策略间的矛盾。
基准测试与能力对比

微软发布MAI Code 1.1 Flash,声称成本降低四分之一且效率提升,但基准测试显示其性能远逊于更便宜的DeepSeek V4 Flash,凸显微软在开源与闭源策略间的矛盾。

英伟达发布开源权重模型Nemotron 3.5 Lightning,仅3.6B活跃参数在智能指数上匹敌OpenAI的gpt-oss-120b,且生成速度达每秒670 tokens,凸显小模型高效路线。

Hugging Face 发布 ACE 基准,强调在复杂任务中减少 Token 消耗可显著提升效率与性能,为开发者提供新优化思路。

Hugging Face与EleutherAI的FineBooks项目测试了14种开源OCR模型,最佳模型字符准确率达97.6%,每千页成本不足2美元,为大规模清洗历史书籍文本提供了新方案。


xAI推出Imagine Image 2.0图像生成器,在Arena基准中排名第二,仅次于OpenAI的GPT-Image-2,并新增Magic Wand等编辑工具。

Hugging Face 发布 TutorMoments 数据集,聚焦 AI 辅导中‘何时该帮、何时该等’的时机判断,为教育 AI 提供新评估维度。

Anthropic 将 Fable 5 的生物安全过滤误报率降低约 85%,使更多常规生物查询不再被拦截,但针对病毒学、毒理学等敏感双用途领域仍保留严格限制。

Composio 测试显示,Claude Code 在四个 Agent 框架中速度最快,但单任务成本高达 0.195 美元,是 OpenCode 的近三倍。框架选择正从性能转向成本与速度的权衡。

阿里 Qwen3.8 Max 在 Artificial Analysis 智能指数上跃升 10 分至 56,追平 Claude Opus 4.8,但月之暗面 Kimi K3 得分更高且成本低 25%,引发性价比之争。

OpenAI近日就第三方网络安全评估中涉及其模型的事件进行说明,并宣布加强AI模型测试与评估的新保障措施,引发行业对AI安全评估流程的关注。

Computer Anthology 是一个不断演进的基准测试系列,旨在评估 AI 智能体在真实计算机任务中的表现。本文解读其背景、意义及对智能体开发的影响。