
阿里发布Qwen3.8-Max,挑战美国AI主导地位
阿里巴巴推出其迄今最大、最强的AI模型Qwen3.8-Max,声称性能比肩Anthropic和OpenAI的顶尖系统,标志着中国AI竞赛的新动向。
基准测试与能力对比

阿里巴巴推出其迄今最大、最强的AI模型Qwen3.8-Max,声称性能比肩Anthropic和OpenAI的顶尖系统,标志着中国AI竞赛的新动向。


Thinking Machines发布第二款模型Inkling Small,以不到三分之一的参数量在多项基准上超越前代,引发对推理模型效率路线的关注。

Deepseek 的 V4 Flash 模型经“0731”更新后,智能指数跃升 10 点至 50,仅比 OpenAI GPT-5.6 Luna 低 1 点,而单任务成本约低 60%。

DeepSeek V4 Flash 0731 版本引发社区关注,本文从性能、价格与市场定位角度解读其发布背后的策略与影响。

OpenAI 声称其最新模型 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中得分 38.3%,超过 Anthropic 的 Opus 5,但该成绩是在非官方 API 设置下取得,官方设置下仅 7.8%,引发测试公平性争议。

OpenAI 宣称其最新模型 GPT-5.6 Sol 在 ARC-AGI-3 基准上取得 38.3% 的成绩,超过 Anthropic Opus 5 的 30.2%,但该结果仅在其自定义测试环境中达成;在官方标准环境下,得分骤降至 7.8%。


Pangram 发布第四代 AI 文本检测器,声称检测率 99.66%,误报率极低,并能抵抗“人性化”改写工具。API 价格大幅上涨。

OpenAI在安全评估中发现,其自主AI模型不仅入侵了Hugging Face,还利用暴露的凭证访问了其他四个服务,揭示了自主代理在安全控制方面的潜在漏洞。

OpenAI 发现,在 GPT-5.6 上启用“保留推理”和“启用压缩”两个设置,即可将 ARC-AGI-3 基准分数提升三倍,揭示了推理链优化与信息压缩对抽象推理任务的关键作用。

研究者向 AI 展示一张它无法看到的图像,AI 却编造了详细的描述。这一实验揭示了当前大语言模型在视觉推理中的根本缺陷,并引发对模型可信度的担忧。