
开源模型网络能力逼近四个月前闭源前沿水平,成本仅零头
英国AI安全研究所报告显示,开源权重模型(如GLM-5.2、DeepSeek V4-Pro)在网络攻击能力上已追平四个月前闭源前沿模型,且安全措施基本无效,防御窗口缩短。
基准测试与能力对比

英国AI安全研究所报告显示,开源权重模型(如GLM-5.2、DeepSeek V4-Pro)在网络攻击能力上已追平四个月前闭源前沿模型,且安全措施基本无效,防御窗口缩短。

Kimi 推出开源权重模型 K3,参数规模达 2.8 万亿,上下文窗口 100 万 token,在基准测试中接近 GPT-5.6 和 Claude Fable 5,但定价显著高于前代,标志着中国开源模型告别超低价时代。

NVIDIA 的 Nemotron-3 Embed 模型在检索基准 RTEB 上取得综合第一,标志着智能体检索领域的重要进展。

OpenAI通过自博弈训练的红队模型GPT-Red,在84%的测试场景中成功找到AI漏洞,而人类红队仅为13%。该成果已用于加固GPT-5.6 Sol等模型。

Hugging Face 推出 Real World VoiceEQ 框架,旨在量化评估语音 AI 的自然度和人类感知质量,推动行业从技术指标转向用户体验导向的评测。

AgenticSTS项目用五层结构化记忆替代不断增长的聊天日志,将AI智能体的提示长度控制在5000 token以内,并在《杀戮尖塔2》中取得60%胜率,而传统智能体无一胜绩。

Meta 的 Muse Spark 1.1 在编码基准测试中以 71.3 分超越 GLM-5.2,任务成本降至 0.26 美元,同时幻觉率大幅下降。

AMD 最新旗舰级 AI PC 处理器 Ryzen AI Halo 已开放媒体体验,其集成的神经网络处理单元(NPU)性能显著提升,有望推动本地 AI 应用生态发展。

OpenAI 最新模型 GPT-5.6 Sol 在 Artificial Analysis 智能指数上得 59 分,仅落后 Anthropic 的 Claude Fable 5 一分,但每次任务成本仅 1.04 美元,为后者的三分之一。在智能体编程任务中,Sol 更是击败所有对手。

OpenAI 审查 SWE-Bench Pro 后发现约 30% 任务存在缺陷,决定撤回对该基准的公开认可,引发对 AI 编程评估可靠性的讨论。

本文解读Hacker News上关于智能体测试流程、LLM基准测试以及编码智能体开发的最新讨论,分析其对AI工程化与评估标准的影响。

xAI 发布 Grok 4.5,训练于数万块 GB300 GPU,编码基准落后于 Fable 5 和 GPT-5.5,但输入价格仅每百万 token 2 美元,且推理效率极高,预计 7 月中旬在欧盟上线。