
NSA 每年花数十亿美元测试 AI 模型,这意味着什么
有报道称美国国家安全局为测试 AI 模型支付了数十亿美元级别的费用。这一数字揭示了情报机构与前沿模型之间正在形成的深度依赖关系。
大模型能力、发布与评测

有报道称美国国家安全局为测试 AI 模型支付了数十亿美元级别的费用。这一数字揭示了情报机构与前沿模型之间正在形成的深度依赖关系。

一项研究显示,顶尖 AI 专家持续低估技术推进速度:AI 提前五年达到 IMO 金牌水平,Anthropic 年化收入约为专家预测的五倍,但自动驾驶等落地场景的预测则喜忧参半。

PrismML 将其小型语言模型带到搭载高通芯片的智能眼镜上,目标是让开放权重模型直接跑在设备端,充分利用已有算力。

以图像生成模型 FLUX 闻名的 Black Forest Labs 进军机器人领域,发布开源世界动作模型 FLUX 3 Action,仅 70 亿参数便在 RoboLab-120 基准上刷新纪录,推理速度最高达前代最佳模型的 3.95 倍。
Google DeepMind 发布 Gemini 3.8 Live,首次引入 Live Avatar 能力,让模型在实时音视频对话中拥有可交互的虚拟形象,多模态交互从“语音助手”迈向“面对面代理”。

Epoch AI 测算,达到固定性能基准的 AI 成本每年下降约 13 倍;剔除硬件与竞争因素后,MIT 估计算法本身的年进步约为 3 倍。但推理模型单任务算力消耗更高,实际账单未必更便宜。

Hugging Face 上出现 LFM2.5-VL-DSpark,主打视觉语言模型的推理加速。它指向多模态部署中最现实的瓶颈:不是能不能看懂,而是看得够不够快、够不够便宜。

Google DeepMind 新负责人 Koray Kavukcuoglu 将重心从 AGI 叙事转向产品交付,计划让 Gemini 4 比年底更早发布,并称可信智能体比 AGI 讨论更重要。

Google DeepMind 新任负责人 Koray Kavukcuoglu 首次以该身份接受采访,透露 Gemini 4 正处于 refinement 阶段,Google 在旗舰模型发布节奏上长期落后于竞争对手后,正接近推出这款备受期待的模型。

Mercury 2.5 宣称达到每秒 770 tokens 的生成速度,把大模型竞争从参数规模推向推理效率,对实时交互类应用意义重大。

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音合成模型,支持超 100 种语言,可通过文字描述凭空生成新音色,并能在单份脚本中生成双人对话。

Google DeepMind 放出 Gemini 3.8 文本转语音的预告,延续 Gemini 系列多模态能力向语音端的延伸。本文梳理这次发布的位置、TTS 赛道的竞争格局,以及它对开发者和产品方的实际意义。