
🔬
研究前沿
论文、技术突破与趋势解读

新闻

新闻

新闻
AI Agent 的“技能”为何有效?普林斯顿研究揭示其局限
普林斯顿与加州大学圣迭戈分校的研究发现,AI Agent 的“技能”主要通过结构化工作流提升性能,而非知识本身;但技能库过大会增加选择负担,导致性能下降。
The Decoder2 分钟阅读

新闻
AI世界模型忽视人类信念,新框架Mental World Modeling补上关键短板
现有世界模型如Sora只模拟物理规律,忽略人类信念与意图。新提出的Mental World Modeling框架引入心理变量,即使较弱语言模型也能超越未建模的强模型。
The Decoder1 分钟阅读

新闻
RayNeo 发布无摄像头 AI 眼镜,专注文本叠加显示
RayNeo 推出新款 AI 眼镜,摒弃摄像头和扬声器,专注于文本叠加功能,为 AI 可穿戴设备提供差异化思路。
The Decoder2 分钟阅读

新闻
Netflix 测试语言模型替代手工推荐逻辑,GenRec 初显优势
Netflix 将其多年使用的推荐引擎与内部语言模型 GenRec 对比,后者将观看行为转化为文本,取得了更好的效果。Netflix 称这是“早期但有希望的一步”。
The Decoder2 分钟阅读

新闻
心理测量学方法揭示AI安全测试的重大缺陷
英国AI安全研究所的研究表明,流行的安全基准并未衡量一致的特质,且一刀切的拒绝会虚增安全分数,同时提出识别测试时更谨慎的模型的方法。
The Decoder2 分钟阅读

新闻
✨
新闻
Anthropic Opus 4.6 被曝可轻松绕过内容限制,生成露骨内容
TechCrunch 测试发现,Anthropic 最新模型 Opus 4.6 的色情内容限制可被轻易绕过,引发对 AI 安全与内容审核有效性的质疑。
TechCrunch2 分钟阅读

新闻
英伟达再投数据中心:与Cloverleaf合作背后,AI算力军备竞赛的缩影
英伟达与数据中心开发商Cloverleaf达成合作,继续加码AI基础设施投资。这既是英伟达巩固算力生态的举措,也折射出AI热潮下数据中心建设的激烈竞争。
TechCrunch2 分钟阅读

新闻
LinkedIn“疑似AI废话”按钮被点击超百万次,平台内容信任危机凸显
LinkedIn推出的“疑似AI废话”反馈按钮上线不久即获超百万次点击,反映出用户对平台AI生成内容泛滥的不满,也促使平台重新审视内容治理策略。
The Verge2 分钟阅读

新闻
Anthropic 将最强模型 Claude Mythos 5 投入网络防御
Anthropic 将其最强模型 Claude Mythos 5 用于网络安全,通过安全扫描器 Claude Security 检测代码漏洞,并集成到合作伙伴的安全产品中,以保护关键基础设施。
The Decoder1 分钟阅读