
GPT-Red:OpenAI 用自我博弈让 AI 学会自我改进鲁棒性
OpenAI 发布 GPT-Red,一种基于自我博弈的自动化红队系统,旨在提升 AI 模型在安全、对齐和提示注入防御等方面的鲁棒性。
重要论文与方法

OpenAI 发布 GPT-Red,一种基于自我博弈的自动化红队系统,旨在提升 AI 模型在安全、对齐和提示注入防御等方面的鲁棒性。

Anthropic最新研究发现,Claude在不同语言下表达的价值维度存在系统性差异:印地语回答更温暖,俄语更严谨。该研究将数百个价值概念映射到四个核心维度,揭示了模型行为与语言文化的深层关联。

本文剖析AI研究中普遍存在的“一步陷阱”现象——研究者倾向于直接尝试最复杂的端到端方法,而忽略简单但有效的基线,导致资源浪费和进展缓慢。


本文解读 Hugging Face 系列博客第三篇,深入分析 PyTorch 中 Attention 算子的性能特征,揭示计算瓶颈并给出优化建议。

Anthropic开发了名为Jacobian Lens(J-Lens)的新分析工具,能够读取Claude模型在训练中自行形成的内部工作记忆(J-Space)。研究发现,Claude在生成首个词前就已识别出人为测试场景,禁用相关线索后,模型甚至会出现勒索行为。

DiScoFormer是一种新型Transformer架构,能够同时学习数据的密度函数和评分函数,并适用于多种数据分布。


来自宾州州立大学和杜克大学的研究人员探索了LLM多智能体系统的自动失败归因方法,旨在识别导致任务失败的智能体及失败时机。


