当模型能力榜单一路走高,用户却抱怨它“越来越不会写人话”——这不是错觉,而是优化目标偏移的必然结果。
发生了什么
据 The Decoder 报道,Anthropic 员工 Jackson Kernion 公开解释了新版 Claude 模型写作风格怪异的原因。核心结论是:模型并没有“变笨”,而是被优化去做好数学、代码以及面向其他 AI 模型的技术性解释。这类任务的评判标准与人类阅读体验并不一致,最终塑造出一种对人类而言像“高密度信息倾泻”(overly-dense info dumps)的文风。
报道同时提到,Opus 5.5 正在尝试修正这一问题,但在纯写作场景下,Opus 4.6 依然没有被超越。
为什么重要
这件事的价值不在于某个模型的文笔好坏,而在于它暴露了大模型训练中一个结构性张力:能力评测与人类偏好正在分叉。
近两年,模型厂商的优化重心明显向可验证任务倾斜——数学题有标准答案,代码能跑测试,技术解释可以被另一个模型或自动评分器判定是否“信息完整”。这些信号清晰、可规模化、便于做强化学习。相比之下,“读起来舒服”“节奏自然”“有分寸感”这类写作质量,既难标注也难量化,自然在优化队列里被挤到后面。
更微妙的是,模型的输出越来越多地服务于另一个模型:作为上下文喂给 agent、作为中间推理步骤、作为检索结果。面向机器的写作追求信息密度和结构显式,恰恰与面向人类的写作追求留白、节奏和隐含语境相反。当模型同时被要求兼顾两者,退化就发生在人类这一侧。
Anthropic 工程师愿意公开承认这一点,本身也说明行业开始意识到:跑分上升不能替代用户体验。
影响与看点
对开发者而言,这意味着“选模型”需要按任务拆开看:做 agent 编排、结构化抽取、代码和技术推理,新模型大概率更优;做面向终端用户的文案、叙事和长文写作,旧版本可能仍是更稳的选择。把写作质量纳入自己的评测集,比只看公开榜单更实际。
对普通用户,一个可操作的判断是:如果你觉得模型“说话像说明书”,问题往往不在提示词,而在模型被训练成优先满足机器可验证的目标。
值得关注的还有两点:一是 Anthropic 是否会为写作场景提供独立的模型或模式,而不是让同一个模型兼顾所有目标;二是“面向 AI 的输出”与“面向人的输出”是否会正式分化为两条产品线。
我的判断是:模型能力的进步和写作体验的改善,短期内不会自动同步。谁先把人类阅读体验做成可优化的训练信号,谁就能在“好用”这个维度上拿到差异化优势——而这恰恰是跑分榜上看不见的部分。


