AI 智能体在模型开发流程中参与得越来越深,但这并不等于它们获得了决策权。
发生了什么
据 The Decoder 报道,一个研究团队复盘了自己构建 AI 模型过程中的 769 条任务日志,统计了智能体与人类在各个环节的分工。结果显示:在方法提案环节,AI 智能体贡献的比例最高可达 55%;但进入最终决策环节,超过 85% 的决定由人类拍板。另一个值得注意的数字是,约三分之一的任务,如果没有 AI 参与,团队根本不会去尝试。作者由此给出一个克制的结论:智能体做的事更多了,但这不等于它们更自主。
为什么重要
过去一年,围绕 AI 智能体的讨论常被两种叙事拉扯。一种认为智能体即将接管软件工程与科研流程,另一种则质疑其在真实长链路任务中的可靠性。这项研究的价值在于,它没有停留在演示视频或基准分数上,而是把一次真实的模型开发过程拆成任务日志,去看人机之间究竟如何交接。
它揭示的其实是一种"提案—裁决"的分工结构:智能体擅长铺开候选方案,把人类从"从零构思"的空白页前解放出来,扩大探索的广度;而人类保留了对方向、取舍和风险的最终判断。这也解释了为什么"三分之一任务本不会被尝试"这一点可能比 55% 更关键——智能体真正改变的不是谁做决定,而是哪些问题会被提上桌面。
同时,研究者的提醒值得认真对待。用智能体调用量、生成量来衡量"自主性",是一种常见的指标误读。活跃度是过程指标,决策权才是控制权指标,两者不能混为一谈。
影响与看点
对工具厂商而言,这意味着产品叙事需要更诚实:把智能体定位为"扩大选项的协作者",比宣称"端到端自主开发"更贴近实际,也更容易在团队落地。对开发者与研究者来说,可关注的方向是如何设计人机交接点——在哪些环节允许智能体批量提案,在哪些环节必须强制人类确认,这直接决定效率收益能否兑现而不引入失控风险。
对普通用户,短期内不必担心模型开发被智能体"接管",但可以预期模型迭代中会出现更多此前不会被尝试的技术路线,这或许会体现在能力边界的拓展上。
一个独立判断:当前阶段,衡量智能体价值的正确问题不是"它能替人做多少决定",而是"它能让人类多考虑多少原本想不到的选项"。前者关乎替代,后者关乎增益,而后者才是这轮实践真正在发生的事。



