Anthropic 正在测试其 AI 编程助手 Claude Code 能否承担公司自身软件的日常维护工作,从崩溃模糊测试到死代码删除。在几周内,该 AI 生成了 388 个拉取请求,其中 46% 在人工审核后合并。Claude Code 的发明者 Boris Cherny 称这是“早期生命迹象,表明这可能实现”。
发生了什么
根据 The Decoder 的报道,Anthropic 让 Claude Code 负责其部分软件仓库的日常维护任务,包括崩溃模糊测试(crash fuzzing)和死代码移除(dead-code removal)。在数周的时间里,Claude Code 自动创建了 388 个拉取请求(PR),其中 46% 经过人类开发者审核后被合并到代码库中。这一数据表明,AI 不仅能够生成代码,还能在真实项目中完成维护性工作,并达到接近一半的接受率。
为什么重要
这一实验的意义在于,它展示了 AI 编程助手从“辅助生成代码”向“自主执行维护任务”的转变。日常维护工作通常繁琐且耗时,但却是软件工程中不可或缺的部分。如果 AI 能够可靠地处理这类任务,将大幅减轻开发者的负担,让他们专注于更高层次的架构设计和创新。更重要的是,46% 的合并率并非在孤立环境中取得,而是在 Anthropic 自己的生产代码库中,经过严格的人工审核流程后达成的。这为 AI 在真实软件工程中的可靠性提供了初步证据。
影响与看点
对于开发者而言,这一进展预示着 AI 编程工具将逐步承担更多“杂活”,但人工审核仍然是关键环节。46% 的合并率也意味着超过一半的 PR 被拒绝或需要修改,说明 AI 的判断仍不完美,人类监督不可或缺。值得关注的是,Claude Code 能否从维护任务扩展到更复杂的特性开发,以及这种自主维护模式是否能在其他公司复现。此外,随着 AI 在代码库中留下更多痕迹,代码审查流程和团队协作方式也可能随之演变。一个值得思考的问题是:当 AI 能处理日常维护时,开发者的角色将如何重新定义?



