AI 已经能在记账这件事上跑赢持证会计师——但它还坐不上主位。
发生了什么
据 The Decoder 报道,Mercor 的一项研究显示,当前 AI 模型在结构化会计任务上的表现已在速度和准确率两个维度超过持证注册会计师(CPA)。这一结论放在 18 个月前几乎不可想象:当时模型在这类任务上还明显落后于人类专业人士。
不过同一份研究给出了另一面。在难度更高的 APEX Benchmark 上,没有任何一个模型能够完整完成全部任务;在缺少人工监督的情况下,AI 依然无法独立完成结账(close the books)。
为什么重要
会计是 AI 落地叙事里最典型的“高价值、强规则、可验证”场景:任务边界清晰、输入输出结构化、错误可被对账发现,理论上非常适合模型接管。过去一年半里模型在这条曲线上从落后到反超,说明的不是“AI 变聪明了”这种笼统判断,而是特定任务类型上的能力跃迁已经发生——凡是规则明确、反馈可量化的白领工作,都在被重新定价。
但 APEX 基准的结果同样关键。它揭示的是能力分布的形状:模型能高效处理大量结构化子任务,却在需要跨环节串联、处理异常、承担最终责任的全流程任务上掉链子。“结账”恰恰是这类任务的代表——它不是一堆独立操作的加总,而是一条需要判断、核对与兜底的闭环。
影响与看点
对财务与会计行业而言,短期最现实的变化不是替代,而是任务结构的重组:底层的凭证处理、分类、核对会加速自动化,而复核、异常处理与签字担责的位置反而更值钱。持证资质的价值可能从“会做账”转向“敢签字”。
对开发者与企业采购方,这份研究给出的信号是:不要用“能否通过某项考试”来评估部署可行性,而要看任务链条有多长、异常率有多高、出错成本由谁承担。APEX 这类全流程基准,比单点准确率更接近真实上线条件。
对模型厂商,结构化任务的领先已经不再是差异化优势,真正的竞争点正在向长链条任务的完成度、可审计性与人机交接设计转移。
一句话判断:AI 在会计上的胜利是真实的,但它是“子任务级”的胜利;从子任务到结账之间那段距离,恰恰是当前 AI 商业化最贵、也最难跨越的一段。



