当大模型从“会聊天”走向“会干活”,最难的关卡不是生成文字,而是在真实软件界面里一步步把事办成。OpenAI 与合同管理平台 Ironclad 的这次合作,正是冲着这个关卡去的。
发生了什么
OpenAI 官方披露,其与 Ironclad 正在围绕复杂的合同工作流,对 AI 智能体进行训练与评估,目标是推进 computer use 在专业工作中的应用。所谓 computer use,指模型像人一样操作图形界面——点击、填写、切换系统、读取页面信息,而不是只通过 API 调用完成单一任务。合同流程恰好是这类能力的试金石:它横跨多个系统、步骤冗长、状态多变,且对准确性要求极高。
为什么重要
过去一年,智能体的叙事大多停留在演示视频里:订机票、填表单、跑通一个短流程。但专业工作场景的复杂度完全不同。一份合同的流转,往往涉及起草、条款比对、审批、签署、归档,中间穿插邮件、文档、CRM 和法务系统,任何一步的界面变化都可能让自动化脚本失效。
这也是 computer use 的价值所在:它试图用视觉理解和通用操作能力,替代脆弱的定制化脚本。OpenAI 选择与 Ironclad 合作,而不是自己造一个合同场景,说明其策略是借真实企业工作流来暴露模型短板——评估比训练更难,而专业场景能提供高质量的“压力测试”。
对 Ironclad 而言,这既是产品能力的探索,也是一次数据与场景的卡位。合同管理是典型的高价值、低容错领域,谁能把智能体在这里跑通,谁就握住了企业级自动化的入口。
影响与看点
对开发者来说,这个信号很明确:computer use 的竞争正在从“能不能做”转向“在真实业务里稳不稳”。评估基准、失败恢复机制、人机协作的边界,会比单纯的模型能力更值得投入。
对企业用户来说,短期内不必期待全自动的法务流程。更现实的路径是“人在环中”——智能体处理重复性操作,人负责关键判断。合同场景的合规与审计要求,决定了它会是渐进式落地,而非一夜替换。
值得关注的点有三个:一是 OpenAI 是否会公开相关的评估方法或基准,这将影响整个 computer use 生态的衡量标准;二是 Ironclad 会把能力落到哪些具体环节,是起草辅助还是流程执行;三是这类合作能否沉淀出可复用的模式,让其他垂直行业照搬。
一个独立判断:专业工作流正在成为 computer use 的主战场,而胜负手不在模型多聪明,而在它出错时能否被信任地兜住。



