当模型能力开始以"同一份真实工作、快一倍"来衡量时,评测的坐标系正在从跑分转向产出。

发生了什么

据 OpenAI 披露,Basis 使用 GPT-6 Astra 完成了一份包含 50 个标签页(tab)的税务工作簿,耗时约为 GPT-5.6 Sol 的一半。OpenAI 同时提到,Astra 对用户意图的理解更强,这让 Basis 对把模型投入真实业务场景更有信心。

信息本身很克制:没有披露具体耗时、成本、准确率,也没有说明"完成"的验收标准是人工复核通过还是自动校验通过。但两个要素值得注意——一是任务形态,二是对比对象。

为什么重要

税务工作簿不是一道题,而是一个长链条、强结构、跨表引用的工程。50 个标签页意味着大量相互勾稽的单元格、公式依赖和口径一致性要求;一处口径错,整本表可能连锁失真。这类任务恰好落在当前模型最容易暴露短板的地方:长上下文中的状态保持、跨表引用的一致性、以及对"用户到底想要什么口径"的推断。

正因如此,"快两倍"这个说法如果只看速度,意义有限。真正有分量的是后半句:意图理解的提升带来了落地信心。在专业服务场景里,速度从来不是瓶颈,返工才是。一个能少猜错意图、少做无效修改的模型,节省的往往不是生成时间,而是复核和纠错的人力。

从命名看,GPT-6 Astra 与 GPT-5.6 Sol 构成代际关系,OpenAI 选择用客户案例而非基准榜单来发布能力信号,这本身也说明企业级专业工作流正成为模型竞争的主战场。

影响与看点

对行业而言,会计、税务、审计、财务建模这类"高结构化 + 高容错成本"的领域,正在成为大模型价值验证的试金石。它们不像写代码那样有即时可运行的反馈,也不像文案那样容错宽松,因此对模型的意图对齐和长程一致性要求更苛刻。

对开发者而言,值得关注的不是"换哪个模型",而是如何把这类任务拆成可校验的中间产物:公式与数值分离、跨表引用显式化、关键口径可回溯。模型越快,验证环节的设计就越决定最终收益。

对使用者而言,一个务实的判断是:在专业工作簿场景里,模型的价值不体现在它能生成多少行,而体现在它需要被纠正多少次。速度翻倍是入场券,意图理解才是决定它能否留在生产流程里的那一票。

接下来值得观察的是:Basis 是否会把 Astra 从试点推向常态化流程,以及 OpenAI 是否会给出更细的任务级评测口径。目前披露的信息还不足以判断这套能力在更复杂的多期、多主体税务场景中是否同样成立。