当智能体开始操作真实的政府网站,问题就不再是“它能不能点对按钮”,而是“它有没有资格替人做这件事”。

发生了什么

据 Hacker News 上的一条讨论,Anthropic 的智能体(Agents)被尝试用于在美国国务院网站上填写签证表单。这条信息本身很简短,没有披露具体是哪个产品、哪类签证、由谁发起,也没有说明最终是否成功提交。可确认的核心事实只有一点:有人把面向公众的政务表单填写流程,交给了自主代理去执行。

为什么重要

过去一年,Agent 的演示大多发生在沙盒里:订机票、比价、整理邮件、跑通一个内部工具链。这些场景的共同点是低风险、可回滚、失败成本小。签证表单不一样——它涉及个人身份信息、法律声明、提交后的不可逆后果,以及一个由人类设计的、充满反爬与反自动化机制的政府系统。

Anthropic 本身是“计算机使用”类能力的主要推动者之一,其 Agent 产品线强调让模型直接操作浏览器和桌面。把这类能力放到国务院网站上,等于同时测试三件事:模型对复杂表单的理解能力、代理在真实网络环境中的鲁棒性,以及现有法律与平台规则是否允许这种代操作。

更值得注意的背景是,美国政府网站通常有明确的使用条款,自动化访问往往被限制甚至禁止。即便技术上跑通,也不代表合规上成立。这条讨论之所以被关注,恰恰因为它触碰了“能力边界”和“许可边界”之间那条模糊的线。

影响与看点

对开发者而言,这个案例是一个提醒:Agent 的评估体系需要从“任务完成率”扩展到“是否被允许完成”。在涉及政务、金融、医疗等强监管领域,代理的每一步操作都可能需要可审计的授权链,而不是一个 API key 就放行。

对行业来说,真正的瓶颈可能不在模型能力,而在身份与责任。如果 Agent 填错了信息、提交了虚假声明,责任归属于用户、开发者还是模型提供方?目前没有清晰答案。这也解释了为什么许多 Agent 产品在涉及真实身份的场景里选择保守——它们宁可停在“帮你准备好草稿”,也不愿直接点提交。

一个独立的判断是:这类尝试会越来越多,但短期内更可能催生“人机协作式”的合规流程,而不是完全无人化的代提交。真正被验证的,不是 Agent 能不能填表,而是我们愿不愿意为它的错误买单。