当大模型不再只是“大脑”,而是直接伸手去拿盘子,机器人的软件栈正在被重新划分。
发生了什么
据The Decoder报道,斯坦福与加州理工(Caltech)的研究人员做了一项实验:让一台人形机器人独立整理一间它此前并不熟悉的厨房。驱动它的不是传统的机器人控制程序,而是GPT-6 Astra。
关键在于架构选择。他们提出的HomeBody系统跳过了通常需要专门训练的控制层,让语言模型直接调用一组模块化技能——比如抓取、导航等底层能力。换句话说,模型不负责生成关节扭矩,而是像调用工具一样,决定“现在该用哪个技能、对哪个物体、去哪里”。
为什么重要
机器人做家务并不是新话题,但过去的主流路线是分层的:底层是运动控制,中层是任务规划,上层才可能接入语言模型。每一层都需要大量专门数据和训练,换一个环境、换一类物体,往往就要重新调参甚至重训。
HomeBody的思路是把“理解任务”和“执行动作”之间的耦合拆开。语言模型承担语义理解与任务分解,模块化技能承担可靠的动作执行。这样做的直接好处是泛化:面对陌生厨房,系统不需要为这个具体场景重新训练控制策略,而是靠模型的常识去组合已有技能。
这也呼应了近一年机器人领域的一个趋势——把大模型当作机器人的“调度中枢”,而非端到端的动作生成器。相比让模型直接输出低层动作,这种“模型调用技能”的方式在工程上更可控,也更容易复用现有机器人能力。
影响与看点
对机器人研究者而言,这项工作的价值不在于机器人把厨房收拾得多干净,而在于验证了一条降低适配成本的路径:新环境、新任务,可能只需要更好的任务分解,而不需要新的控制层训练。
对开发者和平台方而言,值得关注的是“技能接口”的标准化问题。如果语言模型要稳定调用抓取、导航等技能,这些技能就需要统一的描述与调用约定,这本身可能催生新的中间层生态——不是控制层,而是技能注册与调度层。
需要克制看待的是,报道并未给出成功率、耗时或失败案例的细节,因此无法判断这套系统在真实家庭环境中的鲁棒性。陌生厨房的“整理”任务,涉及大量长尾物体和模糊指令,语言模型的常识能否稳定转化为正确动作序列,仍是开放问题。
一个独立判断:HomeBody代表的不是“机器人终于会做家务”,而是机器人软件栈的重心正在从控制层上移到调度层。谁定义技能接口,谁就可能掌握下一代机器人应用的入口。



