每经记者|赵雯琪 每经编辑|余婷婷
近日,OpenAI发布新模型GPT-6 Astra后,用户可以通过该模型控制机械臂的测试视频在社交平台流传,“通用大模型将降维打击具身智能”的声音再起。
9月10日,自变量创始人兼CEO(首席执行官)王潜在2026 Inclusion·外滩大会主论坛上回应称,通用大模型展现机器人控制能力并不意外,但这不意味着其他领域的智能可以自然泛化到具身领域。
王潜(右二)图片来源:企业供图
王潜介绍,当前版本的大模型已经训练了大量机器人数据。从去年年初起,OpenAI和Anthropic便开始大量采购机器人数据、招聘机器人领域人才,并通过小规模数据工厂开展采集。这些基础模型本身具备较强的多模态能力,加入机器人数据后能够控制机器人并不令人意外。
“智能的本体是存在于数据里面的。”王潜认为,模型更多扮演“蒸馏器”和“容器”的角色——训练时提炼数据中的能力,部署时承载这些能力。大模型每一代的提升,既来自规模扩大和基础设施增强,更依赖数据质量的改善。大量工作集中在数据的生产、筛选、验证和标注上,这些环节推动了AI(人工智能)系统的进步。
对于基础模型能否凭借其他领域的通用智能,对具身智能形成“降维打击”,王潜判断可能性较小。他指出,编程能力的成功并非源于对话能力,而是依赖大量编程数据以及更完善的数据和验证体系。数学能力也没有随着编程能力的提升而自然增强,两者在训练中甚至可能相互干扰,需要分别训练专家模型后再进行融合。同样,视频生成模型虽然已经表现出色,也尚未自然转化为机器人动作控制的优势。
因此,在王潜看来,通用大模型公司与具身智能企业的区别,可能更多在于前者将机器人数据和相关基础设施融入通用模型,后者则面向具身领域构建专用模型。考虑到机器人对推理速度和部署效率的要求,专用具身模型可能是更高效的选择。
不过王潜也表示,GPT-6操控机器人的表现确实为具身智能行业带来了一个启示:通用数据预训练是有效的。过去人们会怀疑,在具身模型预训练阶段加入大量通用数据,会不会反而是有害的做法、影响模型效果?王潜认为,Astra展示了这一做法的积极价值。对于在做预训练的具身智能企业,持续完善数据和验证基础设施,在预训练阶段加入更多通用数据,这条路应该坚定地走下去。
王潜同时表示,OpenAI和Anthropic如果进入具身智能领域,同样需要建设数据采集、仿真和验证基础设施,在真实环境中开展评测,并解决硬件问题。王潜表示,这些工作的难度不会因为基础模型的优势而降低,具身智能企业反而可能拥有实质性优势。
公开信息显示,自变量机器人成立于2023年12月。成立不到三年,自变量已先后获得美团、阿里云、字节跳动、小米等互联网大厂战略投资,并在两个月内连续完成B轮至C轮四轮融资,投后估值突破200亿元。
王潜本硕毕业于清华大学,攻读博士学位期间在美国顶级机器人实验室从事机器人学习研究,曾是全球最早在神经网络中提出“注意力机制”的研究人员之一。在技术路线上,自变量坚持“大小脑统一的端到端大模型”路径,自主研发了WALL-B世界统一具身智能大模型,将视觉、语言、触觉、动作和物理预测等能力融合于同一神经网络。