具身智能(Embodied AI)指的是拥有物理身体、通过身体与环境交互来感知和行动,并在交互中不断学习的智能系统。

这个定义里有两个要素。一是身体,智能要落在一个能感知、能行动的实体上,比如机器人、无人机或汽车。二是在交互中学习,它的能力要在和环境打交道的过程中形成和提高。只有身体、不会学习,或者只会学习、没有身体,都不算具身智能。

和离身智能有什么不同

与具身智能相对的说法是"离身智能",ChatGPT、DeepSeek 这类大模型是典型。它们的知识来自人类事先写下、拍下的数据,文本、图片、视频都是收集整理好的。模型从这些数据里学习,学完以后回答问题,本身并不接触物理世界。

具身智能的经验来源不同。它要用自己的传感器去看、去摸,用自己的关节去动,观察动作带来的结果,再据此调整下一步。有学者把前者称为"互联网 AI"(Internet AI),后者称为"具身 AI",区分的就是经验从哪里来。

离身智能(如大语言模型) 具身智能
经验来源 人类事先收集的文本、图像、视频 自身与环境的交互
输入 文字、图片等数据 相机、触觉、力觉、关节位置等传感器信号
输出 文字、图片等内容 电机和关节的动作
反馈 人对回答的评价 动作造成的环境变化

两者并不互相排斥。这两年具身智能进展加快,很大程度上正是因为大模型提供了常识和语言理解。

这个想法从哪来

"具身"一词来自认知科学里的具身认知(embodied cognition)。这一派认为,认知不只是大脑里的符号运算,它依赖身体,也依赖身体和环境的互动。

在人工智能领域,类似的设想出现得很早。1950 年,图灵在《计算机器与智能》的结尾讨论过机器学习该从哪里入手。他提到两条路,一条是从下棋这类非常抽象的活动开始,另一条是给机器装上最好的感官,再像教孩子一样教它理解和说英语。此后几十年,人工智能的主流走的基本是前一条路。

心理学上常被引用的一个证据,是 1963 年 Richard Held 和 Alan Hein 的小猫实验。研究者把在黑暗中长大的小猫两两放进一个旋转装置,一只自己走动、带着装置转,另一只坐在吊篮里被动地跟着转,两只看到的景象几乎一样。

之后用"视觉悬崖"测试,主动走动的小猫能分辨出看上去的落差,被动的那只却不能。这说明主动的身体运动,对视觉的正常发育是必要的。

机器人学里,罗德尼·布鲁克斯(Rodney Brooks)1991 年在《没有表征的智能》(Intelligence without Representation)中主张,机器人不必先在内部建好一个完整的世界模型再行动,智能行为可以直接从感知和行动的耦合中产生。

2005 年,心理学家 Linda Smith 和 Michael Gasser 把这类观点概括为"具身假说",即智能产生于智能体与环境的交互,是感知和运动活动的结果。

和机器人、人形机器人是什么关系

具身智能常被等同于机器人,尤其是人形机器人,其实两者不在一个层面上。具身智能说的是智能的一种形成方式,机器人是它最常见的载体。

有身体不等于具身智能。工厂里的焊接机械臂按工程师写好的轨迹重复动作,换一条产线就要重新编程调试。有些展厅里的讲解机器人外形逼真,但回答和动作都是预先设定的,遇到设定以外的问题就无法应对。它们都有身体,但不能根据环境自己调整,一般不算具身智能。

具身智能也不一定是人形。机械臂、轮式机器人、四足机器人、无人机、自动驾驶汽车,只要能在与环境的交互中感知、决策并适应,都可以是它的载体。

人形是其中最受关注的一种,主要因为人类的生活和工作环境都是按人的身体设计的,楼梯、门把手、工具都是如此,人形机器人不用改造环境就能使用。

一个具身系统怎么运转

具身系统的工作方式是一个循环。感知环境,做出决策,执行动作,动作改变了环境,再感知新的状态。这个循环每秒要重复几十到几百次。人伸手接球也是这样,眼睛跟着球,大脑估计落点,手一边移动一边修正。

国内业界常把具身系统分成"大脑""小脑"和"本体"三部分,大致对应这个循环里的不同环节。各家的划分不完全一致,下表是比较常见的用法。

部分 负责什么 常见的技术和名词
大脑 理解任务、识别物体、规划步骤 大语言模型、视觉语言模型(VLM)、VLA
小脑 控制身体运动、保持平衡,把规划变成关节动作 运动控制、强化学习、全身控制
本体 身体本身,以及身上的传感器和执行机构 关节电机、减速器、灵巧手、相机、触觉传感器

"在交互中学习"这一半,目前最常用的是模仿学习和强化学习。

模仿学习靠人来示范。操作员戴上 VR 设备,或者握着一套和机器人联动的操纵装置,远程操控机器人把任务做一遍,这叫遥操作。机器人记下整个过程里的图像、关节角度和受力,再用这些数据训练自己。

强化学习则让机器人自己去试。做得好就给奖励,做得不好就扣分,机器人在一次次尝试中逐渐摸索出好的做法。真机试错太慢,也容易损坏,所以这一步常放在仿真环境里,让成千上万个虚拟机器人同时练习。仿真和现实总有差距,仿真里学会的本事搬到真机上会打折扣,这个问题叫 sim2real。

为什么这两年才火

具身智能的想法由来已久,这两年才突然升温,最直接的推动力是大模型。

过去的机器人很难理解"把桌子收拾一下"这类开放的指令,也认不出没见过的物体。大模型补上了这部分常识和语言理解。2023 年,谷歌 DeepMind 发布的 RT-2 把视觉语言模型直接接到机械臂上输出动作,这类模型后来被统称为 VLA(视觉-语言-动作模型)。

RT-2 的演示中,研究人员让它"拿起那只灭绝的动物",它从一桌物品里拿起了恐龙玩具。机器人的训练数据里并没有这样的指令,恐龙已经灭绝这个常识,来自它学过的网络数据。

另外,仿真和强化学习让机器人的运动能力进步很快,行走、奔跑、跌倒后爬起都已经能在真机上稳定演示。关节电机、减速器等硬件的成本也在下降,宇树的 G1 人形机器人 2024 年起售价为 9.9 万元。2025 年的《政府工作报告》首次写入"具身智能",把它列为需要培育的未来产业之一。

难在哪

难点首先在于,对人来说越容易的事,对机器往往越难。1988 年,机器人学家汉斯·莫拉维克(Hans Moravec)指出,让计算机在智力测验或跳棋上达到成人水平相对容易,让它具备一岁儿童的感知和行动能力却很难,这后来被称为莫拉维克悖论。叠衣服、收拾桌子这类家务,机器人至今还很难做得又快又稳。

具体到技术上,最大的瓶颈是数据。大语言模型可以用互联网上积累了几十年的文本训练,Meta 训练 Llama 3 用了超过 15 万亿个 token。机器人要学的却是每一刻的图像、关节角度和受力,这类数据互联网上几乎没有,只能专门采集。

目前公开的大型机器人数据集,比如智元 2024 年底开源的 AgiBot World,总时长约 2,976 小时;Physical Intelligence 训练 π0 模型用了超过 1 万小时的机器人数据。这些数字和大模型的训练数据不在一个量级上。

这也是机器人的腿比手进步得快的原因。机器人身体的物理参数是已知的,走路所需的经验可以在仿真里大量生成。手上的操作要面对布料、液体这类软物体和复杂的接触,很难准确仿真,操作所需的数据大多只能在真实世界里一条条采集。

常见名词速查

名词 含义
离身智能 不依赖物理身体、从事先收集的数据中学习的 AI,如大语言模型
本体 机器人的硬件整机
大脑 / 小脑 国内业界的说法,大脑负责理解和规划,小脑负责运动控制
VLM 视觉语言模型,能同时理解图像和文字
VLA 视觉-语言-动作模型,在 VLM 的基础上增加动作输出
遥操作 人通过设备远程实时操控机器人,常用来采集示范数据
模仿学习 用人类示范的数据训练机器人
强化学习 让机器人在试错中根据奖励信号改进
sim2real 把仿真中学到的能力迁移到真实机器人上,以及两者之间的差距
灵巧手 有多个手指和关节、能做精细操作的机械手
自由度 机构能独立运动的方向数,大致对应可以独立驱动的关节数
世界模型 预测"执行某个动作后环境会怎样变化"的模型

参考