第29章 AI 进入物理世界
让模型在图片里指出玻璃杯,与让机器人抓起玻璃杯,是两种难度完全不同的任务。
识别错误可能产生一句错话;抓取错误会让杯子掉落。机器人伸手以后,杯子可能滑动,摄像机视角会变化,电机有延迟,旁边的人也可能突然靠近。系统必须在动作发生后立即读取新传感器数据并修正。
物理世界把 AI 从“预测一个输出”变成持续控制:每个输出都会改变下一时刻的输入。多模态理解、规划、工具调用和强化学习在这里汇合,但现实的噪声、时间和不可逆后果也同时进入系统。
机器人把模型接到传感器和执行器
物理系统至少包含:
- 传感器:摄像机、深度相机、麦克风、力矩、触觉、位置和速度;
- 状态估计:从不完整、带噪声的测量推断物体、机器人和环境状态;
- 目标与规划:决定要到达什么状态,以及可能的动作序列;
- 控制器或策略:把当前状态变成电机、方向、速度或抓取指令;
- 执行器:真正施加力和运动;
- 安全监控:检查碰撞、速度、工作区、异常和人工停止。
语言模型通常只位于其中一层。它可以理解“把桌面整理好”并选择技能,但毫秒级稳定控制常由专门控制器执行。把所有层都叫作“机器人模型”,会掩盖真正决定安全和性能的接口。
物理智能的核心是闭环
开环动作只按预先计划执行,不关心结果。例如机械臂按固定轨迹移动三秒。闭环控制在执行中持续测量误差:杯子偏了就修正轨迹,轮子打滑就调整速度。
目标
|
状态估计 -> 规划或策略 -> 控制指令 -> 执行器
^ |
| v
传感器 <-------- 真实环境发生变化 ---+
反馈频率很重要。高层计划可以每秒更新一次,平衡和力控制可能每秒更新数十到上千次。一个擅长慢速语言推理的模型,不一定适合直接承担快速控制。
核心机制:动作改变世界,反馈再改变动作
物理 AI 在闭环中运行:传感器产生观察,系统估计状态并选择动作,执行器改变真实环境,新观察再用于纠正。模型能力只有接入及时、稳定、受约束的反馈回路才会成为物理能力;高层语言规划不能替代低层控制和独立安全机制。
模块化与端到端是一条连续谱
传统机器人和自动驾驶常把感知、定位、预测、规划和控制分成模块。优点是接口明确,可针对每层测试;缺点是中间表示可能丢失信息,模块误差还会向后传播。
端到端路线直接从传感器输入预测动作。深度视觉运动策略展示了从图像到机器人控制的联合学习;端到端驾驶工作则从道路图像预测转向控制。(Levine 等 2016年; Bojarski 等 2016年)
“端到端”也不意味着系统真的只有一个网络。部署时仍可能有传感器处理、地图、速度限制、碰撞检测和备用控制器。学习策略可以端到端训练,整个安全系统仍然是模块化的。
两条路线的实用组合是:模型负责难以手写规则的感知、预测或高层动作,确定性控制器和安全约束负责已知边界。模块多少不是目的,关键是错误能否被检测、隔离和恢复。
技术深潜:闭环控制中的不确定性
设真实状态为 \(x_t\),控制输入为 \(u_t\),环境动力学为:
\[ x_{t+1}=f(x_t,u_t,w_t) \]
\(w_t\) 表示摩擦变化、外力和模型误差等扰动。传感器只能得到观察:
\[ y_t=h(x_t,v_t) \]
\(v_t\) 表示测量噪声、遮挡和延迟。策略根据观察历史或估计状态选择控制:
\[ u_t=\pi_\theta(y_{1:t},g) \]
其中 \(g\) 是任务目标。若只看单帧图像,系统可能不知道物体正在向哪边运动;历史、速度估计和内部记忆因此很重要。
控制延迟会让动作基于过期状态。策略训练时若只见过理想、同步的传感器,部署后的小延迟就可能引起振荡或越界。闭环评估必须测连续轨迹、扰动恢复和最坏情况,而不能只测静态图像上的动作预测准确率。
模型学习到的 \(\pi_\theta\) 还受训练状态分布限制。一次错误动作把机器人带到训练数据很少覆盖的姿态后,后续误差可能迅速扩大,这与长任务中的状态漂移相似,但物理后果更直接。
机器人怎样学习动作
手写控制适合明确动力学和约束,但复杂抓取、布料折叠和家庭环境很难完整建模。机器学习常用三类数据来源:
- 示范:人类遥操作或已知控制器提供观察 - 动作对;
- 强化学习:系统通过奖励和环境反馈改进策略;
- 离线轨迹:从已有日志学习,不在训练时直接探索真实环境。
模仿学习容易复制示范中的局部行为,但遇到示范未覆盖的状态会累积偏差。强化学习能探索恢复动作,却在真实机器人上昂贵且可能危险。实际系统常组合示范预训练、仿真强化学习、少量真实数据适配和安全约束。
数据标签也与语言不同。一段机器人轨迹不仅有图像和文字,还要同步关节位置、末端位姿、动作、时间戳和成功信号。不同机器人机体、相机位置和控制接口不一致,使数据合并比网页文本困难得多。
语言目标必须落到可执行技能
用户说“把饮料拿来”,语言模型可以分解为找到饮料、靠近、抓取和递送。但机器人当前可能够不到瓶子,抓手也可能不适合某个容器。
可供性(affordance)描述某个动作在当前环境中是否可行。SayCan 将语言模型对技能与指令的匹配,和机器人价值函数估计的可执行性结合,用于选择下一项技能。(Ahn 等 2022年)
设候选技能为 \(a\),可用一个简化打分表达:
\[ S(a)=L(a\mid g)\,A(a\mid x) \]
\(L\) 表示技能与语言目标 \(g\) 的匹配,\(A\) 表示技能在当前状态 \(x\) 下的可供性。语言上合理但够不到的动作会被压低;物理上可行但与目标无关的动作也不应被选中。
这种分层让高层模型选择“抓取”或“移动”等技能,低层策略完成连续控制。但技能库之外的新动作、错误状态估计和价值函数偏差仍会导致失败。
视觉语言动作模型把动作也表示成序列
视觉语言动作模型(vision-language-action model, VLA)同时读取图像、语言指令和机器人状态,并输出动作或动作 Token。
RT-1 用 Transformer 在大规模真实机器人数据上预测离散动作;PaLM-E 把连续传感器表示接入语言模型,研究具身多模态任务;RT-2 将机器人动作表示为文本式 Token,与视觉语言数据共同训练,探索互联网语义知识向机器人控制的迁移。(Brohan 等 2022年, 2023年; Driess 等 2023年)
图像 + 机器人状态 + 语言目标
|
多模态编码
|
动作 Token 或动作块
|
低层控制与安全约束
把动作 Token 化允许复用序列模型结构,但不会消除连续控制问题。动作分辨率、频率、延迟和机体定义必须在 Token 与执行器之间重新建立联系。
这些系统在特定机器人、任务和数据分布上的成功,不等于获得了人类式通用身体能力。真实部署仍要面对新物体、光照、磨损、碰撞和人机协作。
技术深潜:离散化、控制频率与误差
设某个连续动作分量 \(u\) 的范围为 \([u_{\min},u_{\max}]\)。若均匀量化为 \(M\) 个包含两端点的离散值,每个值对应一个 Token,步长为:
\[ \Delta u=\frac{u_{\max}-u_{\min}}{M-1} \]
只考虑量化时,最大舍入误差约为:
\[ |u-\hat u|\le\frac{\Delta u}{2} \]
增加 Token 数能提高分辨率,却需要更多数据覆盖每个动作区间。不同动作维度的尺度也不同:夹爪开合、关节角和底盘速度不能盲目共享量化范围。
模型可以每次只预测一步,也可以预测未来 \(H\) 步的动作块:
\[ U_t=(u_t,u_{t+1},\ldots,u_{t+H-1}) \]
动作块减少模型调用次数,让短期轨迹更平滑。\(H\) 太大时,后半段基于过期观察,遇到扰动不能及时修正;\(H\) 太小时,推理延迟又可能跟不上控制频率。
一种折中是滚动执行:每次预测动作块,只执行前几步,获得新观察后重新规划。评估要同时报告任务成功、轨迹平滑、碰撞、控制频率和端到端延迟。
机器人数据是昂贵的系统资源
互联网文本可以大规模复制,真实机器人轨迹却需要硬件、场地、维护和人员。一次失败抓取还可能中断采集或损坏物体。
低成本遥操作硬件和动作块策略可以提高示范采集效率。ACT 工作展示了低成本系统上的精细双臂操作学习。(Zhao 等 2023年) 但高质量演示仍受操作者、视角、任务定义和成功判据影响。
Open X-Embodiment 汇集多机构、不同机器人和任务的数据,并研究跨机体模型;Octo 则探索可在多种机器人数据上训练并适配的开源通用策略。(Open X-Embodiment Collaboration 等 2024年; Octo Model Team 等 2024年)
跨机体训练的困难包括:
- 关节数量和动作坐标系不同;
- 摄像机、夹爪和工作空间不同;
- 同一语言动作在不同机体上需要不同轨迹;
- 数据成功率、频率和标注标准不一致;
- 某些任务在一种机器人上根本不可执行。
规模可以增加行为覆盖,却不能自动统一这些物理语义。数据混合需要明确机体、动作空间和质量元数据。
世界模型让系统在内部预测后果
世界模型学习状态怎样随动作变化。系统可以在模型中想象多个未来,选择可能获得高奖励或满足约束的动作,再到真实环境执行。
Ha 与 Schmidhuber 的 World Models 展示了用压缩视觉表示、动态模型和控制器组合学习环境;Dreamer 系列则在学习到的世界模型潜空间中训练行为,DreamerV3 研究了跨多类任务的统一配置。(Ha 和 Schmidhuber 2018年; Hafner 等 2023年)
世界模型不是完整复制现实。它会保留有助于训练目标的规律,忽略未被数据或损失强调的细节。若模型没有学会玻璃破碎、轮胎打滑或人类突然出现,内部规划就可能偏爱现实中危险的轨迹。
因此,模型内预测适合扩大候选和减少真实试错,但最终仍需真实反馈、保守约束和异常监控。
仿真可以扩大数据,但现实差距不会自动消失
仿真器能低成本并行生成轨迹,允许碰撞和探索,还能给出精确状态标签。问题是仿真的纹理、光照、摩擦、传感器噪声和物体动力学与现实不同。
领域随机化在仿真训练时随机改变这些因素,迫使策略不要依赖单一外观或参数。Tobin 等人展示了用随机仿真训练视觉模型并迁移到现实。(Tobin 等 2017年)
若真实条件落在随机化范围之外,策略仍会失败。把随机范围开得极大也可能让训练问题过难,降低精细性能。sim-to-real 不是一次转换,而是循环:仿真训练、真实测试、发现差距、修正模型和数据,再测试。
现实数据还可以校准仿真器或用于少量微调,但必须防止测试场景泄漏到训练,掩盖真正的泛化能力。
物理安全需要独立于生成模型
语言模型可以被要求“谨慎”,但安全不能只依赖它生成一句自我保证。物理系统常需要多层防护:
- 速度、力矩、工作空间和距离的硬限制;
- 碰撞检测、急停和人工接管;
- 高层动作的白名单与前置条件;
- 不确定或传感器异常时进入安全状态;
- 仿真、回放和封闭场地逐级测试;
- 记录传感器、动作、模型版本和安全触发;
- 对儿童、道路、医疗等高风险场景采用更严格准入。
端到端模型输出也必须经过这些边界。安全控制器可能牺牲部分效率,却在模型遇到分布外输入时提供最后一道限制。
演示视频尤其容易高估能力。一次剪辑后的成功不能回答成功率、失败后果、干预次数、测试分布和连续运行时间。物理 AI 应报告重复试验、未筛选失败、扰动恢复和安全事件。
学习路径:先在仿真中观察闭环
实践继续后置,首轮不需要购买机器人。可以在低维控制或简单仿真环境中完成:
- 比较开环动作与读取反馈的闭环控制;
- 给传感器加入噪声、延迟和遮挡,观察轨迹变化;
- 用少量示范训练行为克隆,并测试偏离示范状态后的误差累积;
- 改变摩擦、质量和视觉外观,测量分布变化;
- 加入动作量化与不同动作块长度,比较平滑度、延迟和成功率;
- 设置速度与工作区硬约束,记录策略触发安全层的次数;
- 报告多次运行的成功率和失败类型,而非只保存最佳视频。
这个实验的核心观察是:同一个策略网络在闭环频率、噪声和动力学改变后会表现不同,物理能力不能脱离整个控制系统评价。
本章小结
- 物理 AI 把模型连接到传感器、状态估计、规划、控制器和执行器,输出会改变下一时刻输入。
- 闭环反馈让系统根据真实结果持续纠正;高层语言规划不能替代高速低层控制。
- 模块化与端到端是连续谱,部署系统仍需要可检测、可隔离的安全边界。
- 模仿学习、强化学习和离线轨迹各有数据与风险权衡,机器人数据比互联网文本更昂贵、更异构。
- 可供性把语言上的合理动作与当前物理可执行性结合。
- 视觉语言动作模型把图像、语言、状态与动作 Token 连接,但动作分辨率、频率和机体差异仍然存在。
- 世界模型和仿真可以减少真实试错,却会遗漏未被数据覆盖的现实细节。
- 物理安全需要硬约束、监控、急停和逐级测试,不能只依赖生成模型自我检查。
思考问题
- 为什么一个准确识别物体的视觉模型不一定能稳定抓取它?
- 动作块变长会减少推理调用,为什么也可能降低扰动恢复能力?
- 领域随机化的范围太窄或太宽,分别会造成什么问题?
- 物理系统的一次成功演示还缺少哪些可靠性信息?
延伸阅读
- 深度视觉运动策略和端到端驾驶工作适合比较从感知到动作的联合学习。(Levine 等 2016年; Bojarski 等 2016年)
- SayCan、RT-1、PaLM-E 与 RT-2 展示了语言、视觉、技能和动作表示的多种组合。(Ahn 等 2022年; Brohan 等 2022年, 2023年; Driess 等 2023年)
- World Models 与 DreamerV3 适合进一步理解在学习到的动力学中预测和训练行为。(Ha 和 Schmidhuber 2018年; Hafner 等 2023年)
- Open X-Embodiment、ACT 与 Octo 提供了机器人数据采集、跨机体训练和开放策略的案例。(Open X-Embodiment Collaboration 等 2024年; Zhao 等 2023年; Octo Model Team 等 2024年)
- 领域随机化论文适合观察仿真变化怎样影响现实迁移。(Tobin 等 2017年)
