第29章 AI 进入物理世界

让模型在图片里指出玻璃杯,与让机器人抓起玻璃杯,是两种难度完全不同的任务。

识别错误可能产生一句错话;抓取错误会让杯子掉落。机器人伸手以后,杯子可能滑动,摄像机视角会变化,电机有延迟,旁边的人也可能突然靠近。系统必须在动作发生后立即读取新传感器数据并修正。

物理世界把 AI 从“预测一个输出”变成持续控制:每个输出都会改变下一时刻的输入。多模态理解、规划、工具调用和强化学习在这里汇合,但现实的噪声、时间和不可逆后果也同时进入系统。

机器人把模型接到传感器和执行器

物理系统至少包含:

  • 传感器:摄像机、深度相机、麦克风、力矩、触觉、位置和速度;
  • 状态估计:从不完整、带噪声的测量推断物体、机器人和环境状态;
  • 目标与规划:决定要到达什么状态,以及可能的动作序列;
  • 控制器或策略:把当前状态变成电机、方向、速度或抓取指令;
  • 执行器:真正施加力和运动;
  • 安全监控:检查碰撞、速度、工作区、异常和人工停止。

语言模型通常只位于其中一层。它可以理解“把桌面整理好”并选择技能,但毫秒级稳定控制常由专门控制器执行。把所有层都叫作“机器人模型”,会掩盖真正决定安全和性能的接口。

物理智能的核心是闭环

开环动作只按预先计划执行,不关心结果。例如机械臂按固定轨迹移动三秒。闭环控制在执行中持续测量误差:杯子偏了就修正轨迹,轮子打滑就调整速度。

目标
 |
状态估计 -> 规划或策略 -> 控制指令 -> 执行器
   ^                                |
   |                                v
传感器 <-------- 真实环境发生变化 ---+

反馈频率很重要。高层计划可以每秒更新一次,平衡和力控制可能每秒更新数十到上千次。一个擅长慢速语言推理的模型,不一定适合直接承担快速控制。

核心机制:动作改变世界,反馈再改变动作

物理 AI 在闭环中运行:传感器产生观察,系统估计状态并选择动作,执行器改变真实环境,新观察再用于纠正。模型能力只有接入及时、稳定、受约束的反馈回路才会成为物理能力;高层语言规划不能替代低层控制和独立安全机制。

图 1: 机器人闭环控制从目标和传感器观察开始,经过状态估计、规划或策略、控制器与执行器改变真实环境;环境变化产生新的观察并反馈给下一轮决策。安全监控独立检查速度、碰撞、工作区和急停条件,高层计划与低层控制可以采用不同更新频率。

模块化与端到端是一条连续谱

传统机器人和自动驾驶常把感知、定位、预测、规划和控制分成模块。优点是接口明确,可针对每层测试;缺点是中间表示可能丢失信息,模块误差还会向后传播。

端到端路线直接从传感器输入预测动作。深度视觉运动策略展示了从图像到机器人控制的联合学习;端到端驾驶工作则从道路图像预测转向控制。(Levine 等 2016年; Bojarski 等 2016年)

“端到端”也不意味着系统真的只有一个网络。部署时仍可能有传感器处理、地图、速度限制、碰撞检测和备用控制器。学习策略可以端到端训练,整个安全系统仍然是模块化的。

两条路线的实用组合是:模型负责难以手写规则的感知、预测或高层动作,确定性控制器和安全约束负责已知边界。模块多少不是目的,关键是错误能否被检测、隔离和恢复。

技术深潜:闭环控制中的不确定性

设真实状态为 \(x_t\),控制输入为 \(u_t\),环境动力学为:

\[ x_{t+1}=f(x_t,u_t,w_t) \]

\(w_t\) 表示摩擦变化、外力和模型误差等扰动。传感器只能得到观察:

\[ y_t=h(x_t,v_t) \]

\(v_t\) 表示测量噪声、遮挡和延迟。策略根据观察历史或估计状态选择控制:

\[ u_t=\pi_\theta(y_{1:t},g) \]

其中 \(g\) 是任务目标。若只看单帧图像,系统可能不知道物体正在向哪边运动;历史、速度估计和内部记忆因此很重要。

控制延迟会让动作基于过期状态。策略训练时若只见过理想、同步的传感器,部署后的小延迟就可能引起振荡或越界。闭环评估必须测连续轨迹、扰动恢复和最坏情况,而不能只测静态图像上的动作预测准确率。

模型学习到的 \(\pi_\theta\) 还受训练状态分布限制。一次错误动作把机器人带到训练数据很少覆盖的姿态后,后续误差可能迅速扩大,这与长任务中的状态漂移相似,但物理后果更直接。

机器人怎样学习动作

手写控制适合明确动力学和约束,但复杂抓取、布料折叠和家庭环境很难完整建模。机器学习常用三类数据来源:

  1. 示范:人类遥操作或已知控制器提供观察 - 动作对;
  2. 强化学习:系统通过奖励和环境反馈改进策略;
  3. 离线轨迹:从已有日志学习,不在训练时直接探索真实环境。

模仿学习容易复制示范中的局部行为,但遇到示范未覆盖的状态会累积偏差。强化学习能探索恢复动作,却在真实机器人上昂贵且可能危险。实际系统常组合示范预训练、仿真强化学习、少量真实数据适配和安全约束。

数据标签也与语言不同。一段机器人轨迹不仅有图像和文字,还要同步关节位置、末端位姿、动作、时间戳和成功信号。不同机器人机体、相机位置和控制接口不一致,使数据合并比网页文本困难得多。

语言目标必须落到可执行技能

用户说“把饮料拿来”,语言模型可以分解为找到饮料、靠近、抓取和递送。但机器人当前可能够不到瓶子,抓手也可能不适合某个容器。

可供性(affordance)描述某个动作在当前环境中是否可行。SayCan 将语言模型对技能与指令的匹配,和机器人价值函数估计的可执行性结合,用于选择下一项技能。(Ahn 等 2022年)

设候选技能为 \(a\),可用一个简化打分表达:

\[ S(a)=L(a\mid g)\,A(a\mid x) \]

\(L\) 表示技能与语言目标 \(g\) 的匹配,\(A\) 表示技能在当前状态 \(x\) 下的可供性。语言上合理但够不到的动作会被压低;物理上可行但与目标无关的动作也不应被选中。

这种分层让高层模型选择“抓取”或“移动”等技能,低层策略完成连续控制。但技能库之外的新动作、错误状态估计和价值函数偏差仍会导致失败。

视觉语言动作模型把动作也表示成序列

视觉语言动作模型(vision-language-action model, VLA)同时读取图像、语言指令和机器人状态,并输出动作或动作 Token。

RT-1 用 Transformer 在大规模真实机器人数据上预测离散动作;PaLM-E 把连续传感器表示接入语言模型,研究具身多模态任务;RT-2 将机器人动作表示为文本式 Token,与视觉语言数据共同训练,探索互联网语义知识向机器人控制的迁移。(Brohan 等 2022年, 2023年; Driess 等 2023年)

图像 + 机器人状态 + 语言目标
                |
           多模态编码
                |
       动作 Token 或动作块
                |
        低层控制与安全约束

把动作 Token 化允许复用序列模型结构,但不会消除连续控制问题。动作分辨率、频率、延迟和机体定义必须在 Token 与执行器之间重新建立联系。

这些系统在特定机器人、任务和数据分布上的成功,不等于获得了人类式通用身体能力。真实部署仍要面对新物体、光照、磨损、碰撞和人机协作。

技术深潜:离散化、控制频率与误差

设某个连续动作分量 \(u\) 的范围为 \([u_{\min},u_{\max}]\)。若均匀量化为 \(M\) 个包含两端点的离散值,每个值对应一个 Token,步长为:

\[ \Delta u=\frac{u_{\max}-u_{\min}}{M-1} \]

只考虑量化时,最大舍入误差约为:

\[ |u-\hat u|\le\frac{\Delta u}{2} \]

增加 Token 数能提高分辨率,却需要更多数据覆盖每个动作区间。不同动作维度的尺度也不同:夹爪开合、关节角和底盘速度不能盲目共享量化范围。

模型可以每次只预测一步,也可以预测未来 \(H\) 步的动作块

\[ U_t=(u_t,u_{t+1},\ldots,u_{t+H-1}) \]

动作块减少模型调用次数,让短期轨迹更平滑。\(H\) 太大时,后半段基于过期观察,遇到扰动不能及时修正;\(H\) 太小时,推理延迟又可能跟不上控制频率。

一种折中是滚动执行:每次预测动作块,只执行前几步,获得新观察后重新规划。评估要同时报告任务成功、轨迹平滑、碰撞、控制频率和端到端延迟。

机器人数据是昂贵的系统资源

互联网文本可以大规模复制,真实机器人轨迹却需要硬件、场地、维护和人员。一次失败抓取还可能中断采集或损坏物体。

低成本遥操作硬件和动作块策略可以提高示范采集效率。ACT 工作展示了低成本系统上的精细双臂操作学习。(Zhao 等 2023年) 但高质量演示仍受操作者、视角、任务定义和成功判据影响。

Open X-Embodiment 汇集多机构、不同机器人和任务的数据,并研究跨机体模型;Octo 则探索可在多种机器人数据上训练并适配的开源通用策略。(Open X-Embodiment Collaboration 等 2024年; Octo Model Team 等 2024年)

跨机体训练的困难包括:

  • 关节数量和动作坐标系不同;
  • 摄像机、夹爪和工作空间不同;
  • 同一语言动作在不同机体上需要不同轨迹;
  • 数据成功率、频率和标注标准不一致;
  • 某些任务在一种机器人上根本不可执行。

规模可以增加行为覆盖,却不能自动统一这些物理语义。数据混合需要明确机体、动作空间和质量元数据。

世界模型让系统在内部预测后果

世界模型学习状态怎样随动作变化。系统可以在模型中想象多个未来,选择可能获得高奖励或满足约束的动作,再到真实环境执行。

Ha 与 Schmidhuber 的 World Models 展示了用压缩视觉表示、动态模型和控制器组合学习环境;Dreamer 系列则在学习到的世界模型潜空间中训练行为,DreamerV3 研究了跨多类任务的统一配置。(Ha 和 Schmidhuber 2018年; Hafner 等 2023年)

世界模型不是完整复制现实。它会保留有助于训练目标的规律,忽略未被数据或损失强调的细节。若模型没有学会玻璃破碎、轮胎打滑或人类突然出现,内部规划就可能偏爱现实中危险的轨迹。

因此,模型内预测适合扩大候选和减少真实试错,但最终仍需真实反馈、保守约束和异常监控。

仿真可以扩大数据,但现实差距不会自动消失

仿真器能低成本并行生成轨迹,允许碰撞和探索,还能给出精确状态标签。问题是仿真的纹理、光照、摩擦、传感器噪声和物体动力学与现实不同。

领域随机化在仿真训练时随机改变这些因素,迫使策略不要依赖单一外观或参数。Tobin 等人展示了用随机仿真训练视觉模型并迁移到现实。(Tobin 等 2017年)

若真实条件落在随机化范围之外,策略仍会失败。把随机范围开得极大也可能让训练问题过难,降低精细性能。sim-to-real 不是一次转换,而是循环:仿真训练、真实测试、发现差距、修正模型和数据,再测试。

现实数据还可以校准仿真器或用于少量微调,但必须防止测试场景泄漏到训练,掩盖真正的泛化能力。

物理安全需要独立于生成模型

语言模型可以被要求“谨慎”,但安全不能只依赖它生成一句自我保证。物理系统常需要多层防护:

  • 速度、力矩、工作空间和距离的硬限制;
  • 碰撞检测、急停和人工接管;
  • 高层动作的白名单与前置条件;
  • 不确定或传感器异常时进入安全状态;
  • 仿真、回放和封闭场地逐级测试;
  • 记录传感器、动作、模型版本和安全触发;
  • 对儿童、道路、医疗等高风险场景采用更严格准入。

端到端模型输出也必须经过这些边界。安全控制器可能牺牲部分效率,却在模型遇到分布外输入时提供最后一道限制。

演示视频尤其容易高估能力。一次剪辑后的成功不能回答成功率、失败后果、干预次数、测试分布和连续运行时间。物理 AI 应报告重复试验、未筛选失败、扰动恢复和安全事件。

学习路径:先在仿真中观察闭环

实践继续后置,首轮不需要购买机器人。可以在低维控制或简单仿真环境中完成:

  1. 比较开环动作与读取反馈的闭环控制;
  2. 给传感器加入噪声、延迟和遮挡,观察轨迹变化;
  3. 用少量示范训练行为克隆,并测试偏离示范状态后的误差累积;
  4. 改变摩擦、质量和视觉外观,测量分布变化;
  5. 加入动作量化与不同动作块长度,比较平滑度、延迟和成功率;
  6. 设置速度与工作区硬约束,记录策略触发安全层的次数;
  7. 报告多次运行的成功率和失败类型,而非只保存最佳视频。

这个实验的核心观察是:同一个策略网络在闭环频率、噪声和动力学改变后会表现不同,物理能力不能脱离整个控制系统评价。

本章小结

  • 物理 AI 把模型连接到传感器、状态估计、规划、控制器和执行器,输出会改变下一时刻输入。
  • 闭环反馈让系统根据真实结果持续纠正;高层语言规划不能替代高速低层控制。
  • 模块化与端到端是连续谱,部署系统仍需要可检测、可隔离的安全边界。
  • 模仿学习、强化学习和离线轨迹各有数据与风险权衡,机器人数据比互联网文本更昂贵、更异构。
  • 可供性把语言上的合理动作与当前物理可执行性结合。
  • 视觉语言动作模型把图像、语言、状态与动作 Token 连接,但动作分辨率、频率和机体差异仍然存在。
  • 世界模型和仿真可以减少真实试错,却会遗漏未被数据覆盖的现实细节。
  • 物理安全需要硬约束、监控、急停和逐级测试,不能只依赖生成模型自我检查。

思考问题

  1. 为什么一个准确识别物体的视觉模型不一定能稳定抓取它?
  2. 动作块变长会减少推理调用,为什么也可能降低扰动恢复能力?
  3. 领域随机化的范围太窄或太宽,分别会造成什么问题?
  4. 物理系统的一次成功演示还缺少哪些可靠性信息?

延伸阅读

参考文献

Ahn, Michael, Anthony Brohan, Noah Brown, 等. 2022年. 《Do As I Can, Not As I Say: Grounding Language in Robotic Affordances》. 6th Conference on Robot Learning. https://arxiv.org/abs/2204.01691.
Bojarski, Mariusz, Davide Del Testa, Daniel Dworakowski, 等. 2016年. 《End to End Learning for Self-Driving Cars》. arXiv preprint arXiv:1604.07316.
Brohan, Anthony, Noah Brown, Justice Carbajal, 等. 2022年. RT-1: Robotics Transformer for Real-World Control at Scale》. arXiv preprint arXiv:2212.06817.
Brohan, Anthony, Noah Brown, Justice Carbajal, 等. 2023年. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control》. arXiv preprint arXiv:2307.15818.
Driess, Danny, Fei Xia, Mehdi S. M. Sajjadi, 等. 2023年. PaLM-E: An Embodied Multimodal Language Model》. Proceedings of the 40th International Conference on Machine Learning. https://arxiv.org/abs/2303.03378.
Ha, David, 和 Jurgen Schmidhuber. 2018年. 《World Models》. Advances in Neural Information Processing Systems 31. https://arxiv.org/abs/1803.10122.
Hafner, Danijar, Jurgis Pasukonis, Jimmy Ba, 和 Timothy Lillicrap. 2023年. 《Mastering Diverse Domains through World Models》. arXiv preprint arXiv:2301.04104.
Levine, Sergey, Chelsea Finn, Trevor Darrell, 和 Pieter Abbeel. 2016年. 《End-to-End Training of Deep Visuomotor Policies》. Journal of Machine Learning Research 17 (39): 1~40. https://arxiv.org/abs/1504.00702.
Octo Model Team, Dibya Ghosh, Homer Walke, 等. 2024年. 《Octo: An Open-Source Generalist Robot Policy》. arXiv preprint arXiv:2405.12213.
Open X-Embodiment Collaboration, Abby O’Neill, Abdul Rehman, 等. 2024年. 《Open X-Embodiment: Robotic Learning Datasets and RT-X Models》. 2024 IEEE International Conference on Robotics and Automation. https://arxiv.org/abs/2310.08864.
Tobin, Josh, Rachel Fong, Alex Ray, Jonas Schneider, Wojciech Zaremba, 和 Pieter Abbeel. 2017年. 《Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World》. 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems. https://arxiv.org/abs/1703.06907.
Zhao, Tony Z., Vikash Kumar, Sergey Levine, 和 Chelsea Finn. 2023年. 《Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware》. Robotics: Science and Systems XIX. https://arxiv.org/abs/2304.13705.