机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

真实机器人没有“暂停键”。

现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列,也就是 action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。

所以真实部署里更常见的方式是异步推理:机器人继续执行手头的动作,模型同时在后台计算下一段。简单说,手上做 A,模型已经在算 B。

但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。

近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。解决的是大模型异步推理成为真实部署常态后,与之适配的online RL 到底该从哪些动作里学。

SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。

图注:SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。

异步执行之后,RL 为什么会“对错账”?

传统在线 RL 往往默认一种更规整的节奏:模型先算出动作,机器人执行,再根据结果更新策略。模型生成什么,机器人就执行什么。

异步执行打破了这个对应关系。等一段新的 action chunk 算出来,机器人已经沿着上一轮指令往前做了一截;而这一段新动作还没全部执行完,下一轮推理结果又可能到来,把后半段直接替换。于是,一整段 action chunk 里,有些动作已经来不及改,有些真正执行了,还有一些根本没有发生。

如果强化学习仍然把整段动作一起拿来优化,就会出现一个很直接的问题:机器人来不及改或没做过的动作,也可能因为这次任务成功而被“记功”,或者因为失败而“背锅”。

SmoothRL 先把这笔账拆清楚。它将 action chunk 按执行状态分成三个区域:

  • 已提交区域(committed region):这些动作已经被上一轮推理“提交”了,不能再改变,确定会执行。
  • 执行区域(execution region):当前这轮新生成、机器人实际上会执行的动作。
  • 丢弃区域(discarded region):这些动作虽然模型生成过,但机器人根本不会执行,因为下一轮推理会把它们替换掉了。

训练的时候,不能把这三部分一视同仁。SmoothRL 的核心思想就是:机器人真正执行了什么,就只对什么进行强化学习。也就是说,只让梯度穿过 execution region(执行区域)。

这样训练出来的模型,优化目标才和机器人真实运行时经历的过程一致。第二步,是让训练和部署遵守同一套时间节奏。SmoothRL 在训练 rollout 中就直接运行异步推理:模型计算和机器人执行并行发生,replay buffer 记录的也是这种真实时间关系下产生的轨迹。团队将这一原则概括为 Reinforce in Deployment(在部署强化学习)——不是先在一个理想的同步世界里训练,再换成异步方式部署,而是从训练开始就面对机器人真正会遇到的执行动态。

在论文的具体实现中,团队采用针对各任务微调后的 π0.5 作为基础策略,并沿用 RLT 的基本骨架,用轻量 TD3-style actor-critic 在原始动作空间预测 residual correction。S1 以 30 Hz 执行动作,推理请求频率为 5 Hz,即每 200 ms 得到一个新的 action chunk。基础策略每次预测 32 帧动作;在固定延迟预算下,Committed 与 Execution 共占 12 帧,其中 6 帧属于本轮真正执行的 Execution Region,其余 20 帧在执行前会被后续 chunk 覆盖。

图注:SmoothRL 将异步 action chunk 划分为 Committed / Execution / Discarded 三个区域,并只让价值梯度通过真正执行的 Execution Region。

从高速投掷到毫米级插入,测试两类真实部署难题

团队在绳驱本体星尘智能S1上测试了三项真机任务,覆盖两类常见且互补场景:高速动态操作与高精度双臂操作

特别是高动态任务:机器人动作变化很快,如果每一步都等模型算完再执行,就会卡顿,所以必须采用异步推理。

动态投掷:39% → 94%。 机器人需要从随机位置抓取物体,再投进不同位置的目标箱。这个任务不是到达一个目标位姿就结束,而是要求手臂在摆动过程中持续积累速度,并在准确时刻释放。论文特别指出,一旦在 action chunk 边界发生停顿,手臂可能几乎降到静止,剩余摆动很难重新恢复所需释放速度。因此,它对异步执行尤其敏感。在累计 250 个 rollout episodes 的评估节点,成功率从基础策略的 39% 提升至 94%。

/Users/suyue/Desktop/星尘智能SmoothRL论文通稿-素材包/动态投掷对比.gif动态投掷对比

给笔戴帽:8% → 83%。 双臂需要把笔和笔帽精确对齐,允许的相对位姿误差约为 5 mm。基础策略通常已经能到达目标附近,但对不同笔帽位置的微小变化适应不足。最终成功率从 8% 提升至 83%。

快递开箱:30% → 90%。 机器人需要用约 1 mm 宽的刀片插入仅 2—3 mm 宽的箱盖接缝,再沿接缝切开胶带。基础策略存在稳定左偏。值得注意的是,它的学习曲线并非一路上升:150 个 rollout episodes 时成功率一度从 30% 降到 20%,随后回升至 40%,最终达到 90%。真实在线探索并不一定单调变好。

图注:三项真机任务随累计 rollout episodes 增加的成功率变化。

比成功率更值得看的是,机器人的“错法”变了。

RL 之前,三项任务都有明显的系统性偏差:投掷时不能根据目标距离正确调节释放速度;开箱时刀片持续向左偏;给笔戴帽时,对不同笔帽位置产生过于相似的动作。在线 RL 做的,就是利用真实执行结果,一点点把这些固定偏差修回来。

到最终 checkpoint,失败已经明显向成功位置收缩。开箱任务的失败样本中,刀片相对接缝的左右偏差约为 1—2 mm;给笔戴帽的失败样本也主要变成了正确位置附近的小幅错位。

所以这里的 RL,并不是从零重新教机器人“什么叫开箱”,而是在做一件更接近部署的问题:把一个已经基本会做的策略,继续练到足够准确。

而且,更准的同时还要兼顾动作平滑性。通过在策略中加入平滑性约束,在一次真实自主投掷 rollout 中,经过在线 RL 后,右侧末端执行器的加速度均方根下降了 52%,急动度(Jerk)下降了 47%。也就是说,机器人不仅成功率更高,突然加速、减速和方向变化也更少,整个投掷过程更平稳、更连续。

图注:动态投掷中的 Velocity / Acceleration / Jerk 对比

机器人开始工作以后,训练还没有结束

过去几年,机器人基础模型主要解决的是“会不会”:用更多数据、更强模型,把能力做宽。但机器人真正进入真实环境以后,新的问题往往不是完全不会,而是差几毫米、差半拍,或者换一个物体位置就不够稳定。

SmoothRL 关注的是这之后的一层:一个已经具备基础能力的 pretrained policy,进入真实世界以后,能不能继续根据真实执行结果修正自己。

论文当前使用的是稀疏的任务成功 / 失败奖励,训练过程中操作员也可以在必要时介入,介入动作属于 raw action space 中,并可直接用于后续的模型训练。因此,这还不是完全无人参与的“自主进化”,而是一套面向真实部署的更高效的在线后训练机制。

它也有明确边界。当前实现要求每次 chunk-level inference 都在预设 latency budget 内完成;轻量 residual policy 的表达能力也受到冻结基础策略限制。如果基础策略本身离目标行为太远,局部 residual correction 并不能凭空把它救回来。

下一步,团队计划进一步探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。

SmoothRL 指向的是一个正在变得越来越具体的问题:预训练让机器人学会怎么做,真实世界里的后训练,再把这些能力练得更准、更稳、更可靠。

SmoothRL 背后,延续了星尘在机器人模型上一条独特的长期判断:动作不是视觉或语言模型最后附带生成的结果,而应该成为机器人智能里的“第一公民模态”。 因为机器人最终不只是为了看懂世界,更要在物理世界正确行动。所以Lumo系列基座模型始终关注“为什么要这样动”,从Lumo-1的显式推理、到Lumo-2预测世界因动作带来的变化,都在沿此思路发展。

在这条主线下,星尘也形成了从前端 Agent、中间基座模型、到 RL 后训练的完整模型布局:Agent 负责交互、记忆、理解任务与调用能力,基座模型逐步形成开放场景里可泛化的通用操作能力,RL再从真实执行中的成功、失败和反馈中修正策略、持续进化。

在模型全面发展时,星尘“AI模型-具身OS-绳驱本体”的全栈系统也在持续迭代,推动Physical AI的应用与规模化部署。

SmoothRL 由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究。