主要考查了XL-VLA和UniDex两篇工作关于灵巧手,两个工作都是基于 PI0 上添加
| 工作 | VLA/策略基座 | 原模型如何训练 | 灵巧手动作输出 | 跨手形态的核心机制 |
|---|---|---|---|---|
| XL-VLA | π0;PaliGemma VLM + action expert | 微调 VLA;预训练的手特定 codec 冻结 | 预测 32D 潜动作块,再由手特定 decoder 还原关节 | FK 约束的共享潜空间;新增手只接 codec |
| UniDex | π0 风格;PaliGemma,SigLIP 被 Uni3D 替换 | 9M 帧多手数据大规模预训练,再后训练 | 82D FAAS 动作块 | 功能槽位对齐、填充/掩码、八手联合训练 |
XL-VLA
XL-VLA 的思路是不动 pi0 上的 VL 主干,再加上 action expert。覆盖Ability、Paxini DexH13、X-Hand1、Inspire 四种手、10 个任务。每只手都创建一个 MLP encoder/decoder,中间共享一个 VAE 风格的 32 维 hand latent。本工作只使用真机数据,没有使用人类数据
对于第 (h) 种灵巧手,其原生关节配置为:
每种手有独立的 encoder 和 decoder:
最终选定的 hand latent 维度是:
关于 latent 的维度,作者专门做过消融实验:
- 8D:压缩过强,关节和指尖重建明显变差;
- 16D:仍有一定重建和跨手几何损失;
- 32D:在重建、跨手对齐、连续性和插值平滑性之间取得较好平衡;
- 64/96D:重建没有带来稳定、全面的提升;
- 128D:作者观察到跨 embodiment 结构开始退化。
同时,这个 hand latent 没有编码:时间轴 (T);手指轴 (F);XYZ 空间轴;关节图或 URDF 拓扑;接触点、法向、力等槽位。因此还是偏向扁平,而非具有空间状态的 latent,可以主要从这个地方发力。
UniDex
UniDex-VLA 大体沿用 pi0,但把 PaliGemma 中的 SigLIP 2D 视觉编码器替换为 Uni3D 点云编码器;语言、彩色单视角点云和本体状态进入策略,action expert 用 conditional flow matching 生成动作块。适配八种手:Ability、Allegro、Inspire、LEAP、Oymotion、Shadow、Wuji、Xhand
同时使用人类桌面操作,首先将人手分解成骨骼和关键点,再使用人工去对齐,获取人类操作数据。
在 latent 侧,除了 pi0 本身的 latent,本篇工作没有使用 VQ-VAE/VAE/模型内部状态 等形式的 latent 层设计,而是使用人工定义的统一动作空间,并不是非常严格的 latent 设计。其使用了一个 82 维的 FAAS(Function–Actuator–Aligned Space),将每一个「功能相近的」关节的动作填入对应的维数,比如前 18D 是左右腕的位姿槽位,后 64D 是双手关节命令槽位。以此方式实现了跨灵巧手形式的动作输出。
模型就是在 pi0 上面进行了修改,加入了 FAAS,同时极少冻结,大部分都会进入预训练进行修改。
其在 900 万配对帧、5 万多轨迹和八种手的数据上,用 8 张 H800 训练约 24 小时,即约 192 H800 GPU-hours;每个下游任务另需约 8 H800 GPU-hours。
同样,这个工作的 latent 并不是非常典型,更像是动作空间,可以输出对应硬件的动作格式。没有包含灵巧手本身的状态。