# RDT2:UMI 数据规模化与跨本体零样本部署 (RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization) > **发布时间**:2026-02(arXiv:2602.03310) > **论文题目**:RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization > **核心定位**:用 UMI 统一末端接口 + 规模化真实数据 + 动作 tokenization + 扩散蒸馏,实现跨本体零样本部署与高吞吐推理。 跨本体迁移的最大成本不是“模型结构”,而是**数据采集与末端接口不统一**。RDT2 的结论很工程化:先把末端统一成 UMI,再把动作生成从多步去噪压到单步,这才有零样本部署的可行性。 **一手来源**: - 论文:`https://arxiv.org/abs/2602.03310` - 项目主页:`https://rdt-robotics.github.io/rdt2/` --- ## 0. 先把“可复述结论”写清楚(1 分钟版) - **一句话**:RDT2 把“硬件统一 + 数据规模化 + 扩散蒸馏”连成闭环,主张跨本体零样本部署可通过 UMI 数据规模化实现。 - **关键机制**:Residual VQ 动作 tokenization + 流匹配动作专家 + 单步蒸馏。 - **工程价值**:推理从多步去噪压到单步,同时保持指令跟随与跨场景泛化。 - **结果口径**:未见本体/场景/物体/语言的“4U”条件下仍可执行任务;折衣任务成功率相对 π0.5 提升约 40%(原文口径,待核验)。 --- ## 1. 核心架构/方法总览 (Overview / Architecture) ### 1.1 系统对比概览 (System Component Comparison) | 模块 | 输入 → 输出 | 训练/推理角色 | 关键收益 | |---|---|---|---| | **UMI 硬件与末端统一** | 末端 6DoF + 双鱼眼图像 | 数据采集底座 | 降低跨本体差异 | | **Residual VQ (RDT2‑VQ)** | 连续动作 → 离散 token | 指令跟随预训练 | 压缩动作序列、可控 | | **Flow Matching (RDT2‑FM)** | 噪声 → 连续动作 | 快速推理 | 减少去噪步数 | | **单步蒸馏 (UltraFast)** | 噪声 → 动作(单步) | 低延迟部署 | 推理最短路径 | ### 1.2 关键机制 (Key Mechanism) 1) **末端接口统一**:UMI 把“本体差异”降到可控范围。 2) **Residual VQ**:动作 token 化,缩短序列长度与推理链路。 3) **流匹配动作专家**:从“多步扩散”切换为少步生成。 4) **单步蒸馏**:把多步生成器压成单步,换取延迟优势。 ### 1.3 信息流/架构图 (Flow / Diagram) ``` UMI 统一末端接口 + 双鱼眼腕相机 │ 大规模 UMI 数据 (10k+ 小时) │ Stage 1: VLM + Residual VQ (RDT2‑VQ) │ Stage 2: Flow Matching Action Expert (RDT2‑FM) │ Stage 3: 单步蒸馏 (RDT2‑UltraFast) ``` --- ## 2. 数学核心:动作 tokenization + 流匹配 + 蒸馏 (Math Core) **目标**:在保持指令跟随与泛化能力的前提下,压缩动作生成步数与延迟。 **Residual VQ(示意)**: 将连续动作 $a$ 表示为多级码本的残差和: $$ \hat{a} = \sum_{k=1}^{K} e_k(z_k) $$ - $a$:连续动作 - $e_k(z_k)$:第 $k$ 个码本向量 - $K$:残差层数 **Flow Matching(通用表达,示意)**: $$ \mathcal{L}_{FM} = \mathbb{E}_{t,x_0,x_1}\left\| v_\theta(x_t,t,c) - v^*(x_t,t,c)\right\|^2,\quad x_t=(1-t)x_0 + t x_1 $$ - $x_0$:噪声起点 - $x_1$:目标动作 - $c$:条件(图像 + 语言 + 本体) **单步蒸馏(示意)**: $$ \min_\phi \ \mathbb{E}_{\epsilon,c}\left\| g_\phi(\epsilon,c) - a_{FM}(\epsilon,c)\right\|^2 $$ - $a_{FM}$:多步生成器输出 - $g_\phi$:单步生成器 > 直觉:VQ 先“缩短序列”,Flow Matching 再“减少步数”,蒸馏最终把“多步”压成“单步”。(公式为通用表达,细节以论文为准) --- ## 3. 带数字走一遍:玩具例子 (Worked Example) 假设动作片段长度为 **0.8s**,控制频率 **30Hz**: - 原始序列步数约 $0.8 \times 30 \approx 24$ 帧 - **Stage 1 (RDT2‑VQ)**:动作片段被编码为 **27 tokens**(原文口径),推理时需要 27 次自回归前向 - **Stage 2 (RDT2‑FM)**:推理为 **1 次 Qwen 前向 + 5 次 RDT 去噪**(原文口径) - **Stage 3 (UltraFast)**:推理为 **1 次 Qwen 前向 + 1 次 RDT 前向** **结论**:步数从 27 → 6 → 2,延迟路径随之显著缩短(数值为示意级,来源见论文与项目主页)。 --- ## 4. 工程视角:快慢路径 / 训练-推理折中 (Engineering View) | 版本 | 推理步数(示意) | 速度/延迟 | 误差来源 | 适用场景 | |---|---|---|---|---| | **RDT2‑VQ** | 27 次 | 慢 | VQ 离散化误差 | 离线评测/高精度指令跟随 | | **RDT2‑FM** | 1+5 次 | 中 | 多步去噪误差 | 默认部署路径 | | **RDT2‑UltraFast** | 1+1 次 | 快 | 蒸馏误差 | 高速交互/低延迟任务 | **工程含义**: - **延迟边界**:单步蒸馏才能接近高频控制需求。 - **硬件依赖**:红外定位对遮挡/反光敏感,部署需保证视线与标定稳定。 - **跨本体迁移**:需要标准化夹爪/相机/法兰与 TCP 对齐流程。 --- ## 5. 数据与评测 (Data & Eval) **数据规模(原文口径,待核验)**: - UMI 设备:近 100 套 - 场景:100+ 家庭/办公室 - 时长:约 10,000 小时人类操作数据 - 成本/效率:相对遥操作系统约 1/10 成本、约 5× 采集速度 **任务覆盖(原文口径)**: - 拾取、放置、按压、擦拭、折衣等开放词汇任务 **评测口径(原文口径,待核验)**: - “4U”条件(未见本体/场景/物体/语言)仍能执行 - 折衣任务成功率相对 π0.5 提升约 40% > 数据与评测口径来自论文与项目主页,数值需以官方表格为准。 --- ## 6. 能力与失败模式 (Capabilities & Failure Modes) **能力**: - 跨本体零样本部署(前提是 UMI 标准化末端与标定) - 开放词汇任务指令跟随 - 高速推理版本可用于低延迟控制 **失败模式**: - 非标准末端(多指灵巧手/复杂工具)适配成本高 - 红外定位对遮挡/反射敏感 - 长序列、强接触、力控任务的泛化边界尚不明确(待补证据) --- ## 7. 与相关工作对比 (Comparison) | 方法 | 动作生成路线 | 推理步数 | 跨本体零样本 | 备注 | |---|---|---|---|---| | **RDT‑1B** | Diffusion (DiT) | 多步(DDIM) | 未强调 | 参考 `rdt.md` | | **π0.5** | Flow Matching | 少步 | 原文口径支持 | 参考 `pi0_5_dissection.md` | | **RDT2‑VQ** | Residual VQ + AR | 27 次 | 原文口径支持 | 指令跟随强 | | **RDT2‑FM** | Flow Matching | 1+5 次 | 原文口径支持 | 默认部署版本 | | **RDT2‑UltraFast** | 单步蒸馏 | 1+1 次 | 原文口径支持 | 超低延迟 | **面试 Tip**: “RDT2 的核心不是再堆模型,而是把 **硬件统一 + 数据规模化 + 生成步数压缩** 做成系统工程,跨本体零样本因此变成可复用的工程路径。” --- ## 参考链接 - 论文:`https://arxiv.org/abs/2602.03310` - 项目主页:`https://rdt-robotics.github.io/rdt2/` --- [← Back to Theory](../README.md)