--- type: 路线图 status: 已发布 level: 通用 topic: - 面试求职 - 具身智能 - 多模态 --- # 具身智能与 VLA 完整学习指南 > 基于已筛选的真实岗位职责、硬要求与加分项整理。生成时间:2026-07-10T12:43:12+08:00。 ## 一、如何使用这份指南 这不是术语目录,而是一条以岗位能力为终点的实践路线。每个阶段都包含五件事: 1. **学习目标**:完成后应该具备的能力。 2. **必学内容**:岗位职责和要求中反复出现的知识。 3. **实践任务**:必须亲手完成的训练、评测或部署工作。 4. **可交付成果**:可以放进代码仓库或作品集的产物。 5. **验收标准**:判断自己是否真正掌握,而不是只看过资料。 建议始终维护一个实验仓库,至少包含:环境配置、数据说明、训练脚本、评测脚本、实验记录、失败案例和复现步骤。每个阶段都在同一个仓库中累积,而不是做完就丢。 ## 二、VLA 岗位能力全景 VLA 与具身智能岗位可以拆成八层能力栈: | 层级 | 核心问题 | 最终需要证明的能力 | |---|---|---| | 工程基础 | 能否稳定写出和调试训练代码 | Python、PyTorch、Linux、Git、实验管理 | | 模型基础 | 是否理解模型为何有效或失败 | 深度学习、Transformer、Diffusion、优化方法 | | 多模态基础 | 如何联合视觉、语言、视频与状态 | VLM、对齐、Token 化、跨模态融合 | | 动作建模 | 如何从观察和指令生成动作 | Action Head、ACT、Diffusion Policy、自回归策略 | | 机器人学习 | 如何让策略从数据和交互中学习 | BC、IL、RL、Offline RL、Policy Learning | | 世界模型与决策 | 如何预测、规划并处理长时序任务 | World Model、Model-Based RL、Planning、MPC | | 数据与闭环 | 如何持续提升真实任务成功率 | 采集、清洗、配比、评测、bad case、再训练 | | 系统与落地 | 如何让模型在仿真和真机稳定运行 | ROS2、Sim2Real、推理优化、分布式训练、部署 | 学习时不要把这八层割裂。一个合格项目应至少打通:数据输入 → 模型训练 → 离线评测 → 仿真闭环 → 失败分析;更完整的项目还应包含真机或受控硬件验证。 ## 三、总学习路线 | 阶段 | 建议节奏 | 核心产出 | |---|---:|---| | 0. 工程环境与实验规范 | 1–2 周 | 可复现的 PyTorch 训练模板 | | 1. 深度学习与 Transformer | 4–6 周 | 图像/序列模型训练与消融实验 | | 2. LLM、VLM 与多模态对齐 | 4–6 周 | 多模态微调和评测项目 | | 3. 机器人基础与仿真 | 4–6 周 | ROS2 + 仿真环境闭环任务 | | 4. 模仿学习与策略模型 | 4–6 周 | ACT 或 Diffusion Policy 复现 | | 5. VLA 训练全链路 | 6–8 周 | 数据、训练、评测、部署一体化项目 | | 6. World Model、RL 与长时序决策 | 4–8 周 | 预测、规划或策略改进实验 | | 7. Sim2Real、真机和数据闭环 | 持续进行 | 闭环评测与 bad case 再训练 | | 8. 分布式训练与推理优化 | 3–5 周 | 吞吐、显存、延迟优化报告 | | 9. 论文复现与作品集 | 持续进行 | 可复现实验、技术报告和演示 | 节奏可以压缩或拉长,但顺序不宜完全颠倒。VLA 的困难通常不在“调用一个现成模型”,而在数据质量、动作表示、评测协议、闭环稳定性和真实系统约束。 ## 四、阶段 0:工程环境与实验规范 ### 学习目标 - 能独立配置 Linux、Python、CUDA 与 PyTorch 环境。 - 能编写可恢复、可记录、可比较的训练程序。 - 能定位数据、梯度、显存、速度和数值稳定性问题。 - 能为训练平台、推理服务和机器人终端设计可靠的数据与接口层。 ### 必学内容 - Python、NumPy、PyTorch、Git、Shell、基础 Docker。 - Dataset/DataLoader、自动微分、优化器、学习率调度、混合精度。 - 配置管理、随机种子、断点恢复、日志、指标和实验版本管理。 - 单元测试、数据检查、梯度检查、profiling 和异常样本定位。 - RESTful API/RPC 的接口契约、版本、超时、重试、幂等、鉴权和可观测性。 - MySQL/PostgreSQL、MongoDB/Redis 的数据模型、索引、缓存与大规模多模态元数据查询。 - Docker/Kubernetes、微服务边界、任务调度、健康检查和故障恢复。 ### 实践任务 1. 用 PyTorch 完成一个图像分类或序列预测任务。 2. 支持配置文件、混合精度、断点恢复、训练日志和独立评测。 3. 主动制造数据为空、标签越界、梯度爆炸和显存不足问题,并记录定位过程。 4. 用 FastAPI 实现模型推理 RESTful API,并用 RPC 模拟机器人终端调用;加入超时、重试、幂等键和链路日志。 5. 为轨迹元数据、实验记录和任务状态设计关系型表与 Redis/MongoDB 查询层,比较索引和缓存前后的延迟。 ### 可交付成果 - 一个干净的训练模板仓库。 - 一份实验复现说明。 - 一份失败排查手册。 - API 契约、数据库 schema、负载测试和故障注入报告。 ### 验收标准 - 换一台机器后可以按文档完成训练和评测。 - 同一随机种子能得到可解释的结果波动。 - 能说明训练慢、显存高或 loss 异常的具体原因。 - 能证明接口在重复请求、超时和服务重启下不产生重复动作,并能解释数据表、文档库和缓存的选型。 ### 岗位技术扩展:编程、训练框架与开发环境 - **学习定位:** 掌握级:能独立编写、调试、测试和复现训练代码。 - **最低实践:** 把同一训练任务分别做成单卡、混合精度、断点恢复和容器化版本,并记录速度、显存和复现误差。 - **达标标准:** 离开现成 Notebook 后仍能从数据读取开始搭出可维护的训练与评测工程。 - **本阶段需要覆盖的原文技术:** - `c++`、`CUDA`、`Docker`、`FastAPI`、`git`、`Java`、`JAX`、`Kubernetes`、`linux` - `MongoDB`、`MySQL`、`PostgreSQL`、`python`、`pytorch`、`Redis`、`RESTful API`、`RPC`、`TensorFlow` - `代码`、`工程`、`微服务`、`框架`、`编程` ## 五、阶段 1:深度学习、Transformer 与生成建模 ### 学习目标 - 理解视觉、语言和动作序列的共同建模基础。 - 能读懂并修改 Transformer、Diffusion 和常见视觉编码器代码。 - 能通过消融实验解释模型设计选择。 ### 必学内容 - 线性代数、概率、优化、交叉熵、对比学习和序列建模。 - CNN、ViT、Attention、Transformer、位置编码和归一化。 - 自回归建模、VAE/VQ-VAE、Diffusion、Flow Matching。 - Transfusion、Show-o、Janus-Pro、Cosmos、RynnVLA 等 AR + Generation 统一建模思路。 - 图学习、图信号处理与跨域迁移学习,理解其在拓扑、关系建模和域泛化中的适用边界。 - 训练稳定性、数据分布偏移、过拟合、泛化和指标设计。 ### 实践任务 1. 从头实现一个小型 Transformer,并用于序列预测。 2. 训练一个视觉编码器或 ViT,比较不同增强和预训练方式。 3. 完成一个小型 Diffusion 或 Flow Matching 生成任务。 4. 为每个实验设计至少一个消融变量,并解释结果。 5. 选择一个统一生成架构,比较自回归 token 与连续生成目标;再用一个小型图任务验证跨域迁移前后的泛化差异。 ### 可交付成果 - Transformer 与生成模型实现。 - 消融实验表格和结论。 - 模型失败案例可视化。 - 统一生成与图迁移实验笔记,明确它们何时值得用于 VLA。 ### 验收标准 - 能解释 Attention、Token、位置编码和 Action Chunk 的关系。 - 能区分自回归动作生成、Diffusion Policy 和 Flow Matching 的主要取舍。 - 面对训练不稳定时,能提出可验证的排查顺序。 - 能说明统一生成架构、图学习或跨域迁移给 VLA 带来的收益假设,并用基线验证而不是只复述模型名称。 ### 岗位技术扩展:深度学习、基础模型与生成建模 - **学习定位:** 掌握级:理解核心结构、损失、训练稳定性和主要架构取舍。 - **最低实践:** 实现小型 Transformer 与生成模型,完成自回归、Diffusion、Flow Matching 的可控对比。 - **达标标准:** 能从数据分布、架构和优化三个层面解释模型效果,不只会调用接口。 - **本阶段需要覆盖的原文技术:** - `AR + Generation`、`BERT`、`Cosmos`、`diffusion`、`DINO`、`DINOv2`、`DiT`、`Flow Matching`、`Gemini` - `GPT`、`HuggingFace`、`Janus-Pro`、`Llama`、`loss`、`Mamba`、`MoE`、`RWKV`、`RynnVLA` - `SAM`、`Show-o`、`Sora`、`transformer`、`Transformers`、`Transfusion`、`ViT`、`VQ-GAN`、`VQ-VAE` - `优化`、`图信号处理`、`图学习`、`数学`、`机器学习`、`概率`、`模型`、`深度学习`、`神经网络` - `线性代数`、`跨域迁移学习` ## 六、阶段 2:LLM、VLM 与多模态对齐 ### 学习目标 - 理解语言、图像、视频和状态信息如何进入统一模型。 - 能完成 VLM 的数据处理、微调、评测和失败分析。 - 能解释 VLM 如何成为 VLA 的视觉语言基座。 ### 必学内容 - LLM/VLM 基础、Tokenizer、视觉编码器、投影层和跨模态对齐。 - CLIP 式对比学习、视觉指令微调、图文/视频语言建模。 - SFT、LoRA/QLoRA、PEFT、数据配比和多模态 batch 构造。 - 幻觉、时空理解、视觉定位、开放词汇识别和评测设计。 ### 实践任务 1. 选择一个开源 VLM,完成领域数据的 SFT 或 LoRA 微调。 2. 构建包含图像、指令和答案的数据管线。 3. 建立自动指标与人工错误类型相结合的评测集。 4. 分析视觉遗漏、语言误解、时序错误和错误推理案例。 ### 可交付成果 - 可复现的 VLM 微调脚本。 - 数据格式与质量规则说明。 - 评测报告和 bad case 分类。 ### 验收标准 - 能说明视觉编码器、语言模型和投影模块分别承担什么作用。 - 能解释数据配比变化为什么影响泛化。 - 能把失败案例转化为数据或训练策略改进。 ### 岗位技术扩展:LLM、VLM 与多模态对齐 - **学习定位:** 掌握级:能完成多模态数据处理、微调、对齐和评测。 - **最低实践:** 微调一个 VLM,建立图像/视频、指令和答案数据管线,并对幻觉、定位和时序错误做分类。 - **达标标准:** 能说明视觉编码器、语言基座和投影/融合模块各自的作用与失败模式。 - **本阶段需要覆盖的原文技术:** - `agent`、`CLIP`、`LLaVA`、`llm`、`QwenVL`、`vlm`、`VLM-Adapter`、`多模态`、`多视角` - `大模型`、`视觉`、`视觉-语言`、`视觉语言` ## 七、阶段 3:机器人基础、ROS2 与仿真 ### 学习目标 - 理解 VLA 输出如何真正驱动机器人。 - 能在仿真中完成观察、决策、动作执行和评测闭环。 - 能处理坐标系、标定、控制频率和延迟问题。 - 能完成机器人本体、物理参数和仿真场景资产的建模与校验。 - 能把真实场景重建为可用于仿真、数据合成和策略评测的三维资产。 ### 必学内容 - 机器人运动学、动力学、关节空间、笛卡尔空间和末端执行器。 - 相机内外参、手眼标定、RGB-D、力觉、触觉和状态估计。 - ROS/ROS2 Topic、Service、Action、TF、rosbag 和控制接口。 - 多模态传感器接入:RGB-D/深度相机、IMU、力/力矩、压阻、电容和视触觉;时间同步、空间标定与质量监控。 - SLAM、Topological Map、Global/Local Planner、路径规划、SMACH/BehaviorTree 与导航状态机。 - MuJoCo、Isaac Sim/Gym、Habitat、Gazebo 中至少一个环境。 - 遥操作、轨迹记录、动作归一化、控制频率与安全约束。 - URDF/SDF 的本体描述、关节限制、惯量、碰撞体和传感器配置。 - USD 的 Stage/Prim、Layer、Reference/Payload、变换、材质和资产组合;理解它与 URDF/SDF 的职责差异。 - PhysX 刚体、Articulation、碰撞检测、接触、摩擦、恢复系数和阻尼,以及参数失真如何影响策略。 - Isaac Sim/Isaac Lab 的 Python API、传感器仿真、并行环境、合成数据和 Domain Randomization。 - 多视图几何、相机位姿、深度/点云/网格、NeRF、3DGS 与大规模场景重建流水线。 ### 实践任务 1. 在仿真中搭建机械臂抓取或 pick-and-place 任务。 2. 用 ROS2 串联传感器输入、策略推理和动作执行。 3. 记录 observation、language、state、action 和时间戳。 4. 接入至少两种异步传感器,完成硬/软件时间戳对齐、外参标定、丢帧检测和数据质量告警。 5. 在 ROS2 中搭建 SLAM/拓扑地图、Global/Local Planner 与 BehaviorTree 状态流,验证重规划和异常恢复。 6. 用 URDF/SDF 描述机器人,再转换或重建为 USD 资产,逐项检查坐标、关节、惯量和碰撞体。 7. 使用 COLMAP 配合 NeRF 或 3DGS 重建一个真实桌面场景,将点云、网格或渲染资产导入 Isaac Sim,并补齐可碰撞几何。 8. 对 PhysX 的摩擦、恢复系数、阻尼、质量和接触参数做受控扫描,记录抓取成功率和轨迹误差变化。 9. 故意引入标定误差、延迟、观测噪声和重建误差,观察策略退化。 ### 可交付成果 - 可一键启动的仿真任务。 - ROS2 节点图和数据字段说明。 - 延迟、频率、标定误差实验报告。 - 多传感器时间同步、标定、丢帧与质量监控报告,以及导航/重规划状态图。 - 一套可复用的 URDF/SDF、USD 和场景资产,以及资产校验清单。 - NeRF/3DGS 重建报告,包含相机轨迹、重建质量、碰撞近似和导入仿真的过程。 - PhysX 参数敏感性实验与仿真参数表。 ### 验收标准 - 能解释模型动作如何转换为机器人可执行指令。 - 能定位策略失败属于感知、决策、控制还是系统时序问题。 - 能定义任务成功率、轨迹误差、响应延迟和恢复率。 - 能区分同步、外参、传感器漂移和规划状态机造成的失败,并通过日志复现问题。 - 能解释 URDF/SDF、USD、渲染资产和物理碰撞体各自解决什么问题。 - 能证明重建质量或物理参数变化会怎样影响闭环策略,而不只展示三维渲染效果。 ### 岗位技术扩展:机器人本体、感知与传感器 - **学习定位:** 实践级:能把模型输出接入真实或高保真机器人闭环。 - **最低实践:** 完成传感器同步、坐标变换、动作接口、控制频率和安全限制的系统联调。 - **达标标准:** 能够判断失败来自观测、标定、策略、控制、延迟还是执行机构。 - **本阶段需要覆盖的原文技术:** - `6DoF`、`AGV`、`ALOHA`、`BehaviorTree`、`DDS`、`forward kinematics`、`Franka`、`Global/Local Planner`、`IK` - `IMU`、`Kuavo`、`locomotion`、`Mobile-ALOHA`、`MoveIt`、`MoveIt 2`、`PLC`、`proprioception`、`retargeting` - `RGB-D`、`ROS`、`ROS2`、`SDF`、`SDK`、`SLAM`、`SMACH`、`SMPL-X`、`subgoal image` - `teleoperation`、`Topological Map`、`URDF`、`xArm`、`具身`、`力矩传感器`、`力觉`、`动作`、`动力学` - `压阻`、`多模态传感器`、`导航`、`感知`、`手眼标定`、`抓取`、`控制`、`操作`、`机器人` - `机械臂`、`灵巧手`、`点云`、`电容`、`规划`、`视触觉`、`触觉`、`触觉传感器`、`路径规划` - `运动学`、`遥操作` ### 岗位技术扩展:三维重建、场景建模与仿真资产 - **学习定位:** 实践级:能把真实场景变成可校验、可碰撞、可用于策略实验的仿真资产。 - **最低实践:** 完成相机标定与 NeRF/3DGS 重建,导入 Isaac Sim 后补齐碰撞几何,并比较重建误差对策略成功率的影响。 - **达标标准:** 能分别量化视觉、几何和碰撞误差,并说明何时使用神经渲染、网格资产或人工建模。 - **本阶段需要覆盖的原文技术:** - `3DGS`、`3D建模`、`NeRF`、`三维重建`、`场景重建`、`计算机图形学` ## 八、阶段 4:模仿学习、策略学习与动作生成 ### 学习目标 - 能从示教轨迹训练机器人策略。 - 理解动作表示、Action Chunk、闭环误差和分布偏移。 - 能复现至少一种主流策略模型。 ### 必学内容 - Behavior Cloning、DAgger、Offline RL、Imitation Learning。 - ACT、Diffusion Policy、自回归 Policy、Action Tokenizer。 - observation/action space、动作归一化、控制频率和 horizon。 - 遥操作数据、轨迹切分、数据不平衡和异常动作过滤。 - 离线评测与闭环评测之间的差异。 ### 实践任务 1. 在仿真数据上复现 ACT 或 Diffusion Policy。 2. 比较单步动作、Action Chunk 和不同 horizon。 3. 测试视觉扰动、指令变化和物体位置变化下的泛化。 4. 建立失败类型:未识别、抓取偏差、动作振荡、长时序中断、恢复失败。 ### 可交付成果 - 策略训练与评测代码。 - 不同动作表示的对比实验。 - 闭环失败分析和数据改进方案。 ### 验收标准 - 能解释为什么训练 loss 下降但真实成功率不升。 - 能说明 BC、DAgger、Offline RL 与在线 RL 的数据假设。 - 能根据失败类型选择增加数据、修改模型还是调整控制接口。 ## 九、阶段 5:VLA 模型训练全链路 ### 学习目标 - 打通视觉、语言、机器人状态到动作输出的完整链路。 - 能完成数据构建、预训练/微调、评测、推理和系统集成。 - 能理解主流 VLA 路线的架构取舍。 ### 必学内容 - RT-1/RT-2、OpenVLA、Octo、ACT、RDT、PI 系列、GR00T 等代表路线。 - 视觉编码器、语言基座、状态编码、Action Head 和动作解码。 - 离散动作 Token、连续动作、Diffusion/Flow Matching、Autoregressive Policy。 - 预训练、SFT、Post-training、LoRA/QLoRA 和策略微调。 - 多任务、多本体、跨场景泛化与 embodiment 差异。 ### 实践任务 1. 选择一个开源 VLA 或策略模型,跑通数据到评测全流程。 2. 将自定义任务转换为模型所需 observation/action 格式。 3. 比较冻结基座、部分微调和全量微调。 4. 设计跨对象、跨背景、跨指令和跨任务测试。 5. 记录成功率、动作平滑度、延迟、失败恢复和泛化差异。 ### 可交付成果 - 完整 VLA 训练与评测仓库。 - 模型架构图和数据流图。 - 至少三组关键消融实验。 - 可重复运行的演示和技术报告。 ### 验收标准 - 能讲清视觉、语言、状态和动作在哪些位置融合。 - 能解释 Action Head、动作 Token 和控制频率如何影响结果。 - 能把模型效果变化追溯到数据、架构、训练或部署因素。 ### 岗位技术扩展:VLA、动作表示与策略模型 - **学习定位:** 核心掌握级:这是岗位主线,至少要完整复现并改造一种策略架构。 - **最低实践:** 比较 ACT、Diffusion Policy 和一个 VLA 路线,测试 Action Chunk、动作归一化与控制频率。 - **达标标准:** 能讲清观察、语言、状态、Action Head 和机器人控制接口之间的完整数据流。 - **本阶段需要覆盖的原文技术:** - `ACT`、`Action Chunk`、`action chunking`、`Action Head`、`Diffusion Policy`、`FluxVLA`、`GR00T`、`GR00T N1.7`、`GROOT` - `Helix`、`LingBot`、`LoRA`、`MT-ACT`、`Octo`、`OpenPI`、`OpenVLA`、`PI0`、`policy` - `prompt-to-action`、`QLoRA`、`Qwen-VLA`、`RDT`、`RoboBrain`、`RT-2`、`RT-X`、`SARM`、`SARM2` - `StarVLA`、`Vision-Language-Action`、`vla`、`VTLA`、`wam`、`World-Action Model`、`世界动作模型`、`动作分块`、`视觉语言动作` - `跨本体` ## 十、阶段 6:World Model、RL 与长时序决策 ### 学习目标 - 理解环境动力学、动作后果和长期演化如何建模。 - 能把 World Model、Planning、RL 与 VLA Policy 联系起来。 - 能针对长时序、稀疏奖励和误差累积设计实验。 ### 必学内容 - Latent Dynamics、Video Prediction、Action-Conditioned Model。 - Dreamer、MuZero、JEPA、TD-MPC、Model-Based RL。 - PPO、SAC、Offline RL、Reward Model、Curriculum 和 Replay Buffer。 - Planning、MPC、Skill-Level Planning、长 horizon 和 recovery policy。 - SFT、DPO、RLHF/RLAIF、GRPO 等后训练思想在策略模型中的应用。 ### 实践任务 1. 训练一个预测未来状态或视频帧的动作条件模型。 2. 用预测模型辅助规划或策略选择,并与无 World Model 基线对比。 3. 设计长时序任务,测量误差累积和任务中断位置。 4. 研究 reward sparsity、reset distribution 和 curriculum 对训练的影响。 ### 可交付成果 - World Model 或 Model-Based Policy 实验。 - 长时序任务评测协议。 - 模型预测误差与任务成功率关系分析。 ### 验收标准 - 能说明 World Model 不等于 VLA,但可以如何辅助 VLA。 - 能区分预测准确率提升与实际策略提升。 - 能设计验证长期规划、恢复能力和分布外泛化的实验。 ### 岗位技术扩展:World Model、强化学习与模仿学习 - **学习定位:** 掌握级:能区分离线学习、在线交互、世界模型预测和后训练各自解决的问题。 - **最低实践:** 实现 BC 基线,再加入一种 RL 或 World Model 改进,分析 reward、horizon 和分布偏移。 - **达标标准:** 能用闭环成功率证明策略改进,而不是只展示预测 loss 或离线指标。 - **本阶段需要覆盖的原文技术:** - `BC`、`Cosmos Policy`、`Ctrl-World`、`DAgger`、`DAPO`、`DDPG`、`DPO`、`Dreamer`、`DreamerV2` - `GRPO`、`HIL-SERL`、`human-in-the-loop learning`、`JEPA`、`long-horizon manipulation`、`Model-Based RL`、`mpc`、`Offline RL`、`offline-to-online` - `planning`、`PPO`、`real-robot RL`、`reward`、`RFT`、`rl`、`RLAIF`、`RLHF`、`RLINF` - `RLVR`、`SAC`、`SERL`、`SFT`、`TD-MPC`、`TD-MPC2`、`TD3`、`V-Learning`、`world model` - `世界模型`、`决策`、`序列决策`、`强化学习`、`模仿学习`、`策略`、`行为克隆`、`长时序` ## 十一、阶段 7:数据工程、评测闭环与 Sim2Real ### 学习目标 - 能建立从采集到再训练的数据闭环。 - 能把失败案例转换成可操作的数据和模型改进。 - 能评估仿真策略迁移到真实系统的风险。 ### 必学内容 - 遥操作、UMI、rosbag、LeRobot 格式和多源轨迹数据。 - 时间同步、空间标定、轨迹切分、异常过滤、质量评分和版本管理。 - 真机数据、仿真数据、互联网视频和合成数据的配比。 - Domain Randomization、Real-to-Sim-to-Real、校准与域适配。 - Real2Sim 场景重建、仿真参数辨识、HIL/SiL 验证与 Sim-Real 差异度量。 - Benchmark、failure case、任务成功率、恢复率、鲁棒性和数据效率。 ### 实践任务 1. 定义一套机器人轨迹数据规范和质量检查器。 2. 建立训练集、验证集和真实闭环测试集,避免任务泄漏。 3. 搭建“训练 → 部署 → bad case → 数据修复 → 再训练”流程。 4. 测试光照、遮挡、物体变化、延迟、标定误差和执行噪声。 5. 对同一真实场景构建粗网格、NeRF/3DGS 重建和人工高保真资产三个版本,比较视觉差异、接触差异与策略成功率。 6. 通过 HIL/SiL 和少量真机回放校准质量、摩擦、延迟及传感器噪声,记录每次校准是否缩小 Sim-Real 指标差距。 ### 可交付成果 - 数据规范与自动检查脚本。 - Benchmark 和评测仪表。 - bad case 数据闭环报告。 - Sim2Real 风险清单和缓解方案。 - Real2Sim 资产版本、参数辨识记录和“重建质量 → 策略表现”对照表。 ### 验收标准 - 能说明每条数据为什么进入训练集、被删除或被降权。 - 能用稳定指标比较两版策略,而不是只看演示视频。 - 能判断失败来自仿真差异、传感器、动作接口还是模型本身。 - 能把视觉重建误差、几何/碰撞误差和物理参数误差分别量化,并据此选择重建、随机化或真实数据回流方案。 ### 岗位技术扩展:轨迹数据、数据集与评测闭环 - **学习定位:** 核心实践级:数据和评测决定策略是否真正进步。 - **最低实践:** 建立轨迹格式、质量检查、版本管理、Benchmark 和 bad case 再训练流水线。 - **达标标准:** 每次模型迭代都能追溯到数据变化、训练变化和闭环指标变化。 - **本阶段需要覆盖的原文技术:** - `AGIBot World`、`AGIBot-World`、`benchmark`、`Bridge`、`DexGraspNet`、`DROID`、`Ego4D`、`EgoDex`、`Epic-Kitchen` - `GO-1`、`LeRobot`、`Open X-Embodiment`、`OXE`、`ROBOCOIN`、`ROBOMIND`、`RoboNet`、`rosbag`、`rosbag2` - `UMI`、`后训练`、`微调`、`数据`、`数据处理`、`数据标注`、`数据清洗`、`数据集`、`标注` - `泛化`、`训练`、`评估`、`评测`、`预训练` ### 岗位技术扩展:仿真、Sim2Real 与数字孪生 - **学习定位:** 实践级:能在仿真中稳定训练和评测,并知道迁移到真实系统会坏在哪里。 - **最低实践:** 搭建同一任务的仿真训练、扰动评测和受控真实验证,量化域差异。 - **达标标准:** 能提出并验证校准、随机化、域适配和真实数据回流方案。 - **本阶段需要覆盖的原文技术:** - `AI2-THOR`、`Blender`、`CARLA`、`Domain Randomization`、`Gazebo`、`Genesis`、`Habitat`、`HIL`、`isaac` - `Isaac Gym`、`Isaac Lab`、`Isaac Sim`、`IsaacGym`、`IsaacLab`、`ManiSkill`、`MuJoCo`、`Newton`、`NVIDIA Isaac` - `Omniverse`、`Orbit`、`PhysX`、`PyBullet`、`Real-Sim-Real`、`Real2Sim`、`RLBench`、`RoboCasa`、`SAPIEN` - `SiL`、`sim-to-real`、`sim2real`、`Unity`、`Unreal Engine`、`USD`、`V-Rep`、`仿真`、`域随机化` - `数字孪生`、`真机` ## 十二、阶段 8:分布式训练、推理与部署优化 ### 学习目标 - 能训练更大模型并解释吞吐、显存和通信瓶颈。 - 能把模型部署到满足机器人实时约束的推理链路。 - 能量化优化前后的精度与系统代价。 ### 必学内容 - DDP、FSDP、DeepSpeed、Megatron-LM、Colossal-AI、数据/张量/流水线并行。 - 混合精度、梯度累积、Checkpoint、数据加载和通信优化。 - INT8/INT4、AWQ/GPTQ、Pruning、Distillation、ONNX/ONNX Runtime、TensorRT/TensorRT-LLM、vLLM 和推理引擎。 - KV Cache、Action Chunk、批处理、异步流水线和端到端延迟。 - Docker/K8s、服务接口、ROS2 集成、监控和故障恢复;Jetson/Orin 等边缘硬件的算力、内存和功耗约束。 ### 实践任务 1. 在多卡环境对比 DDP、FSDP 或 DeepSpeed 的显存和吞吐。 2. 对一个 VLM/VLA 模型做量化或蒸馏实验。 3. 分解视觉预处理、模型推理、动作后处理和通信延迟。 4. 建立超时、异常输入和模型失效时的安全降级路径。 5. 导出 ONNX,比较 FP16、INT8、INT4/AWQ/GPTQ 与 TensorRT 的精度、显存、吞吐和 P99 延迟,并在目标边缘硬件上复测。 6. 用 profiler 找出一个 CUDA 热点,完成算子融合、内存访问或自定义 CUDA 算子优化,并验证数值一致性与端到端收益。 ### 可交付成果 - 分布式训练配置与性能报告。 - 推理优化前后对比。 - 端到端延迟剖析和部署说明。 - 可复现的模型导出、量化、引擎构建和目标硬件基准脚本。 - CUDA profiling、算子优化前后基准和正确性测试。 ### 验收标准 - 能解释 OOM、低 GPU 利用率和数据加载瓶颈。 - 能说明训练并行策略、量化格式、推理引擎与机器人实时预算之间的取舍。 - 能说明优化带来的精度、吞吐、显存和延迟取舍。 - 部署链路能够稳定运行,并有异常监控和恢复策略。 ### 岗位技术扩展:分布式训练、推理优化与部署 - **学习定位:** 工程掌握级:能量化显存、吞吐、精度和延迟之间的取舍。 - **最低实践:** 完成一次多卡训练和一次端侧/服务化推理优化,输出 profiling 与对比报告。 - **达标标准:** 能定位 OOM、通信、数据加载和推理延迟瓶颈,并给出可验证改进。 - **本阶段需要覆盖的原文技术:** - `AWQ`、`Colossal-AI`、`CUDA 加速`、`CUDA 算子`、`CUDA加速`、`DDP`、`DeepSpeed`、`FSDP`、`GPTQ` - `INT4`、`INT8`、`Jetson`、`K8s`、`KV cache`、`llama.cpp`、`Megatron`、`Megatron-LM`、`NanoLLM` - `ONNX`、`ONNX Runtime`、`Orin`、`TensorRT`、`TensorRT-LLM`、`TorchDeploy`、`vLLM`、`分布式`、`剪枝` - `加速`、`工程化`、`并行`、`性能`、`推理`、`蒸馏`、`部署`、`量化`、`集群` ## 十三、阶段 9:论文复现、研究能力与作品集 ### 学习目标 - 能快速读懂论文、识别关键假设并独立复现核心方法。 - 能设计可信的对照实验、消融实验和失败分析。 - 能用项目证明具备数据、模型、机器人和系统的综合能力。 ### 必学内容 - ICLR、NeurIPS、CVPR、ICRA、IROS、RSS、CoRL 等会议的相关方向。 - 论文问题定义、方法假设、实验协议、基线、公平比较和复现误差。 - 技术报告写作、图表、实验日志、代码质量和开源规范。 ### 实践任务 1. 每两周精读一篇论文,输出问题、方法、实验和局限总结。 2. 至少完成一次“论文无完整代码时”的核心模块复现。 3. 对自己的 VLA 项目完成基线、消融、失败分析和复现实验。 4. 将项目整理成代码仓库、技术报告和短演示。 ### 作品集最低配置 - 一个 VLM 微调与评测项目。 - 一个 ACT、Diffusion Policy 或同类策略复现。 - 一个 VLA 全链路项目。 - 一个 World Model、RL 或长时序决策实验。 - 一份数据闭环或 Sim2Real 报告。 - 一份训练/推理性能优化报告。 ### 验收标准 - 别人可以按文档复现主要结果。 - 每个结果都有基线、指标和失败案例,而不只是成功演示。 - 能清楚说明自己完成了哪些工作、做了哪些选择、失败过什么以及如何改进。 ### 岗位技术扩展:研究、开源与能力证明 - **学习定位:** 证明级:这些词不是模型模块,但决定学习结果能否被验证和复用。 - **最低实践:** 把技术工作整理成复现仓库、消融实验、失败分析、技术报告和可运行演示。 - **达标标准:** 第三方可以依据文档复现核心结果,并看清你的具体贡献与技术判断。 - **本阶段需要覆盖的原文技术:** - `ACL`、`corl`、`cvpr`、`ECCV`、`EMNLP`、`ICCV`、`iclr`、`ICML`、`icra` - `IJRR`、`iros`、`neurips`、`NIPS`、`RAL`、`rss`、`TPAMI`、`TRO`、`专利` - `前沿`、`复现`、`实践经验`、`工作经验`、`工程经验`、`年以上`、`年经验`、`开源`、`研发经验` - `研究经验`、`科研`、`竞赛`、`落地经验`、`论文`、`顶会`、`项目经验` ## 十四、按岗位层级准备 ### 工程师与实习生主线 优先证明“能做完整实验闭环”: - 能处理数据并完成训练、调优和评测。 - 能复现 VLA/VLM/Policy 模型并解释主要模块。 - 能在仿真或真实机器人任务中做闭环验证。 - 能定位 failure case,提出数据或模型改进。 - 能写出可维护、可复现的训练代码。 ### 专家、负责人和科学家进阶 在主线能力之外,需要进一步证明: - 能制定 VLA、World Model、机器人学习和数据闭环技术路线。 - 能比较不同模型架构、训练范式和落地方案的取舍。 - 能建立统一 Benchmark、数据规范和研发流程。 - 能推动多团队完成模型、控制、硬件和系统集成。 - 能持续形成研究成果、核心技术和规模化落地能力。 ### 自动驾驶 VLA 分支 在通用 VLA 能力上补充: - 驾驶场景的感知、预测、规划与行为建模。 - BEV、Occupancy、Spatial Memory、World Model 和闭环仿真。 - 视觉、语言、驾驶动作和车辆状态的多模态数据。 - CARLA 等闭环环境、bad case 分析和安全评测。 - 车端芯片推理、量化、延迟和资源约束。 #### 岗位技术扩展 - **学习定位:** 分支实践级:在通用 VLA 之外补充驾驶场景的感知、预测、规划和安全评测。 - **最低实践:** 在 CARLA 或闭环数据上完成 VLA/World Model 的轨迹生成、bad case 和车端延迟实验。 - **达标标准:** 能区分机器人操作 VLA 与驾驶 VLA 在动作空间、数据、评测和安全约束上的差异。 - **本阶段需要覆盖的原文技术:** - `Apollo`、`Autoware`、`BEV`、`Occupancy`、`OpenDriveLab`、`Spatial Memory`、`UniAD`、`VAD`、`自动驾驶` ## 十五、项目选择建议 ### 项目 A:策略学习入门 - 任务:仿真机械臂 pick-and-place。 - 模型:ACT 或 Diffusion Policy。 - 必须包含:数据处理、训练、闭环评测、扰动测试和失败分析。 ### 项目 B:VLA 全链路 - 任务:自然语言指令驱动多任务操作。 - 模型:OpenVLA、PI、RDT、GR00T 或其他可运行路线。 - 必须包含:多模态数据、微调、跨任务测试、延迟测量和部署说明。 ### 项目 C:World Model 与长时序 - 任务:预测动作后果并辅助规划或策略选择。 - 模型:Dreamer、JEPA、视频预测或 Action-Conditioned Model。 - 必须包含:预测指标、任务指标、误差累积和基线比较。 ### 项目 D:数据与 Sim2Real - 任务:建立遥操作/仿真数据到真实策略验证的闭环。 - 必须包含:数据质量规则、域随机化、真机或受控验证、bad case 再训练。 ### 项目 E:Real2Sim 场景重建与 Isaac 物理校准 - 任务:用 NeRF/3DGS 重建一个真实操作场景,生成可碰撞资产并导入 Isaac Sim。 - 必须包含:相机标定、重建质量评测、USD 资产组织、PhysX 参数辨识、HIL/SiL 或受控真机对照。 - 核心结论:量化视觉、几何和物理误差分别怎样影响策略成功率,并给出 Domain Randomization 或真实数据回流方案。 选择项目时,优先做“可完整闭环的小任务”,不要一开始追求庞大模型。岗位真正看重的是能否清晰处理数据、训练、评测、失败和落地。 ## 十六、自检清单 ### 模型 - [ ] 能解释 VLM、VLA、World Model 和 Policy 的边界与关系。 - [ ] 能解释 Action Head、Action Token、Action Chunk 和控制频率。 - [ ] 能独立完成 SFT/微调、评测和 failure case 分析。 - [ ] 能比较自回归、Diffusion Policy 和 Flow Matching。 ### 机器人 - [ ] 能处理坐标系、标定、运动学、传感器和控制接口。 - [ ] 能在 ROS2 与仿真环境中完成闭环任务。 - [ ] 能定义任务成功、恢复、鲁棒性和延迟指标。 - [ ] 能校验 URDF/SDF 与 USD 资产,并调试 PhysX 接触、摩擦、阻尼和碰撞参数。 - [ ] 能完成 NeRF/3DGS 场景重建、仿真导入,并评估重建误差对策略的影响。 ### 数据 - [ ] 能设计轨迹数据格式、同步、清洗、切分和质量评分。 - [ ] 能解释训练数据分布如何影响真实泛化。 - [ ] 能建立 bad case 到再训练的闭环。 ### 系统 - [ ] 能定位训练吞吐、显存、通信和数据加载瓶颈。 - [ ] 能完成量化、推理优化和端到端延迟分析。 - [ ] 能为异常输入、超时和模型失效设计保护机制。 - [ ] 能比较 ONNX/TensorRT、INT8/INT4、AWQ/GPTQ 在目标硬件上的精度、显存和 P99 延迟。 ### 研究与表达 - [ ] 能快速阅读并复现核心方法。 - [ ] 能设计基线、消融和公平评测。 - [ ] 能把实验结论写成可复现的技术报告。