使用说明
本文用于长期记录 World Model(WM)在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析。
当前重点关注:
- Navigation World Model
- Latent World Model
- World Model + Policy
- World Model + Model-Based RL
- World Model + MPC / CEM / MPPI
- 动态障碍预测与导航
- World Model 实时化与轻量化
- Sim2Real
- ROS2 / Nav2 / 实机部署
- 3D Structured World Model(3D 结构化世界模型)
- Gaussian World Model(高斯世界模型)
- Learnable Digital Twin(可学习数字孪生)
- Renderer / Simulator / Planner 功能分类
- World Model 的输入、世界表示、输出与决策模块之间的关系
当前阶段的目标不是立即确定创新点,而是:
- 建立 World Model + Navigation 方向的论文谱系;
- 找到适合作为第一篇工作的强 baseline;
- 完整复现至少一个 baseline;
- 分析 failure case 和 limitation;
- 从实际问题中寻找 research question;
- 再把 research question 转化为可验证的创新点;
- 最终完成仿真、消融、对比和实机闭环实验。
论文目录
| 论文 | Venue / 状态 | 核心路线 | 与移动导航关系 | 当前定位 | 阅读优先级 |
|---|---|---|---|---|---|
| X-MOBILITY | ICRA 2025 | Latent WM + Policy | 直接相关 | 第一主 baseline 候选 | ⭐⭐⭐⭐⭐ |
| Navigation World Models(NWM) | CVPR 2025 Oral / Best Paper Honorable Mention | Diffusion Video WM + Planning | 直接相关 | Navigation WM 标志性工作 | ⭐⭐⭐⭐⭐ |
| DINO-WM | ICML 2025 | Pretrained Visual Latent WM + Planning | 间接相关 | Latent WM 核心参考 | ⭐⭐⭐⭐⭐ |
| DreamerNav | Frontiers in Robotics and AI 2025 | DreamerV3 + Model-Based RL | 直接相关 | 学习完整机器人论文流程 | ⭐⭐⭐⭐ |
| V-JEPA 2 / V-JEPA 2-AC | 2025 Research Release / arXiv | Foundation Video WM + Action Conditioning | 当前偏 Manipulation | Foundation WM 核心参考 | ⭐⭐⭐⭐ |
| One-Step World Model | 2026 arXiv | One-Step Video WM + Optimization Planning | 直接相关 | 实时化重要工作 | ⭐⭐⭐⭐⭐ |
| AR Forcing | 2026 arXiv | Autoregressive Training for Navigation WM | 直接相关 | 长时序预测重要工作 | ⭐⭐⭐⭐ |
| NavWAM | 2026 arXiv | World Model + Action Model | 直接相关 | WM → World Action Model 新路线 | ⭐⭐⭐⭐ |
| GWM | ICCV 2025 | 3D Gaussian WM + Diffusion Transformer | 当前偏 Manipulation | 3D / Geometry-aware WM 代表工作 | ⭐⭐⭐⭐⭐ |
| DreMa / Dream to Manipulate | ICLR 2025 | Gaussian Digital Twin + Physics + Imagination | 当前偏 Manipulation | 组合式 WM / 数据生成重要工作 | ⭐⭐⭐⭐⭐ |
| Atlas | World Labs 2026 Research Release | Omni WM:Generation + Reconstruction + Simulation | 当前偏 Spatial Intelligence / Simulation | Foundation Spatial WM 重要参考 | ⭐⭐⭐⭐⭐ |
论文链接总表
论文定位与影响力
| 论文 | 学术定位 | 主要贡献类型 | 对我的价值 |
|---|---|---|---|
| NWM | Navigation World Model 标志性工作 | 大规模生成式 WM、CDiT、视频想象 + 规划 | 理解最前沿 Navigation WM 应该做到什么程度 |
| DINO-WM | Latent WM 代表工作 | 不重建 RGB,直接预测预训练视觉特征 | 理解「不生成图像也能做 World Model」 |
| X-MOBILITY | 机器人导航 WM 代表工作 | World Model + Policy、Sim2Real、Cross-Embodiment | 最适合作为第一主 baseline |
| DreamerNav | 系统型 WM 导航工作 | DreamerV3 + 动态导航 + 混合规划 | 学完整机器人科研链条 |
| V-JEPA 2 | Foundation WM 重要路线 | 大规模视频自监督 + Action-conditioned WM | 理解 Foundation World Model |
| One-Step WM | 实时化路线 | One-Step generation + planning | 研究如何把 WM 真正跑实时 |
| AR Forcing | 长时序稳定性路线 | 缓解 AR rollout 的 train-test mismatch | 研究 long-horizon prediction |
| NavWAM | World Action Model 路线 | 联合 future / value / action chunk | 观察 WM 是否向 WAM 演化 |
| GWM | 3D Structured WM / Gaussian WM 代表工作 | 用 3D Gaussian 显式表示并预测未来三维场景 | 理解 Geometry-aware World Model |
| DreMa | Compositional WM / Learnable Digital Twin 代表工作 | Gaussian Splatting + Physics,用 imagination 生成训练数据 | 理解 WM 不只用于在线规划,也可用于数据生成 |
| Atlas | Foundation Spatial World Model | 统一文本、图像、视频、深度与 3D,做生成、重建和模拟 | 理解现代大型 WM 为什么越来越像 CV / 3D Vision |
复现与工程成本
这一表重点用于判断:能不能作为 baseline、算力够不够、复现成本多高、实机链路是否成熟。
| 论文 | 主要 WM / Backbone | 规模 | 原论文训练资源 | 数据 | 仿真 / 环境 | 规划 / Policy | 实机 | 开源成熟度 | 我的复现难度 |
|---|---|---|---|---|---|---|---|---|---|
| X-MOBILITY | DINOv2 + GRU Probabilistic Latent WM + Policy | WM 主体较小;RGB Diffuser ≈ 962M | 8 × H100 | Isaac Sim:160K Random + 100K Nav2 Teacher | Isaac Sim | Learned Action Policy | Nova Carter | 高:Code + Dataset + Checkpoint + TensorRT/ROS2 | ⭐⭐⭐ |
| NWM | Conditional Diffusion Transformer(CDiT) | 50M / 200M / 最大 1B | XL:8 台 × 8 H100 = 64 × H100 | RECON / SCAND / TartanDrive / HuRoN / Ego4D 等 | Offline robot/human navigation datasets | CEM / trajectory ranking / MPC-style planning | 原论文重点不是完整真机闭环 | 高:Code + Weights | ⭐⭐⭐⭐⭐ |
| DINO-WM | DINOv2 patch feature + ViT predictor | Predictor 约 19M(论文配置需进一步逐项核对) | 原论文未在当前日志中记录明确 GPU 配置 | Offline trajectories | PointMaze / PushT / Wall / Reacher 等 | CEM / gradient planning | 无移动机器人真机 | 高:Code + checkpoints | ⭐⭐ |
| DreamerNav | DreamerV3 / RSSM | 中小型 | 1 × RTX 4090 24GB;约 24.79h;495K policy steps | Isaac Sim 在线交互 | Isaac Sim Warehouse | Actor-Critic policy + A* global guidance | Spot + Unitree A1 | 中:论文完整,代码需继续确认 | ⭐⭐ |
| V-JEPA 2-AC | V-JEPA 2 + Action-Conditioned Predictor | ViT-L/H/g,最大约 1B 级 | Foundation-scale,具体训练资源待单独整理 | >1M hours internet video + robot interaction data | Manipulation / video benchmarks | latent-space planning | Franka 等 manipulation | 高:Official repo / models | ⭐⭐⭐⭐⭐ |
| One-Step WM | 3D U-Net + spatial-temporal attention | 待核实 | 待核实 | Public navigation data + Habitat/MP3D 等 | Habitat + real robot | Optimization-based planning / anchors | 有实机 | 较高:Paper + Project + Code | ⭐⭐⭐ |
| AR Forcing | Diffusion Navigation WM | 基于 NWM 类框架 | 待核实 | RECON / SCAND / HuRoN / TartanDrive | Offline navigation datasets | 保留原 diffusion planning framework | 待核实 | 中低:目前代码状态需确认 | ⭐⭐⭐⭐ |
| NavWAM | Diffusion Transformer World-Action Model | 待详细整理 | 待核实 | Simulation pretraining + real-robot adaptation | Simulation + real robot | 直接输出 action chunk,无需默认 CEM | Diablo | 中:Paper + Project 已公开 | ⭐⭐⭐⭐ |
当前实验室计算资源
GPU Server A
1 × RTX 5090
用途:
- 单卡开发;
- 训练 Debug;
- 小中型 World Model fine-tuning;
- 单卡 ablation;
- inference;
- ONNX / TensorRT;
- 实机部署前性能测试。
GPU Server B
3 × RTX A6000 48GB
用途:
- 当前主要训练资源;
- DDP 多卡训练;
- World Model fine-tuning;
- 中型 Transformer / Diffusion;
- 多组 ablation;
- 较大 batch;
- 部分模型并行 / FSDP。
注意:
3 × 48GB != 单进程天然拥有 144GB 显存
需要 DDP / FSDP / model parallel 等方式利用多卡。
GPU Server C
4 × GTX 1080 Ti
用途:
- 数据预处理;
- CPU/GPU 混合的数据生成;
- 传统 baseline;
- 老模型;
- 部分仿真任务;
- 不依赖现代 Tensor Core / BF16 的任务。
不优先用于现代大规模 Transformer / Diffusion 训练。
World Model 放在完整机器人链条中的位置
Sensor / Observation
传感器 / 当前观测
↓
Perception / Representation
感知 / 世界表示
↓
World Model
世界模型
↓
Future Prediction
未来预测
↓
Planner / Policy
规划器 / 策略
↓
Controller
控制器
↓
Robot Command
机器人执行命令
最简单的记忆方式:
- Computer Vision(计算机视觉,CV):回答“现在世界是什么样”;
- World Model(世界模型,WM):回答“如果执行某个动作,未来世界会变成什么样”;
- Planner(规划器) / Policy(策略):回答“我应该做什么动作”;
- Controller(控制器):把高层动作变成速度、关节或力矩命令。
因此,World Model 的输出通常不等于 cmd_vel。常见输出包括 Future RGB(未来图像)、Future Latent State(未来隐状态)、Future Depth(未来深度)、Future Occupancy(未来占据)、Future 3D Gaussian Scene(未来 3D 高斯场景)、Reward / Value / Risk(奖励 / 价值 / 风险)等。
Renderer / Simulator / Planner 功能分类
Renderer(渲染器)
主要回答:世界看起来会是什么样?
典型输出:RGB、Video、Novel View(新视角)、Depth、3D rendering。更偏 CV / Generative Vision(计算机视觉 / 生成视觉)。
Simulator(模拟器)
主要回答:世界在时间和动作作用下会怎样变化?
典型输出:Future State(未来状态)、Future Geometry(未来几何)、Object Pose(物体位姿)、Future Latent(未来隐状态)、Future 3DGS(未来三维高斯)、Reward / Risk / Dynamics(奖励 / 风险 / 动态)。
Planner(规划器)
主要回答:为了达到目标,我应该做什么?
典型输出:Action(动作)、Action Sequence(动作序列)、Trajectory(轨迹)、Velocity Command(速度命令)。
常见术语:
- CEM(Cross-Entropy Method,交叉熵方法):采样很多候选动作,保留表现更好的,再继续搜索;
- MPC(Model Predictive Control,模型预测控制):不断向前预测一小段,只执行当前最优动作,然后重新规划;
- MPPI(Model Predictive Path Integral,模型预测路径积分):一种采样式 MPC;
- Learned Policy(学习策略):神经网络直接根据状态选择动作;
- Actor-Critic(演员-评论家):强化学习中的策略学习结构。
按 World Model 输出形式分类
| 输出类型 | 中文解释 | 代表工作 | 后续怎么决策 |
|---|---|---|---|
| Future RGB / Video | 未来 RGB / 视频,直接“画”未来 | NWM、One-Step WM | CEM / trajectory ranking |
| Future Latent State | 未来隐状态,不画图,只预测压缩后的内部表示 | DINO-WM、X-MOBILITY、V-JEPA 2-AC、DreamerNav | CEM / Learned Policy / RL |
| Future 3D Gaussian Scene | 未来 3D 高斯场景,显式三维结构 | GWM | Imitation Learning / Model-Based RL |
| Digital Twin Future State | 数字孪生中的未来状态 | DreMa | 生成 imagined demonstrations,再训练 Policy |
| RGB + Depth + Explicit 3D | RGB、深度、点云或 3DGS | Atlas | 当前主要用于 reconstruction / simulation |
| Future + Action Chunk | 预测未来的同时直接给出动作序列 | NavWAM | 模型自身承担更多 Planner / Policy 功能 |
**Latent State(隐空间状态)**可以理解成:把复杂图像、三维结构、语义和动态压缩成一组机器可处理的数字特征,人通常不能直接看懂,但模型可以拿它做预测和决策。
按 World Representation(世界表示)分类
| World Representation | 中文 | 代表工作 | 特点 |
|---|---|---|---|
| Pixel / Video Latent | 像素 / 视频隐空间 | NWM、One-Step WM | 视觉生成强,但计算量可能较大 |
| Pretrained Visual Feature | 预训练视觉特征 | DINO-WM | 不必重建 RGB,更强调语义特征 |
| Probabilistic Latent State | 概率隐状态 | X-MOBILITY、DreamerNav | 更适合 Policy / RL / 时序状态估计 |
| Explicit 3D Gaussian | 显式 3D 高斯 | GWM | 三维几何结构更明确 |
| Gaussian Digital Twin + Physics | 高斯数字孪生 + 物理模拟 | DreMa | 场景可组合、可变换、可生成训练数据 |
| Unified Spatial Context | 统一空间上下文 | Atlas | 文本、图像、视频、相机位姿、深度、3D 统一建模 |
按“更偏 CV 还是更偏 Planner / Robotics”分类
不是严格学科划分,只是标记主要创新发生在哪一段。
更偏 CV / 3D Vision 更偏 Planning / Robotics
Atlas
GWM
DreMa
DINO-WM
NWM ---------------------------- CEM Planning
One-Step WM -------------------- CEM / Optimizer
V-JEPA 2-AC -------------------- Latent Planning
X-MOBILITY --------------------- Learned Policy
DreamerNav --------------------- Model-Based RL
NavWAM ------------------------- World + Action Joint Modeling
| 工作 | 主要偏向 | 直白解释 |
|---|---|---|
| Atlas | CV / 3D Vision / Spatial Intelligence | 强项是生成、三维重建、Real-to-Sim 和机器人传感器模拟,不是专门导航 Planner |
| GWM | 3D Vision + Simulator | 最大创新在 3D Gaussian 世界表示和未来三维状态预测 |
| DreMa | 3D Vision + Simulator + Robot Learning | 3DGS + Physics 构建数字孪生,再生成 imagined data |
| DINO-WM | CV ↔ Planning 中间 | 前半段用 DINOv2 特征,后半段把未来 latent 用于规划 |
| NWM | CV / Video WM → Planning | 先生成未来视觉,再通过 CEM 选择动作 |
| One-Step WM | CV / Video WM → Planning | 重点是把未来生成做快,再接优化式规划 |
| V-JEPA 2-AC | Representation Learning → Planning | foundation latent representation + action-conditioned prediction |
| X-MOBILITY | Robot Learning / Policy | WM 学 dynamics,Action Policy 最终输出速度和路径 |
| DreamerNav | Model-Based RL / Navigation | WM 用于 imagination,Actor-Critic 学导航策略 |
| NavWAM | Planner / Policy 更强 | 不只预测未来,还联合输出 Action Chunk |
按 Renderer / Simulator / Planner 重新看这些工作
| 工作 | Renderer | Simulator | Planner / Policy | 直白理解 |
|---|---|---|---|---|
| Atlas | ★★★★★ | ★★★★☆ | ★★☆☆☆ | 强生成 / 重建 / 仿真,当前不是专门导航 Planner |
| NWM | ★★★★★ | ★★★★☆ | ★★★☆☆ | 先生成未来视觉,再用 CEM 规划 |
| One-Step WM | ★★★★☆ | ★★★★☆ | ★★★☆☆ | 把未来视觉生成做得更快,再规划 |
| DINO-WM | ★☆☆☆☆ | ★★★★☆ | ★★★★☆ | 不画未来图,直接在 latent space 预测并规划 |
| GWM | ★★★★☆ | ★★★★★ | ★★☆☆☆ | 显式模拟未来 3D Gaussian 世界 |
| DreMa | ★★★★☆ | ★★★★★ | ★★☆☆☆ | 构建数字孪生,用模拟结果扩充训练数据 |
| V-JEPA 2-AC | ★☆☆☆☆ | ★★★★☆ | ★★★★☆ | latent prediction + action-conditioned planning |
| X-MOBILITY | ★★☆☆☆ | ★★★★☆ | ★★★★★ | WM 主要服务 Learned Policy |
| DreamerNav | ★☆☆☆☆ | ★★★★☆ | ★★★★★ | RSSM imagination + Actor-Critic navigation |
| NavWAM | ★★★☆☆ | ★★★★☆ | ★★★★★ | 未来预测和动作生成联合 |
一个统一的五问阅读法
以后看到任何 World Model 论文,优先回答:
- Observation(观测)是什么? RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal?
- Representation(世界表示)是什么? Pixel、Latent、DINO feature、BEV、Occupancy、3D Gaussian、Digital Twin?
- World Model Output(世界模型输出)是什么? Future RGB、Future Latent、Future Occupancy、Future 3DGS、Reward / Risk、Action-conditioned future?
- Planner / Policy(规划器 / 策略)怎么决定动作? CEM、MPC、MPPI、Neural Policy、Actor-Critic、World Action Model?
- Robot Output(机器人最终输出)是什么?
cmd_vel、trajectory、joint position、end-effector pose、action chunk?
当前路线判断
World Model + Policy
代表:
- X-MOBILITY
- NavWAM
基本结构:
Observation
↓
World Model
↓
Latent State
↓
Policy
↓
Action
特点:
- 适合真实机器人闭环;
- 不一定需要每个控制周期进行大量 CEM 搜索;
- 推理更容易做实时;
- 容易形成 World Model + robot deployment 的完整故事。
当前判断:
最适合第一篇工作的主路线。
World Model + Planning
代表:
- Navigation World Models
- DINO-WM
- One-Step WM
结构:
Observation
↓
World Model
↓
Imagine Future
↓
CEM / MPC / Optimizer
↓
Action
特点:
- World Model 与 Planner 解耦;
- 可显式测试 counterfactual actions;
- 学术上很有 World Model 味;
- 生成式 WM 往往存在推理延迟;
- planner 需要大量 candidate rollout 时计算成本很高。
World Model + Model-Based RL
代表:
- DreamerNav
- DreamerV3 系列
结构:
Observation
↓
RSSM World Model
↓
Imagined Rollouts
↓
Actor-Critic
↓
Policy
特点:
- latent imagination;
- sample efficiency;
- reward design 很重要;
- training stability 是核心问题;
- 很适合动态环境与复杂决策;
- 需要理解 RL,不只是模型结构。
第一主 baseline 候选:X-MOBILITY
基本信息
论文:
X-MOBILITY: End-To-End Generalizable Navigation via World Modeling
Venue:
ICRA 2025
机构:
- NVIDIA
- UC Berkeley
- UT Austin
链接:
- arXiv: https://arxiv.org/abs/2410.17491
- Project: https://nvlabs.github.io/X-MOBILITY/
- GitHub: https://github.com/NVlabs/X-MOBILITY
- Hugging Face Model: https://huggingface.co/nvidia/X-Mobility
- Hugging Face Dataset: https://huggingface.co/datasets/nvidia/X-Mobility
方向:
- World Model
- Robot Navigation
- Imitation Learning
- End-to-End Navigation
- Sim2Real
- Cross-Embodiment
- Edge Deployment
当前定位:
第一主 baseline 候选。
选择原因:
- 本身就是移动机器人导航,不需要强行把一个 manipulation WM 改成 navigation;
- World Model 与 Action Policy 解耦,适合在 World Model 部分做研究;
- 有 Isaac Sim;
- Teacher 直接使用 Nav2;
- 有 Dataset;
- 有 Checkpoint;
- 有 ONNX / TensorRT / ROS2 部署链;
- 有 Nova Carter 实机;
- 算力虽然原论文高,但比从零复现 NWM 1B 更现实;
- 和未来 ROS2 / Nav2 / 实机方向高度兼容。
一句话理解
X-MOBILITY 的核心思想:
利用 World Model 学习一个包含环境状态与动态信息的 latent representation,再利用这个 latent state 学习导航 Action Policy。
普通 Behavior Cloning:
Image
↓
Network
↓
Action
X-MOBILITY:
Image + Robot State
↓
World Model
↓
Latent State
↓
Action Policy
↓
Action
关键区别:
Latent State 不只是为了拟合 teacher action,而是通过 World Modeling 与 multi-task decoder 被迫学习环境与动态信息。
总体网络结构
Image
↓
DINOv2
Robot State → MLP ─────┤
↓
Observation Embedding
↓
State Estimator
↓
Belief State
↓
Latent State z
↙ ↓ ↘
/ │ \
↓ ↓ ↓
RGB Decoder Semantic Action Policy
Decoder ↓
Velocity
+
Path
另有:
State Predictor
负责:
History
+
Action
↓
Future Belief State
World Model 的关键本质:
[ p(s_{t+1}\mid s_t,a_t) ]
Observation Encoder
输入主要包括:
RGB
前视相机图像。
视觉特征:
DINOv2
Robot State
主要包括机器人速度等状态量。
通过:
MLP
编码。
最终:
Image Embedding
+
Robot State Embedding
↓
Observation Embedding
State Estimator
输入:
History
+
Previous Action
+
Current Observation
输出 probabilistic belief state。
用于估计:
在已经看到真实 observation 的情况下,当前世界 latent state 应该是什么。
State Predictor
输入:
History
+
Action
不使用未来 observation。
输出:
Predicted Future Belief State
也就是:
如果我执行这个 action,未来 latent world state 会变成什么。
State Predictor 与 State Estimator 之间通过 KL 约束,使预测出来的 latent distribution 接近真实观察得到的 posterior。
Multi-Task Decoder
作者希望 latent state 不是只会拟合 action,因此使用多个 decoder 给 latent state 提供监督。
主要包括:
RGB Reconstruction
+
Semantic Segmentation
RGB Reconstruction 使用 Latent Diffusion Model。
论文 appendix 给出的模型规模中:
RGB Diffuser ≈ 962M
但真正负责 world dynamics 的组件小得多,例如:
State Estimator ≈ 5.5M
State Predictor ≈ 2.3M
这一点非常值得关注:
Navigation World Model 是否真的需要一个近 1B 的 RGB Diffuser?
Action Policy
输入:
Latent State
+
Route Feature
Route 使用:
VectorNet
编码。
之后:
Self-Attention Fusion
↓
Action Decoder
输出:
Linear / Angular Velocity
+
Optional Local Path
Policy 使用 imitation learning 学习 teacher。
数据集
训练数据来自 Isaac Sim 中的 Nova Carter。
分为两类。
Random Action Dataset
≈ 160K frames
用途:
World Model pretraining。
核心目标不是学导航,而是尽量探索:
state-action coverage
让 WM 学习:
执行动作后世界怎么变化。
Nav2 Teacher Dataset
≈ 100K frames
Nav2 在 Isaac Sim 中闭环运行:
Random Start
+
Random Goal
↓
Nav2
↓
Teacher Trajectory
用途:
World Model
+
Action Policy
联合训练。
Multi-Stage Training
Stage 1:World Model Pretraining
Random Action Dataset
↓
World Model
Policy 关闭。
Stage 2:World Model + Action Policy
Nav2 Teacher Dataset
↓
World Model + Policy
特点:
World Modeling 与 Policy Learning 解耦。
这可能是 X-MOBILITY 最值得作为 baseline 的设计之一。
原论文计算资源
原始训练配置:
8 × NVIDIA H100
World Model:
100 epochs
World Model + Policy:
100 epochs
Batch:
32
因此不建议第一步直接尝试:
从零 100% 复现 NVIDIA 的完整训练规模。
更现实:
Official Checkpoint
↓
Reproduce Evaluation
↓
Fine-tuning
↓
Modify Module
↓
Ablation
推理与 Edge Deployment
作者在:
Jetson AGX Orin
测试推理。
Policy Only:
P50 ≈ 38.6 ms
P95 ≈ 42.0 ms
GPU Memory ≈ 594 MB
Policy + Semantic:
P50 ≈ 55.6 ms
GPU Memory ≈ 804 MB
说明:
真正用于 navigation inference 的主体并没有 962M RGB diffuser 看上去那么夸张。
官方工程链:
PyTorch
↓
ONNX
↓
TensorRT
↓
ROS2
↓
Robot
这对未来实机很重要。
Sim2Real
真实平台:
NVIDIA Nova Carter
训练:
Isaac Sim
真实部署:
Zero-Shot Sim2Real
即:
不针对真实实验室环境额外 fine-tune。
实机 benchmark 包括:
Single Obstacle
Multi Obstacles
Normal Lighting
Dark Lighting
论文报告:
Single / Normal 10 / 10
Single / Dark 10 / 10
Multi / Normal 8 / 9
Multi / Dark 8 / 9
Cross-Embodiment
Isaac Sim 中进一步测试:
Nova Carter
Forklift
Unitree Go2
Unitree G1
对应:
Differential Drive
Ackermann
Quadruped
Humanoid
研究意义:
latent representation 与标准化 input/output 是否可以跨 embodiment 泛化。
原论文 Baselines
当前记录:
- Nav2 Teacher;
- Behavior Cloning;
- MILE;
- X-MOBILITY。
后续需要继续详细整理:
- 每个 baseline 的 network;
- 是否使用同一 dataset;
- 是否 retrain;
- 训练预算是否一致;
- open-loop 与 closed-loop 分别怎么比;
- statistical significance;
- 是否有 hidden implementation advantage。
Evaluation Metrics
Open-loop:
- Linear Speed MAE;
- Angular Speed MAE;
- Path MAE。
Closed-loop:
- Success Rate;
- Weighted Trip Time;
- Average Absolute Angular Acceleration。
未来自己的论文可以追加:
- Collision Rate;
- Minimum Obstacle Distance;
- Path Length;
- Navigation Time;
- SPL;
- FPS;
- P50 / P95 latency;
- GPU memory;
- Parameters;
- Energy / power;
- Dynamic obstacle collision rate;
- OOD success rate。
当前认为的优点
工程链完整
Isaac Sim
↓
Dataset
↓
World Model
↓
Policy
↓
TensorRT
↓
ROS2
↓
Real Robot
Dataset / Checkpoint / Code 都有
降低复现门槛。
World Model 与 Policy 解耦
非常适合:
保持 Policy Pipeline
↓
重点改 WM
Nav2 可以同时当 Teacher 和传统 baseline
这与移动机器人研究非常自然。
可上实机
不是只在 offline benchmark 上比较 prediction metric。
当前认为的不足 / 待验证问题
动态障碍研究仍不充分
作者未来工作明确提到:
需要增加更多 diverse dynamic-obstacle scenes,进一步研究 world model 对 action policy 的作用。
可能的 research question:
X-MOBILITY 的 latent dynamics 在高速、多人、交叉运动动态环境中是否仍然可靠?
感知主要依赖 RGB
当前核心输入:
RGB
+
Robot State
机器人导航还有:
LiDAR
Depth
BEV
Occupancy
待验证:
RGB latent 是否缺少稳定 geometry grounding?
RGB Diffuser 很大
≈ 962M
待验证:
对导航来说,有没有必要生成 / 重建 RGB?
可能替代:
- Future Latent;
- Depth;
- Occupancy;
- Traversability;
- Dynamic Motion;
- Collision Risk。
World Model prediction 与 navigation performance 的因果关系不够直观
必须问:
prediction metric 更好,是否一定带来 closed-loop navigation 更好?
未来 ablation 应该专门分析。
潜在 Research Questions
以下只进入「问题池」,不能直接当作论文创新点。
Dynamic World Modeling
现象候选:
Fast Pedestrian
Crossing Pedestrian
Multi-Agent Interaction
Sudden Appearance
问题:
现有 latent dynamics 是否能可靠预测动态实体?
Multi-Modal World Modeling
候选:
RGB
+
LiDAR / Depth / BEV
问题:
显式 geometry modality 是否提高 OOD、暗光、运动模糊和动态导航鲁棒性?
Navigation-Oriented Representation
从:
RGB Reconstruction
转向:
Future Occupancy
Depth
Traversability
Dynamic Motion
Collision Risk
问题:
对 navigation 来说,task-oriented prediction 是否比 photorealistic reconstruction 更有效?
Lightweight World Model
研究:
- Distillation;
- Quantization;
- Efficient temporal model;
- Decoder pruning / replacement;
- Adapter;
- low-rank fine-tuning。
目标:
Lower Latency
Lower VRAM
Similar / Better Navigation SR
Uncertainty-Aware WM
从:
One Future
变为:
P(Future | State, Action)
研究:
uncertainty 是否能用于 risk-aware navigation?
X-MOBILITY 复现 Checklist
- 通读论文第一遍
- 画出总体网络图
- 搞懂 Observation Encoder
- 搞懂 State Estimator
- 搞懂 State Predictor
- 搞懂 KL Loss
- 搞懂 RGB Decoder
- 搞懂 Semantic Decoder
- 搞懂 Route Encoder
- 搞懂 Action Policy
- 下载 GitHub
- 搭建 Docker 环境
- 下载 official checkpoint
- 下载 official dataset
- 跑通官方 inference
- 跑通 official evaluation
- 跑通 Isaac Sim demo / 数据链
- 尝试一次 fine-tuning
- 记录单卡显存
- 记录单 iteration 时间
- 记录多卡训练效率
- 复现主要 open-loop 指标
- 复现主要 closed-loop 指标
- 建 Failure Case Dataset
- Failure Case Analysis
- 提出第一个 hypothesis
- 做最小修改验证 hypothesis
- 通过后进入正式创新点设计
- Ablation
- 与强 baseline 对比
- TensorRT
- ROS2
- 实机
Navigation World Models(NWM)
基本信息
论文:
Navigation World Models
Venue:
CVPR 2025 Oral
Best Paper Honorable Mention。
链接:
- arXiv: https://arxiv.org/abs/2412.03572
- Project: https://www.amirbar.net/nwm/
- GitHub: https://github.com/facebookresearch/nwm
- Hugging Face: https://huggingface.co/facebook/nwm
核心:
Observation
+
Navigation Action
↓
Conditional Diffusion Transformer
↓
Future Observation
↓
CEM / Trajectory Ranking
↓
Navigation
模型
核心提出:
CDiT
Conditional Diffusion Transformer
模型公开规模包括:
CDiT/S ≈ 50M
CDiT/B ≈ 200M
CDiT/XL ≈ 1B
最大模型:
≈ 1B
原论文计算资源
CDiT-XL:
8 machines
×
8 H100 / machine
=
64 × H100
这意味着:
不适合当前阶段把 1B XL 从零完整训练作为第一篇论文的必要前置条件。
但:
50M / 200M pretrained model
可以作为以后小规模实验入口。
数据
主要:
- RECON;
- SCAND;
- TartanDrive;
- HuRoN;
- Ego4D 等。
特点:
使用机器人、人类 egocentric video 与 navigation action 学世界动态。
Planning
NWM 可以:
Standalone Planning
Sample Candidate Actions
↓
NWM Imagine Future
↓
Compare Future with Goal
↓
CEM
↓
Best Action
官方 planning 示例一次可以采:
120 candidate trajectories
这也是它实时部署成本很高的原因之一。
Rank External Policy
也可以:
External Policy
↓
Candidate Trajectories
↓
NWM Rank
↓
Best Trajectory
实时性
原始 NWM 推理较慢。
论文讨论了:
- Time Skip;
- Diffusion Distillation;
- 4-bit Quantization(论文中作为潜在方向)。
这直接说明:
实时 World Model 是该路线的重要研究问题。
已知 Limitation
OOD Mode Collapse
在未知环境 autoregressive rollout 时:
prediction 逐渐丢失当前环境 context,并向训练分布中的场景靠拢。
Pedestrian Temporal Dynamics
论文明确指出:
对 pedestrian motion 等 temporal dynamics 模拟仍然困难。
Long-Horizon Drift
随着 autoregressive rollout 变长:
Error Accumulation
越来越严重。
这些问题后来直接衍生出:
- AR Forcing;
- One-Step WM;
- NavWAM 等新工作。
当前定位
必须精读,但暂时不作为第一篇从零训练主 baseline。
主要用途:
- 理解 Navigation World Model 最前沿问题;
- 学 Diffusion World Model;
- 学 action-conditioned future generation;
- 学 CEM planning;
- 找 long-horizon / realtime / dynamic motion 的研究问题。
DINO-WM
基本信息
论文:
DINO-WM: World Models on Pre-trained Visual Features Enable Zero-shot Planning
Venue:
ICML 2025
链接:
- arXiv: https://arxiv.org/abs/2411.04983
- Project: https://dino-wm.github.io/
- GitHub: https://github.com/gaoyuezhou/dino_wm
核心问题
它挑战一个非常重要的问题:
World Model 为什么一定要重建未来 RGB?
DINO-WM:
Image
↓
DINOv2
↓
Patch Features
↓
World Model
↓
Future Patch Features
↓
Planning
即:
直接在 pretrained visual feature space 预测未来。
重要意义
相比:
World Model
↓
Generate Future RGB
DINO-WM:
World Model
↓
Predict Future Representation
可能具有:
- 更低计算成本;
- 更少无关 pixel reconstruction;
- 更强语义 representation;
- 更容易用于 task-oriented planning。
这与未来想研究的:
Navigation-Oriented Latent World Model
高度相关。
Tasks
官方代码主要覆盖:
- PointMaze;
- PushT;
- Wall;
- Reacher 等。
因此:
学术价值很高,但不是最直接的真实移动机器人导航 baseline。
当前定位
Latent World Model 必读论文。
重点看:
- pretrained representation;
- patch-level latent dynamics;
- CEM planning;
- gradient-based planning;
- task-agnostic world representation。
DreamerNav
基本信息
论文:
DreamerNav: learning-based autonomous navigation in dynamic indoor environments using world models
Venue:
Frontiers in Robotics and AI,2025
链接:
- DOI: https://doi.org/10.3389/frobt.2025.1655171
- Full Text: https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1655171/full
- PMC: https://pmc.ncbi.nlm.nih.gov/articles/PMC12510832/
Backbone:
DreamerV3
+
RSSM
核心
Depth
+
Structured Local Occupancy Map
+
Dynamic Obstacle History
+
Points of Interest
+
A* Global Path
↓
DreamerV3 / RSSM
↓
Local Navigation Policy
其中:
A*
负责 global guidance;
DreamerV3:
在 latent space 处理动态环境与 local decision。
Training Compute
论文报告:
1 × RTX 4090 24GB
≈ 24.79 h
≈ 495,000 policy steps
相比另外几条路线非常友好。
Simulation
NVIDIA Isaac Sim
动态障碍、warehouse environment、curriculum learning。
Real Robot
平台:
Boston Dynamics Spot
Unitree A1
基本部署:
Real Sensors
↓
ROS Node
↓
DreamerNav Model
↓
Velocity Commands
↓
Robot
同一 policy 部署两个 quadruped。
已知 Limitation
论文明确提到:
rapidly approaching dynamic obstacles 下避障策略仍会失败。
作者提出未来:
- RNN / attention;
- motion prediction;
- semantic segmentation;
- domain randomization;
- 更多真实环境测试;
- ablation study。
这篇论文非常适合学习:
一篇机器人硕士型完整论文从问题、方法、仿真、baseline 到实机应该怎么组织。
当前定位
第一篇科研的低风险参考工作。
如果 X-MOBILITY 复现成本高于预期,可退一步从 DreamerNav / DreamerV3 体系建立科研闭环。
V-JEPA 2 / V-JEPA 2-AC
基本信息
论文:
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
链接:
- arXiv: https://arxiv.org/abs/2506.09985
- Official GitHub: https://github.com/facebookresearch/vjepa2
- Meta Blog: https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
核心路线
V-JEPA 2:
Internet-Scale Video
↓
Self-Supervised JEPA
↓
World Representation
V-JEPA 2-AC:
V-JEPA 2 Representation
+
Robot Action
↓
Action-Conditioned Predictor
↓
Future Latent State
↓
Planning
数据规模
论文使用超过:
1 million hours
互联网视频做大规模预训练。
随后使用较少 robot interaction data 进行 action-conditioned post-training。
与当前课题关系
目前机器人实验主要偏:
Manipulation
而不是移动导航。
因此:
不适合作为第一主 baseline,但必须关注 Foundation World Model 如何做预训练 + robot post-training。
当前定位
重点学习:
- JEPA;
- Self-supervised representation learning;
- Foundation video model;
- Action-conditioned post-training;
- latent planning;
- 大模型预训练与机器人小数据适配。
One-Step World Model
基本信息
论文:
An Efficient and Multi-Modal Navigation System with One-Step World Model
链接:
- arXiv: https://arxiv.org/abs/2601.12277
- Project: https://robotnav-bot.github.io/nav-onestepwm/
- GitHub: https://github.com/robotnav-bot/NOW
机构包括:
- Tsinghua University;
- Xiaomi Robotics Lab。
解决的问题
针对传统 Navigation WM:
Multi-Step Diffusion
+
Autoregressive Frame Generation
↓
High Latency
提出:
One-Step Generation
Backbone
3D U-Net
+
Efficient Spatial-Temporal Attention
目标:
在保留 future imagination 能力的同时,大幅降低推理延迟。
Navigation
结合:
Optimization-Based Planning
+
Anchor-Based Initialization
支持:
- Image Goal;
- Language Goal;
- Point Goal。
当前定位
实时 World Model 必读工作。
如果以后基于 X-MOBILITY 做 lightweight / realtime WM,要重点对比。
AR Forcing
基本信息
论文:
AR Forcing: Towards Long-Horizon Robot Navigation World Model
链接:
- arXiv: https://arxiv.org/abs/2605.31314
- Code: 当前 arXiv 信息称将发布,后续需要持续检查官方仓库
问题
很多 Diffusion Navigation WM:
训练:
Ground Truth Context
推理:
Model Generated Context
于是:
Train-Test Distribution Shift
↓
Autoregressive Error Accumulation
↓
Long-Horizon Instability
方法
核心:
Autoregressive Training
训练时显式把模型自己的 prediction 重新放入 context。
目的:
让模型在训练阶段就暴露于真正 inference 时会遇到的 state distribution。
Dataset
包括:
- RECON;
- SCAND;
- HuRoN;
- TartanDrive。
与 NWM 系导航数据高度重合。
当前定位
NWM long-horizon problem 的重要 follow-up。
重点研究:
- exposure bias;
- autoregressive rollout;
- diffusion training;
- long-horizon navigation consistency。
NavWAM
基本信息
论文:
NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation
链接:
核心问题
传统 Navigation WM:
Observation
↓
World Model
↓
Future
↓
External Planner / CEM
↓
Action
问题:
future prediction 本身不能直接执行,还需要 expensive planning。
NavWAM
Observation + Goal
↓
World Action Model
↓
Future Observation
+
Goal Progress
+
Action Chunk
↓
Closed-Loop Action
核心:
把「预测未来」与「决定动作」联合建模。
实机
使用:
Diablo mobile robot
并进行:
Simulation Pretraining
+
Real-Robot Adaptation
当前定位
用来观察 World Model 是否正在从「预测模型」演化到「World Action Model」。
这可能是未来非常重要的方向:
WM
↓
WAM
GWM:Towards Scalable Gaussian World Models for Robotic Manipulation
基本信息
Venue:ICCV 2025。 ICCV(International Conference on Computer Vision,国际计算机视觉大会)属于计算机视觉领域第一梯队顶会。
链接:
- ICCV Open Access: https://openaccess.thecvf.com/content/ICCV2025/html/Lu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html
- Project: https://gaussian-world-model.github.io/
- GitHub: https://github.com/Gaussian-World-Model/gaussianwm
一句话理解
GWM 的重点不是简单改变传感器输入,而是把 World Representation(世界表示)换成具有显式三维几何结构的 3D Gaussian,并预测动作作用后的 Future Gaussian Scene(未来高斯场景)。
核心结构
Current RGB Image(s)
↓
3D Reconstruction / Lifting
三维重建 / 提升
↓
Gaussian Splats
3D 高斯场景
↓
3D Variational Autoencoder
3D 变分自编码器
↓
Compact Gaussian Latent
↓
Latent Diffusion Transformer
隐空间扩散 Transformer
+
Robot Action
↓
Future Gaussian Latent
↓
Future 3D Gaussian Scene
未来 3D 高斯场景
Gaussian Splatting(高斯泼溅 / 3DGS):用大量带位置、大小、方向、颜色和透明度的三维高斯椭球表示场景。
World Model 输出
主要是 Future 3D Gaussian Scene(未来 3D 高斯场景),不是直接 cmd_vel。
怎么用于机器人
- Imitation Learning(模仿学习):用 GWM 学到的 3D representation 帮助 policy;
- Model-Based Reinforcement Learning(基于模型强化学习):把 GWM 当 Neural Simulator(神经网络模拟器)产生 imagined rollouts。
实机
项目页展示 Franka Emika FR3 + Panda Gripper + RealSense D435i,真实观测使用第三视角 RGB-only 图像。因此 GWM 的关键创新是内部 3D representation 与 dynamics prediction,而不是单纯“加深度输入”。
当前定位
3D Structured World Model / Geometry-Aware World Model / Simulator-oriented WM,更偏 3D Vision + Simulator。
DreMa:Dream to Manipulate
基本信息
全名: Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination
Venue:ICLR 2025。 ICLR(International Conference on Learning Representations,国际学习表征会议)属于机器学习 / 深度学习第一梯队顶会。
链接:
- arXiv: https://arxiv.org/abs/2412.14957
- ICLR Proceedings: https://proceedings.iclr.cc/paper_files/paper/2025/hash/8f0d446441a938d9de420a8ab8d7fd36-Abstract-Conference.html
- Project: https://dreamtomanipulate.github.io/
- GitHub: https://github.com/leobarcellona/drema_code
一句话理解
DreMa 把 World Model 做成 Learnable Digital Twin(可学习数字孪生),用 3D Gaussian Splatting + Physics Simulator 显式复制真实场景,然后在里面“做梦”,自动生成新的机器人训练示范。
Compositional World Model(组合式世界模型)
**Compositional(组合式)**表示场景中的物体、机器人和环境可以单独移动、变换和重新组合,而不只是作为一整张不可拆分的图像存在。
Few Real Demonstrations
少量真实示范
↓
Learnable Digital Twin
可学习数字孪生
↓
改变物体 / 目标 / 场景配置
↓
Physics Simulation
物理模拟
↓
Imagined Demonstrations
想象出来的新示范
↓
Imitation Learning
模仿学习
↓
Robot Policy
核心用途
DreMa 不是主要做在线路径规划,而是:
World Model → Imagination → Data Generation → Policy Learning
实机
使用 Franka Emika Panda,并展示 one-shot policy learning(单样本策略学习):某些任务变化只需一个真实示范,再依靠 imagination 扩充训练数据。
当前定位
3D Structured WM + Learnable Digital Twin + Compositional WM + Data Generation for Imitation Learning,更偏 Simulator + Robot Learning。
Atlas:A World Model for Spatial Intelligence
基本信息
发布方:World Labs
时间:2026-09-01
状态: World Labs Research Release / Product Research Model,不是目前意义上的 CVPR / ICML / ICLR 正式会议论文。
链接:
- Official Blog: https://www.worldlabs.ai/blog/atlas
- World Model Taxonomy: https://www.worldlabs.ai/blog/taxonomy-of-world-models
- World Labs: https://www.worldlabs.ai/
一句话理解
Atlas 是面向 Spatial Intelligence(空间智能)的通用多模态 World Model,统一处理文本、图像、视频、相机位姿、深度和 3D,并进行世界生成、三维重建和时空模拟。
Spatial Intelligence(空间智能)
指 AI 不只知道“图像里有什么”,还理解物体在哪里、空间结构是什么、换视角会看到什么,以及世界如何随时间和动作变化。
Model Architecture(模型架构)
官方描述为:
Multimodal Autoregressive Diffusion Transformer(多模态自回归扩散 Transformer)
目前可处理 Text(文本)、Image(图像)、Camera Pose(相机位姿)、Depth Map(深度图)、Video(视频序列)以及 3D spatial context(三维空间上下文)。
Atlas 能输出什么
官方展示了:
RGB Image / Video
+
Depth
+
Point Cloud
+
3D Gaussian Splats
所以 Atlas 不只是“输出图像”,也可以产生 explicit 3D representation(显式三维表示)。
Robotics Simulation(机器人仿真)
真实环境手机视频
↓
Atlas
↓
3D Reconstruction
三维重建
↓
Virtual Robot 沿给定路径运动
↓
Atlas 生成机器人将看到的 RGB + Depth
这里要特别注意:当前公开演示更接近 Path → Atlas → Future Observation,而不是 Atlas → Path。 因此 Atlas 当前不是专门的导航 Planner。
当前定位
Foundation World Model / Spatial Intelligence Model(基础世界模型 / 空间智能模型),目前更偏 CV + 3D Vision + Generative Model + Simulator。
统一论文阅读模板
以后每篇新论文都复制下面模板。
基本信息
Title:
Authors:
Venue:
Year:
Organization:
Paper:
arXiv:
Project:
GitHub:
Model:
Dataset:
Citation / BibTeX:
一句话概括
它解决什么问题
为什么旧方法不行
核心假设
Observation / Input(观测 / 输入)
World Representation(世界表示)
记录模型内部怎么表示世界:Pixel / Video latent、DINO feature、RSSM latent、BEV / Occupancy、3D Gaussian、Explicit Digital Twin 等。
World Model Output(世界模型输出)
明确记录:Future RGB / Video、Future Latent、Future Depth、Future Occupancy、Future 3DGS、Reward / Value / Risk、Action Chunk 等。
Renderer / Simulator / Planner 定位
Renderer:
Simulator:
Planner / Policy:
CV ↔ Robotics 定位
记录论文主要创新更偏 CV / 3D Vision,还是更偏 Planning / Policy / Robotics。
最终 Robot Output(机器人执行输出)
例如 cmd_vel、vx / vy / wz、trajectory、joint position、end-effector pose、action chunk。
World Model 定义
Backbone
参数量
Pretrained Model
Dataset
Training Pipeline
Loss
Optimizer / LR / Batch
Training Compute
记录:
GPU:
GPU 数量:
GPU 显存:
训练时间:
Epoch / Steps:
Precision:
Multi-GPU Strategy:
Inference Compute
记录:
Device:
P50 Latency:
P95 Latency:
FPS:
VRAM:
Power:
Planner / Policy
与 Nav2 / ROS 的关系
Simulation
记录:
Simulator:
Robot:
Sensor:
Scene:
Dynamic Obstacle:
Domain Randomization:
Control Frequency:
Real Robot
记录:
Robot:
Compute:
Sensor:
ROS / ROS2:
Control Output:
Environment:
Number of Trials:
Success Rate:
是否 Fine-tune:
是否 Zero-Shot Sim2Real:
Baselines
Metrics
Main Results
Ablation
Failure Cases
Limitations
Authors' Future Work
我认为的潜在问题
和已有工作的差异
是否适合当我的 baseline
评分:
代码完整度:
数据完整度:
Checkpoint:
算力可承受:
复现难度:
移动机器人相关性:
实机难度:
创新空间:
复现结论
Research Question 池
这里只存「问题」,不直接写成“我的创新点”。
模板
问题名称:
来源论文:
现象:
证据:
可能原因:
已有方法怎么做:
为什么现有方法还不够:
我的 Hypothesis:
最小验证实验:
需要的 Baseline:
需要的 Dataset:
需要的 Compute:
可能失败原因:
状态:
未验证 / 初步验证 / 值得继续 / 放弃
创新点候选池
只有经过最小实验支持的 Research Question 才进入这里。
| Idea | 来源 | Problem | Hypothesis | 修改位置 | Main Experiment | Ablation | Compute | 风险 | 状态 |
|---|---|---|---|---|---|---|---|---|---|
| Dynamic WM | X-MOBILITY | 高速/多人动态障碍可能预测弱 | 显式 temporal motion modeling 能改善闭环避障 | State Predictor / Decoder | Dynamic Navigation | w/o motion module | 中 | 中 | 待验证 |
| Multi-Modal WM | X-MOBILITY | RGB geometry 不稳定 | RGB + LiDAR/Depth 提高鲁棒性 | Encoder / Fusion | OOD / dark / blur / dynamic | RGB only / LiDAR only / Fusion | 中 | 中 | 待验证 |
| Navigation-Oriented WM | X-MOBILITY / DINO-WM | RGB reconstruction 成本高且可能与导航弱相关 | task-oriented latent/occupancy 更高效 | Decoder / Representation | SR + latency | RGB vs latent vs occupancy | 中 | 中 | 待验证 |
| Lightweight WM | X-MOBILITY / NWM / One-Step | WM 实时性差 | distillation / one-step / pruning 可保性能降成本 | WM / Decoder | FPS / SR / VRAM | 各压缩组件 | 中 | 中 | 待验证 |
| Long-Horizon WM | NWM / AR Forcing | AR rollout drift | AR-aware training 降低 exposure bias | Training Objective | 2/4/8/16s rollout | teacher context vs AR context | 高 | 高 | 待验证 |
| Uncertainty-Aware WM | X-MOBILITY / Dreamer | 单一未来不足 | 显式 uncertainty 可用于 risk-aware navigation | Latent distribution / Policy | dynamic collision | deterministic vs uncertainty | 中高 | 高 | 待验证 |
Failure Case 日志
YYYY-MM-DD:实验名称
Model:
Checkpoint:
Environment:
Input:
Expected:
Actual:
是否稳定复现:
失败类型:
- perception
- world prediction
- long-horizon drift
- planner
- policy
- sim2real
- latency
- localization
- sensor
- control
- other
初步原因:
需要做的对照实验:
是否形成 Research Question:
实验结果日志
YYYY-MM-DD:Experiment ID
Goal:
Git Commit:
Config:
Dataset:
GPU:
Seed:
Training Time:
Metrics:
| Metric | Baseline | Ours | Delta |
|---|---|---|---|
结论:
是否支持 Hypothesis:
下一步:
每日工作日志
YYYY-MM-DD
今日目标:
今日阅读:
今日实验:
今天搞明白的问题:
仍然不理解:
Failure Case:
新的 Research Question:
新的 Idea:
下一步:
阶段性目标
阶段 A:建立方向认知
- 精读 X-MOBILITY
- 精读 NWM
- 精读 DINO-WM
- 阅读 DreamerNav
- 阅读 One-Step WM
- 阅读 AR Forcing
- 阅读 NavWAM
- 精读 GWM
- 阅读 DreMa / Dream to Manipulate
- 阅读 Atlas 官方技术说明
- 理解 Renderer / Simulator / Planner 分类
- 理解 RGB / Latent / 3DGS 等不同 WM 输出
- 理解 World Model + Policy
- 理解 World Model + Planning
- 理解 Dreamer / RSSM
阶段 B:建立 Baseline
- 跑通 X-MOBILITY official checkpoint
- 跑通 official evaluation
- 下载并检查 dataset
- 跑一次 fine-tuning
- 记录真实 compute cost
- 在本实验室 GPU 上建立可复现配置
阶段 C:Failure Case Analysis
- static
- cluttered
- narrow corridor
- dark
- motion blur
- fast dynamic obstacle
- crossing pedestrian
- multi-agent
- OOD environment
- long-horizon
阶段 D:Research Question
- 选择一个稳定 failure
- 找到可能原因
- 查 related work
- 提出 hypothesis
- 做最小验证
阶段 E:第一篇论文
- Baselines
- Ours
- Main experiments
- Ablation
- Efficiency
- Simulation
- Real robot
- Figures
- Tables
- Writing
- Submission