使用说明
本文用于长期记录 World Model(WM)在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析。
当前重点关注:
- Navigation World Model
- Latent World Model
- World Model + Policy
- World Model + Model-Based RL
- World Model + MPC / CEM / MPPI
- 动态障碍预测与导航
- World Model 实时化与轻量化
- Sim2Real
- ROS2 / Nav2 / 实机部署
- 3D Structured World Model(3D 结构化世界模型)
- Gaussian World Model(高斯世界模型)
- Learnable Digital Twin(可学习数字孪生)
- Renderer / Simulator / Planner 功能分类
- World Model 的输入、世界表示、输出与决策模块之间的关系
当前阶段的目标不是立即确定创新点,而是:
- 建立 World Model + Navigation 方向的论文谱系;
- 找到适合作为第一篇工作的强 baseline;
- 完整复现至少一个 baseline;
- 分析 failure case 和 limitation;
- 从实际问题中寻找 research question;
- 再把 research question 转化为可验证的创新点;
- 最终完成仿真、消融、对比和实机闭环实验。
论文目录
|论文|Venue / 状态|核心路线|与移动导航关系|当前定位|阅读优先级|
|---|---|---|---|---|---| |X-MOBILITY|ICRA 2025|Latent WM + Policy|直接相关|第一主 baseline 候选|⭐⭐⭐⭐⭐|
|Navigation World Models(NWM)|CVPR 2025 Oral / Best Paper Honorable Mention|Diffusion Video WM + Planning|直接相关|Navigation WM 标志性工作|⭐⭐⭐⭐⭐|
|DINO-WM|ICML 2025|Pretrained Visual Latent WM + Planning|间接相关|Latent WM 核心参考|⭐⭐⭐⭐⭐|
|DreamerNav|Frontiers in Robotics and AI 2025|DreamerV3 + Model-Based RL|直接相关|学习完整机器人论文流程|⭐⭐⭐⭐|
|V-JEPA 2 / V-JEPA 2-AC|2025 Research Release / arXiv|Foundation Video WM + Action Conditioning|当前偏 Manipulation|Foundation WM 核心参考|⭐⭐⭐⭐|
|One-Step World Model|2026 arXiv|One-Step Video WM + Optimization Planning|直接相关|实时化重要工作|⭐⭐⭐⭐⭐|
|AR Forcing|2026 arXiv|Autoregressive Training for Navigation WM|直接相关|长时序预测重要工作|⭐⭐⭐⭐|
|NavWAM|2026 arXiv|World Model + Action Model|直接相关|WM → World Action Model 新路线|⭐⭐⭐⭐|
|GWM|ICCV 2025|3D Gaussian WM + Diffusion Transformer|当前偏 Manipulation|3D / Geometry-aware WM 代表工作|⭐⭐⭐⭐⭐|
|DreMa / Dream to Manipulate|ICLR 2025|Gaussian Digital Twin + Physics + Imagination|当前偏 Manipulation|组合式 WM / 数据生成重要工作|⭐⭐⭐⭐⭐|
|Atlas|World Labs 2026 Research Release|Omni WM:Generation + Reconstruction + Simulation|当前偏 Spatial Intelligence / Simulation|Foundation Spatial WM 重要参考|⭐⭐⭐⭐⭐|
论文链接总表
|论文|Paper / arXiv|Project|GitHub / Code|Models / Dataset|
|---|---|---|---|---| |X-MOBILITY|https://arxiv.org/abs/2410.17491|https://nvlabs.github.io/X-MOBILITY/|https://github.com/NVlabs/X-MOBILITY|Model: https://huggingface.co/nvidia/X-Mobility ;Dataset: https://huggingface.co/datasets/nvidia/X-Mobility| |Navigation World Models|https://arxiv.org/abs/2412.03572|https://www.amirbar.net/nwm/|https://github.com/facebookresearch/nwm|https://huggingface.co/facebook/nwm| |DINO-WM|https://arxiv.org/abs/2411.04983|https://dino-wm.github.io/|https://github.com/gaoyuezhou/dino_wm|Checkpoints / data instructions are in the official GitHub repository| |DreamerNav|https://doi.org/10.3389/frobt.2025.1655171|https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1655171/full|暂未记录到可靠的官方独立代码仓库|Paper states raw data will be made available; details need further verification|
|V-JEPA 2|https://arxiv.org/abs/2506.09985|https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/|https://github.com/facebookresearch/vjepa2|Official repository contains model/evaluation resources| |One-Step World Model|https://arxiv.org/abs/2601.12277|https://robotnav-bot.github.io/nav-onestepwm/|https://github.com/robotnav-bot/NOW|See official repository| |AR Forcing|https://arxiv.org/abs/2605.31314|待补充|arXiv 页面称将发布代码,当前先标记待确认|待补充|
|NavWAM|https://arxiv.org/abs/2606.13494|https://dachii-azm.github.io/navwam/|待确认官方独立仓库|待补充|
|DreMa / Dream to Manipulate|https://arxiv.org/abs/2412.14957|https://dreamtomanipulate.github.io/|https://github.com/leobarcellona/drema_code|官方代码已公开|
|Atlas|https://www.worldlabs.ai/blog/atlas|https://www.worldlabs.ai/|暂无公开训练代码|Early Access;不是传统会议论文项目|
论文定位与影响力
|论文|学术定位|主要贡献类型|对我的价值|
|---|---|---|---| |NWM|Navigation World Model 标志性工作|大规模生成式 WM、CDiT、视频想象 + 规划|理解最前沿 Navigation WM 应该做到什么程度|
|DINO-WM|Latent WM 代表工作|不重建 RGB,直接预测预训练视觉特征|理解「不生成图像也能做 World Model」|
|X-MOBILITY|机器人导航 WM 代表工作|World Model + Policy、Sim2Real、Cross-Embodiment|最适合作为第一主 baseline|
|DreamerNav|系统型 WM 导航工作|DreamerV3 + 动态导航 + 混合规划|学完整机器人科研链条|
|V-JEPA 2|Foundation WM 重要路线|大规模视频自监督 + Action-conditioned WM|理解 Foundation World Model|
|One-Step WM|实时化路线|One-Step generation + planning|研究如何把 WM 真正跑实时|
|AR Forcing|长时序稳定性路线|缓解 AR rollout 的 train-test mismatch|研究 long-horizon prediction|
|NavWAM|World Action Model 路线|联合 future / value / action chunk|观察 WM 是否向 WAM 演化|
|GWM|3D Structured WM / Gaussian WM 代表工作|用 3D Gaussian 显式表示并预测未来三维场景|理解 Geometry-aware World Model|
|DreMa|Compositional WM / Learnable Digital Twin 代表工作|Gaussian Splatting + Physics,用 imagination 生成训练数据|理解 WM 不只用于在线规划,也可用于数据生成|
|Atlas|Foundation Spatial World Model|统一文本、图像、视频、深度与 3D,做生成、重建和模拟|理解现代大型 WM 为什么越来越像 CV / 3D Vision|
复现与工程成本
这一表重点用于判断:能不能作为 baseline、算力够不够、复现成本多高、实机链路是否成熟。
|论文|主要 WM / Backbone|规模|原论文训练资源|数据|仿真 / 环境|规划 / Policy|实机|开源成熟度|我的复现难度|
|---|---|---:|---|---|---|---|---|---|---| |X-MOBILITY|DINOv2 + GRU Probabilistic Latent WM + Policy|WM 主体较小;RGB Diffuser ≈ 962M|8 × H100|Isaac Sim:160K Random + 100K Nav2 Teacher|Isaac Sim|Learned Action Policy|Nova Carter|高:Code + Dataset + Checkpoint + TensorRT/ROS2|⭐⭐⭐|
|NWM|Conditional Diffusion Transformer(CDiT)|50M / 200M / 最大 1B|XL:8 台 × 8 H100 = 64 × H100|RECON / SCAND / TartanDrive / HuRoN / Ego4D 等|Offline robot/human navigation datasets|CEM / trajectory ranking / MPC-style planning|原论文重点不是完整真机闭环|高:Code + Weights|⭐⭐⭐⭐⭐|
|DINO-WM|DINOv2 patch feature + ViT predictor|Predictor 约 19M(论文配置需进一步逐项核对)|原论文未在当前日志中记录明确 GPU 配置|Offline trajectories|PointMaze / PushT / Wall / Reacher 等|CEM / gradient planning|无移动机器人真机|高:Code + checkpoints|⭐⭐|
|DreamerNav|DreamerV3 / RSSM|中小型|1 × RTX 4090 24GB;约 24.79h;495K policy steps|Isaac Sim 在线交互|Isaac Sim Warehouse|Actor-Critic policy + A* global guidance|Spot + Unitree A1|中:论文完整,代码需继续确认|⭐⭐|
|V-JEPA 2-AC|V-JEPA 2 + Action-Conditioned Predictor|ViT-L/H/g,最大约 1B 级|Foundation-scale,具体训练资源待单独整理|>1M hours internet video + robot interaction data|Manipulation / video benchmarks|latent-space planning|Franka 等 manipulation|高:Official repo / models|⭐⭐⭐⭐⭐|
|One-Step WM|3D U-Net + spatial-temporal attention|待核实|待核实|Public navigation data + Habitat/MP3D 等|Habitat + real robot|Optimization-based planning / anchors|有实机|较高:Paper + Project + Code|⭐⭐⭐|
|AR Forcing|Diffusion Navigation WM|基于 NWM 类框架|待核实|RECON / SCAND / HuRoN / TartanDrive|Offline navigation datasets|保留原 diffusion planning framework|待核实|中低:目前代码状态需确认|⭐⭐⭐⭐|
|NavWAM|Diffusion Transformer World-Action Model|待详细整理|待核实|Simulation pretraining + real-robot adaptation|Simulation + real robot|直接输出 action chunk,无需默认 CEM|Diablo|中:Paper + Project 已公开|⭐⭐⭐⭐|
当前实验室计算资源
GPU Server A
1 × RTX 5090
用途:
- 单卡开发;
- 训练 Debug;
- 小中型 World Model fine-tuning;
- 单卡 ablation;
- inference;
- ONNX / TensorRT;
- 实机部署前性能测试。
GPU Server B
3 × RTX A6000 48GB
用途:
- 当前主要训练资源;
- DDP 多卡训练;
- World Model fine-tuning;
- 中型 Transformer / Diffusion;
- 多组 ablation;
- 较大 batch;
- 部分模型并行 / FSDP。
Note:
3 × 48GB != 单进程天然拥有 144GB 显存
需要 DDP / FSDP / model parallel 等方式利用多卡。
GPU Server C
4 × GTX 1080 Ti
用途:
- 数据预处理;
- CPU/GPU 混合的数据生成;
- 传统 baseline;
- 老模型;
- 部分仿真任务;
- 不依赖现代 Tensor Core / BF16 的任务。
不优先用于现代大规模 Transformer / Diffusion 训练。
World Model 放在完整机器人链条中的位置
Sensor / Observation
传感器 / 当前观测
↓
Perception / Representation
感知 / 世界表示
↓
World Model
世界模型
↓
Future Prediction
未来预测
↓
Planner / Policy
规划器 / 策略
↓
Controller
控制器
↓
Robot Command
机器人执行命令
最简单的记忆方式:
- Computer Vision(计算机视觉,CV):回答“现在世界是什么样”;
- World Model(世界模型,WM):回答“如果执行某个动作,未来世界会变成什么样”;
- Planner(规划器) / Policy(策略):回答“我应该做什么动作”;
- Controller(控制器):把高层动作变成速度、关节或力矩命令。
因此,World Model 的输出通常不等于 cmd_vel。常见输出包括 Future RGB(未来图像)、Future Latent State(未来隐状态)、Future Depth(未来深度)、Future Occupancy(未来占据)、Future 3D Gaussian Scene(未来 3D 高斯场景)、Reward / Value / Risk(奖励 / 价值 / 风险)等。
Renderer / Simulator / Planner 功能分类
Renderer(渲染器)
主要回答:世界看起来会是什么样?
典型输出:RGB、Video、Novel View(新视角)、Depth、3D rendering。更偏 CV / Generative Vision(计算机视觉 / 生成视觉)。
Simulator(模拟器)
主要回答:世界在时间和动作作用下会怎样变化?
典型输出:Future State(未来状态)、Future Geometry(未来几何)、Object Pose(物体位姿)、Future Latent(未来隐状态)、Future 3DGS(未来三维高斯)、Reward / Risk / Dynamics(奖励 / 风险 / 动态)。
Planner(规划器)
主要回答:为了达到目标,我应该做什么?
典型输出:Action(动作)、Action Sequence(动作序列)、Trajectory(轨迹)、Velocity Command(速度命令)。
常见术语:
- CEM(Cross-Entropy Method,交叉熵方法):采样很多候选动作,保留表现更好的,再继续搜索;
- MPC(Model Predictive Control,模型预测控制):不断向前预测一小段,只执行当前最优动作,然后重新规划;
- MPPI(Model Predictive Path Integral,模型预测路径积分):一种采样式 MPC;
- Learned Policy(学习策略):神经网络直接根据状态选择动作;
- Actor-Critic(演员-评论家):强化学习中的策略学习结构。
按 World Model 输出形式分类
|输出类型|中文解释|代表工作|后续怎么决策|
|---|---|---|---| |Future RGB / Video|未来 RGB / 视频,直接“画”未来|NWM、One-Step WM|CEM / trajectory ranking|
|Future Latent State|未来隐状态,不画图,只预测压缩后的内部表示|DINO-WM、X-MOBILITY、V-JEPA 2-AC、DreamerNav|CEM / Learned Policy / RL|
|Future 3D Gaussian Scene|未来 3D 高斯场景,显式三维结构|GWM|Imitation Learning / Model-Based RL|
|Digital Twin Future State|数字孪生中的未来状态|DreMa|生成 imagined demonstrations,再训练 Policy|
|RGB + Depth + Explicit 3D|RGB、深度、点云或 3DGS|Atlas|当前主要用于 reconstruction / simulation|
|Future + Action Chunk|预测未来的同时直接给出动作序列|NavWAM|模型自身承担更多 Planner / Policy 功能|
**Latent State(隐空间状态)**可以理解成:把复杂图像、三维结构、语义和动态压缩成一组机器可处理的数字特征,人通常不能直接看懂,但模型可以拿它做预测和决策。
按 World Representation(世界表示)分类
|World Representation|中文|代表工作|Features|
|---|---|---|---| |Pixel / Video Latent|像素 / 视频隐空间|NWM、One-Step WM|视觉生成强,但计算量可能较大|
|Pretrained Visual Feature|预训练视觉特征|DINO-WM|不必重建 RGB,更强调语义特征|
|Probabilistic Latent State|概率隐状态|X-MOBILITY、DreamerNav|更适合 Policy / RL / 时序状态估计|
|Explicit 3D Gaussian|显式 3D 高斯|GWM|三维几何结构更明确|
|Gaussian Digital Twin + Physics|高斯数字孪生 + 物理模拟|DreMa|场景可组合、可变换、可生成训练数据|
|Unified Spatial Context|统一空间上下文|Atlas|文本、图像、视频、相机位姿、深度、3D 统一建模|
按“更偏 CV 还是更偏 Planner / Robotics”分类
不是严格学科划分,只是标记主要创新发生在哪一段。
更偏 CV / 3D Vision 更偏 Planning / Robotics
Atlas
GWM
DreMa
DINO-WM
NWM ---------------------------- CEM Planning
One-Step WM -------------------- CEM / Optimizer
V-JEPA 2-AC -------------------- Latent Planning
X-MOBILITY --------------------- Learned Policy
DreamerNav --------------------- Model-Based RL
NavWAM ------------------------- World + Action Joint Modeling
|工作|主要偏向|直白解释|
|---|---|---| |Atlas|CV / 3D Vision / Spatial Intelligence|强项是生成、三维重建、Real-to-Sim 和机器人传感器模拟,不是专门导航 Planner|
|GWM|3D Vision + Simulator|最大创新在 3D Gaussian 世界表示和未来三维状态预测|
|DreMa|3D Vision + Simulator + Robot Learning|3DGS + Physics 构建数字孪生,再生成 imagined data|
|DINO-WM|CV ↔ Planning 中间|前半段用 DINOv2 特征,后半段把未来 latent 用于规划|
|NWM|CV / Video WM → Planning|先生成未来视觉,再通过 CEM 选择动作|
|One-Step WM|CV / Video WM → Planning|重点是把未来生成做快,再接优化式规划|
|V-JEPA 2-AC|Representation Learning → Planning|foundation latent representation + action-conditioned prediction| |X-MOBILITY|Robot Learning / Policy|WM 学 dynamics,Action Policy 最终输出速度和路径|
|DreamerNav|Model-Based RL / Navigation|WM 用于 imagination,Actor-Critic 学导航策略|
|NavWAM|Planner / Policy 更强|不只预测未来,还联合输出 Action Chunk|
按 Renderer / Simulator / Planner 重新看这些工作
|工作|Renderer|Simulator|Planner / Policy|直白理解|
|---|---:|---:|---:|---| |Atlas|★★★★★|★★★★☆|★★☆☆☆|强生成 / 重建 / 仿真,当前不是专门导航 Planner|
|NWM|★★★★★|★★★★☆|★★★☆☆|先生成未来视觉,再用 CEM 规划|
|One-Step WM|★★★★☆|★★★★☆|★★★☆☆|把未来视觉生成做得更快,再规划|
|DINO-WM|★☆☆☆☆|★★★★☆|★★★★☆|不画未来图,直接在 latent space 预测并规划|
|GWM|★★★★☆|★★★★★|★★☆☆☆|显式模拟未来 3D Gaussian 世界|
|DreMa|★★★★☆|★★★★★|★★☆☆☆|构建数字孪生,用模拟结果扩充训练数据|
|V-JEPA 2-AC|★☆☆☆☆|★★★★☆|★★★★☆|latent prediction + action-conditioned planning| |X-MOBILITY|★★☆☆☆|★★★★☆|★★★★★|WM 主要服务 Learned Policy|
|DreamerNav|★☆☆☆☆|★★★★☆|★★★★★|RSSM imagination + Actor-Critic navigation| |NavWAM|★★★☆☆|★★★★☆|★★★★★|未来预测和动作生成联合|
一个统一的五问阅读法
以后看到任何 World Model 论文,优先回答:
- Observation(观测)是什么? RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal?
- Representation(世界表示)是什么? Pixel、Latent、DINO feature、BEV、Occupancy、3D Gaussian、Digital Twin?
- World Model Output(世界模型输出)是什么? Future RGB、Future Latent、Future Occupancy、Future 3DGS、Reward / Risk、Action-conditioned future?
- Planner / Policy(规划器 / 策略)怎么决定动作? CEM、MPC、MPPI、Neural Policy、Actor-Critic、World Action Model?
- Robot Output(机器人最终输出)是什么?
cmd_vel、trajectory、joint position、end-effector pose、action chunk?
当前路线判断
World Model + Policy
代表:
- X-MOBILITY
- NavWAM
基本结构:
Observation
↓
World Model
↓
Latent State
↓
Policy
↓
Action
特点:
- 适合真实机器人闭环;
- 不一定需要每个控制周期进行大量 CEM 搜索;
- 推理更容易做实时;
- 容易形成 World Model + robot deployment 的完整故事。
当前判断:
最适合第一篇工作的主路线。
World Model + Planning
代表:
- Navigation World Models
- DINO-WM
- One-Step WM
结构:
Observation
↓
World Model
↓
Imagine Future
↓
CEM / MPC / Optimizer
↓
Action
特点:
- World Model 与 Planner 解耦;
- 可显式测试 counterfactual actions;
- 学术上很有 World Model 味;
- 生成式 WM 往往存在推理延迟;
- planner 需要大量 candidate rollout 时计算成本很高。
World Model + Model-Based RL
代表:
- DreamerNav
- DreamerV3 系列
结构:
Observation
↓
RSSM World Model
↓
Imagined Rollouts
↓
Actor-Critic
↓
Policy
特点:
- latent imagination;
- sample efficiency;
- reward design 很重要;
- training stability 是核心问题;
- 很适合动态环境与复杂决策;
- 需要理解 RL,不只是模型结构。
第一主 baseline 候选:X-MOBILITY
基本信息
论文:
X-MOBILITY: End-To-End Generalizable Navigation via World Modeling
Venue:
ICRA 2025
机构:
- NVIDIA
- UC Berkeley
- UT Austin
链接:
- arXiv: https://arxiv.org/abs/2410.17491
- Project: https://nvlabs.github.io/X-MOBILITY/
- GitHub: https://github.com/NVlabs/X-MOBILITY
- Hugging Face Model: https://huggingface.co/nvidia/X-Mobility
- Hugging Face Dataset: https://huggingface.co/datasets/nvidia/X-Mobility
方向:
- World Model
- Robot Navigation
- Imitation Learning
- End-to-End Navigation
- Sim2Real
- Cross-Embodiment
- Edge Deployment
当前定位:
第一主 baseline 候选。
选择原因:
- 本身就是移动机器人导航,不需要强行把一个 manipulation WM 改成 navigation;
- World Model 与 Action Policy 解耦,适合在 World Model 部分做研究;
- 有 Isaac Sim;
- Teacher 直接使用 Nav2;
- 有 Dataset;
- 有 Checkpoint;
- 有 ONNX / TensorRT / ROS2 部署链;
- 有 Nova Carter 实机;
- 算力虽然原论文高,但比从零复现 NWM 1B 更现实;
- 和未来 ROS2 / Nav2 / 实机方向高度兼容。
一句话理解
X-MOBILITY 的核心思想:
利用 World Model 学习一个包含环境状态与动态信息的 latent representation,再利用这个 latent state 学习导航 Action Policy。
普通 Behavior Cloning:
Image
↓
Network
↓
Action
X-MOBILITY:
Image + Robot State
↓
World Model
↓
Latent State
↓
Action Policy
↓
Action
关键区别:
Latent State 不只是为了拟合 teacher action,而是通过 World Modeling 与 multi-task decoder 被迫学习环境与动态信息。
总体网络结构
Image
↓
DINOv2
Robot State → MLP ─────┤
↓
Observation Embedding
↓
State Estimator
↓
Belief State
↓
Latent State z
↙ ↓ ↘
/ │ \
↓ ↓ ↓
RGB Decoder Semantic Action Policy
Decoder ↓
Velocity
+
Path
另有:
State Predictor
负责:
History
+
Action
↓
Future Belief State
World Model 的关键本质:
[ p(s_{t+1}\mid s_t,a_t) ]
Observation Encoder
输入主要包括:
RGB
前视相机图像。
视觉特征:
DINOv2
Robot State
主要包括机器人速度等状态量。
通过:
MLP
编码。
最终:
Image Embedding
+
Robot State Embedding
↓
Observation Embedding
State Estimator
输入:
History
+
Previous Action
+
Current Observation
输出 probabilistic belief state。
用于估计:
在已经看到真实 observation 的情况下,当前世界 latent state 应该是什么。
State Predictor
输入:
History
+
Action
不使用未来 observation。
输出:
Predicted Future Belief State
That is: if the communication parameters (like baud rate) set in the microcontroller program are not consistent with those configured in the serial port software on the PC, the communication between the microcontroller and the computer will fail.
如果我执行这个 action,未来 latent world state 会变成什么。
State Predictor 与 State Estimator 之间通过 KL 约束,使预测出来的 latent distribution 接近真实观察得到的 posterior。
Multi-Task Decoder
作者希望 latent state 不是只会拟合 action,因此使用多个 decoder 给 latent state 提供监督。
主要包括:
RGB Reconstruction
+
Semantic Segmentation
RGB Reconstruction 使用 Latent Diffusion Model。
论文 appendix 给出的模型规模中:
RGB Diffuser ≈ 962M
但真正负责 world dynamics 的组件小得多,例如:
State Estimator ≈ 5.5M
State Predictor ≈ 2.3M
这一点非常值得关注:
Navigation World Model 是否真的需要一个近 1B 的 RGB Diffuser?
Action Policy
输入:
Latent State
+
Route Feature
Route 使用:
VectorNet
编码。
之后:
Self-Attention Fusion
↓
Action Decoder
输出:
Linear / Angular Velocity
+
Optional Local Path
Policy 使用 imitation learning 学习 teacher。
数据集
训练数据来自 Isaac Sim 中的 Nova Carter。
分为两类。
Random Action Dataset
≈ 160K frames
用途:
World Model pretraining。
核心目标不是学导航,而是尽量探索:
state-action coverage
让 WM 学习:
执行动作后世界怎么变化。
Nav2 Teacher Dataset
≈ 100K frames
Nav2 在 Isaac Sim 中闭环运行:
Random Start
+
Random Goal
↓
Nav2
↓
Teacher Trajectory
用途:
World Model
+
Action Policy
联合训练。
Multi-Stage Training
Stage 1:World Model Pretraining
Random Action Dataset
↓
World Model
Policy 关闭。
Stage 2:World Model + Action Policy
Nav2 Teacher Dataset
↓
World Model + Policy
特点:
World Modeling 与 Policy Learning 解耦。
这可能是 X-MOBILITY 最值得作为 baseline 的设计之一。
原论文计算资源
原始训练配置:
8 × NVIDIA H100
World Model:
100 epochs
World Model + Policy:
100 epochs
Batch:
32
因此不建议第一步直接尝试:
从零 100% 复现 NVIDIA 的完整训练规模。
更现实:
Official Checkpoint
↓
Reproduce Evaluation
↓
Fine-tuning
↓
Modify Module
↓
Ablation
推理与 Edge Deployment
作者在:
Jetson AGX Orin
测试推理。
Policy Only:
P50 ≈ 38.6 ms
P95 ≈ 42.0 ms
GPU Memory ≈ 594 MB
Policy + Semantic:
P50 ≈ 55.6 ms
GPU Memory ≈ 804 MB
说明:
真正用于 navigation inference 的主体并没有 962M RGB diffuser 看上去那么夸张。
官方工程链:
PyTorch
↓
ONNX
↓
TensorRT
↓
ROS2
↓
Robot
这对未来实机很重要。
Sim2Real
真实平台:
NVIDIA Nova Carter
训练:
Isaac Sim
真实部署:
Zero-Shot Sim2Real
即:
不针对真实实验室环境额外 fine-tune。
实机 benchmark 包括:
Single Obstacle
Multi Obstacles
Normal Lighting
Dark Lighting
论文报告:
Single / Normal 10 / 10
Single / Dark 10 / 10
Multi / Normal 8 / 9
Multi / Dark 8 / 9
Cross-Embodiment
Isaac Sim 中进一步测试:
Nova Carter
Forklift
Unitree Go2
Unitree G1
对应:
Differential Drive
Ackermann
Quadruped
Humanoid
研究意义:
latent representation 与标准化 input/output 是否可以跨 embodiment 泛化。
原论文 Baselines
当前记录:
- Nav2 Teacher;
- Behavior Cloning;
- MILE;
- X-MOBILITY。
后续需要继续详细整理:
- 每个 baseline 的 network;
- 是否使用同一 dataset;
- 是否 retrain;
- 训练预算是否一致;
- open-loop 与 closed-loop 分别怎么比;
- statistical significance;
- 是否有 hidden implementation advantage。
Evaluation Metrics
Open-loop:
- Linear Speed MAE;
- Angular Speed MAE;
- Path MAE。
Closed-loop:
- Success Rate;
- Weighted Trip Time;
- Average Absolute Angular Acceleration。
未来自己的论文可以追加:
- Collision Rate;
- Minimum Obstacle Distance;
- Path Length;
- Navigation Time;
- SPL;
- FPS;
- P50 / P95 latency;
- GPU memory;
- Parameters;
- Energy / power;
- Dynamic obstacle collision rate;
- OOD success rate。
当前认为的优点
工程链完整
Isaac Sim
↓
Dataset
↓
World Model
↓
Policy
↓
TensorRT
↓
ROS2
↓
Real Robot
Dataset / Checkpoint / Code 都有
降低复现门槛。
World Model 与 Policy 解耦
非常适合:
保持 Policy Pipeline
↓
重点改 WM
Nav2 可以同时当 Teacher 和传统 baseline
这与移动机器人研究非常自然。
可上实机
不是只在 offline benchmark 上比较 prediction metric。
当前认为的不足 / 待验证问题
动态障碍研究仍不充分
作者未来工作明确提到:
需要增加更多 diverse dynamic-obstacle scenes,进一步研究 world model 对 action policy 的作用。
可能的 research question:
X-MOBILITY 的 latent dynamics 在高速、多人、交叉运动动态环境中是否仍然可靠?
感知主要依赖 RGB
当前核心输入:
RGB
+
Robot State
机器人导航还有:
LiDAR
Depth
BEV
Occupancy
待验证:
RGB latent 是否缺少稳定 geometry grounding?
RGB Diffuser 很大
≈ 962M
待验证:
对导航来说,有没有必要生成 / 重建 RGB?
可能替代:
- Future Latent;
- Depth;
- Occupancy;
- Traversability;
- Dynamic Motion;
- Collision Risk。
World Model prediction 与 navigation performance 的因果关系不够直观
必须问:
prediction metric 更好,是否一定带来 closed-loop navigation 更好?
未来 ablation 应该专门分析。
潜在 Research Questions
以下只进入「问题池」,不能直接当作论文创新点。
Dynamic World Modeling
现象候选:
Fast Pedestrian
Crossing Pedestrian
Multi-Agent Interaction
Sudden Appearance
Question
现有 latent dynamics 是否能可靠预测动态实体?
Multi-Modal World Modeling
候选:
RGB
+
LiDAR / Depth / BEV
Question
显式 geometry modality 是否提高 OOD、暗光、运动模糊和动态导航鲁棒性?
Navigation-Oriented Representation
从:
RGB Reconstruction
转向:
Future Occupancy
Depth
Traversability
Dynamic Motion
Collision Risk
Question
对 navigation 来说,task-oriented prediction 是否比 photorealistic reconstruction 更有效?
Lightweight World Model
研究:
- Distillation;
- Quantization;
- Efficient temporal model;
- Decoder pruning / replacement;
- Adapter;
- low-rank fine-tuning。
目标:
Lower Latency
Lower VRAM
Similar / Better Navigation SR
Uncertainty-Aware WM
从:
One Future
变为:
P(Future | State, Action)
研究:
uncertainty 是否能用于 risk-aware navigation?
X-MOBILITY 复现 Checklist
- 通读论文第一遍
- 画出总体网络图
- 搞懂 Observation Encoder
- 搞懂 State Estimator
- 搞懂 State Predictor
- 搞懂 KL Loss
- 搞懂 RGB Decoder
- 搞懂 Semantic Decoder
- 搞懂 Route Encoder
- 搞懂 Action Policy
- 下载 GitHub
- 搭建 Docker 环境
- 下载 official checkpoint
- 下载 official dataset
- 跑通官方 inference
- 跑通 official evaluation
- 跑通 Isaac Sim demo / 数据链
- 尝试一次 fine-tuning
- 记录单卡显存
- 记录单 iteration 时间
- 记录多卡训练效率
- 复现主要 open-loop 指标
- 复现主要 closed-loop 指标
- 建 Failure Case Dataset
- Failure Case Analysis
- 提出第一个 hypothesis
- 做最小修改验证 hypothesis
- 通过后进入正式创新点设计
- Ablation
- 与强 baseline 对比
- TensorRT
- ROS2
- 实机
Navigation World Models(NWM)
基本信息
论文:
Navigation World Models
Venue:
CVPR 2025 Oral
Best Paper Honorable Mention。
链接:
- arXiv: https://arxiv.org/abs/2412.03572
- Project: https://www.amirbar.net/nwm/
- GitHub: https://github.com/facebookresearch/nwm
- Hugging Face: https://huggingface.co/facebook/nwm
核心:
Observation
+
Navigation Action
↓
Conditional Diffusion Transformer
↓
Future Observation
↓
CEM / Trajectory Ranking
↓
Navigation
模型
核心提出:
CDiT
Conditional Diffusion Transformer
模型公开规模包括:
CDiT/S ≈ 50M
CDiT/B ≈ 200M
CDiT/XL ≈ 1B
最大模型:
≈ 1B
原论文计算资源
CDiT-XL:
8 machines
×
8 H100 / machine
=
64 × H100
This means:
不适合当前阶段把 1B XL 从零完整训练作为第一篇论文的必要前置条件。
但:
50M / 200M pretrained model
可以作为以后小规模实验入口。
数据
主要:
- RECON;
- SCAND;
- TartanDrive;
- HuRoN;
- Ego4D 等。
特点:
使用机器人、人类 egocentric video 与 navigation action 学世界动态。
Planning
NWM 可以:
Standalone Planning
Sample Candidate Actions
↓
NWM Imagine Future
↓
Compare Future with Goal
↓
CEM
↓
Best Action
官方 planning 示例一次可以采:
120 candidate trajectories
这也是它实时部署成本很高的原因之一。
Rank External Policy
也可以:
External Policy
↓
Candidate Trajectories
↓
NWM Rank
↓
Best Trajectory
Real-time performance
原始 NWM 推理较慢。
论文讨论了:
- Time Skip;
- Diffusion Distillation;
- 4-bit Quantization(论文中作为潜在方向)。
这直接说明:
实时 World Model 是该路线的重要研究问题。
已知 Limitation
OOD Mode Collapse
在未知环境 autoregressive rollout 时:
prediction 逐渐丢失当前环境 context,并向训练分布中的场景靠拢。
Pedestrian Temporal Dynamics
论文明确指出:
对 pedestrian motion 等 temporal dynamics 模拟仍然困难。
Long-Horizon Drift
随着 autoregressive rollout 变长:
Error Accumulation
越来越严重。
这些问题后来直接衍生出:
- AR Forcing;
- One-Step WM;
- NavWAM 等新工作。
当前定位
必须精读,但暂时不作为第一篇从零训练主 baseline。
主要用途:
- 理解 Navigation World Model 最前沿问题;
- 学 Diffusion World Model;
- 学 action-conditioned future generation;
- 学 CEM planning;
- 找 long-horizon / realtime / dynamic motion 的研究问题。
DINO-WM
基本信息
论文:
DINO-WM: World Models on Pre-trained Visual Features Enable Zero-shot Planning
Venue:
ICML 2025
链接:
- arXiv: https://arxiv.org/abs/2411.04983
- Project: https://dino-wm.github.io/
- GitHub: https://github.com/gaoyuezhou/dino_wm
核心问题
它挑战一个非常重要的问题:
World Model 为什么一定要重建未来 RGB?
DINO-WM:
Image
↓
DINOv2
↓
Patch Features
↓
World Model
↓
Future Patch Features
↓
Planning
即:
直接在 pretrained visual feature space 预测未来。
重要意义
相比:
World Model
↓
Generate Future RGB
DINO-WM:
World Model
↓
Predict Future Representation
可能具有:
- 更低计算成本;
- 更少无关 pixel reconstruction;
- 更强语义 representation;
- 更容易用于 task-oriented planning。
这与未来想研究的:
Navigation-Oriented Latent World Model
高度相关。
Tasks
官方代码主要覆盖:
- PointMaze;
- PushT;
- Wall;
- Reacher 等。
因此:
学术价值很高,但不是最直接的真实移动机器人导航 baseline。
当前定位
Latent World Model 必读论文。
重点看:
- pretrained representation;
- patch-level latent dynamics;
- CEM planning;
- gradient-based planning;
- task-agnostic world representation。
DreamerNav
基本信息
论文:
DreamerNav: learning-based autonomous navigation in dynamic indoor environments using world models
Venue:
Frontiers in Robotics and AI,2025
链接:
- DOI: https://doi.org/10.3389/frobt.2025.1655171
- Full Text: https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1655171/full
- PMC: https://pmc.ncbi.nlm.nih.gov/articles/PMC12510832/
Backbone:
DreamerV3
+
RSSM
核心
Depth
+
Structured Local Occupancy Map
+
Dynamic Obstacle History
+
Points of Interest
+
A* Global Path
↓
DreamerV3 / RSSM
↓
Local Navigation Policy
Among them:
A*
负责 global guidance;
DreamerV3:
在 latent space 处理动态环境与 local decision。
Training Compute
论文报告:
1 × RTX 4090 24GB
≈ 24.79 h
≈ 495,000 policy steps
相比另外几条路线非常友好。
Simulation
NVIDIA Isaac Sim
动态障碍、warehouse environment、curriculum learning。
Real Robot
平台:
Boston Dynamics Spot
Unitree A1
基本部署:
Real Sensors
↓
ROS Node
↓
DreamerNav Model
↓
Velocity Commands
↓
Robot
同一 policy 部署两个 quadruped。
已知 Limitation
论文明确提到:
rapidly approaching dynamic obstacles 下避障策略仍会失败。
作者提出未来:
- RNN / attention;
- motion prediction;
- semantic segmentation;
- domain randomization;
- 更多真实环境测试;
- ablation study。
这篇论文非常适合学习:
一篇机器人硕士型完整论文从问题、方法、仿真、baseline 到实机应该怎么组织。
当前定位
第一篇科研的低风险参考工作。
如果 X-MOBILITY 复现成本高于预期,可退一步从 DreamerNav / DreamerV3 体系建立科研闭环。
V-JEPA 2 / V-JEPA 2-AC
基本信息
论文:
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
链接:
- arXiv: https://arxiv.org/abs/2506.09985
- Official GitHub: https://github.com/facebookresearch/vjepa2
- Meta Blog: https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
核心路线
V-JEPA 2:
Internet-Scale Video
↓
Self-Supervised JEPA
↓
World Representation
V-JEPA 2-AC:
V-JEPA 2 Representation
+
Robot Action
↓
Action-Conditioned Predictor
↓
Future Latent State
↓
Planning
数据规模
论文使用超过:
1 million hours
互联网视频做大规模预训练。
随后使用较少 robot interaction data 进行 action-conditioned post-training。
与当前课题关系
目前机器人实验主要偏:
Manipulation
而不是移动导航。
因此:
不适合作为第一主 baseline,但必须关注 Foundation World Model 如何做预训练 + robot post-training。
当前定位
重点学习:
- JEPA;
- Self-supervised representation learning;
- Foundation video model;
- Action-conditioned post-training;
- latent planning;
- 大模型预训练与机器人小数据适配。
One-Step World Model
基本信息
论文:
An Efficient and Multi-Modal Navigation System with One-Step World Model
链接:
- arXiv: https://arxiv.org/abs/2601.12277
- Project: https://robotnav-bot.github.io/nav-onestepwm/
- GitHub: https://github.com/robotnav-bot/NOW
机构包括:
- Tsinghua University;
- Xiaomi Robotics Lab。
Problems Addressed
针对传统 Navigation WM:
Multi-Step Diffusion
+
Autoregressive Frame Generation
↓
High Latency
提出:
One-Step Generation
Backbone
3D U-Net
+
Efficient Spatial-Temporal Attention
目标:
在保留 future imagination 能力的同时,大幅降低推理延迟。
Navigation
结合:
Optimization-Based Planning
+
Anchor-Based Initialization
支持:
- Image Goal;
- Language Goal;
- Point Goal。
当前定位
实时 World Model 必读工作。
如果以后基于 X-MOBILITY 做 lightweight / realtime WM,要重点对比。
AR Forcing
基本信息
论文:
AR Forcing: Towards Long-Horizon Robot Navigation World Model
链接:
- arXiv: https://arxiv.org/abs/2605.31314
- Code: 当前 arXiv 信息称将发布,后续需要持续检查官方仓库
问题
很多 Diffusion Navigation WM:
训练:
Ground Truth Context
推理:
Model Generated Context
于是:
Train-Test Distribution Shift
↓
Autoregressive Error Accumulation
↓
Long-Horizon Instability
Method
核心:
Autoregressive Training
训练时显式把模型自己的 prediction 重新放入 context。
目的:
让模型在训练阶段就暴露于真正 inference 时会遇到的 state distribution。
Dataset
包括:
- RECON;
- SCAND;
- HuRoN;
- TartanDrive。
与 NWM 系导航数据高度重合。
当前定位
NWM long-horizon problem 的重要 follow-up。
重点研究:
- exposure bias;
- autoregressive rollout;
- diffusion training;
- long-horizon navigation consistency。
NavWAM
基本信息
论文:
NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation
链接:
核心问题
传统 Navigation WM:
Observation
↓
World Model
↓
Future
↓
External Planner / CEM
↓
Action
Question
future prediction 本身不能直接执行,还需要 expensive planning。
NavWAM
Observation + Goal
↓
World Action Model
↓
Future Observation
+
Goal Progress
+
Action Chunk
↓
Closed-Loop Action
核心:
把「预测未来」与「决定动作」联合建模。
实机
使用:
Diablo mobile robot
并进行:
Simulation Pretraining
+
Real-Robot Adaptation
当前定位
用来观察 World Model 是否正在从「预测模型」演化到「World Action Model」。
这可能是未来非常重要的方向:
WM
↓
WAM
GWM:Towards Scalable Gaussian World Models for Robotic Manipulation
基本信息
Venue:ICCV 2025。 ICCV(International Conference on Computer Vision,国际计算机视觉大会)属于计算机视觉领域第一梯队顶会。
链接:
- ICCV Open Access: https://openaccess.thecvf.com/content/ICCV2025/html/Lu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html
- Project: https://gaussian-world-model.github.io/
- GitHub: https://github.com/Gaussian-World-Model/gaussianwm
一句话理解
GWM 的重点不是简单改变传感器输入,而是把 World Representation(世界表示)换成具有显式三维几何结构的 3D Gaussian,并预测动作作用后的 Future Gaussian Scene(未来高斯场景)。
核心结构
Current RGB Image(s)
↓
3D Reconstruction / Lifting
三维重建 / 提升
↓
Gaussian Splats
3D 高斯场景
↓
3D Variational Autoencoder
3D 变分自编码器
↓
Compact Gaussian Latent
↓
Latent Diffusion Transformer
隐空间扩散 Transformer
+
Robot Action
↓
Future Gaussian Latent
↓
Future 3D Gaussian Scene
未来 3D 高斯场景
Gaussian Splatting(高斯泼溅 / 3DGS):用大量带位置、大小、方向、颜色和透明度的三维高斯椭球表示场景。
World Model 输出
主要是 Future 3D Gaussian Scene(未来 3D 高斯场景),不是直接 cmd_vel。
怎么用于机器人
- Imitation Learning(模仿学习):用 GWM 学到的 3D representation 帮助 policy;
- Model-Based Reinforcement Learning(基于模型强化学习):把 GWM 当 Neural Simulator(神经网络模拟器)产生 imagined rollouts。
实机
项目页展示 Franka Emika FR3 + Panda Gripper + RealSense D435i,真实观测使用第三视角 RGB-only 图像。因此 GWM 的关键创新是内部 3D representation 与 dynamics prediction,而不是单纯“加深度输入”。
当前定位
3D Structured World Model / Geometry-Aware World Model / Simulator-oriented WM,更偏 3D Vision + Simulator。
DreMa:Dream to Manipulate
基本信息
全名: Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination
Venue:ICLR 2025。 ICLR(International Conference on Learning Representations,国际学习表征会议)属于机器学习 / 深度学习第一梯队顶会。
链接:
- arXiv: https://arxiv.org/abs/2412.14957
- ICLR Proceedings: https://proceedings.iclr.cc/paper_files/paper/2025/hash/8f0d446441a938d9de420a8ab8d7fd36-Abstract-Conference.html
- Project: https://dreamtomanipulate.github.io/
- GitHub: https://github.com/leobarcellona/drema_code
一句话理解
DreMa 把 World Model 做成 Learnable Digital Twin(可学习数字孪生),用 3D Gaussian Splatting + Physics Simulator 显式复制真实场景,然后在里面“做梦”,自动生成新的机器人训练示范。
Compositional World Model(组合式世界模型)
**Compositional(组合式)**表示场景中的物体、机器人和环境可以单独移动、变换和重新组合,而不只是作为一整张不可拆分的图像存在。
Few Real Demonstrations
少量真实示范
↓
Learnable Digital Twin
可学习数字孪生
↓
改变物体 / 目标 / 场景配置
↓
Physics Simulation
物理模拟
↓
Imagined Demonstrations
想象出来的新示范
↓
Imitation Learning
模仿学习
↓
Robot Policy
核心用途
DreMa 不是主要做在线路径规划,而是:
World Model → Imagination → Data Generation → Policy Learning
实机
使用 Franka Emika Panda,并展示 one-shot policy learning(单样本策略学习):某些任务变化只需一个真实示范,再依靠 imagination 扩充训练数据。
当前定位
3D Structured WM + Learnable Digital Twin + Compositional WM + Data Generation for Imitation Learning,更偏 Simulator + Robot Learning。
Atlas:A World Model for Spatial Intelligence
基本信息
发布方:World Labs
时间:2026-09-01
状态: World Labs Research Release / Product Research Model,不是目前意义上的 CVPR / ICML / ICLR 正式会议论文。
链接:
- Official Blog: https://www.worldlabs.ai/blog/atlas
- World Model Taxonomy: https://www.worldlabs.ai/blog/taxonomy-of-world-models
- World Labs: https://www.worldlabs.ai/
一句话理解
Atlas 是面向 Spatial Intelligence(空间智能)的通用多模态 World Model,统一处理文本、图像、视频、相机位姿、深度和 3D,并进行世界生成、三维重建和时空模拟。
Spatial Intelligence(空间智能)
指 AI 不只知道“图像里有什么”,还理解物体在哪里、空间结构是什么、换视角会看到什么,以及世界如何随时间和动作变化。
Model Architecture(模型架构)
官方描述为:
Multimodal Autoregressive Diffusion Transformer(多模态自回归扩散 Transformer)
目前可处理 Text(文本)、Image(图像)、Camera Pose(相机位姿)、Depth Map(深度图)、Video(视频序列)以及 3D spatial context(三维空间上下文)。
Atlas 能输出什么
官方展示了:
RGB Image / Video
+
Depth
+
Point Cloud
+
3D Gaussian Splats
所以 Atlas 不只是“输出图像”,也可以产生 explicit 3D representation(显式三维表示)。
Robotics Simulation(机器人仿真)
真实环境手机视频
↓
Atlas
↓
3D Reconstruction
三维重建
↓
Virtual Robot 沿给定路径运动
↓
Atlas 生成机器人将看到的 RGB + Depth
这里要特别注意:当前公开演示更接近 Path → Atlas → Future Observation,而不是 Atlas → Path。 因此 Atlas 当前不是专门的导航 Planner。
当前定位
Foundation World Model / Spatial Intelligence Model(基础世界模型 / 空间智能模型),目前更偏 CV + 3D Vision + Generative Model + Simulator。
统一论文阅读模板
以后每篇新论文都复制下面模板。
基本信息
Title:
Authors:
Venue:
Year:
Organization:
Paper:
arXiv:
Project:
GitHub:
Model:
Dataset:
Citation / BibTeX:
一句话概括
它解决什么问题
为什么旧方法不行
核心假设
Observation / Input(观测 / 输入)
World Representation(世界表示)
记录模型内部怎么表示世界:Pixel / Video latent、DINO feature、RSSM latent、BEV / Occupancy、3D Gaussian、Explicit Digital Twin 等。
World Model Output(世界模型输出)
明确记录:Future RGB / Video、Future Latent、Future Depth、Future Occupancy、Future 3DGS、Reward / Value / Risk、Action Chunk 等。
Renderer / Simulator / Planner 定位
Renderer:
Simulator:
Planner / Policy:
CV ↔ Robotics 定位
记录论文主要创新更偏 CV / 3D Vision,还是更偏 Planning / Policy / Robotics。
最终 Robot Output(机器人执行输出)
例如 cmd_vel、vx / vy / wz、trajectory、joint position、end-effector pose、action chunk。
World Model 定义
Backbone
参数量
Pretrained Model
Dataset
Training Pipeline
Loss
Optimizer / LR / Batch
Training Compute
记录:
GPU:
GPU 数量:
GPU 显存:
训练时间:
Epoch / Steps:
Precision:
Multi-GPU Strategy:
Inference Compute
记录:
Device:
P50 Latency:
P95 Latency:
FPS:
VRAM:
Power:
Planner / Policy
与 Nav2 / ROS 的关系
Simulation
记录:
Simulator:
Robot:
Sensor:
Scene:
Dynamic Obstacle:
Domain Randomization:
Control Frequency:
Real Robot
记录:
Robot:
Compute:
Sensor:
ROS / ROS2:
Control Output:
Environment:
Number of Trials:
Success Rate:
是否 Fine-tune:
是否 Zero-Shot Sim2Real:
Baselines
Metrics
Main Results
Ablation
Failure Cases
Limitations
Authors' Future Work
我认为的潜在问题
和已有工作的差异
是否适合当我的 baseline
评分:
代码完整度:
数据完整度:
Checkpoint:
算力可承受:
复现难度:
移动机器人相关性:
实机难度:
创新空间:
复现结论
Research Question 池
这里只存「问题」,不直接写成“我的创新点”。
template
问题名称:
来源论文:
现象:
证据:
可能原因:
已有方法怎么做:
为什么现有方法还不够:
我的 Hypothesis:
最小验证实验:
需要的 Baseline:
需要的 Dataset:
需要的 Compute:
可能失败原因:
状态:
未验证 / 初步验证 / 值得继续 / 放弃
创新点候选池
只有经过最小实验支持的 Research Question 才进入这里。
|Idea|来源|Problem|Hypothesis|修改位置|Main Experiment|Ablation|Compute|Risk|Status|
|---|---|---|---|---|---|---|---|---|---| |Dynamic WM|X-MOBILITY|高速/多人动态障碍可能预测弱|显式 temporal motion modeling 能改善闭环避障|State Predictor / Decoder|Dynamic Navigation|w/o motion module|In|In|待验证|
|Multi-Modal WM|X-MOBILITY|RGB geometry 不稳定|RGB + LiDAR/Depth 提高鲁棒性|Encoder / Fusion|OOD / dark / blur / dynamic|RGB only / LiDAR only / Fusion|In|In|待验证|
|Navigation-Oriented WM|X-MOBILITY / DINO-WM|RGB reconstruction 成本高且可能与导航弱相关|task-oriented latent/occupancy 更高效|Decoder / Representation|SR + latency|RGB vs latent vs occupancy|In|In|待验证|
|Lightweight WM|X-MOBILITY / NWM / One-Step|WM 实时性差|distillation / one-step / pruning 可保性能降成本|WM / Decoder|FPS / SR / VRAM|各压缩组件|In|In|待验证|
|Long-Horizon WM|NWM / AR Forcing|AR rollout drift|AR-aware training 降低 exposure bias|Training Objective|2/4/8/16s rollout|teacher context vs AR context|High|High|待验证|
|Uncertainty-Aware WM|X-MOBILITY / Dreamer|单一未来不足|显式 uncertainty 可用于 risk-aware navigation|Latent distribution / Policy|dynamic collision|deterministic vs uncertainty|中高|High|待验证|
Failure Case 日志
YYYY-MM-DD:实验名称
Model:
Checkpoint:
Environment:
Input:
Expected:
Actual:
是否稳定复现:
失败类型:
- perception
- world prediction
- long-horizon drift
- planner
- policy
- sim2real
- latency
- localization
- sensor
- control
- other
初步原因:
需要做的对照实验:
是否形成 Research Question:
实验结果日志
YYYY-MM-DD:Experiment ID
Goal:
Git Commit:
Config:
Dataset:
GPU:
Seed:
Training Time:
Metrics:
| Metric | Baseline | Ours | Delta |
|---|---|---|---|
结论:
是否支持 Hypothesis:
下一步:
每日工作日志
YYYY-MM-DD
今日目标:
今日阅读:
今日实验:
今天搞明白的问题:
仍然不理解:
Failure Case:
新的 Research Question:
新的 Idea:
下一步:
阶段性目标
阶段 A:建立方向认知
- 精读 X-MOBILITY
- 精读 NWM
- 精读 DINO-WM
- 阅读 DreamerNav
- 阅读 One-Step WM
- 阅读 AR Forcing
- 阅读 NavWAM
- 精读 GWM
- 阅读 DreMa / Dream to Manipulate
- 阅读 Atlas 官方技术说明
- 理解 Renderer / Simulator / Planner 分类
- 理解 RGB / Latent / 3DGS 等不同 WM 输出
- 理解 World Model + Policy
- 理解 World Model + Planning
- 理解 Dreamer / RSSM
阶段 B:建立 Baseline
- 跑通 X-MOBILITY official checkpoint
- 跑通 official evaluation
- 下载并检查 dataset
- 跑一次 fine-tuning
- 记录真实 compute cost
- 在本实验室 GPU 上建立可复现配置
阶段 C:Failure Case Analysis
- static
- cluttered
- narrow corridor
- dark
- motion blur
- fast dynamic obstacle
- crossing pedestrian
- multi-agent
- OOD environment
- long-horizon
阶段 D:Research Question
- 选择一个稳定 failure
- 找到可能原因
- 查 related work
- 提出 hypothesis
- 做最小验证
阶段 E:第一篇论文
- Baselines
- Ours
- Main experiments
- Ablation
- Efficiency
- Simulation
- Real robot
- Figures
- Tables
- Writing
- Submission