WM论文日志

0瀏覽次數0訪問次數--跳出率--平均停留

使用说明

本文用于长期记录 World Model(WM)在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析

当前重点关注:

  • Navigation World Model
  • Latent World Model
  • World Model + Policy
  • World Model + Model-Based RL
  • World Model + MPC / CEM / MPPI
  • 动态障碍预测与导航
  • World Model 实时化与轻量化
  • Sim2Real
  • ROS2 / Nav2 / 实机部署
  • 3D Structured World Model(3D 结构化世界模型)
  • Gaussian World Model(高斯世界模型)
  • Learnable Digital Twin(可学习数字孪生)
  • Renderer / Simulator / Planner 功能分类
  • World Model 的输入、世界表示、输出与决策模块之间的关系

当前阶段的目标不是立即确定创新点,而是:

  1. 建立 World Model + Navigation 方向的论文谱系;
  2. 找到适合作为第一篇工作的强 baseline;
  3. 完整复现至少一个 baseline;
  4. 分析 failure case 和 limitation;
  5. 从实际问题中寻找 research question;
  6. 再把 research question 转化为可验证的创新点;
  7. 最终完成仿真、消融、对比和实机闭环实验。

论文目录

论文Venue / 状态核心路线与移动导航关系当前定位阅读优先级
X-MOBILITYICRA 2025Latent WM + Policy直接相关第一主 baseline 候选⭐⭐⭐⭐⭐
Navigation World Models(NWM)CVPR 2025 Oral / Best Paper Honorable MentionDiffusion Video WM + Planning直接相关Navigation WM 标志性工作⭐⭐⭐⭐⭐
DINO-WMICML 2025Pretrained Visual Latent WM + Planning间接相关Latent WM 核心参考⭐⭐⭐⭐⭐
DreamerNavFrontiers in Robotics and AI 2025DreamerV3 + Model-Based RL直接相关学习完整机器人论文流程⭐⭐⭐⭐
V-JEPA 2 / V-JEPA 2-AC2025 Research Release / arXivFoundation Video WM + Action Conditioning当前偏 ManipulationFoundation WM 核心参考⭐⭐⭐⭐
One-Step World Model2026 arXivOne-Step Video WM + Optimization Planning直接相关实时化重要工作⭐⭐⭐⭐⭐
AR Forcing2026 arXivAutoregressive Training for Navigation WM直接相关长时序预测重要工作⭐⭐⭐⭐
NavWAM2026 arXivWorld Model + Action Model直接相关WM → World Action Model 新路线⭐⭐⭐⭐
GWMICCV 20253D Gaussian WM + Diffusion Transformer当前偏 Manipulation3D / Geometry-aware WM 代表工作⭐⭐⭐⭐⭐
DreMa / Dream to ManipulateICLR 2025Gaussian Digital Twin + Physics + Imagination当前偏 Manipulation组合式 WM / 数据生成重要工作⭐⭐⭐⭐⭐
AtlasWorld Labs 2026 Research ReleaseOmni WM:Generation + Reconstruction + Simulation当前偏 Spatial Intelligence / SimulationFoundation Spatial WM 重要参考⭐⭐⭐⭐⭐

论文链接总表

论文Paper / arXivProjectGitHub / CodeModels / Dataset
X-MOBILITYhttps://arxiv.org/abs/2410.17491https://nvlabs.github.io/X-MOBILITY/https://github.com/NVlabs/X-MOBILITYModel: https://huggingface.co/nvidia/X-Mobility ;Dataset: https://huggingface.co/datasets/nvidia/X-Mobility
Navigation World Modelshttps://arxiv.org/abs/2412.03572https://www.amirbar.net/nwm/https://github.com/facebookresearch/nwmhttps://huggingface.co/facebook/nwm
DINO-WMhttps://arxiv.org/abs/2411.04983https://dino-wm.github.io/https://github.com/gaoyuezhou/dino_wmCheckpoints / data instructions are in the official GitHub repository
DreamerNavhttps://doi.org/10.3389/frobt.2025.1655171https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1655171/full暂未记录到可靠的官方独立代码仓库Paper states raw data will be made available; details need further verification
V-JEPA 2https://arxiv.org/abs/2506.09985https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/https://github.com/facebookresearch/vjepa2Official repository contains model/evaluation resources
One-Step World Modelhttps://arxiv.org/abs/2601.12277https://robotnav-bot.github.io/nav-onestepwm/https://github.com/robotnav-bot/NOWSee official repository
AR Forcinghttps://arxiv.org/abs/2605.31314待补充arXiv 页面称将发布代码,当前先标记待确认待补充
NavWAMhttps://arxiv.org/abs/2606.13494https://dachii-azm.github.io/navwam/待确认官方独立仓库待补充
GWMICCV: https://openaccess.thecvf.com/content/ICCV2025/html/Lu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.htmlhttps://gaussian-world-model.github.io/https://github.com/Gaussian-World-Model/gaussianwm官方仓库仍在持续整理
DreMa / Dream to Manipulatehttps://arxiv.org/abs/2412.14957https://dreamtomanipulate.github.io/https://github.com/leobarcellona/drema_code官方代码已公开
Atlashttps://www.worldlabs.ai/blog/atlashttps://www.worldlabs.ai/暂无公开训练代码Early Access;不是传统会议论文项目

论文定位与影响力

论文学术定位主要贡献类型对我的价值
NWMNavigation World Model 标志性工作大规模生成式 WM、CDiT、视频想象 + 规划理解最前沿 Navigation WM 应该做到什么程度
DINO-WMLatent WM 代表工作不重建 RGB,直接预测预训练视觉特征理解「不生成图像也能做 World Model」
X-MOBILITY机器人导航 WM 代表工作World Model + Policy、Sim2Real、Cross-Embodiment最适合作为第一主 baseline
DreamerNav系统型 WM 导航工作DreamerV3 + 动态导航 + 混合规划学完整机器人科研链条
V-JEPA 2Foundation WM 重要路线大规模视频自监督 + Action-conditioned WM理解 Foundation World Model
One-Step WM实时化路线One-Step generation + planning研究如何把 WM 真正跑实时
AR Forcing长时序稳定性路线缓解 AR rollout 的 train-test mismatch研究 long-horizon prediction
NavWAMWorld Action Model 路线联合 future / value / action chunk观察 WM 是否向 WAM 演化
GWM3D Structured WM / Gaussian WM 代表工作用 3D Gaussian 显式表示并预测未来三维场景理解 Geometry-aware World Model
DreMaCompositional WM / Learnable Digital Twin 代表工作Gaussian Splatting + Physics,用 imagination 生成训练数据理解 WM 不只用于在线规划,也可用于数据生成
AtlasFoundation Spatial World Model统一文本、图像、视频、深度与 3D,做生成、重建和模拟理解现代大型 WM 为什么越来越像 CV / 3D Vision

复现与工程成本

这一表重点用于判断:能不能作为 baseline、算力够不够、复现成本多高、实机链路是否成熟。

论文主要 WM / Backbone规模原论文训练资源数据仿真 / 环境规划 / Policy实机开源成熟度我的复现难度
X-MOBILITYDINOv2 + GRU Probabilistic Latent WM + PolicyWM 主体较小;RGB Diffuser ≈ 962M8 × H100Isaac Sim:160K Random + 100K Nav2 TeacherIsaac SimLearned Action PolicyNova Carter高:Code + Dataset + Checkpoint + TensorRT/ROS2⭐⭐⭐
NWMConditional Diffusion Transformer(CDiT)50M / 200M / 最大 1BXL:8 台 × 8 H100 = 64 × H100RECON / SCAND / TartanDrive / HuRoN / Ego4D 等Offline robot/human navigation datasetsCEM / trajectory ranking / MPC-style planning原论文重点不是完整真机闭环高:Code + Weights⭐⭐⭐⭐⭐
DINO-WMDINOv2 patch feature + ViT predictorPredictor 约 19M(论文配置需进一步逐项核对)原论文未在当前日志中记录明确 GPU 配置Offline trajectoriesPointMaze / PushT / Wall / Reacher 等CEM / gradient planning无移动机器人真机高:Code + checkpoints⭐⭐
DreamerNavDreamerV3 / RSSM中小型1 × RTX 4090 24GB;约 24.79h;495K policy stepsIsaac Sim 在线交互Isaac Sim WarehouseActor-Critic policy + A* global guidanceSpot + Unitree A1中:论文完整,代码需继续确认⭐⭐
V-JEPA 2-ACV-JEPA 2 + Action-Conditioned PredictorViT-L/H/g,最大约 1B 级Foundation-scale,具体训练资源待单独整理>1M hours internet video + robot interaction dataManipulation / video benchmarkslatent-space planningFranka 等 manipulation高:Official repo / models⭐⭐⭐⭐⭐
One-Step WM3D U-Net + spatial-temporal attention待核实待核实Public navigation data + Habitat/MP3D 等Habitat + real robotOptimization-based planning / anchors有实机较高:Paper + Project + Code⭐⭐⭐
AR ForcingDiffusion Navigation WM基于 NWM 类框架待核实RECON / SCAND / HuRoN / TartanDriveOffline navigation datasets保留原 diffusion planning framework待核实中低:目前代码状态需确认⭐⭐⭐⭐
NavWAMDiffusion Transformer World-Action Model待详细整理待核实Simulation pretraining + real-robot adaptationSimulation + real robot直接输出 action chunk,无需默认 CEMDiablo中:Paper + Project 已公开⭐⭐⭐⭐

当前实验室计算资源

GPU Server A

1 × RTX 5090

用途:

  • 单卡开发;
  • 训练 Debug;
  • 小中型 World Model fine-tuning;
  • 单卡 ablation;
  • inference;
  • ONNX / TensorRT;
  • 实机部署前性能测试。

GPU Server B

3 × RTX A6000 48GB

用途:

  • 当前主要训练资源;
  • DDP 多卡训练;
  • World Model fine-tuning;
  • 中型 Transformer / Diffusion;
  • 多组 ablation;
  • 较大 batch;
  • 部分模型并行 / FSDP。

注意:

3 × 48GB != 单进程天然拥有 144GB 显存

需要 DDP / FSDP / model parallel 等方式利用多卡。

GPU Server C

4 × GTX 1080 Ti

用途:

  • 数据预处理;
  • CPU/GPU 混合的数据生成;
  • 传统 baseline;
  • 老模型;
  • 部分仿真任务;
  • 不依赖现代 Tensor Core / BF16 的任务。

不优先用于现代大规模 Transformer / Diffusion 训练。


World Model 放在完整机器人链条中的位置

Sensor / Observation
传感器 / 当前观测
        ↓
Perception / Representation
感知 / 世界表示
        ↓
World Model
世界模型
        ↓
Future Prediction
未来预测
        ↓
Planner / Policy
规划器 / 策略
        ↓
Controller
控制器
        ↓
Robot Command
机器人执行命令

最简单的记忆方式:

  • Computer Vision(计算机视觉,CV):回答“现在世界是什么样”;
  • World Model(世界模型,WM):回答“如果执行某个动作,未来世界会变成什么样”;
  • Planner(规划器) / Policy(策略):回答“我应该做什么动作”;
  • Controller(控制器):把高层动作变成速度、关节或力矩命令。

因此,World Model 的输出通常不等于 cmd_vel。常见输出包括 Future RGB(未来图像)、Future Latent State(未来隐状态)、Future Depth(未来深度)、Future Occupancy(未来占据)、Future 3D Gaussian Scene(未来 3D 高斯场景)、Reward / Value / Risk(奖励 / 价值 / 风险)等。


Renderer / Simulator / Planner 功能分类

Renderer(渲染器)

主要回答:世界看起来会是什么样?

典型输出:RGB、Video、Novel View(新视角)、Depth、3D rendering。更偏 CV / Generative Vision(计算机视觉 / 生成视觉)

Simulator(模拟器)

主要回答:世界在时间和动作作用下会怎样变化?

典型输出:Future State(未来状态)、Future Geometry(未来几何)、Object Pose(物体位姿)、Future Latent(未来隐状态)、Future 3DGS(未来三维高斯)、Reward / Risk / Dynamics(奖励 / 风险 / 动态)。

Planner(规划器)

主要回答:为了达到目标,我应该做什么?

典型输出:Action(动作)、Action Sequence(动作序列)、Trajectory(轨迹)、Velocity Command(速度命令)。

常见术语:

  • CEM(Cross-Entropy Method,交叉熵方法):采样很多候选动作,保留表现更好的,再继续搜索;
  • MPC(Model Predictive Control,模型预测控制):不断向前预测一小段,只执行当前最优动作,然后重新规划;
  • MPPI(Model Predictive Path Integral,模型预测路径积分):一种采样式 MPC;
  • Learned Policy(学习策略):神经网络直接根据状态选择动作;
  • Actor-Critic(演员-评论家):强化学习中的策略学习结构。

按 World Model 输出形式分类

输出类型中文解释代表工作后续怎么决策
Future RGB / Video未来 RGB / 视频,直接“画”未来NWM、One-Step WMCEM / trajectory ranking
Future Latent State未来隐状态,不画图,只预测压缩后的内部表示DINO-WM、X-MOBILITY、V-JEPA 2-AC、DreamerNavCEM / Learned Policy / RL
Future 3D Gaussian Scene未来 3D 高斯场景,显式三维结构GWMImitation Learning / Model-Based RL
Digital Twin Future State数字孪生中的未来状态DreMa生成 imagined demonstrations,再训练 Policy
RGB + Depth + Explicit 3DRGB、深度、点云或 3DGSAtlas当前主要用于 reconstruction / simulation
Future + Action Chunk预测未来的同时直接给出动作序列NavWAM模型自身承担更多 Planner / Policy 功能

**Latent State(隐空间状态)**可以理解成:把复杂图像、三维结构、语义和动态压缩成一组机器可处理的数字特征,人通常不能直接看懂,但模型可以拿它做预测和决策。


按 World Representation(世界表示)分类

World Representation中文代表工作特点
Pixel / Video Latent像素 / 视频隐空间NWM、One-Step WM视觉生成强,但计算量可能较大
Pretrained Visual Feature预训练视觉特征DINO-WM不必重建 RGB,更强调语义特征
Probabilistic Latent State概率隐状态X-MOBILITY、DreamerNav更适合 Policy / RL / 时序状态估计
Explicit 3D Gaussian显式 3D 高斯GWM三维几何结构更明确
Gaussian Digital Twin + Physics高斯数字孪生 + 物理模拟DreMa场景可组合、可变换、可生成训练数据
Unified Spatial Context统一空间上下文Atlas文本、图像、视频、相机位姿、深度、3D 统一建模

按“更偏 CV 还是更偏 Planner / Robotics”分类

不是严格学科划分,只是标记主要创新发生在哪一段。

更偏 CV / 3D Vision                              更偏 Planning / Robotics

Atlas
GWM
DreMa
DINO-WM
NWM ---------------------------- CEM Planning
One-Step WM -------------------- CEM / Optimizer
V-JEPA 2-AC -------------------- Latent Planning
X-MOBILITY --------------------- Learned Policy
DreamerNav --------------------- Model-Based RL
NavWAM ------------------------- World + Action Joint Modeling
工作主要偏向直白解释
AtlasCV / 3D Vision / Spatial Intelligence强项是生成、三维重建、Real-to-Sim 和机器人传感器模拟,不是专门导航 Planner
GWM3D Vision + Simulator最大创新在 3D Gaussian 世界表示和未来三维状态预测
DreMa3D Vision + Simulator + Robot Learning3DGS + Physics 构建数字孪生,再生成 imagined data
DINO-WMCV ↔ Planning 中间前半段用 DINOv2 特征,后半段把未来 latent 用于规划
NWMCV / Video WM → Planning先生成未来视觉,再通过 CEM 选择动作
One-Step WMCV / Video WM → Planning重点是把未来生成做快,再接优化式规划
V-JEPA 2-ACRepresentation Learning → Planningfoundation latent representation + action-conditioned prediction
X-MOBILITYRobot Learning / PolicyWM 学 dynamics,Action Policy 最终输出速度和路径
DreamerNavModel-Based RL / NavigationWM 用于 imagination,Actor-Critic 学导航策略
NavWAMPlanner / Policy 更强不只预测未来,还联合输出 Action Chunk

按 Renderer / Simulator / Planner 重新看这些工作

工作RendererSimulatorPlanner / Policy直白理解
Atlas★★★★★★★★★☆★★☆☆☆强生成 / 重建 / 仿真,当前不是专门导航 Planner
NWM★★★★★★★★★☆★★★☆☆先生成未来视觉,再用 CEM 规划
One-Step WM★★★★☆★★★★☆★★★☆☆把未来视觉生成做得更快,再规划
DINO-WM★☆☆☆☆★★★★☆★★★★☆不画未来图,直接在 latent space 预测并规划
GWM★★★★☆★★★★★★★☆☆☆显式模拟未来 3D Gaussian 世界
DreMa★★★★☆★★★★★★★☆☆☆构建数字孪生,用模拟结果扩充训练数据
V-JEPA 2-AC★☆☆☆☆★★★★☆★★★★☆latent prediction + action-conditioned planning
X-MOBILITY★★☆☆☆★★★★☆★★★★★WM 主要服务 Learned Policy
DreamerNav★☆☆☆☆★★★★☆★★★★★RSSM imagination + Actor-Critic navigation
NavWAM★★★☆☆★★★★☆★★★★★未来预测和动作生成联合

一个统一的五问阅读法

以后看到任何 World Model 论文,优先回答:

  1. Observation(观测)是什么? RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal?
  2. Representation(世界表示)是什么? Pixel、Latent、DINO feature、BEV、Occupancy、3D Gaussian、Digital Twin?
  3. World Model Output(世界模型输出)是什么? Future RGB、Future Latent、Future Occupancy、Future 3DGS、Reward / Risk、Action-conditioned future?
  4. Planner / Policy(规划器 / 策略)怎么决定动作? CEM、MPC、MPPI、Neural Policy、Actor-Critic、World Action Model?
  5. Robot Output(机器人最终输出)是什么? cmd_vel、trajectory、joint position、end-effector pose、action chunk?

当前路线判断

World Model + Policy

代表:

  • X-MOBILITY
  • NavWAM

基本结构:

Observation
    ↓
World Model
    ↓
Latent State
    ↓
Policy
    ↓
Action

特点:

  • 适合真实机器人闭环;
  • 不一定需要每个控制周期进行大量 CEM 搜索;
  • 推理更容易做实时;
  • 容易形成 World Model + robot deployment 的完整故事。

当前判断:

最适合第一篇工作的主路线。


World Model + Planning

代表:

  • Navigation World Models
  • DINO-WM
  • One-Step WM

结构:

Observation
    ↓
World Model
    ↓
Imagine Future
    ↓
CEM / MPC / Optimizer
    ↓
Action

特点:

  • World Model 与 Planner 解耦;
  • 可显式测试 counterfactual actions;
  • 学术上很有 World Model 味;
  • 生成式 WM 往往存在推理延迟;
  • planner 需要大量 candidate rollout 时计算成本很高。

World Model + Model-Based RL

代表:

  • DreamerNav
  • DreamerV3 系列

结构:

Observation
    ↓
RSSM World Model
    ↓
Imagined Rollouts
    ↓
Actor-Critic
    ↓
Policy

特点:

  • latent imagination;
  • sample efficiency;
  • reward design 很重要;
  • training stability 是核心问题;
  • 很适合动态环境与复杂决策;
  • 需要理解 RL,不只是模型结构。

第一主 baseline 候选:X-MOBILITY

基本信息

论文:

X-MOBILITY: End-To-End Generalizable Navigation via World Modeling

Venue:

ICRA 2025

机构:

  • NVIDIA
  • UC Berkeley
  • UT Austin

链接:

方向:

  • World Model
  • Robot Navigation
  • Imitation Learning
  • End-to-End Navigation
  • Sim2Real
  • Cross-Embodiment
  • Edge Deployment

当前定位:

第一主 baseline 候选。

选择原因:

  1. 本身就是移动机器人导航,不需要强行把一个 manipulation WM 改成 navigation;
  2. World Model 与 Action Policy 解耦,适合在 World Model 部分做研究;
  3. 有 Isaac Sim;
  4. Teacher 直接使用 Nav2;
  5. 有 Dataset;
  6. 有 Checkpoint;
  7. 有 ONNX / TensorRT / ROS2 部署链;
  8. 有 Nova Carter 实机;
  9. 算力虽然原论文高,但比从零复现 NWM 1B 更现实;
  10. 和未来 ROS2 / Nav2 / 实机方向高度兼容。

一句话理解

X-MOBILITY 的核心思想:

利用 World Model 学习一个包含环境状态与动态信息的 latent representation,再利用这个 latent state 学习导航 Action Policy。

普通 Behavior Cloning:

Image
  ↓
Network
  ↓
Action

X-MOBILITY:

Image + Robot State
        ↓
    World Model
        ↓
    Latent State
        ↓
   Action Policy
        ↓
      Action

关键区别:

Latent State 不只是为了拟合 teacher action,而是通过 World Modeling 与 multi-task decoder 被迫学习环境与动态信息。


总体网络结构

                     Image
                       ↓
                    DINOv2

Robot State → MLP ─────┤
                       ↓
              Observation Embedding
                       ↓
               State Estimator
                       ↓
                Belief State
                       ↓
               Latent State z
                 ↙     ↓      ↘
                /      │       \
               ↓       ↓        ↓
          RGB Decoder Semantic  Action Policy
                         Decoder      ↓
                                   Velocity
                                     +
                                    Path

另有:

State Predictor

负责:

History
+
Action
  ↓
Future Belief State

World Model 的关键本质:

[ p(s_{t+1}\mid s_t,a_t) ]


Observation Encoder

输入主要包括:

RGB

前视相机图像。

视觉特征:

DINOv2

Robot State

主要包括机器人速度等状态量。

通过:

MLP

编码。

最终:

Image Embedding
+
Robot State Embedding
      ↓
Observation Embedding

State Estimator

输入:

History
+
Previous Action
+
Current Observation

输出 probabilistic belief state。

用于估计:

在已经看到真实 observation 的情况下,当前世界 latent state 应该是什么。


State Predictor

输入:

History
+
Action

不使用未来 observation。

输出:

Predicted Future Belief State

也就是:

如果我执行这个 action,未来 latent world state 会变成什么。

State Predictor 与 State Estimator 之间通过 KL 约束,使预测出来的 latent distribution 接近真实观察得到的 posterior。


Multi-Task Decoder

作者希望 latent state 不是只会拟合 action,因此使用多个 decoder 给 latent state 提供监督。

主要包括:

RGB Reconstruction
+
Semantic Segmentation

RGB Reconstruction 使用 Latent Diffusion Model。

论文 appendix 给出的模型规模中:

RGB Diffuser ≈ 962M

但真正负责 world dynamics 的组件小得多,例如:

State Estimator ≈ 5.5M
State Predictor ≈ 2.3M

这一点非常值得关注:

Navigation World Model 是否真的需要一个近 1B 的 RGB Diffuser?


Action Policy

输入:

Latent State
+
Route Feature

Route 使用:

VectorNet

编码。

之后:

Self-Attention Fusion
        ↓
Action Decoder

输出:

Linear / Angular Velocity
+
Optional Local Path

Policy 使用 imitation learning 学习 teacher。


数据集

训练数据来自 Isaac Sim 中的 Nova Carter。

分为两类。

Random Action Dataset

≈ 160K frames

用途:

World Model pretraining。

核心目标不是学导航,而是尽量探索:

state-action coverage

让 WM 学习:

执行动作后世界怎么变化。

≈ 100K frames

Nav2 在 Isaac Sim 中闭环运行:

Random Start
+
Random Goal
      ↓
Nav2
      ↓
Teacher Trajectory

用途:

World Model
+
Action Policy

联合训练。


Multi-Stage Training

Stage 1:World Model Pretraining

Random Action Dataset
        ↓
World Model

Policy 关闭。

Stage 2:World Model + Action Policy

Nav2 Teacher Dataset
        ↓
World Model + Policy

特点:

World Modeling 与 Policy Learning 解耦。

这可能是 X-MOBILITY 最值得作为 baseline 的设计之一。


原论文计算资源

原始训练配置:

8 × NVIDIA H100

World Model:

100 epochs

World Model + Policy:

100 epochs

Batch:

32

因此不建议第一步直接尝试:

从零 100% 复现 NVIDIA 的完整训练规模。

更现实:

Official Checkpoint
        ↓
Reproduce Evaluation
        ↓
Fine-tuning
        ↓
Modify Module
        ↓
Ablation

推理与 Edge Deployment

作者在:

Jetson AGX Orin

测试推理。

Policy Only:

P50 ≈ 38.6 ms
P95 ≈ 42.0 ms
GPU Memory ≈ 594 MB

Policy + Semantic:

P50 ≈ 55.6 ms
GPU Memory ≈ 804 MB

说明:

真正用于 navigation inference 的主体并没有 962M RGB diffuser 看上去那么夸张。

官方工程链:

PyTorch
   ↓
ONNX
   ↓
TensorRT
   ↓
ROS2
   ↓
Robot

这对未来实机很重要。


Sim2Real

真实平台:

NVIDIA Nova Carter

训练:

Isaac Sim

真实部署:

Zero-Shot Sim2Real

即:

不针对真实实验室环境额外 fine-tune。

实机 benchmark 包括:

Single Obstacle
Multi Obstacles

Normal Lighting
Dark Lighting

论文报告:

Single / Normal    10 / 10
Single / Dark      10 / 10
Multi / Normal      8 / 9
Multi / Dark        8 / 9

Cross-Embodiment

Isaac Sim 中进一步测试:

Nova Carter
Forklift
Unitree Go2
Unitree G1

对应:

Differential Drive
Ackermann
Quadruped
Humanoid

研究意义:

latent representation 与标准化 input/output 是否可以跨 embodiment 泛化。


原论文 Baselines

当前记录:

  • Nav2 Teacher;
  • Behavior Cloning;
  • MILE;
  • X-MOBILITY。

后续需要继续详细整理:

  • 每个 baseline 的 network;
  • 是否使用同一 dataset;
  • 是否 retrain;
  • 训练预算是否一致;
  • open-loop 与 closed-loop 分别怎么比;
  • statistical significance;
  • 是否有 hidden implementation advantage。

Evaluation Metrics

Open-loop:

  • Linear Speed MAE;
  • Angular Speed MAE;
  • Path MAE。

Closed-loop:

  • Success Rate;
  • Weighted Trip Time;
  • Average Absolute Angular Acceleration。

未来自己的论文可以追加:

  • Collision Rate;
  • Minimum Obstacle Distance;
  • Path Length;
  • Navigation Time;
  • SPL;
  • FPS;
  • P50 / P95 latency;
  • GPU memory;
  • Parameters;
  • Energy / power;
  • Dynamic obstacle collision rate;
  • OOD success rate。

当前认为的优点

工程链完整

Isaac Sim
↓
Dataset
↓
World Model
↓
Policy
↓
TensorRT
↓
ROS2
↓
Real Robot

Dataset / Checkpoint / Code 都有

降低复现门槛。

World Model 与 Policy 解耦

非常适合:

保持 Policy Pipeline
      ↓
重点改 WM

这与移动机器人研究非常自然。

可上实机

不是只在 offline benchmark 上比较 prediction metric。


当前认为的不足 / 待验证问题

动态障碍研究仍不充分

作者未来工作明确提到:

需要增加更多 diverse dynamic-obstacle scenes,进一步研究 world model 对 action policy 的作用。

可能的 research question:

X-MOBILITY 的 latent dynamics 在高速、多人、交叉运动动态环境中是否仍然可靠?

感知主要依赖 RGB

当前核心输入:

RGB
+
Robot State

机器人导航还有:

LiDAR
Depth
BEV
Occupancy

待验证:

RGB latent 是否缺少稳定 geometry grounding?

RGB Diffuser 很大

≈ 962M

待验证:

对导航来说,有没有必要生成 / 重建 RGB?

可能替代:

  • Future Latent;
  • Depth;
  • Occupancy;
  • Traversability;
  • Dynamic Motion;
  • Collision Risk。

World Model prediction 与 navigation performance 的因果关系不够直观

必须问:

prediction metric 更好,是否一定带来 closed-loop navigation 更好?

未来 ablation 应该专门分析。


潜在 Research Questions

以下只进入「问题池」,不能直接当作论文创新点。

Dynamic World Modeling

现象候选:

Fast Pedestrian
Crossing Pedestrian
Multi-Agent Interaction
Sudden Appearance

问题:

现有 latent dynamics 是否能可靠预测动态实体?

Multi-Modal World Modeling

候选:

RGB
+
LiDAR / Depth / BEV

问题:

显式 geometry modality 是否提高 OOD、暗光、运动模糊和动态导航鲁棒性?

从:

RGB Reconstruction

转向:

Future Occupancy
Depth
Traversability
Dynamic Motion
Collision Risk

问题:

对 navigation 来说,task-oriented prediction 是否比 photorealistic reconstruction 更有效?

Lightweight World Model

研究:

  • Distillation;
  • Quantization;
  • Efficient temporal model;
  • Decoder pruning / replacement;
  • Adapter;
  • low-rank fine-tuning。

目标:

Lower Latency
Lower VRAM
Similar / Better Navigation SR

Uncertainty-Aware WM

从:

One Future

变为:

P(Future | State, Action)

研究:

uncertainty 是否能用于 risk-aware navigation?


X-MOBILITY 复现 Checklist

  • 通读论文第一遍
  • 画出总体网络图
  • 搞懂 Observation Encoder
  • 搞懂 State Estimator
  • 搞懂 State Predictor
  • 搞懂 KL Loss
  • 搞懂 RGB Decoder
  • 搞懂 Semantic Decoder
  • 搞懂 Route Encoder
  • 搞懂 Action Policy
  • 下载 GitHub
  • 搭建 Docker 环境
  • 下载 official checkpoint
  • 下载 official dataset
  • 跑通官方 inference
  • 跑通 official evaluation
  • 跑通 Isaac Sim demo / 数据链
  • 尝试一次 fine-tuning
  • 记录单卡显存
  • 记录单 iteration 时间
  • 记录多卡训练效率
  • 复现主要 open-loop 指标
  • 复现主要 closed-loop 指标
  • 建 Failure Case Dataset
  • Failure Case Analysis
  • 提出第一个 hypothesis
  • 做最小修改验证 hypothesis
  • 通过后进入正式创新点设计
  • Ablation
  • 与强 baseline 对比
  • TensorRT
  • ROS2
  • 实机

基本信息

论文:

Navigation World Models

Venue:

CVPR 2025 Oral

Best Paper Honorable Mention。

链接:

核心:

Observation
+
Navigation Action
        ↓
Conditional Diffusion Transformer
        ↓
Future Observation
        ↓
CEM / Trajectory Ranking
        ↓
Navigation

模型

核心提出:

CDiT
Conditional Diffusion Transformer

模型公开规模包括:

CDiT/S ≈ 50M
CDiT/B ≈ 200M
CDiT/XL ≈ 1B

最大模型:

≈ 1B

原论文计算资源

CDiT-XL:

8 machines
×
8 H100 / machine
=
64 × H100

这意味着:

不适合当前阶段把 1B XL 从零完整训练作为第一篇论文的必要前置条件。

但:

50M / 200M pretrained model

可以作为以后小规模实验入口。


数据

主要:

  • RECON;
  • SCAND;
  • TartanDrive;
  • HuRoN;
  • Ego4D 等。

特点:

使用机器人、人类 egocentric video 与 navigation action 学世界动态。


Planning

NWM 可以:

Standalone Planning

Sample Candidate Actions
        ↓
NWM Imagine Future
        ↓
Compare Future with Goal
        ↓
CEM
        ↓
Best Action

官方 planning 示例一次可以采:

120 candidate trajectories

这也是它实时部署成本很高的原因之一。

Rank External Policy

也可以:

External Policy
      ↓
Candidate Trajectories
      ↓
NWM Rank
      ↓
Best Trajectory

实时性

原始 NWM 推理较慢。

论文讨论了:

  • Time Skip;
  • Diffusion Distillation;
  • 4-bit Quantization(论文中作为潜在方向)。

这直接说明:

实时 World Model 是该路线的重要研究问题。


已知 Limitation

OOD Mode Collapse

在未知环境 autoregressive rollout 时:

prediction 逐渐丢失当前环境 context,并向训练分布中的场景靠拢。

Pedestrian Temporal Dynamics

论文明确指出:

对 pedestrian motion 等 temporal dynamics 模拟仍然困难。

Long-Horizon Drift

随着 autoregressive rollout 变长:

Error Accumulation

越来越严重。

这些问题后来直接衍生出:

  • AR Forcing;
  • One-Step WM;
  • NavWAM 等新工作。

当前定位

必须精读,但暂时不作为第一篇从零训练主 baseline。

主要用途:

  1. 理解 Navigation World Model 最前沿问题;
  2. 学 Diffusion World Model;
  3. 学 action-conditioned future generation;
  4. 学 CEM planning;
  5. 找 long-horizon / realtime / dynamic motion 的研究问题。

DINO-WM

基本信息

论文:

DINO-WM: World Models on Pre-trained Visual Features Enable Zero-shot Planning

Venue:

ICML 2025

链接:


核心问题

它挑战一个非常重要的问题:

World Model 为什么一定要重建未来 RGB?

DINO-WM:

Image
 ↓
DINOv2
 ↓
Patch Features
 ↓
World Model
 ↓
Future Patch Features
 ↓
Planning

即:

直接在 pretrained visual feature space 预测未来。


重要意义

相比:

World Model
↓
Generate Future RGB

DINO-WM:

World Model
↓
Predict Future Representation

可能具有:

  • 更低计算成本;
  • 更少无关 pixel reconstruction;
  • 更强语义 representation;
  • 更容易用于 task-oriented planning。

这与未来想研究的:

Navigation-Oriented Latent World Model

高度相关。


Tasks

官方代码主要覆盖:

  • PointMaze;
  • PushT;
  • Wall;
  • Reacher 等。

因此:

学术价值很高,但不是最直接的真实移动机器人导航 baseline。


当前定位

Latent World Model 必读论文。

重点看:

  • pretrained representation;
  • patch-level latent dynamics;
  • CEM planning;
  • gradient-based planning;
  • task-agnostic world representation。

DreamerNav

基本信息

论文:

DreamerNav: learning-based autonomous navigation in dynamic indoor environments using world models

Venue:

Frontiers in Robotics and AI,2025

链接:

Backbone:

DreamerV3
+
RSSM

核心

Depth
+
Structured Local Occupancy Map
+
Dynamic Obstacle History
+
Points of Interest
+
A* Global Path
        ↓
DreamerV3 / RSSM
        ↓
Local Navigation Policy

其中:

A*

负责 global guidance;

DreamerV3:

在 latent space 处理动态环境与 local decision。


Training Compute

论文报告:

1 × RTX 4090 24GB
≈ 24.79 h
≈ 495,000 policy steps

相比另外几条路线非常友好。


Simulation

NVIDIA Isaac Sim

动态障碍、warehouse environment、curriculum learning。


Real Robot

平台:

Boston Dynamics Spot
Unitree A1

基本部署:

Real Sensors
   ↓
ROS Node
   ↓
DreamerNav Model
   ↓
Velocity Commands
   ↓
Robot

同一 policy 部署两个 quadruped。


已知 Limitation

论文明确提到:

rapidly approaching dynamic obstacles 下避障策略仍会失败。

作者提出未来:

  • RNN / attention;
  • motion prediction;
  • semantic segmentation;
  • domain randomization;
  • 更多真实环境测试;
  • ablation study。

这篇论文非常适合学习:

一篇机器人硕士型完整论文从问题、方法、仿真、baseline 到实机应该怎么组织。


当前定位

第一篇科研的低风险参考工作。

如果 X-MOBILITY 复现成本高于预期,可退一步从 DreamerNav / DreamerV3 体系建立科研闭环。


V-JEPA 2 / V-JEPA 2-AC

基本信息

论文:

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

链接:


核心路线

V-JEPA 2:

Internet-Scale Video
       ↓
Self-Supervised JEPA
       ↓
World Representation

V-JEPA 2-AC:

V-JEPA 2 Representation
        +
Robot Action
        ↓
Action-Conditioned Predictor
        ↓
Future Latent State
        ↓
Planning

数据规模

论文使用超过:

1 million hours

互联网视频做大规模预训练。

随后使用较少 robot interaction data 进行 action-conditioned post-training。


与当前课题关系

目前机器人实验主要偏:

Manipulation

而不是移动导航。

因此:

不适合作为第一主 baseline,但必须关注 Foundation World Model 如何做预训练 + robot post-training。


当前定位

重点学习:

  • JEPA;
  • Self-supervised representation learning;
  • Foundation video model;
  • Action-conditioned post-training;
  • latent planning;
  • 大模型预训练与机器人小数据适配。

One-Step World Model

基本信息

论文:

An Efficient and Multi-Modal Navigation System with One-Step World Model

链接:

机构包括:

  • Tsinghua University;
  • Xiaomi Robotics Lab。

解决的问题

针对传统 Navigation WM:

Multi-Step Diffusion
+
Autoregressive Frame Generation
        ↓
High Latency

提出:

One-Step Generation

Backbone

3D U-Net
+
Efficient Spatial-Temporal Attention

目标:

在保留 future imagination 能力的同时,大幅降低推理延迟。


结合:

Optimization-Based Planning
+
Anchor-Based Initialization

支持:

  • Image Goal;
  • Language Goal;
  • Point Goal。

当前定位

实时 World Model 必读工作。

如果以后基于 X-MOBILITY 做 lightweight / realtime WM,要重点对比。


AR Forcing

基本信息

论文:

AR Forcing: Towards Long-Horizon Robot Navigation World Model

链接:


问题

很多 Diffusion Navigation WM:

训练:

Ground Truth Context

推理:

Model Generated Context

于是:

Train-Test Distribution Shift
        ↓
Autoregressive Error Accumulation
        ↓
Long-Horizon Instability

方法

核心:

Autoregressive Training

训练时显式把模型自己的 prediction 重新放入 context。

目的:

让模型在训练阶段就暴露于真正 inference 时会遇到的 state distribution。


Dataset

包括:

  • RECON;
  • SCAND;
  • HuRoN;
  • TartanDrive。

与 NWM 系导航数据高度重合。


当前定位

NWM long-horizon problem 的重要 follow-up。

重点研究:

  • exposure bias;
  • autoregressive rollout;
  • diffusion training;
  • long-horizon navigation consistency。

基本信息

论文:

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

链接:


核心问题

传统 Navigation WM:

Observation
   ↓
World Model
   ↓
Future
   ↓
External Planner / CEM
   ↓
Action

问题:

future prediction 本身不能直接执行,还需要 expensive planning。


Observation + Goal
        ↓
World Action Model
        ↓
Future Observation
+
Goal Progress
+
Action Chunk
        ↓
Closed-Loop Action

核心:

把「预测未来」与「决定动作」联合建模。


实机

使用:

Diablo mobile robot

并进行:

Simulation Pretraining
+
Real-Robot Adaptation

当前定位

用来观察 World Model 是否正在从「预测模型」演化到「World Action Model」。

这可能是未来非常重要的方向:

WM
↓
WAM

GWM:Towards Scalable Gaussian World Models for Robotic Manipulation

基本信息

Venue:ICCV 2025。 ICCV(International Conference on Computer Vision,国际计算机视觉大会)属于计算机视觉领域第一梯队顶会。

链接:

一句话理解

GWM 的重点不是简单改变传感器输入,而是把 World Representation(世界表示)换成具有显式三维几何结构的 3D Gaussian,并预测动作作用后的 Future Gaussian Scene(未来高斯场景)。

核心结构

Current RGB Image(s)
        ↓
3D Reconstruction / Lifting
三维重建 / 提升
        ↓
Gaussian Splats
3D 高斯场景
        ↓
3D Variational Autoencoder
3D 变分自编码器
        ↓
Compact Gaussian Latent
        ↓
Latent Diffusion Transformer
隐空间扩散 Transformer
+
Robot Action
        ↓
Future Gaussian Latent
        ↓
Future 3D Gaussian Scene
未来 3D 高斯场景

Gaussian Splatting(高斯泼溅 / 3DGS):用大量带位置、大小、方向、颜色和透明度的三维高斯椭球表示场景。

World Model 输出

主要是 Future 3D Gaussian Scene(未来 3D 高斯场景),不是直接 cmd_vel

怎么用于机器人

  • Imitation Learning(模仿学习):用 GWM 学到的 3D representation 帮助 policy;
  • Model-Based Reinforcement Learning(基于模型强化学习):把 GWM 当 Neural Simulator(神经网络模拟器)产生 imagined rollouts。

实机

项目页展示 Franka Emika FR3 + Panda Gripper + RealSense D435i,真实观测使用第三视角 RGB-only 图像。因此 GWM 的关键创新是内部 3D representation 与 dynamics prediction,而不是单纯“加深度输入”。

当前定位

3D Structured World Model / Geometry-Aware World Model / Simulator-oriented WM,更偏 3D Vision + Simulator


DreMa:Dream to Manipulate

基本信息

全名: Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination

Venue:ICLR 2025。 ICLR(International Conference on Learning Representations,国际学习表征会议)属于机器学习 / 深度学习第一梯队顶会。

链接:

一句话理解

DreMa 把 World Model 做成 Learnable Digital Twin(可学习数字孪生),用 3D Gaussian Splatting + Physics Simulator 显式复制真实场景,然后在里面“做梦”,自动生成新的机器人训练示范。

Compositional World Model(组合式世界模型)

**Compositional(组合式)**表示场景中的物体、机器人和环境可以单独移动、变换和重新组合,而不只是作为一整张不可拆分的图像存在。

Few Real Demonstrations
少量真实示范
        ↓
Learnable Digital Twin
可学习数字孪生
        ↓
改变物体 / 目标 / 场景配置
        ↓
Physics Simulation
物理模拟
        ↓
Imagined Demonstrations
想象出来的新示范
        ↓
Imitation Learning
模仿学习
        ↓
Robot Policy

核心用途

DreMa 不是主要做在线路径规划,而是:

World Model → Imagination → Data Generation → Policy Learning

实机

使用 Franka Emika Panda,并展示 one-shot policy learning(单样本策略学习):某些任务变化只需一个真实示范,再依靠 imagination 扩充训练数据。

当前定位

3D Structured WM + Learnable Digital Twin + Compositional WM + Data Generation for Imitation Learning,更偏 Simulator + Robot Learning


Atlas:A World Model for Spatial Intelligence

基本信息

发布方:World Labs

时间:2026-09-01

状态: World Labs Research Release / Product Research Model,不是目前意义上的 CVPR / ICML / ICLR 正式会议论文

链接:

一句话理解

Atlas 是面向 Spatial Intelligence(空间智能)的通用多模态 World Model,统一处理文本、图像、视频、相机位姿、深度和 3D,并进行世界生成、三维重建和时空模拟。

Spatial Intelligence(空间智能)

指 AI 不只知道“图像里有什么”,还理解物体在哪里、空间结构是什么、换视角会看到什么,以及世界如何随时间和动作变化。

Model Architecture(模型架构)

官方描述为:

Multimodal Autoregressive Diffusion Transformer(多模态自回归扩散 Transformer)

目前可处理 Text(文本)、Image(图像)、Camera Pose(相机位姿)、Depth Map(深度图)、Video(视频序列)以及 3D spatial context(三维空间上下文)。

Atlas 能输出什么

官方展示了:

RGB Image / Video
+
Depth
+
Point Cloud
+
3D Gaussian Splats

所以 Atlas 不只是“输出图像”,也可以产生 explicit 3D representation(显式三维表示)。

Robotics Simulation(机器人仿真)

真实环境手机视频
        ↓
Atlas
        ↓
3D Reconstruction
三维重建
        ↓
Virtual Robot 沿给定路径运动
        ↓
Atlas 生成机器人将看到的 RGB + Depth

这里要特别注意:当前公开演示更接近 Path → Atlas → Future Observation,而不是 Atlas → Path 因此 Atlas 当前不是专门的导航 Planner。

当前定位

Foundation World Model / Spatial Intelligence Model(基础世界模型 / 空间智能模型),目前更偏 CV + 3D Vision + Generative Model + Simulator


统一论文阅读模板

以后每篇新论文都复制下面模板。

基本信息

Title:

Authors:

Venue:

Year:

Organization:

Paper:

arXiv:

Project:

GitHub:

Model:

Dataset:

Citation / BibTeX:


一句话概括


它解决什么问题


为什么旧方法不行


核心假设


Observation / Input(观测 / 输入)


World Representation(世界表示)

记录模型内部怎么表示世界:Pixel / Video latent、DINO feature、RSSM latent、BEV / Occupancy、3D Gaussian、Explicit Digital Twin 等。


World Model Output(世界模型输出)

明确记录:Future RGB / Video、Future Latent、Future Depth、Future Occupancy、Future 3DGS、Reward / Value / Risk、Action Chunk 等。


Renderer / Simulator / Planner 定位

Renderer:
Simulator:
Planner / Policy:

CV ↔ Robotics 定位

记录论文主要创新更偏 CV / 3D Vision,还是更偏 Planning / Policy / Robotics。


最终 Robot Output(机器人执行输出)

例如 cmd_vel、vx / vy / wz、trajectory、joint position、end-effector pose、action chunk。


World Model 定义


Backbone


参数量


Pretrained Model


Dataset


Training Pipeline


Loss


Optimizer / LR / Batch


Training Compute

记录:

GPU:
GPU 数量:
GPU 显存:
训练时间:
Epoch / Steps:
Precision:
Multi-GPU Strategy:

Inference Compute

记录:

Device:
P50 Latency:
P95 Latency:
FPS:
VRAM:
Power:

Planner / Policy


与 Nav2 / ROS 的关系


Simulation

记录:

Simulator:
Robot:
Sensor:
Scene:
Dynamic Obstacle:
Domain Randomization:
Control Frequency:

Real Robot

记录:

Robot:
Compute:
Sensor:
ROS / ROS2:
Control Output:
Environment:
Number of Trials:
Success Rate:
是否 Fine-tune:
是否 Zero-Shot Sim2Real:

Baselines


Metrics


Main Results


Ablation


Failure Cases


Limitations


Authors' Future Work


我认为的潜在问题


和已有工作的差异


是否适合当我的 baseline

评分:

代码完整度:
数据完整度:
Checkpoint:
算力可承受:
复现难度:
移动机器人相关性:
实机难度:
创新空间:

复现结论


Research Question 池

这里只存「问题」,不直接写成“我的创新点”。

模板

问题名称:

来源论文:

现象:

证据:

可能原因:

已有方法怎么做:

为什么现有方法还不够:

我的 Hypothesis:

最小验证实验:

需要的 Baseline:

需要的 Dataset:

需要的 Compute:

可能失败原因:

状态:

未验证 / 初步验证 / 值得继续 / 放弃

创新点候选池

只有经过最小实验支持的 Research Question 才进入这里。

Idea来源ProblemHypothesis修改位置Main ExperimentAblationCompute风险状态
Dynamic WMX-MOBILITY高速/多人动态障碍可能预测弱显式 temporal motion modeling 能改善闭环避障State Predictor / DecoderDynamic Navigationw/o motion module待验证
Multi-Modal WMX-MOBILITYRGB geometry 不稳定RGB + LiDAR/Depth 提高鲁棒性Encoder / FusionOOD / dark / blur / dynamicRGB only / LiDAR only / Fusion待验证
Navigation-Oriented WMX-MOBILITY / DINO-WMRGB reconstruction 成本高且可能与导航弱相关task-oriented latent/occupancy 更高效Decoder / RepresentationSR + latencyRGB vs latent vs occupancy待验证
Lightweight WMX-MOBILITY / NWM / One-StepWM 实时性差distillation / one-step / pruning 可保性能降成本WM / DecoderFPS / SR / VRAM各压缩组件待验证
Long-Horizon WMNWM / AR ForcingAR rollout driftAR-aware training 降低 exposure biasTraining Objective2/4/8/16s rolloutteacher context vs AR context待验证
Uncertainty-Aware WMX-MOBILITY / Dreamer单一未来不足显式 uncertainty 可用于 risk-aware navigationLatent distribution / Policydynamic collisiondeterministic vs uncertainty中高待验证

Failure Case 日志

YYYY-MM-DD:实验名称

Model:

Checkpoint:

Environment:

Input:

Expected:

Actual:

是否稳定复现:

失败类型:

  • perception
  • world prediction
  • long-horizon drift
  • planner
  • policy
  • sim2real
  • latency
  • localization
  • sensor
  • control
  • other

初步原因:

需要做的对照实验:

是否形成 Research Question:


实验结果日志

YYYY-MM-DD:Experiment ID

Goal:

Git Commit:

Config:

Dataset:

GPU:

Seed:

Training Time:

Metrics:

MetricBaselineOursDelta

结论:

是否支持 Hypothesis:

下一步:


每日工作日志

YYYY-MM-DD

今日目标:

今日阅读:

今日实验:

今天搞明白的问题:

仍然不理解:

Failure Case:

新的 Research Question:

新的 Idea:

下一步:


阶段性目标

阶段 A:建立方向认知

  • 精读 X-MOBILITY
  • 精读 NWM
  • 精读 DINO-WM
  • 阅读 DreamerNav
  • 阅读 One-Step WM
  • 阅读 AR Forcing
  • 阅读 NavWAM
  • 精读 GWM
  • 阅读 DreMa / Dream to Manipulate
  • 阅读 Atlas 官方技术说明
  • 理解 Renderer / Simulator / Planner 分类
  • 理解 RGB / Latent / 3DGS 等不同 WM 输出
  • 理解 World Model + Policy
  • 理解 World Model + Planning
  • 理解 Dreamer / RSSM

阶段 B:建立 Baseline

  • 跑通 X-MOBILITY official checkpoint
  • 跑通 official evaluation
  • 下载并检查 dataset
  • 跑一次 fine-tuning
  • 记录真实 compute cost
  • 在本实验室 GPU 上建立可复现配置

阶段 C:Failure Case Analysis

  • static
  • cluttered
  • narrow corridor
  • dark
  • motion blur
  • fast dynamic obstacle
  • crossing pedestrian
  • multi-agent
  • OOD environment
  • long-horizon

阶段 D:Research Question

  • 选择一个稳定 failure
  • 找到可能原因
  • 查 related work
  • 提出 hypothesis
  • 做最小验证

阶段 E:第一篇论文

  • Baselines
  • Ours
  • Main experiments
  • Ablation
  • Efficiency
  • Simulation
  • Real robot
  • Figures
  • Tables
  • Writing
  • Submission
音乐页