[{"data":1,"prerenderedAt":5814},["ShallowReactive",2],{"page-\u002Fen-us\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":3,"surrounding-\u002Fen-us\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":5792,"language-switcher-data-\u002Fen-us\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":5798,"blog-i18n-paths-\u002Fen-us\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":5813},{"id":4,"title":5,"body":6,"canonicalPath":5779,"chapterDepth":5780,"chapterOrder":5780,"date":5781,"description":548,"docI18nKey":5780,"docKey":5780,"docRoot":5780,"docTitle":5780,"extension":5782,"i18nKey":5783,"isBlogPost":2513,"isWikiDoc":5784,"isWikiIndex":5784,"layout":5780,"legacyPath":5780,"locale":5785,"localeSlug":5786,"meta":5787,"navigation":2513,"path":5779,"seo":5788,"sourcePath":5789,"sourceStem":5783,"stem":5790,"wikiDepth":5780,"__hash__":5791},"content\u002F_i18n\u002Fen-us\u002Fposts\u002F2026-09-02-WM论文罗列.md","WM论文日志",{"type":7,"value":8,"toc":5591},"minimark",[9,13,22,25,47,52,60,65,70,75,80,85,88,94,100,106,112,118,124,130,133,136,139,157,169,178,187,193,202,211,220,229,238,244,246,249,252,300,327,336,346,355,365,367,370,373,380,385,393,396,399,402,405,408,413,419,424,426,429,438,441,458,474,483,496,502,514,519,531,533,536,541,552,555,560,565,570,575,586,590,596,598,603,608,616,621,626,631,634,640,643,647,653,655,660,665,670,675,680,685,688,690,694,700,703,711,719,727,735,745,747,750,754,760,766,770,775,778,782,787,790,793,801,809,817,825,833,835,839,842,852,862,871,880,889,898,901,903,907,910,913,916,919,922,925,928,930,934,939,945,948,957,965,973,978,983,988,999,1007,1015,1017,1021,1024,1030,1035,1040,1045,1050,1055,1063,1071,1073,1076,1079,1087,1095,1103,1111,1122,1124,1127,1130,1133,1139,1142,1148,1151,1156,1161,1166,1171,1174,1181,1183,1187,1189,1197,1200,1206,1208,1213,1218,1223,1228,1233,1235,1238,1240,1247,1249,1255,1257,1268,1273,1278,1283,1285,1289,1292,1297,1300,1305,1307,1312,1323,1328,1364,1369,1391,1396,1403,1406,1411,1416,1421,1426,1431,1436,1441,1447,1453,1459,1461,1464,1467,1472,1475,1481,1484,1490,1493,1498,1500,1503,1509,1512,1518,1521,1527,1530,1533,1535,1539,1542,1547,1550,1553,1559,1563,1566,1569,1575,1578,1581,1587,1589,1593,1596,1602,1605,1608,1613,1615,1619,1621,1627,1630,1633,1639,1642,1647,1650,1652,1656,1659,1662,1668,1671,1674,1680,1683,1689,1692,1699,1701,1705,1707,1713,1716,1722,1724,1727,1733,1735,1741,1744,1746,1749,1752,1755,1759,1765,1767,1772,1775,1781,1784,1789,1793,1799,1802,1808,1810,1816,1819,1821,1825,1829,1835,1838,1842,1848,1850,1855,1858,1860,1863,1866,1872,1875,1881,1884,1889,1892,1898,1901,1906,1909,1915,1917,1921,1924,1930,1933,1936,1942,1945,1951,1954,1959,1962,1968,1971,1973,1976,1979,1985,1988,1994,1997,2003,2006,2011,2014,2020,2023,2029,2031,2034,2037,2043,2046,2052,2055,2060,2062,2066,2069,2083,2086,2091,2096,2101,2106,2111,2119,2121,2125,2128,2139,2142,2153,2156,2194,2196,2199,2202,2208,2212,2215,2219,2222,2228,2232,2235,2238,2241,2243,2247,2250,2253,2258,2261,2266,2270,2273,2279,2282,2288,2291,2296,2300,2306,2308,2313,2316,2336,2340,2343,2348,2351,2353,2357,2362,2366,2369,2375,2378,2383,2387,2390,2396,2398,2403,2407,2410,2416,2419,2425,2427,2432,2436,2439,2459,2462,2468,2472,2474,2480,2483,2489,2491,2496,2498,2502,2516,2525,2534,2543,2552,2561,2570,2579,2588,2597,2606,2615,2624,2633,2642,2651,2660,2669,2678,2687,2696,2705,2714,2723,2738,2747,2756,2771,2792,2794,2797,2800,2804,2806,2810,2813,2816,2820,2847,2852,2858,2860,2863,2866,2872,2875,2881,2884,2890,2892,2895,2898,2904,2907,2912,2915,2921,2924,2926,2929,2932,2949,2951,2956,2958,2962,2965,2969,2975,2978,2984,2987,2991,2994,3000,3002,3006,3009,3012,3023,3026,3031,3033,3037,3041,3044,3049,3053,3056,3061,3065,3068,3074,3077,3080,3091,3093,3096,3103,3106,3111,3116,3121,3126,3131,3133,3136,3139,3143,3146,3150,3152,3156,3176,3178,3181,3184,3189,3192,3198,3200,3205,3207,3210,3213,3219,3221,3227,3230,3235,3240,3245,3250,3253,3259,3262,3264,3268,3271,3285,3288,3293,3295,3298,3305,3308,3325,3327,3330,3333,3337,3340,3344,3347,3351,3374,3379,3385,3387,3390,3396,3399,3405,3408,3411,3416,3418,3422,3424,3430,3433,3435,3439,3445,3448,3450,3454,3457,3463,3466,3472,3475,3477,3480,3483,3488,3491,3508,3513,3516,3521,3523,3526,3533,3536,3538,3541,3544,3548,3551,3555,3577,3579,3582,3585,3591,3594,3600,3602,3605,3608,3614,3617,3620,3622,3625,3628,3634,3637,3639,3644,3646,3649,3652,3672,3674,3677,3680,3684,3687,3691,3711,3714,3722,3724,3728,3731,3737,3740,3746,3748,3752,3758,3760,3765,3767,3771,3774,3780,3783,3794,3796,3799,3806,3809,3811,3814,3817,3821,3824,3828,3839,3841,3844,3847,3849,3855,3858,3864,3867,3873,3875,3879,3881,3887,3890,3893,3898,3900,3904,3907,3918,3921,3923,3926,3931,3934,3948,3950,3953,3956,3960,3963,3967,3981,3983,3986,3989,3995,3997,4002,4004,4007,4013,4015,4020,4022,4025,4028,4034,4037,4043,4045,4048,4053,4056,4062,4064,4068,4071,4077,4081,4102,4105,4112,4115,4121,4127,4131,4140,4143,4151,4159,4162,4165,4168,4178,4180,4184,4187,4193,4199,4203,4230,4233,4240,4244,4247,4253,4256,4259,4266,4269,4272,4275,4285,4287,4291,4294,4299,4304,4313,4317,4340,4343,4350,4354,4357,4361,4364,4371,4374,4378,4381,4387,4390,4394,4400,4414,4417,4428,4430,4433,4436,4439,4444,4449,4453,4458,4463,4468,4473,4478,4483,4488,4493,4498,4500,4503,4505,4507,4510,4512,4515,4517,4520,4522,4526,4528,4532,4535,4537,4541,4544,4546,4550,4556,4558,4562,4565,4567,4571,4577,4579,4583,4585,4588,4590,4593,4595,4599,4601,4604,4606,4610,4612,4616,4618,4622,4624,4627,4630,4636,4638,4642,4644,4650,4652,4656,4658,4662,4664,4667,4669,4675,4677,4680,4682,4688,4690,4694,4696,4700,4702,4706,4708,4712,4714,4718,4720,4724,4726,4730,4732,4735,4737,4740,4742,4746,4749,4755,4757,4760,4762,4766,4771,4774,4779,4784,4789,4794,4799,4804,4809,4814,4819,4824,4829,4834,4839,4843,4849,4851,4854,4859,4862,4865,4868,4871,4874,4877,4880,4882,4886,4890,4894,4899,4904,4909,4914,4919,4924,4929,4998,5003,5008,5013,5015,5018,5022,5027,5032,5037,5041,5046,5051,5056,5061,5098,5103,5108,5113,5115,5118,5122,5127,5131,5136,5140,5145,5149,5154,5158,5163,5167,5172,5176,5181,5185,5190,5194,5198,5202,5204,5207,5211,5220,5229,5238,5247,5256,5265,5274,5283,5292,5301,5310,5319,5328,5337,5346,5350,5359,5367,5376,5385,5394,5403,5407,5470,5474,5483,5492,5501,5510,5519,5523],[10,11,12],"h2",{"id":12},"使用说明",[14,15,16,17,21],"p",{},"本文用于长期记录 ",[18,19,20],"strong",{},"World Model（WM）在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析","。",[14,23,24],{},"当前重点关注：",[26,27,28,32,35,38,41,44],"ul",{},[29,30,31],"li",{},"Navigation World Model",[29,33,34],{},"Latent World Model",[29,36,37],{},"World Model + Policy",[29,39,40],{},"World Model + Model-Based RL",[29,42,43],{},"World Model + MPC \u002F CEM \u002F MPPI",[29,45,46],{},"动态障碍预测与导航",[26,48,49],{},[29,50,51],{},"World Model 实时化与轻量化",[26,53,54,57],{},[29,55,56],{},"Sim2Real",[29,58,59],{},"ROS2 \u002F Nav2 \u002F 实机部署",[26,61,62],{},[29,63,64],{},"3D Structured World Model（3D 结构化世界模型）",[26,66,67],{},[29,68,69],{},"Gaussian World Model（高斯世界模型）",[26,71,72],{},[29,73,74],{},"Learnable Digital Twin（可学习数字孪生）",[26,76,77],{},[29,78,79],{},"Renderer \u002F Simulator \u002F Planner 功能分类",[26,81,82],{},[29,83,84],{},"World Model 的输入、世界表示、输出与决策模块之间的关系",[14,86,87],{},"当前阶段的目标不是立即确定创新点，而是：",[89,90,91],"ol",{},[29,92,93],{},"建立 World Model + Navigation 方向的论文谱系；",[89,95,97],{"start":96},2,[29,98,99],{},"找到适合作为第一篇工作的强 baseline；",[89,101,103],{"start":102},3,[29,104,105],{},"完整复现至少一个 baseline；",[89,107,109],{"start":108},4,[29,110,111],{},"分析 failure case 和 limitation；",[89,113,115],{"start":114},5,[29,116,117],{},"从实际问题中寻找 research question；",[89,119,121],{"start":120},6,[29,122,123],{},"再把 research question 转化为可验证的创新点；",[89,125,127],{"start":126},7,[29,128,129],{},"最终完成仿真、消融、对比和实机闭环实验。",[131,132],"hr",{},[10,134,135],{"id":135},"论文目录",[14,137,138],{},"|论文|Venue \u002F 状态|核心路线|与移动导航关系|当前定位|阅读优先级|",[14,140,141,142,145,146,149,150,145,153,156],{},"|---|---|---|---|---|---|\n|",[18,143,144],{},"X-MOBILITY","|",[18,147,148],{},"ICRA 2025","|Latent WM + Policy|",[18,151,152],{},"直接相关",[18,154,155],{},"第一主 baseline 候选","|⭐⭐⭐⭐⭐|",[14,158,145,159,145,162,165,166,168],{},[18,160,161],{},"Navigation World Models（NWM）",[18,163,164],{},"CVPR 2025 Oral \u002F Best Paper Honorable Mention","|Diffusion Video WM + Planning|",[18,167,152],{},"|Navigation WM 标志性工作|⭐⭐⭐⭐⭐|",[14,170,145,171,145,174,177],{},[18,172,173],{},"DINO-WM",[18,175,176],{},"ICML 2025","|Pretrained Visual Latent WM + Planning|间接相关|Latent WM 核心参考|⭐⭐⭐⭐⭐|",[14,179,145,180,183,184,186],{},[18,181,182],{},"DreamerNav","|Frontiers in Robotics and AI 2025|DreamerV3 + Model-Based RL|",[18,185,152],{},"|学习完整机器人论文流程|⭐⭐⭐⭐|",[14,188,145,189,192],{},[18,190,191],{},"V-JEPA 2 \u002F V-JEPA 2-AC","|2025 Research Release \u002F arXiv|Foundation Video WM + Action Conditioning|当前偏 Manipulation|Foundation WM 核心参考|⭐⭐⭐⭐|",[14,194,145,195,198,199,201],{},[18,196,197],{},"One-Step World Model","|2026 arXiv|One-Step Video WM + Optimization Planning|",[18,200,152],{},"|实时化重要工作|⭐⭐⭐⭐⭐|",[14,203,145,204,207,208,210],{},[18,205,206],{},"AR Forcing","|2026 arXiv|Autoregressive Training for Navigation WM|",[18,209,152],{},"|长时序预测重要工作|⭐⭐⭐⭐|",[14,212,145,213,216,217,219],{},[18,214,215],{},"NavWAM","|2026 arXiv|World Model + Action Model|",[18,218,152],{},"|WM → World Action Model 新路线|⭐⭐⭐⭐|",[14,221,145,222,145,225,228],{},[18,223,224],{},"GWM",[18,226,227],{},"ICCV 2025","|3D Gaussian WM + Diffusion Transformer|当前偏 Manipulation|3D \u002F Geometry-aware WM 代表工作|⭐⭐⭐⭐⭐|",[14,230,145,231,145,234,237],{},[18,232,233],{},"DreMa \u002F Dream to Manipulate",[18,235,236],{},"ICLR 2025","|Gaussian Digital Twin + Physics + Imagination|当前偏 Manipulation|组合式 WM \u002F 数据生成重要工作|⭐⭐⭐⭐⭐|",[14,239,145,240,243],{},[18,241,242],{},"Atlas","|World Labs 2026 Research Release|Omni WM：Generation + Reconstruction + Simulation|当前偏 Spatial Intelligence \u002F Simulation|Foundation Spatial WM 重要参考|⭐⭐⭐⭐⭐|",[131,245],{},[10,247,248],{"id":248},"论文链接总表",[14,250,251],{},"|论文|Paper \u002F arXiv|Project|GitHub \u002F Code|Models \u002F Dataset|",[14,253,254,255,145,257,264,265,269,270,275,276,145,279,275,284,145,286,291,292,145,294,299],{},"|---|---|---|---|---|\n|",[18,256,144],{},[258,259,263],"a",{"href":260,"rel":261},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2410.17491%7Chttps:\u002F\u002Fnvlabs.github.io\u002FX-MOBILITY\u002F%7Chttps:\u002F\u002Fgithub.com\u002FNVlabs\u002FX-MOBILITY%7CModel",[262],"nofollow","https:\u002F\u002Farxiv.org\u002Fabs\u002F2410.17491|https:\u002F\u002Fnvlabs.github.io\u002FX-MOBILITY\u002F|https:\u002F\u002Fgithub.com\u002FNVlabs\u002FX-MOBILITY|Model",": ",[258,266,267],{"href":267,"rel":268},"https:\u002F\u002Fhuggingface.co\u002Fnvidia\u002FX-Mobility",[262]," ；Dataset: ",[258,271,274],{"href":272,"rel":273},"https:\u002F\u002Fhuggingface.co\u002Fdatasets\u002Fnvidia\u002FX-Mobility%7C",[262],"https:\u002F\u002Fhuggingface.co\u002Fdatasets\u002Fnvidia\u002FX-Mobility|","\n|",[18,277,278],{},"Navigation World Models",[258,280,283],{"href":281,"rel":282},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.03572%7Chttps:\u002F\u002Fwww.amirbar.net\u002Fnwm\u002F%7Chttps:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fnwm%7Chttps:\u002F\u002Fhuggingface.co\u002Ffacebook\u002Fnwm%7C",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.03572|https:\u002F\u002Fwww.amirbar.net\u002Fnwm\u002F|https:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fnwm|https:\u002F\u002Fhuggingface.co\u002Ffacebook\u002Fnwm|",[18,285,173],{},[258,287,290],{"href":288,"rel":289},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2411.04983%7Chttps:\u002F\u002Fdino-wm.github.io\u002F%7Chttps:\u002F\u002Fgithub.com\u002Fgaoyuezhou\u002Fdino_wm%7CCheckpoints",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2411.04983|https:\u002F\u002Fdino-wm.github.io\u002F|https:\u002F\u002Fgithub.com\u002Fgaoyuezhou\u002Fdino_wm|Checkpoints"," \u002F data instructions are in the official GitHub repository|\n|",[18,293,182],{},[258,295,298],{"href":296,"rel":297},"https:\u002F\u002Fdoi.org\u002F10.3389\u002Ffrobt.2025.1655171%7Chttps:\u002F\u002Fwww.frontiersin.org\u002Fjournals\u002Frobotics-and-ai\u002Farticles\u002F10.3389\u002Ffrobt.2025.1655171\u002Ffull%7C%E6%9A%82%E6%9C%AA%E8%AE%B0%E5%BD%95%E5%88%B0%E5%8F%AF%E9%9D%A0%E7%9A%84%E5%AE%98%E6%96%B9%E7%8B%AC%E7%AB%8B%E4%BB%A3%E7%A0%81%E4%BB%93%E5%BA%93%7CPaper",[262],"https:\u002F\u002Fdoi.org\u002F10.3389\u002Ffrobt.2025.1655171|https:\u002F\u002Fwww.frontiersin.org\u002Fjournals\u002Frobotics-and-ai\u002Farticles\u002F10.3389\u002Ffrobt.2025.1655171\u002Ffull|暂未记录到可靠的官方独立代码仓库|Paper"," states raw data will be made available; details need further verification|",[14,301,145,302,145,305,310,311,145,313,318,319,145,321,326],{},[18,303,304],{},"V-JEPA 2",[258,306,309],{"href":307,"rel":308},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2506.09985%7Chttps:\u002F\u002Fai.meta.com\u002Fblog\u002Fv-jepa-2-world-model-benchmarks\u002F%7Chttps:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fvjepa2%7COfficial",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2506.09985|https:\u002F\u002Fai.meta.com\u002Fblog\u002Fv-jepa-2-world-model-benchmarks\u002F|https:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fvjepa2|Official"," repository contains model\u002Fevaluation resources|\n|",[18,312,197],{},[258,314,317],{"href":315,"rel":316},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2601.12277%7Chttps:\u002F\u002Frobotnav-bot.github.io\u002Fnav-onestepwm\u002F%7Chttps:\u002F\u002Fgithub.com\u002Frobotnav-bot\u002FNOW%7CSee",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2601.12277|https:\u002F\u002Frobotnav-bot.github.io\u002Fnav-onestepwm\u002F|https:\u002F\u002Fgithub.com\u002Frobotnav-bot\u002FNOW|See"," official repository|\n|",[18,320,206],{},[258,322,325],{"href":323,"rel":324},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2605.31314%7C%E5%BE%85%E8%A1%A5%E5%85%85%7CarXiv",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2605.31314|待补充|arXiv"," 页面称将发布代码，当前先标记待确认|待补充|",[14,328,145,329,145,331],{},[18,330,215],{},[258,332,335],{"href":333,"rel":334},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.13494%7Chttps:\u002F\u002Fdachii-azm.github.io\u002Fnavwam\u002F%7C%E5%BE%85%E7%A1%AE%E8%AE%A4%E5%AE%98%E6%96%B9%E7%8B%AC%E7%AB%8B%E4%BB%93%E5%BA%93%7C%E5%BE%85%E8%A1%A5%E5%85%85%7C",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.13494|https:\u002F\u002Fdachii-azm.github.io\u002Fnavwam\u002F|待确认官方独立仓库|待补充|",[14,337,145,338,340,341],{},[18,339,224],{},"|ICCV: ",[258,342,345],{"href":343,"rel":344},"https:\u002F\u002Fopenaccess.thecvf.com\u002Fcontent\u002FICCV2025\u002Fhtml\u002FLu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html%7Chttps:\u002F\u002Fgaussian-world-model.github.io\u002F%7Chttps:\u002F\u002Fgithub.com\u002FGaussian-World-Model\u002Fgaussianwm%7C%E5%AE%98%E6%96%B9%E4%BB%93%E5%BA%93%E4%BB%8D%E5%9C%A8%E6%8C%81%E7%BB%AD%E6%95%B4%E7%90%86%7C",[262],"https:\u002F\u002Fopenaccess.thecvf.com\u002Fcontent\u002FICCV2025\u002Fhtml\u002FLu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html|https:\u002F\u002Fgaussian-world-model.github.io\u002F|https:\u002F\u002Fgithub.com\u002FGaussian-World-Model\u002Fgaussianwm|官方仓库仍在持续整理|",[14,347,145,348,145,350],{},[18,349,233],{},[258,351,354],{"href":352,"rel":353},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.14957%7Chttps:\u002F\u002Fdreamtomanipulate.github.io\u002F%7Chttps:\u002F\u002Fgithub.com\u002Fleobarcellona\u002Fdrema_code%7C%E5%AE%98%E6%96%B9%E4%BB%A3%E7%A0%81%E5%B7%B2%E5%85%AC%E5%BC%80%7C",[262],"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.14957|https:\u002F\u002Fdreamtomanipulate.github.io\u002F|https:\u002F\u002Fgithub.com\u002Fleobarcellona\u002Fdrema_code|官方代码已公开|",[14,356,145,357,145,359,364],{},[18,358,242],{},[258,360,363],{"href":361,"rel":362},"https:\u002F\u002Fwww.worldlabs.ai\u002Fblog\u002Fatlas%7Chttps:\u002F\u002Fwww.worldlabs.ai\u002F%7C%E6%9A%82%E6%97%A0%E5%85%AC%E5%BC%80%E8%AE%AD%E7%BB%83%E4%BB%A3%E7%A0%81%7CEarly",[262],"https:\u002F\u002Fwww.worldlabs.ai\u002Fblog\u002Fatlas|https:\u002F\u002Fwww.worldlabs.ai\u002F|暂无公开训练代码|Early"," Access；不是传统会议论文项目|",[131,366],{},[10,368,369],{"id":369},"论文定位与影响力",[14,371,372],{},"|论文|学术定位|主要贡献类型|对我的价值|",[14,374,375,376,379],{},"|---|---|---|---|\n|",[18,377,378],{},"NWM","|Navigation World Model 标志性工作|大规模生成式 WM、CDiT、视频想象 + 规划|理解最前沿 Navigation WM 应该做到什么程度|",[14,381,145,382,384],{},[18,383,173],{},"|Latent WM 代表工作|不重建 RGB，直接预测预训练视觉特征|理解「不生成图像也能做 World Model」|",[14,386,145,387,389,390,145],{},[18,388,144],{},"|机器人导航 WM 代表工作|World Model + Policy、Sim2Real、Cross-Embodiment|",[18,391,392],{},"最适合作为第一主 baseline",[14,394,395],{},"|DreamerNav|系统型 WM 导航工作|DreamerV3 + 动态导航 + 混合规划|学完整机器人科研链条|",[14,397,398],{},"|V-JEPA 2|Foundation WM 重要路线|大规模视频自监督 + Action-conditioned WM|理解 Foundation World Model|",[14,400,401],{},"|One-Step WM|实时化路线|One-Step generation + planning|研究如何把 WM 真正跑实时|",[14,403,404],{},"|AR Forcing|长时序稳定性路线|缓解 AR rollout 的 train-test mismatch|研究 long-horizon prediction|",[14,406,407],{},"|NavWAM|World Action Model 路线|联合 future \u002F value \u002F action chunk|观察 WM 是否向 WAM 演化|",[14,409,145,410,412],{},[18,411,224],{},"|3D Structured WM \u002F Gaussian WM 代表工作|用 3D Gaussian 显式表示并预测未来三维场景|理解 Geometry-aware World Model|",[14,414,145,415,418],{},[18,416,417],{},"DreMa","|Compositional WM \u002F Learnable Digital Twin 代表工作|Gaussian Splatting + Physics，用 imagination 生成训练数据|理解 WM 不只用于在线规划，也可用于数据生成|",[14,420,145,421,423],{},[18,422,242],{},"|Foundation Spatial World Model|统一文本、图像、视频、深度与 3D，做生成、重建和模拟|理解现代大型 WM 为什么越来越像 CV \u002F 3D Vision|",[131,425],{},[10,427,428],{"id":428},"复现与工程成本",[430,431,432],"blockquote",{},[14,433,434,435],{},"这一表重点用于判断：",[18,436,437],{},"能不能作为 baseline、算力够不够、复现成本多高、实机链路是否成熟。",[14,439,440],{},"|论文|主要 WM \u002F Backbone|规模|原论文训练资源|数据|仿真 \u002F 环境|规划 \u002F Policy|实机|开源成熟度|我的复现难度|",[14,442,443,444,446,447,450,451,145,454,457],{},"|---|---|---:|---|---|---|---|---|---|---|\n|",[18,445,144],{},"|DINOv2 + GRU Probabilistic Latent WM + Policy|WM 主体较小；RGB Diffuser ≈ 962M|",[18,448,449],{},"8 × H100","|Isaac Sim：160K Random + 100K Nav2 Teacher|Isaac Sim|Learned Action Policy|",[18,452,453],{},"Nova Carter",[18,455,456],{},"高：Code + Dataset + Checkpoint + TensorRT\u002FROS2","|⭐⭐⭐|",[14,459,145,460,462,463,466,467,470,471,156],{},[18,461,378],{},"|Conditional Diffusion Transformer（CDiT）|",[18,464,465],{},"50M \u002F 200M \u002F 最大 1B","|XL：",[18,468,469],{},"8 台 × 8 H100 = 64 × H100","|RECON \u002F SCAND \u002F TartanDrive \u002F HuRoN \u002F Ego4D 等|Offline robot\u002Fhuman navigation datasets|CEM \u002F trajectory ranking \u002F MPC-style planning|原论文重点不是完整真机闭环|",[18,472,473],{},"高：Code + Weights",[14,475,145,476,478,479,482],{},[18,477,173],{},"|DINOv2 patch feature + ViT predictor|Predictor 约 19M（论文配置需进一步逐项核对）|原论文未在当前日志中记录明确 GPU 配置|Offline trajectories|PointMaze \u002F PushT \u002F Wall \u002F Reacher 等|CEM \u002F gradient planning|无移动机器人真机|",[18,480,481],{},"高：Code + checkpoints","|⭐⭐|",[14,484,145,485,487,488,491,492,495],{},[18,486,182],{},"|DreamerV3 \u002F RSSM|中小型|",[18,489,490],{},"1 × RTX 4090 24GB；约 24.79h；495K policy steps","|Isaac Sim 在线交互|Isaac Sim Warehouse|Actor-Critic policy + A* global guidance|",[18,493,494],{},"Spot + Unitree A1","|中：论文完整，代码需继续确认|⭐⭐|",[14,497,145,498,501],{},[18,499,500],{},"V-JEPA 2-AC","|V-JEPA 2 + Action-Conditioned Predictor|ViT-L\u002FH\u002Fg，最大约 1B 级|Foundation-scale，具体训练资源待单独整理|>1M hours internet video + robot interaction data|Manipulation \u002F video benchmarks|latent-space planning|Franka 等 manipulation|高：Official repo \u002F models|⭐⭐⭐⭐⭐|",[14,503,145,504,507,508,145,511,457],{},[18,505,506],{},"One-Step WM","|3D U-Net + spatial-temporal attention|待核实|待核实|Public navigation data + Habitat\u002FMP3D 等|Habitat + real robot|Optimization-based planning \u002F anchors|",[18,509,510],{},"有实机",[18,512,513],{},"较高：Paper + Project + Code",[14,515,145,516,518],{},[18,517,206],{},"|Diffusion Navigation WM|基于 NWM 类框架|待核实|RECON \u002F SCAND \u002F HuRoN \u002F TartanDrive|Offline navigation datasets|保留原 diffusion planning framework|待核实|中低：目前代码状态需确认|⭐⭐⭐⭐|",[14,520,145,521,523,524,145,527,530],{},[18,522,215],{},"|Diffusion Transformer World-Action Model|待详细整理|待核实|Simulation pretraining + real-robot adaptation|Simulation + real robot|",[18,525,526],{},"直接输出 action chunk，无需默认 CEM",[18,528,529],{},"Diablo","|中：Paper + Project 已公开|⭐⭐⭐⭐|",[131,532],{},[10,534,535],{"id":535},"当前实验室计算资源",[537,538,540],"h3",{"id":539},"gpu-server-a","GPU Server A",[542,543,549],"pre",{"className":544,"code":546,"language":547,"meta":548},[545],"language-text","1 × RTX 5090\n","text","",[550,551,546],"code",{"__ignoreMap":548},[14,553,554],{},"用途：",[26,556,557],{},[29,558,559],{},"单卡开发；",[26,561,562],{},[29,563,564],{},"训练 Debug；",[26,566,567],{},[29,568,569],{},"小中型 World Model fine-tuning；",[26,571,572],{},[29,573,574],{},"单卡 ablation；",[26,576,577,580,583],{},[29,578,579],{},"inference；",[29,581,582],{},"ONNX \u002F TensorRT；",[29,584,585],{},"实机部署前性能测试。",[537,587,589],{"id":588},"gpu-server-b","GPU Server B",[542,591,594],{"className":592,"code":593,"language":547,"meta":548},[545],"3 × RTX A6000 48GB\n",[550,595,593],{"__ignoreMap":548},[14,597,554],{},[26,599,600],{},[29,601,602],{},"当前主要训练资源；",[26,604,605],{},[29,606,607],{},"DDP 多卡训练；",[26,609,610,613],{},[29,611,612],{},"World Model fine-tuning；",[29,614,615],{},"中型 Transformer \u002F Diffusion；",[26,617,618],{},[29,619,620],{},"多组 ablation；",[26,622,623],{},[29,624,625],{},"较大 batch；",[26,627,628],{},[29,629,630],{},"部分模型并行 \u002F FSDP。",[14,632,633],{},"Note:",[542,635,638],{"className":636,"code":637,"language":547,"meta":548},[545],"3 × 48GB != 单进程天然拥有 144GB 显存\n",[550,639,637],{"__ignoreMap":548},[14,641,642],{},"需要 DDP \u002F FSDP \u002F model parallel 等方式利用多卡。",[537,644,646],{"id":645},"gpu-server-c","GPU Server C",[542,648,651],{"className":649,"code":650,"language":547,"meta":548},[545],"4 × GTX 1080 Ti\n",[550,652,650],{"__ignoreMap":548},[14,654,554],{},[26,656,657],{},[29,658,659],{},"数据预处理；",[26,661,662],{},[29,663,664],{},"CPU\u002FGPU 混合的数据生成；",[26,666,667],{},[29,668,669],{},"传统 baseline；",[26,671,672],{},[29,673,674],{},"老模型；",[26,676,677],{},[29,678,679],{},"部分仿真任务；",[26,681,682],{},[29,683,684],{},"不依赖现代 Tensor Core \u002F BF16 的任务。",[14,686,687],{},"不优先用于现代大规模 Transformer \u002F Diffusion 训练。",[131,689],{},[10,691,693],{"id":692},"world-model-放在完整机器人链条中的位置","World Model 放在完整机器人链条中的位置",[542,695,698],{"className":696,"code":697,"language":547,"meta":548},[545],"Sensor \u002F Observation\n传感器 \u002F 当前观测\n        ↓\nPerception \u002F Representation\n感知 \u002F 世界表示\n        ↓\nWorld Model\n世界模型\n        ↓\nFuture Prediction\n未来预测\n        ↓\nPlanner \u002F Policy\n规划器 \u002F 策略\n        ↓\nController\n控制器\n        ↓\nRobot Command\n机器人执行命令\n",[550,699,697],{"__ignoreMap":548},[14,701,702],{},"最简单的记忆方式：",[26,704,705],{},[29,706,707,710],{},[18,708,709],{},"Computer Vision（计算机视觉，CV）","：回答“现在世界是什么样”；",[26,712,713],{},[29,714,715,718],{},[18,716,717],{},"World Model（世界模型，WM）","：回答“如果执行某个动作，未来世界会变成什么样”；",[26,720,721],{},[29,722,723,726],{},[18,724,725],{},"Planner（规划器） \u002F Policy（策略）","：回答“我应该做什么动作”；",[26,728,729],{},[29,730,731,734],{},[18,732,733],{},"Controller（控制器）","：把高层动作变成速度、关节或力矩命令。",[14,736,737,738,744],{},"因此，",[18,739,740,741],{},"World Model 的输出通常不等于 ",[550,742,743],{},"cmd_vel","。常见输出包括 Future RGB（未来图像）、Future Latent State（未来隐状态）、Future Depth（未来深度）、Future Occupancy（未来占据）、Future 3D Gaussian Scene（未来 3D 高斯场景）、Reward \u002F Value \u002F Risk（奖励 \u002F 价值 \u002F 风险）等。",[131,746],{},[10,748,79],{"id":749},"renderer-simulator-planner-功能分类",[537,751,753],{"id":752},"renderer渲染器","Renderer（渲染器）",[14,755,756,757],{},"主要回答：",[18,758,759],{},"世界看起来会是什么样？",[14,761,762,763,21],{},"典型输出：RGB、Video、Novel View（新视角）、Depth、3D rendering。更偏 ",[18,764,765],{},"CV \u002F Generative Vision（计算机视觉 \u002F 生成视觉）",[537,767,769],{"id":768},"simulator模拟器","Simulator（模拟器）",[14,771,756,772],{},[18,773,774],{},"世界在时间和动作作用下会怎样变化？",[14,776,777],{},"典型输出：Future State（未来状态）、Future Geometry（未来几何）、Object Pose（物体位姿）、Future Latent（未来隐状态）、Future 3DGS（未来三维高斯）、Reward \u002F Risk \u002F Dynamics（奖励 \u002F 风险 \u002F 动态）。",[537,779,781],{"id":780},"planner规划器","Planner（规划器）",[14,783,756,784],{},[18,785,786],{},"为了达到目标，我应该做什么？",[14,788,789],{},"典型输出：Action（动作）、Action Sequence（动作序列）、Trajectory（轨迹）、Velocity Command（速度命令）。",[14,791,792],{},"常见术语：",[26,794,795],{},[29,796,797,800],{},[18,798,799],{},"CEM（Cross-Entropy Method，交叉熵方法）","：采样很多候选动作，保留表现更好的，再继续搜索；",[26,802,803],{},[29,804,805,808],{},[18,806,807],{},"MPC（Model Predictive Control，模型预测控制）","：不断向前预测一小段，只执行当前最优动作，然后重新规划；",[26,810,811],{},[29,812,813,816],{},[18,814,815],{},"MPPI（Model Predictive Path Integral，模型预测路径积分）","：一种采样式 MPC；",[26,818,819],{},[29,820,821,824],{},[18,822,823],{},"Learned Policy（学习策略）","：神经网络直接根据状态选择动作；",[26,826,827],{},[29,828,829,832],{},[18,830,831],{},"Actor-Critic（演员-评论家）","：强化学习中的策略学习结构。",[131,834],{},[10,836,838],{"id":837},"按-world-model-输出形式分类","按 World Model 输出形式分类",[14,840,841],{},"|输出类型|中文解释|代表工作|后续怎么决策|",[14,843,375,844,847,848,851],{},[18,845,846],{},"Future RGB \u002F Video","|未来 RGB \u002F 视频，直接“画”未来|",[18,849,850],{},"NWM、One-Step WM","|CEM \u002F trajectory ranking|",[14,853,145,854,857,858,861],{},[18,855,856],{},"Future Latent State","|未来隐状态，不画图，只预测压缩后的内部表示|",[18,859,860],{},"DINO-WM、X-MOBILITY、V-JEPA 2-AC、DreamerNav","|CEM \u002F Learned Policy \u002F RL|",[14,863,145,864,867,868,870],{},[18,865,866],{},"Future 3D Gaussian Scene","|未来 3D 高斯场景，显式三维结构|",[18,869,224],{},"|Imitation Learning \u002F Model-Based RL|",[14,872,145,873,876,877,879],{},[18,874,875],{},"Digital Twin Future State","|数字孪生中的未来状态|",[18,878,417],{},"|生成 imagined demonstrations，再训练 Policy|",[14,881,145,882,885,886,888],{},[18,883,884],{},"RGB + Depth + Explicit 3D","|RGB、深度、点云或 3DGS|",[18,887,242],{},"|当前主要用于 reconstruction \u002F simulation|",[14,890,145,891,894,895,897],{},[18,892,893],{},"Future + Action Chunk","|预测未来的同时直接给出动作序列|",[18,896,215],{},"|模型自身承担更多 Planner \u002F Policy 功能|",[14,899,900],{},"**Latent State（隐空间状态）**可以理解成：把复杂图像、三维结构、语义和动态压缩成一组机器可处理的数字特征，人通常不能直接看懂，但模型可以拿它做预测和决策。",[131,902],{},[10,904,906],{"id":905},"按-world-representation世界表示分类","按 World Representation（世界表示）分类",[14,908,909],{},"|World Representation|中文|代表工作|Features|",[14,911,912],{},"|---|---|---|---|\n|Pixel \u002F Video Latent|像素 \u002F 视频隐空间|NWM、One-Step WM|视觉生成强，但计算量可能较大|",[14,914,915],{},"|Pretrained Visual Feature|预训练视觉特征|DINO-WM|不必重建 RGB，更强调语义特征|",[14,917,918],{},"|Probabilistic Latent State|概率隐状态|X-MOBILITY、DreamerNav|更适合 Policy \u002F RL \u002F 时序状态估计|",[14,920,921],{},"|Explicit 3D Gaussian|显式 3D 高斯|GWM|三维几何结构更明确|",[14,923,924],{},"|Gaussian Digital Twin + Physics|高斯数字孪生 + 物理模拟|DreMa|场景可组合、可变换、可生成训练数据|",[14,926,927],{},"|Unified Spatial Context|统一空间上下文|Atlas|文本、图像、视频、相机位姿、深度、3D 统一建模|",[131,929],{},[10,931,933],{"id":932},"按更偏-cv-还是更偏-planner-robotics分类","按“更偏 CV 还是更偏 Planner \u002F Robotics”分类",[430,935,936],{},[14,937,938],{},"不是严格学科划分，只是标记主要创新发生在哪一段。",[542,940,943],{"className":941,"code":942,"language":547,"meta":548},[545],"更偏 CV \u002F 3D Vision                              更偏 Planning \u002F Robotics\n\nAtlas\nGWM\nDreMa\nDINO-WM\nNWM ---------------------------- CEM Planning\nOne-Step WM -------------------- CEM \u002F Optimizer\nV-JEPA 2-AC -------------------- Latent Planning\nX-MOBILITY --------------------- Learned Policy\nDreamerNav --------------------- Model-Based RL\nNavWAM ------------------------- World + Action Joint Modeling\n",[550,944,942],{"__ignoreMap":548},[14,946,947],{},"|工作|主要偏向|直白解释|",[14,949,950,951,145,953,956],{},"|---|---|---|\n|",[18,952,242],{},[18,954,955],{},"CV \u002F 3D Vision \u002F Spatial Intelligence","|强项是生成、三维重建、Real-to-Sim 和机器人传感器模拟，不是专门导航 Planner|",[14,958,145,959,145,961,964],{},[18,960,224],{},[18,962,963],{},"3D Vision + Simulator","|最大创新在 3D Gaussian 世界表示和未来三维状态预测|",[14,966,145,967,145,969,972],{},[18,968,417],{},[18,970,971],{},"3D Vision + Simulator + Robot Learning","|3DGS + Physics 构建数字孪生，再生成 imagined data|",[14,974,145,975,977],{},[18,976,173],{},"|CV ↔ Planning 中间|前半段用 DINOv2 特征，后半段把未来 latent 用于规划|",[14,979,145,980,982],{},[18,981,378],{},"|CV \u002F Video WM → Planning|先生成未来视觉，再通过 CEM 选择动作|",[14,984,145,985,987],{},[18,986,506],{},"|CV \u002F Video WM → Planning|重点是把未来生成做快，再接优化式规划|",[14,989,145,990,992,993,145,995,998],{},[18,991,500],{},"|Representation Learning → Planning|foundation latent representation + action-conditioned prediction|\n|",[18,994,144],{},[18,996,997],{},"Robot Learning \u002F Policy","|WM 学 dynamics，Action Policy 最终输出速度和路径|",[14,1000,145,1001,145,1003,1006],{},[18,1002,182],{},[18,1004,1005],{},"Model-Based RL \u002F Navigation","|WM 用于 imagination，Actor-Critic 学导航策略|",[14,1008,145,1009,145,1011,1014],{},[18,1010,215],{},[18,1012,1013],{},"Planner \u002F Policy 更强","|不只预测未来，还联合输出 Action Chunk|",[131,1016],{},[10,1018,1020],{"id":1019},"按-renderer-simulator-planner-重新看这些工作","按 Renderer \u002F Simulator \u002F Planner 重新看这些工作",[14,1022,1023],{},"|工作|Renderer|Simulator|Planner \u002F Policy|直白理解|",[14,1025,1026,1027,1029],{},"|---|---:|---:|---:|---|\n|",[18,1028,242],{},"|★★★★★|★★★★☆|★★☆☆☆|强生成 \u002F 重建 \u002F 仿真，当前不是专门导航 Planner|",[14,1031,145,1032,1034],{},[18,1033,378],{},"|★★★★★|★★★★☆|★★★☆☆|先生成未来视觉，再用 CEM 规划|",[14,1036,145,1037,1039],{},[18,1038,506],{},"|★★★★☆|★★★★☆|★★★☆☆|把未来视觉生成做得更快，再规划|",[14,1041,145,1042,1044],{},[18,1043,173],{},"|★☆☆☆☆|★★★★☆|★★★★☆|不画未来图，直接在 latent space 预测并规划|",[14,1046,145,1047,1049],{},[18,1048,224],{},"|★★★★☆|★★★★★|★★☆☆☆|显式模拟未来 3D Gaussian 世界|",[14,1051,145,1052,1054],{},[18,1053,417],{},"|★★★★☆|★★★★★|★★☆☆☆|构建数字孪生，用模拟结果扩充训练数据|",[14,1056,145,1057,1059,1060,1062],{},[18,1058,500],{},"|★☆☆☆☆|★★★★☆|★★★★☆|latent prediction + action-conditioned planning|\n|",[18,1061,144],{},"|★★☆☆☆|★★★★☆|★★★★★|WM 主要服务 Learned Policy|",[14,1064,145,1065,1067,1068,1070],{},[18,1066,182],{},"|★☆☆☆☆|★★★★☆|★★★★★|RSSM imagination + Actor-Critic navigation|\n|",[18,1069,215],{},"|★★★☆☆|★★★★☆|★★★★★|未来预测和动作生成联合|",[131,1072],{},[10,1074,1075],{"id":1075},"一个统一的五问阅读法",[14,1077,1078],{},"以后看到任何 World Model 论文，优先回答：",[89,1080,1081],{},[29,1082,1083,1086],{},[18,1084,1085],{},"Observation（观测）是什么？"," RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal？",[89,1088,1089],{"start":96},[29,1090,1091,1094],{},[18,1092,1093],{},"Representation（世界表示）是什么？"," Pixel、Latent、DINO feature、BEV、Occupancy、3D Gaussian、Digital Twin？",[89,1096,1097],{"start":102},[29,1098,1099,1102],{},[18,1100,1101],{},"World Model Output（世界模型输出）是什么？"," Future RGB、Future Latent、Future Occupancy、Future 3DGS、Reward \u002F Risk、Action-conditioned future？",[89,1104,1105],{"start":108},[29,1106,1107,1110],{},[18,1108,1109],{},"Planner \u002F Policy（规划器 \u002F 策略）怎么决定动作？"," CEM、MPC、MPPI、Neural Policy、Actor-Critic、World Action Model？",[89,1112,1113],{"start":114},[29,1114,1115,1118,1119,1121],{},[18,1116,1117],{},"Robot Output（机器人最终输出）是什么？"," ",[550,1120,743],{},"、trajectory、joint position、end-effector pose、action chunk？",[131,1123],{},[10,1125,1126],{"id":1126},"当前路线判断",[537,1128,37],{"id":1129},"world-model-policy",[14,1131,1132],{},"代表：",[26,1134,1135,1137],{},[29,1136,144],{},[29,1138,215],{},[14,1140,1141],{},"基本结构：",[542,1143,1146],{"className":1144,"code":1145,"language":547,"meta":548},[545],"Observation\n    ↓\nWorld Model\n    ↓\nLatent State\n    ↓\nPolicy\n    ↓\nAction\n",[550,1147,1145],{"__ignoreMap":548},[14,1149,1150],{},"特点：",[26,1152,1153],{},[29,1154,1155],{},"适合真实机器人闭环；",[26,1157,1158],{},[29,1159,1160],{},"不一定需要每个控制周期进行大量 CEM 搜索；",[26,1162,1163],{},[29,1164,1165],{},"推理更容易做实时；",[26,1167,1168],{},[29,1169,1170],{},"容易形成 World Model + robot deployment 的完整故事。",[14,1172,1173],{},"当前判断：",[430,1175,1176],{},[14,1177,1178],{},[18,1179,1180],{},"最适合第一篇工作的主路线。",[131,1182],{},[537,1184,1186],{"id":1185},"world-model-planning","World Model + Planning",[14,1188,1132],{},[26,1190,1191,1193,1195],{},[29,1192,278],{},[29,1194,173],{},[29,1196,506],{},[14,1198,1199],{},"结构：",[542,1201,1204],{"className":1202,"code":1203,"language":547,"meta":548},[545],"Observation\n    ↓\nWorld Model\n    ↓\nImagine Future\n    ↓\nCEM \u002F MPC \u002F Optimizer\n    ↓\nAction\n",[550,1205,1203],{"__ignoreMap":548},[14,1207,1150],{},[26,1209,1210],{},[29,1211,1212],{},"World Model 与 Planner 解耦；",[26,1214,1215],{},[29,1216,1217],{},"可显式测试 counterfactual actions；",[26,1219,1220],{},[29,1221,1222],{},"学术上很有 World Model 味；",[26,1224,1225],{},[29,1226,1227],{},"生成式 WM 往往存在推理延迟；",[26,1229,1230],{},[29,1231,1232],{},"planner 需要大量 candidate rollout 时计算成本很高。",[131,1234],{},[537,1236,40],{"id":1237},"world-model-model-based-rl",[14,1239,1132],{},[26,1241,1242,1244],{},[29,1243,182],{},[29,1245,1246],{},"DreamerV3 系列",[14,1248,1199],{},[542,1250,1253],{"className":1251,"code":1252,"language":547,"meta":548},[545],"Observation\n    ↓\nRSSM World Model\n    ↓\nImagined Rollouts\n    ↓\nActor-Critic\n    ↓\nPolicy\n",[550,1254,1252],{"__ignoreMap":548},[14,1256,1150],{},[26,1258,1259,1262,1265],{},[29,1260,1261],{},"latent imagination；",[29,1263,1264],{},"sample efficiency；",[29,1266,1267],{},"reward design 很重要；",[26,1269,1270],{},[29,1271,1272],{},"training stability 是核心问题；",[26,1274,1275],{},[29,1276,1277],{},"很适合动态环境与复杂决策；",[26,1279,1280],{},[29,1281,1282],{},"需要理解 RL，不只是模型结构。",[131,1284],{},[10,1286,1288],{"id":1287},"第一主-baseline-候选x-mobility","第一主 baseline 候选：X-MOBILITY",[537,1290,1291],{"id":1291},"基本信息",[14,1293,1294],{},[18,1295,1296],{},"论文：",[14,1298,1299],{},"X-MOBILITY: End-To-End Generalizable Navigation via World Modeling",[14,1301,1302],{},[18,1303,1304],{},"Venue：",[14,1306,148],{},[14,1308,1309],{},[18,1310,1311],{},"机构：",[26,1313,1314,1317,1320],{},[29,1315,1316],{},"NVIDIA",[29,1318,1319],{},"UC Berkeley",[29,1321,1322],{},"UT Austin",[14,1324,1325],{},[18,1326,1327],{},"链接：",[26,1329,1330,1337,1344,1351,1357],{},[29,1331,1332,1333],{},"arXiv: ",[258,1334,1335],{"href":1335,"rel":1336},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2410.17491",[262],[29,1338,1339,1340],{},"Project: ",[258,1341,1342],{"href":1342,"rel":1343},"https:\u002F\u002Fnvlabs.github.io\u002FX-MOBILITY\u002F",[262],[29,1345,1346,1347],{},"GitHub: ",[258,1348,1349],{"href":1349,"rel":1350},"https:\u002F\u002Fgithub.com\u002FNVlabs\u002FX-MOBILITY",[262],[29,1352,1353,1354],{},"Hugging Face Model: ",[258,1355,267],{"href":267,"rel":1356},[262],[29,1358,1359,1360],{},"Hugging Face Dataset: ",[258,1361,1362],{"href":1362,"rel":1363},"https:\u002F\u002Fhuggingface.co\u002Fdatasets\u002Fnvidia\u002FX-Mobility",[262],[14,1365,1366],{},[18,1367,1368],{},"方向：",[26,1370,1371,1374,1377,1380,1383,1385,1388],{},[29,1372,1373],{},"World Model",[29,1375,1376],{},"Robot Navigation",[29,1378,1379],{},"Imitation Learning",[29,1381,1382],{},"End-to-End Navigation",[29,1384,56],{},[29,1386,1387],{},"Cross-Embodiment",[29,1389,1390],{},"Edge Deployment",[14,1392,1393],{},[18,1394,1395],{},"当前定位：",[430,1397,1398],{},[14,1399,1400],{},[18,1401,1402],{},"第一主 baseline 候选。",[14,1404,1405],{},"选择原因：",[89,1407,1408],{},[29,1409,1410],{},"本身就是移动机器人导航，不需要强行把一个 manipulation WM 改成 navigation；",[89,1412,1413],{"start":96},[29,1414,1415],{},"World Model 与 Action Policy 解耦，适合在 World Model 部分做研究；",[89,1417,1418],{"start":102},[29,1419,1420],{},"有 Isaac Sim；",[89,1422,1423],{"start":108},[29,1424,1425],{},"Teacher 直接使用 Nav2；",[89,1427,1428],{"start":114},[29,1429,1430],{},"有 Dataset；",[89,1432,1433],{"start":120},[29,1434,1435],{},"有 Checkpoint；",[89,1437,1438],{"start":126},[29,1439,1440],{},"有 ONNX \u002F TensorRT \u002F ROS2 部署链；",[89,1442,1444],{"start":1443},8,[29,1445,1446],{},"有 Nova Carter 实机；",[89,1448,1450],{"start":1449},9,[29,1451,1452],{},"算力虽然原论文高，但比从零复现 NWM 1B 更现实；",[89,1454,1456],{"start":1455},10,[29,1457,1458],{},"和未来 ROS2 \u002F Nav2 \u002F 实机方向高度兼容。",[131,1460],{},[537,1462,1463],{"id":1463},"一句话理解",[14,1465,1466],{},"X-MOBILITY 的核心思想：",[430,1468,1469],{},[14,1470,1471],{},"利用 World Model 学习一个包含环境状态与动态信息的 latent representation，再利用这个 latent state 学习导航 Action Policy。",[14,1473,1474],{},"普通 Behavior Cloning：",[542,1476,1479],{"className":1477,"code":1478,"language":547,"meta":548},[545],"Image\n  ↓\nNetwork\n  ↓\nAction\n",[550,1480,1478],{"__ignoreMap":548},[14,1482,1483],{},"X-MOBILITY：",[542,1485,1488],{"className":1486,"code":1487,"language":547,"meta":548},[545],"Image + Robot State\n        ↓\n    World Model\n        ↓\n    Latent State\n        ↓\n   Action Policy\n        ↓\n      Action\n",[550,1489,1487],{"__ignoreMap":548},[14,1491,1492],{},"关键区别：",[430,1494,1495],{},[14,1496,1497],{},"Latent State 不只是为了拟合 teacher action，而是通过 World Modeling 与 multi-task decoder 被迫学习环境与动态信息。",[131,1499],{},[537,1501,1502],{"id":1502},"总体网络结构",[542,1504,1507],{"className":1505,"code":1506,"language":547,"meta":548},[545],"                     Image\n                       ↓\n                    DINOv2\n\nRobot State → MLP ─────┤\n                       ↓\n              Observation Embedding\n                       ↓\n               State Estimator\n                       ↓\n                Belief State\n                       ↓\n               Latent State z\n                 ↙     ↓      ↘\n                \u002F      │       \\\n               ↓       ↓        ↓\n          RGB Decoder Semantic  Action Policy\n                         Decoder      ↓\n                                   Velocity\n                                     +\n                                    Path\n",[550,1508,1506],{"__ignoreMap":548},[14,1510,1511],{},"另有：",[542,1513,1516],{"className":1514,"code":1515,"language":547,"meta":548},[545],"State Predictor\n",[550,1517,1515],{"__ignoreMap":548},[14,1519,1520],{},"负责：",[542,1522,1525],{"className":1523,"code":1524,"language":547,"meta":548},[545],"History\n+\nAction\n  ↓\nFuture Belief State\n",[550,1526,1524],{"__ignoreMap":548},[14,1528,1529],{},"World Model 的关键本质：",[14,1531,1532],{},"[\np(s_{t+1}\\mid s_t,a_t)\n]",[131,1534],{},[537,1536,1538],{"id":1537},"observation-encoder","Observation Encoder",[14,1540,1541],{},"输入主要包括：",[1543,1544,1546],"h4",{"id":1545},"rgb","RGB",[14,1548,1549],{},"前视相机图像。",[14,1551,1552],{},"视觉特征：",[542,1554,1557],{"className":1555,"code":1556,"language":547,"meta":548},[545],"DINOv2\n",[550,1558,1556],{"__ignoreMap":548},[1543,1560,1562],{"id":1561},"robot-state","Robot State",[14,1564,1565],{},"主要包括机器人速度等状态量。",[14,1567,1568],{},"通过：",[542,1570,1573],{"className":1571,"code":1572,"language":547,"meta":548},[545],"MLP\n",[550,1574,1572],{"__ignoreMap":548},[14,1576,1577],{},"编码。",[14,1579,1580],{},"最终：",[542,1582,1585],{"className":1583,"code":1584,"language":547,"meta":548},[545],"Image Embedding\n+\nRobot State Embedding\n      ↓\nObservation Embedding\n",[550,1586,1584],{"__ignoreMap":548},[131,1588],{},[537,1590,1592],{"id":1591},"state-estimator","State Estimator",[14,1594,1595],{},"输入：",[542,1597,1600],{"className":1598,"code":1599,"language":547,"meta":548},[545],"History\n+\nPrevious Action\n+\nCurrent Observation\n",[550,1601,1599],{"__ignoreMap":548},[14,1603,1604],{},"输出 probabilistic belief state。",[14,1606,1607],{},"用于估计：",[430,1609,1610],{},[14,1611,1612],{},"在已经看到真实 observation 的情况下，当前世界 latent state 应该是什么。",[131,1614],{},[537,1616,1618],{"id":1617},"state-predictor","State Predictor",[14,1620,1595],{},[542,1622,1625],{"className":1623,"code":1624,"language":547,"meta":548},[545],"History\n+\nAction\n",[550,1626,1624],{"__ignoreMap":548},[14,1628,1629],{},"不使用未来 observation。",[14,1631,1632],{},"输出：",[542,1634,1637],{"className":1635,"code":1636,"language":547,"meta":548},[545],"Predicted Future Belief State\n",[550,1638,1636],{"__ignoreMap":548},[14,1640,1641],{},"That is: if the communication parameters (like baud rate) set in the microcontroller program are not consistent with those configured in the serial port software on the PC, the communication between the microcontroller and the computer will fail.",[430,1643,1644],{},[14,1645,1646],{},"如果我执行这个 action，未来 latent world state 会变成什么。",[14,1648,1649],{},"State Predictor 与 State Estimator 之间通过 KL 约束，使预测出来的 latent distribution 接近真实观察得到的 posterior。",[131,1651],{},[537,1653,1655],{"id":1654},"multi-task-decoder","Multi-Task Decoder",[14,1657,1658],{},"作者希望 latent state 不是只会拟合 action，因此使用多个 decoder 给 latent state 提供监督。",[14,1660,1661],{},"主要包括：",[542,1663,1666],{"className":1664,"code":1665,"language":547,"meta":548},[545],"RGB Reconstruction\n+\nSemantic Segmentation\n",[550,1667,1665],{"__ignoreMap":548},[14,1669,1670],{},"RGB Reconstruction 使用 Latent Diffusion Model。",[14,1672,1673],{},"论文 appendix 给出的模型规模中：",[542,1675,1678],{"className":1676,"code":1677,"language":547,"meta":548},[545],"RGB Diffuser ≈ 962M\n",[550,1679,1677],{"__ignoreMap":548},[14,1681,1682],{},"但真正负责 world dynamics 的组件小得多，例如：",[542,1684,1687],{"className":1685,"code":1686,"language":547,"meta":548},[545],"State Estimator ≈ 5.5M\nState Predictor ≈ 2.3M\n",[550,1688,1686],{"__ignoreMap":548},[14,1690,1691],{},"这一点非常值得关注：",[430,1693,1694],{},[14,1695,1696],{},[18,1697,1698],{},"Navigation World Model 是否真的需要一个近 1B 的 RGB Diffuser？",[131,1700],{},[537,1702,1704],{"id":1703},"action-policy","Action Policy",[14,1706,1595],{},[542,1708,1711],{"className":1709,"code":1710,"language":547,"meta":548},[545],"Latent State\n+\nRoute Feature\n",[550,1712,1710],{"__ignoreMap":548},[14,1714,1715],{},"Route 使用：",[542,1717,1720],{"className":1718,"code":1719,"language":547,"meta":548},[545],"VectorNet\n",[550,1721,1719],{"__ignoreMap":548},[14,1723,1577],{},[14,1725,1726],{},"之后：",[542,1728,1731],{"className":1729,"code":1730,"language":547,"meta":548},[545],"Self-Attention Fusion\n        ↓\nAction Decoder\n",[550,1732,1730],{"__ignoreMap":548},[14,1734,1632],{},[542,1736,1739],{"className":1737,"code":1738,"language":547,"meta":548},[545],"Linear \u002F Angular Velocity\n+\nOptional Local Path\n",[550,1740,1738],{"__ignoreMap":548},[14,1742,1743],{},"Policy 使用 imitation learning 学习 teacher。",[131,1745],{},[537,1747,1748],{"id":1748},"数据集",[14,1750,1751],{},"训练数据来自 Isaac Sim 中的 Nova Carter。",[14,1753,1754],{},"分为两类。",[1543,1756,1758],{"id":1757},"random-action-dataset","Random Action Dataset",[542,1760,1763],{"className":1761,"code":1762,"language":547,"meta":548},[545],"≈ 160K frames\n",[550,1764,1762],{"__ignoreMap":548},[14,1766,554],{},[430,1768,1769],{},[14,1770,1771],{},"World Model pretraining。",[14,1773,1774],{},"核心目标不是学导航，而是尽量探索：",[542,1776,1779],{"className":1777,"code":1778,"language":547,"meta":548},[545],"state-action coverage\n",[550,1780,1778],{"__ignoreMap":548},[14,1782,1783],{},"让 WM 学习：",[430,1785,1786],{},[14,1787,1788],{},"执行动作后世界怎么变化。",[1543,1790,1792],{"id":1791},"nav2-teacher-dataset","Nav2 Teacher Dataset",[542,1794,1797],{"className":1795,"code":1796,"language":547,"meta":548},[545],"≈ 100K frames\n",[550,1798,1796],{"__ignoreMap":548},[14,1800,1801],{},"Nav2 在 Isaac Sim 中闭环运行：",[542,1803,1806],{"className":1804,"code":1805,"language":547,"meta":548},[545],"Random Start\n+\nRandom Goal\n      ↓\nNav2\n      ↓\nTeacher Trajectory\n",[550,1807,1805],{"__ignoreMap":548},[14,1809,554],{},[542,1811,1814],{"className":1812,"code":1813,"language":547,"meta":548},[545],"World Model\n+\nAction Policy\n",[550,1815,1813],{"__ignoreMap":548},[14,1817,1818],{},"联合训练。",[131,1820],{},[537,1822,1824],{"id":1823},"multi-stage-training","Multi-Stage Training",[1543,1826,1828],{"id":1827},"stage-1world-model-pretraining","Stage 1：World Model Pretraining",[542,1830,1833],{"className":1831,"code":1832,"language":547,"meta":548},[545],"Random Action Dataset\n        ↓\nWorld Model\n",[550,1834,1832],{"__ignoreMap":548},[14,1836,1837],{},"Policy 关闭。",[1543,1839,1841],{"id":1840},"stage-2world-model-action-policy","Stage 2：World Model + Action Policy",[542,1843,1846],{"className":1844,"code":1845,"language":547,"meta":548},[545],"Nav2 Teacher Dataset\n        ↓\nWorld Model + Policy\n",[550,1847,1845],{"__ignoreMap":548},[14,1849,1150],{},[430,1851,1852],{},[14,1853,1854],{},"World Modeling 与 Policy Learning 解耦。",[14,1856,1857],{},"这可能是 X-MOBILITY 最值得作为 baseline 的设计之一。",[131,1859],{},[537,1861,1862],{"id":1862},"原论文计算资源",[14,1864,1865],{},"原始训练配置：",[542,1867,1870],{"className":1868,"code":1869,"language":547,"meta":548},[545],"8 × NVIDIA H100\n",[550,1871,1869],{"__ignoreMap":548},[14,1873,1874],{},"World Model：",[542,1876,1879],{"className":1877,"code":1878,"language":547,"meta":548},[545],"100 epochs\n",[550,1880,1878],{"__ignoreMap":548},[14,1882,1883],{},"World Model + Policy：",[542,1885,1887],{"className":1886,"code":1878,"language":547,"meta":548},[545],[550,1888,1878],{"__ignoreMap":548},[14,1890,1891],{},"Batch：",[542,1893,1896],{"className":1894,"code":1895,"language":547,"meta":548},[545],"32\n",[550,1897,1895],{"__ignoreMap":548},[14,1899,1900],{},"因此不建议第一步直接尝试：",[430,1902,1903],{},[14,1904,1905],{},"从零 100% 复现 NVIDIA 的完整训练规模。",[14,1907,1908],{},"更现实：",[542,1910,1913],{"className":1911,"code":1912,"language":547,"meta":548},[545],"Official Checkpoint\n        ↓\nReproduce Evaluation\n        ↓\nFine-tuning\n        ↓\nModify Module\n        ↓\nAblation\n",[550,1914,1912],{"__ignoreMap":548},[131,1916],{},[537,1918,1920],{"id":1919},"推理与-edge-deployment","推理与 Edge Deployment",[14,1922,1923],{},"作者在：",[542,1925,1928],{"className":1926,"code":1927,"language":547,"meta":548},[545],"Jetson AGX Orin\n",[550,1929,1927],{"__ignoreMap":548},[14,1931,1932],{},"测试推理。",[14,1934,1935],{},"Policy Only：",[542,1937,1940],{"className":1938,"code":1939,"language":547,"meta":548},[545],"P50 ≈ 38.6 ms\nP95 ≈ 42.0 ms\nGPU Memory ≈ 594 MB\n",[550,1941,1939],{"__ignoreMap":548},[14,1943,1944],{},"Policy + Semantic：",[542,1946,1949],{"className":1947,"code":1948,"language":547,"meta":548},[545],"P50 ≈ 55.6 ms\nGPU Memory ≈ 804 MB\n",[550,1950,1948],{"__ignoreMap":548},[14,1952,1953],{},"说明：",[430,1955,1956],{},[14,1957,1958],{},"真正用于 navigation inference 的主体并没有 962M RGB diffuser 看上去那么夸张。",[14,1960,1961],{},"官方工程链：",[542,1963,1966],{"className":1964,"code":1965,"language":547,"meta":548},[545],"PyTorch\n   ↓\nONNX\n   ↓\nTensorRT\n   ↓\nROS2\n   ↓\nRobot\n",[550,1967,1965],{"__ignoreMap":548},[14,1969,1970],{},"这对未来实机很重要。",[131,1972],{},[537,1974,56],{"id":1975},"sim2real",[14,1977,1978],{},"真实平台：",[542,1980,1983],{"className":1981,"code":1982,"language":547,"meta":548},[545],"NVIDIA Nova Carter\n",[550,1984,1982],{"__ignoreMap":548},[14,1986,1987],{},"训练：",[542,1989,1992],{"className":1990,"code":1991,"language":547,"meta":548},[545],"Isaac Sim\n",[550,1993,1991],{"__ignoreMap":548},[14,1995,1996],{},"真实部署：",[542,1998,2001],{"className":1999,"code":2000,"language":547,"meta":548},[545],"Zero-Shot Sim2Real\n",[550,2002,2000],{"__ignoreMap":548},[14,2004,2005],{},"即：",[430,2007,2008],{},[14,2009,2010],{},"不针对真实实验室环境额外 fine-tune。",[14,2012,2013],{},"实机 benchmark 包括：",[542,2015,2018],{"className":2016,"code":2017,"language":547,"meta":548},[545],"Single Obstacle\nMulti Obstacles\n\nNormal Lighting\nDark Lighting\n",[550,2019,2017],{"__ignoreMap":548},[14,2021,2022],{},"论文报告：",[542,2024,2027],{"className":2025,"code":2026,"language":547,"meta":548},[545],"Single \u002F Normal    10 \u002F 10\nSingle \u002F Dark      10 \u002F 10\nMulti \u002F Normal      8 \u002F 9\nMulti \u002F Dark        8 \u002F 9\n",[550,2028,2026],{"__ignoreMap":548},[131,2030],{},[537,2032,1387],{"id":2033},"cross-embodiment",[14,2035,2036],{},"Isaac Sim 中进一步测试：",[542,2038,2041],{"className":2039,"code":2040,"language":547,"meta":548},[545],"Nova Carter\nForklift\nUnitree Go2\nUnitree G1\n",[550,2042,2040],{"__ignoreMap":548},[14,2044,2045],{},"对应：",[542,2047,2050],{"className":2048,"code":2049,"language":547,"meta":548},[545],"Differential Drive\nAckermann\nQuadruped\nHumanoid\n",[550,2051,2049],{"__ignoreMap":548},[14,2053,2054],{},"研究意义：",[430,2056,2057],{},[14,2058,2059],{},"latent representation 与标准化 input\u002Foutput 是否可以跨 embodiment 泛化。",[131,2061],{},[537,2063,2065],{"id":2064},"原论文-baselines","原论文 Baselines",[14,2067,2068],{},"当前记录：",[26,2070,2071,2074,2077,2080],{},[29,2072,2073],{},"Nav2 Teacher；",[29,2075,2076],{},"Behavior Cloning；",[29,2078,2079],{},"MILE；",[29,2081,2082],{},"X-MOBILITY。",[14,2084,2085],{},"后续需要继续详细整理：",[26,2087,2088],{},[29,2089,2090],{},"每个 baseline 的 network；",[26,2092,2093],{},[29,2094,2095],{},"是否使用同一 dataset；",[26,2097,2098],{},[29,2099,2100],{},"是否 retrain；",[26,2102,2103],{},[29,2104,2105],{},"训练预算是否一致；",[26,2107,2108],{},[29,2109,2110],{},"open-loop 与 closed-loop 分别怎么比；",[26,2112,2113,2116],{},[29,2114,2115],{},"statistical significance；",[29,2117,2118],{},"是否有 hidden implementation advantage。",[131,2120],{},[537,2122,2124],{"id":2123},"evaluation-metrics","Evaluation Metrics",[14,2126,2127],{},"Open-loop：",[26,2129,2130,2133,2136],{},[29,2131,2132],{},"Linear Speed MAE；",[29,2134,2135],{},"Angular Speed MAE；",[29,2137,2138],{},"Path MAE。",[14,2140,2141],{},"Closed-loop：",[26,2143,2144,2147,2150],{},[29,2145,2146],{},"Success Rate；",[29,2148,2149],{},"Weighted Trip Time；",[29,2151,2152],{},"Average Absolute Angular Acceleration。",[14,2154,2155],{},"未来自己的论文可以追加：",[26,2157,2158,2161,2164,2167,2170,2173,2176,2179,2182,2185,2188,2191],{},[29,2159,2160],{},"Collision Rate；",[29,2162,2163],{},"Minimum Obstacle Distance；",[29,2165,2166],{},"Path Length；",[29,2168,2169],{},"Navigation Time；",[29,2171,2172],{},"SPL；",[29,2174,2175],{},"FPS；",[29,2177,2178],{},"P50 \u002F P95 latency；",[29,2180,2181],{},"GPU memory；",[29,2183,2184],{},"Parameters；",[29,2186,2187],{},"Energy \u002F power；",[29,2189,2190],{},"Dynamic obstacle collision rate；",[29,2192,2193],{},"OOD success rate。",[131,2195],{},[537,2197,2198],{"id":2198},"当前认为的优点",[1543,2200,2201],{"id":2201},"工程链完整",[542,2203,2206],{"className":2204,"code":2205,"language":547,"meta":548},[545],"Isaac Sim\n↓\nDataset\n↓\nWorld Model\n↓\nPolicy\n↓\nTensorRT\n↓\nROS2\n↓\nReal Robot\n",[550,2207,2205],{"__ignoreMap":548},[1543,2209,2211],{"id":2210},"dataset-checkpoint-code-都有","Dataset \u002F Checkpoint \u002F Code 都有",[14,2213,2214],{},"降低复现门槛。",[1543,2216,2218],{"id":2217},"world-model-与-policy-解耦","World Model 与 Policy 解耦",[14,2220,2221],{},"非常适合：",[542,2223,2226],{"className":2224,"code":2225,"language":547,"meta":548},[545],"保持 Policy Pipeline\n      ↓\n重点改 WM\n",[550,2227,2225],{"__ignoreMap":548},[1543,2229,2231],{"id":2230},"nav2-可以同时当-teacher-和传统-baseline","Nav2 可以同时当 Teacher 和传统 baseline",[14,2233,2234],{},"这与移动机器人研究非常自然。",[1543,2236,2237],{"id":2237},"可上实机",[14,2239,2240],{},"不是只在 offline benchmark 上比较 prediction metric。",[131,2242],{},[537,2244,2246],{"id":2245},"当前认为的不足-待验证问题","当前认为的不足 \u002F 待验证问题",[1543,2248,2249],{"id":2249},"动态障碍研究仍不充分",[14,2251,2252],{},"作者未来工作明确提到：",[430,2254,2255],{},[14,2256,2257],{},"需要增加更多 diverse dynamic-obstacle scenes，进一步研究 world model 对 action policy 的作用。",[14,2259,2260],{},"可能的 research question：",[430,2262,2263],{},[14,2264,2265],{},"X-MOBILITY 的 latent dynamics 在高速、多人、交叉运动动态环境中是否仍然可靠？",[1543,2267,2269],{"id":2268},"感知主要依赖-rgb","感知主要依赖 RGB",[14,2271,2272],{},"当前核心输入：",[542,2274,2277],{"className":2275,"code":2276,"language":547,"meta":548},[545],"RGB\n+\nRobot State\n",[550,2278,2276],{"__ignoreMap":548},[14,2280,2281],{},"机器人导航还有：",[542,2283,2286],{"className":2284,"code":2285,"language":547,"meta":548},[545],"LiDAR\nDepth\nBEV\nOccupancy\n",[550,2287,2285],{"__ignoreMap":548},[14,2289,2290],{},"待验证：",[430,2292,2293],{},[14,2294,2295],{},"RGB latent 是否缺少稳定 geometry grounding？",[1543,2297,2299],{"id":2298},"rgb-diffuser-很大","RGB Diffuser 很大",[542,2301,2304],{"className":2302,"code":2303,"language":547,"meta":548},[545],"≈ 962M\n",[550,2305,2303],{"__ignoreMap":548},[14,2307,2290],{},[430,2309,2310],{},[14,2311,2312],{},"对导航来说，有没有必要生成 \u002F 重建 RGB？",[14,2314,2315],{},"可能替代：",[26,2317,2318,2321,2324,2327,2330,2333],{},[29,2319,2320],{},"Future Latent；",[29,2322,2323],{},"Depth；",[29,2325,2326],{},"Occupancy；",[29,2328,2329],{},"Traversability；",[29,2331,2332],{},"Dynamic Motion；",[29,2334,2335],{},"Collision Risk。",[1543,2337,2339],{"id":2338},"world-model-prediction-与-navigation-performance-的因果关系不够直观","World Model prediction 与 navigation performance 的因果关系不够直观",[14,2341,2342],{},"必须问：",[430,2344,2345],{},[14,2346,2347],{},"prediction metric 更好，是否一定带来 closed-loop navigation 更好？",[14,2349,2350],{},"未来 ablation 应该专门分析。",[131,2352],{},[537,2354,2356],{"id":2355},"潜在-research-questions","潜在 Research Questions",[430,2358,2359],{},[14,2360,2361],{},"以下只进入「问题池」，不能直接当作论文创新点。",[1543,2363,2365],{"id":2364},"dynamic-world-modeling","Dynamic World Modeling",[14,2367,2368],{},"现象候选：",[542,2370,2373],{"className":2371,"code":2372,"language":547,"meta":548},[545],"Fast Pedestrian\nCrossing Pedestrian\nMulti-Agent Interaction\nSudden Appearance\n",[550,2374,2372],{"__ignoreMap":548},[14,2376,2377],{},"Question",[430,2379,2380],{},[14,2381,2382],{},"现有 latent dynamics 是否能可靠预测动态实体？",[1543,2384,2386],{"id":2385},"multi-modal-world-modeling","Multi-Modal World Modeling",[14,2388,2389],{},"候选：",[542,2391,2394],{"className":2392,"code":2393,"language":547,"meta":548},[545],"RGB\n+\nLiDAR \u002F Depth \u002F BEV\n",[550,2395,2393],{"__ignoreMap":548},[14,2397,2377],{},[430,2399,2400],{},[14,2401,2402],{},"显式 geometry modality 是否提高 OOD、暗光、运动模糊和动态导航鲁棒性？",[1543,2404,2406],{"id":2405},"navigation-oriented-representation","Navigation-Oriented Representation",[14,2408,2409],{},"从：",[542,2411,2414],{"className":2412,"code":2413,"language":547,"meta":548},[545],"RGB Reconstruction\n",[550,2415,2413],{"__ignoreMap":548},[14,2417,2418],{},"转向：",[542,2420,2423],{"className":2421,"code":2422,"language":547,"meta":548},[545],"Future Occupancy\nDepth\nTraversability\nDynamic Motion\nCollision Risk\n",[550,2424,2422],{"__ignoreMap":548},[14,2426,2377],{},[430,2428,2429],{},[14,2430,2431],{},"对 navigation 来说，task-oriented prediction 是否比 photorealistic reconstruction 更有效？",[1543,2433,2435],{"id":2434},"lightweight-world-model","Lightweight World Model",[14,2437,2438],{},"研究：",[26,2440,2441,2444,2447,2450,2453,2456],{},[29,2442,2443],{},"Distillation；",[29,2445,2446],{},"Quantization；",[29,2448,2449],{},"Efficient temporal model；",[29,2451,2452],{},"Decoder pruning \u002F replacement；",[29,2454,2455],{},"Adapter；",[29,2457,2458],{},"low-rank fine-tuning。",[14,2460,2461],{},"目标：",[542,2463,2466],{"className":2464,"code":2465,"language":547,"meta":548},[545],"Lower Latency\nLower VRAM\nSimilar \u002F Better Navigation SR\n",[550,2467,2465],{"__ignoreMap":548},[1543,2469,2471],{"id":2470},"uncertainty-aware-wm","Uncertainty-Aware WM",[14,2473,2409],{},[542,2475,2478],{"className":2476,"code":2477,"language":547,"meta":548},[545],"One Future\n",[550,2479,2477],{"__ignoreMap":548},[14,2481,2482],{},"变为：",[542,2484,2487],{"className":2485,"code":2486,"language":547,"meta":548},[545],"P(Future | State, Action)\n",[550,2488,2486],{"__ignoreMap":548},[14,2490,2438],{},[430,2492,2493],{},[14,2494,2495],{},"uncertainty 是否能用于 risk-aware navigation？",[131,2497],{},[537,2499,2501],{"id":2500},"x-mobility-复现-checklist","X-MOBILITY 复现 Checklist",[26,2503,2506],{"className":2504},[2505],"contains-task-list",[29,2507,2510,2515],{"className":2508},[2509],"task-list-item",[2511,2512],"input",{"disabled":2513,"type":2514},true,"checkbox"," 通读论文第一遍",[26,2517,2519],{"className":2518},[2505],[29,2520,2522,2524],{"className":2521},[2509],[2511,2523],{"disabled":2513,"type":2514}," 画出总体网络图",[26,2526,2528],{"className":2527},[2505],[29,2529,2531,2533],{"className":2530},[2509],[2511,2532],{"disabled":2513,"type":2514}," 搞懂 Observation Encoder",[26,2535,2537],{"className":2536},[2505],[29,2538,2540,2542],{"className":2539},[2509],[2511,2541],{"disabled":2513,"type":2514}," 搞懂 State Estimator",[26,2544,2546],{"className":2545},[2505],[29,2547,2549,2551],{"className":2548},[2509],[2511,2550],{"disabled":2513,"type":2514}," 搞懂 State Predictor",[26,2553,2555],{"className":2554},[2505],[29,2556,2558,2560],{"className":2557},[2509],[2511,2559],{"disabled":2513,"type":2514}," 搞懂 KL Loss",[26,2562,2564],{"className":2563},[2505],[29,2565,2567,2569],{"className":2566},[2509],[2511,2568],{"disabled":2513,"type":2514}," 搞懂 RGB Decoder",[26,2571,2573],{"className":2572},[2505],[29,2574,2576,2578],{"className":2575},[2509],[2511,2577],{"disabled":2513,"type":2514}," 搞懂 Semantic Decoder",[26,2580,2582],{"className":2581},[2505],[29,2583,2585,2587],{"className":2584},[2509],[2511,2586],{"disabled":2513,"type":2514}," 搞懂 Route Encoder",[26,2589,2591],{"className":2590},[2505],[29,2592,2594,2596],{"className":2593},[2509],[2511,2595],{"disabled":2513,"type":2514}," 搞懂 Action Policy",[26,2598,2600],{"className":2599},[2505],[29,2601,2603,2605],{"className":2602},[2509],[2511,2604],{"disabled":2513,"type":2514}," 下载 GitHub",[26,2607,2609],{"className":2608},[2505],[29,2610,2612,2614],{"className":2611},[2509],[2511,2613],{"disabled":2513,"type":2514}," 搭建 Docker 环境",[26,2616,2618],{"className":2617},[2505],[29,2619,2621,2623],{"className":2620},[2509],[2511,2622],{"disabled":2513,"type":2514}," 下载 official checkpoint",[26,2625,2627],{"className":2626},[2505],[29,2628,2630,2632],{"className":2629},[2509],[2511,2631],{"disabled":2513,"type":2514}," 下载 official dataset",[26,2634,2636],{"className":2635},[2505],[29,2637,2639,2641],{"className":2638},[2509],[2511,2640],{"disabled":2513,"type":2514}," 跑通官方 inference",[26,2643,2645],{"className":2644},[2505],[29,2646,2648,2650],{"className":2647},[2509],[2511,2649],{"disabled":2513,"type":2514}," 跑通 official evaluation",[26,2652,2654],{"className":2653},[2505],[29,2655,2657,2659],{"className":2656},[2509],[2511,2658],{"disabled":2513,"type":2514}," 跑通 Isaac Sim demo \u002F 数据链",[26,2661,2663],{"className":2662},[2505],[29,2664,2666,2668],{"className":2665},[2509],[2511,2667],{"disabled":2513,"type":2514}," 尝试一次 fine-tuning",[26,2670,2672],{"className":2671},[2505],[29,2673,2675,2677],{"className":2674},[2509],[2511,2676],{"disabled":2513,"type":2514}," 记录单卡显存",[26,2679,2681],{"className":2680},[2505],[29,2682,2684,2686],{"className":2683},[2509],[2511,2685],{"disabled":2513,"type":2514}," 记录单 iteration 时间",[26,2688,2690],{"className":2689},[2505],[29,2691,2693,2695],{"className":2692},[2509],[2511,2694],{"disabled":2513,"type":2514}," 记录多卡训练效率",[26,2697,2699],{"className":2698},[2505],[29,2700,2702,2704],{"className":2701},[2509],[2511,2703],{"disabled":2513,"type":2514}," 复现主要 open-loop 指标",[26,2706,2708],{"className":2707},[2505],[29,2709,2711,2713],{"className":2710},[2509],[2511,2712],{"disabled":2513,"type":2514}," 复现主要 closed-loop 指标",[26,2715,2717],{"className":2716},[2505],[29,2718,2720,2722],{"className":2719},[2509],[2511,2721],{"disabled":2513,"type":2514}," 建 Failure Case Dataset",[26,2724,2726,2732],{"className":2725},[2505],[29,2727,2729,2731],{"className":2728},[2509],[2511,2730],{"disabled":2513,"type":2514}," Failure Case Analysis",[29,2733,2735,2737],{"className":2734},[2509],[2511,2736],{"disabled":2513,"type":2514}," 提出第一个 hypothesis",[26,2739,2741],{"className":2740},[2505],[29,2742,2744,2746],{"className":2743},[2509],[2511,2745],{"disabled":2513,"type":2514}," 做最小修改验证 hypothesis",[26,2748,2750],{"className":2749},[2505],[29,2751,2753,2755],{"className":2752},[2509],[2511,2754],{"disabled":2513,"type":2514}," 通过后进入正式创新点设计",[26,2757,2759,2765],{"className":2758},[2505],[29,2760,2762,2764],{"className":2761},[2509],[2511,2763],{"disabled":2513,"type":2514}," Ablation",[29,2766,2768,2770],{"className":2767},[2509],[2511,2769],{"disabled":2513,"type":2514}," 与强 baseline 对比",[26,2772,2774,2780,2786],{"className":2773},[2505],[29,2775,2777,2779],{"className":2776},[2509],[2511,2778],{"disabled":2513,"type":2514}," TensorRT",[29,2781,2783,2785],{"className":2782},[2509],[2511,2784],{"disabled":2513,"type":2514}," ROS2",[29,2787,2789,2791],{"className":2788},[2509],[2511,2790],{"disabled":2513,"type":2514}," 实机",[131,2793],{},[10,2795,161],{"id":2796},"navigation-world-modelsnwm",[537,2798,1291],{"id":2799},"基本信息-1",[14,2801,2802],{},[18,2803,1296],{},[14,2805,278],{},[14,2807,2808],{},[18,2809,1304],{},[14,2811,2812],{},"CVPR 2025 Oral",[14,2814,2815],{},"Best Paper Honorable Mention。",[14,2817,2818],{},[18,2819,1327],{},[26,2821,2822,2828,2834,2840],{},[29,2823,1332,2824],{},[258,2825,2826],{"href":2826,"rel":2827},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.03572",[262],[29,2829,1339,2830],{},[258,2831,2832],{"href":2832,"rel":2833},"https:\u002F\u002Fwww.amirbar.net\u002Fnwm\u002F",[262],[29,2835,1346,2836],{},[258,2837,2838],{"href":2838,"rel":2839},"https:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fnwm",[262],[29,2841,2842,2843],{},"Hugging Face: ",[258,2844,2845],{"href":2845,"rel":2846},"https:\u002F\u002Fhuggingface.co\u002Ffacebook\u002Fnwm",[262],[14,2848,2849],{},[18,2850,2851],{},"核心：",[542,2853,2856],{"className":2854,"code":2855,"language":547,"meta":548},[545],"Observation\n+\nNavigation Action\n        ↓\nConditional Diffusion Transformer\n        ↓\nFuture Observation\n        ↓\nCEM \u002F Trajectory Ranking\n        ↓\nNavigation\n",[550,2857,2855],{"__ignoreMap":548},[131,2859],{},[537,2861,2862],{"id":2862},"模型",[14,2864,2865],{},"核心提出：",[542,2867,2870],{"className":2868,"code":2869,"language":547,"meta":548},[545],"CDiT\nConditional Diffusion Transformer\n",[550,2871,2869],{"__ignoreMap":548},[14,2873,2874],{},"模型公开规模包括：",[542,2876,2879],{"className":2877,"code":2878,"language":547,"meta":548},[545],"CDiT\u002FS ≈ 50M\nCDiT\u002FB ≈ 200M\nCDiT\u002FXL ≈ 1B\n",[550,2880,2878],{"__ignoreMap":548},[14,2882,2883],{},"最大模型：",[542,2885,2888],{"className":2886,"code":2887,"language":547,"meta":548},[545],"≈ 1B\n",[550,2889,2887],{"__ignoreMap":548},[131,2891],{},[537,2893,1862],{"id":2894},"原论文计算资源-1",[14,2896,2897],{},"CDiT-XL：",[542,2899,2902],{"className":2900,"code":2901,"language":547,"meta":548},[545],"8 machines\n×\n8 H100 \u002F machine\n=\n64 × H100\n",[550,2903,2901],{"__ignoreMap":548},[14,2905,2906],{},"This means:",[430,2908,2909],{},[14,2910,2911],{},"不适合当前阶段把 1B XL 从零完整训练作为第一篇论文的必要前置条件。",[14,2913,2914],{},"但：",[542,2916,2919],{"className":2917,"code":2918,"language":547,"meta":548},[545],"50M \u002F 200M pretrained model\n",[550,2920,2918],{"__ignoreMap":548},[14,2922,2923],{},"可以作为以后小规模实验入口。",[131,2925],{},[537,2927,2928],{"id":2928},"数据",[14,2930,2931],{},"主要：",[26,2933,2934,2937,2940,2943,2946],{},[29,2935,2936],{},"RECON；",[29,2938,2939],{},"SCAND；",[29,2941,2942],{},"TartanDrive；",[29,2944,2945],{},"HuRoN；",[29,2947,2948],{},"Ego4D 等。",[14,2950,1150],{},[430,2952,2953],{},[14,2954,2955],{},"使用机器人、人类 egocentric video 与 navigation action 学世界动态。",[131,2957],{},[537,2959,2961],{"id":2960},"planning","Planning",[14,2963,2964],{},"NWM 可以：",[1543,2966,2968],{"id":2967},"standalone-planning","Standalone Planning",[542,2970,2973],{"className":2971,"code":2972,"language":547,"meta":548},[545],"Sample Candidate Actions\n        ↓\nNWM Imagine Future\n        ↓\nCompare Future with Goal\n        ↓\nCEM\n        ↓\nBest Action\n",[550,2974,2972],{"__ignoreMap":548},[14,2976,2977],{},"官方 planning 示例一次可以采：",[542,2979,2982],{"className":2980,"code":2981,"language":547,"meta":548},[545],"120 candidate trajectories\n",[550,2983,2981],{"__ignoreMap":548},[14,2985,2986],{},"这也是它实时部署成本很高的原因之一。",[1543,2988,2990],{"id":2989},"rank-external-policy","Rank External Policy",[14,2992,2993],{},"也可以：",[542,2995,2998],{"className":2996,"code":2997,"language":547,"meta":548},[545],"External Policy\n      ↓\nCandidate Trajectories\n      ↓\nNWM Rank\n      ↓\nBest Trajectory\n",[550,2999,2997],{"__ignoreMap":548},[131,3001],{},[537,3003,3005],{"id":3004},"real-time-performance","Real-time performance",[14,3007,3008],{},"原始 NWM 推理较慢。",[14,3010,3011],{},"论文讨论了：",[26,3013,3014,3017,3020],{},[29,3015,3016],{},"Time Skip；",[29,3018,3019],{},"Diffusion Distillation；",[29,3021,3022],{},"4-bit Quantization（论文中作为潜在方向）。",[14,3024,3025],{},"这直接说明：",[430,3027,3028],{},[14,3029,3030],{},"实时 World Model 是该路线的重要研究问题。",[131,3032],{},[537,3034,3036],{"id":3035},"已知-limitation","已知 Limitation",[1543,3038,3040],{"id":3039},"ood-mode-collapse","OOD Mode Collapse",[14,3042,3043],{},"在未知环境 autoregressive rollout 时：",[430,3045,3046],{},[14,3047,3048],{},"prediction 逐渐丢失当前环境 context，并向训练分布中的场景靠拢。",[1543,3050,3052],{"id":3051},"pedestrian-temporal-dynamics","Pedestrian Temporal Dynamics",[14,3054,3055],{},"论文明确指出：",[430,3057,3058],{},[14,3059,3060],{},"对 pedestrian motion 等 temporal dynamics 模拟仍然困难。",[1543,3062,3064],{"id":3063},"long-horizon-drift","Long-Horizon Drift",[14,3066,3067],{},"随着 autoregressive rollout 变长：",[542,3069,3072],{"className":3070,"code":3071,"language":547,"meta":548},[545],"Error Accumulation\n",[550,3073,3071],{"__ignoreMap":548},[14,3075,3076],{},"越来越严重。",[14,3078,3079],{},"这些问题后来直接衍生出：",[26,3081,3082,3085,3088],{},[29,3083,3084],{},"AR Forcing；",[29,3086,3087],{},"One-Step WM；",[29,3089,3090],{},"NavWAM 等新工作。",[131,3092],{},[537,3094,3095],{"id":3095},"当前定位",[430,3097,3098],{},[14,3099,3100],{},[18,3101,3102],{},"必须精读，但暂时不作为第一篇从零训练主 baseline。",[14,3104,3105],{},"主要用途：",[89,3107,3108],{},[29,3109,3110],{},"理解 Navigation World Model 最前沿问题；",[89,3112,3113],{"start":96},[29,3114,3115],{},"学 Diffusion World Model；",[89,3117,3118],{"start":102},[29,3119,3120],{},"学 action-conditioned future generation；",[89,3122,3123],{"start":108},[29,3124,3125],{},"学 CEM planning；",[89,3127,3128],{"start":114},[29,3129,3130],{},"找 long-horizon \u002F realtime \u002F dynamic motion 的研究问题。",[131,3132],{},[10,3134,173],{"id":3135},"dino-wm",[537,3137,1291],{"id":3138},"基本信息-2",[14,3140,3141],{},[18,3142,1296],{},[14,3144,3145],{},"DINO-WM: World Models on Pre-trained Visual Features Enable Zero-shot Planning",[14,3147,3148],{},[18,3149,1304],{},[14,3151,176],{},[14,3153,3154],{},[18,3155,1327],{},[26,3157,3158,3164,3170],{},[29,3159,1332,3160],{},[258,3161,3162],{"href":3162,"rel":3163},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2411.04983",[262],[29,3165,1339,3166],{},[258,3167,3168],{"href":3168,"rel":3169},"https:\u002F\u002Fdino-wm.github.io\u002F",[262],[29,3171,1346,3172],{},[258,3173,3174],{"href":3174,"rel":3175},"https:\u002F\u002Fgithub.com\u002Fgaoyuezhou\u002Fdino_wm",[262],[131,3177],{},[537,3179,3180],{"id":3180},"核心问题",[14,3182,3183],{},"它挑战一个非常重要的问题：",[430,3185,3186],{},[14,3187,3188],{},"World Model 为什么一定要重建未来 RGB？",[14,3190,3191],{},"DINO-WM：",[542,3193,3196],{"className":3194,"code":3195,"language":547,"meta":548},[545],"Image\n ↓\nDINOv2\n ↓\nPatch Features\n ↓\nWorld Model\n ↓\nFuture Patch Features\n ↓\nPlanning\n",[550,3197,3195],{"__ignoreMap":548},[14,3199,2005],{},[430,3201,3202],{},[14,3203,3204],{},"直接在 pretrained visual feature space 预测未来。",[131,3206],{},[537,3208,3209],{"id":3209},"重要意义",[14,3211,3212],{},"相比：",[542,3214,3217],{"className":3215,"code":3216,"language":547,"meta":548},[545],"World Model\n↓\nGenerate Future RGB\n",[550,3218,3216],{"__ignoreMap":548},[14,3220,3191],{},[542,3222,3225],{"className":3223,"code":3224,"language":547,"meta":548},[545],"World Model\n↓\nPredict Future Representation\n",[550,3226,3224],{"__ignoreMap":548},[14,3228,3229],{},"可能具有：",[26,3231,3232],{},[29,3233,3234],{},"更低计算成本；",[26,3236,3237],{},[29,3238,3239],{},"更少无关 pixel reconstruction；",[26,3241,3242],{},[29,3243,3244],{},"更强语义 representation；",[26,3246,3247],{},[29,3248,3249],{},"更容易用于 task-oriented planning。",[14,3251,3252],{},"这与未来想研究的：",[542,3254,3257],{"className":3255,"code":3256,"language":547,"meta":548},[545],"Navigation-Oriented Latent World Model\n",[550,3258,3256],{"__ignoreMap":548},[14,3260,3261],{},"高度相关。",[131,3263],{},[537,3265,3267],{"id":3266},"tasks","Tasks",[14,3269,3270],{},"官方代码主要覆盖：",[26,3272,3273,3276,3279,3282],{},[29,3274,3275],{},"PointMaze；",[29,3277,3278],{},"PushT；",[29,3280,3281],{},"Wall；",[29,3283,3284],{},"Reacher 等。",[14,3286,3287],{},"因此：",[430,3289,3290],{},[14,3291,3292],{},"学术价值很高，但不是最直接的真实移动机器人导航 baseline。",[131,3294],{},[537,3296,3095],{"id":3297},"当前定位-1",[430,3299,3300],{},[14,3301,3302],{},[18,3303,3304],{},"Latent World Model 必读论文。",[14,3306,3307],{},"重点看：",[26,3309,3310,3313,3316,3319,3322],{},[29,3311,3312],{},"pretrained representation；",[29,3314,3315],{},"patch-level latent dynamics；",[29,3317,3318],{},"CEM planning；",[29,3320,3321],{},"gradient-based planning；",[29,3323,3324],{},"task-agnostic world representation。",[131,3326],{},[10,3328,182],{"id":3329},"dreamernav",[537,3331,1291],{"id":3332},"基本信息-3",[14,3334,3335],{},[18,3336,1296],{},[14,3338,3339],{},"DreamerNav: learning-based autonomous navigation in dynamic indoor environments using world models",[14,3341,3342],{},[18,3343,1304],{},[14,3345,3346],{},"Frontiers in Robotics and AI，2025",[14,3348,3349],{},[18,3350,1327],{},[26,3352,3353,3360,3367],{},[29,3354,3355,3356],{},"DOI: ",[258,3357,3358],{"href":3358,"rel":3359},"https:\u002F\u002Fdoi.org\u002F10.3389\u002Ffrobt.2025.1655171",[262],[29,3361,3362,3363],{},"Full Text: ",[258,3364,3365],{"href":3365,"rel":3366},"https:\u002F\u002Fwww.frontiersin.org\u002Fjournals\u002Frobotics-and-ai\u002Farticles\u002F10.3389\u002Ffrobt.2025.1655171\u002Ffull",[262],[29,3368,3369,3370],{},"PMC: ",[258,3371,3372],{"href":3372,"rel":3373},"https:\u002F\u002Fpmc.ncbi.nlm.nih.gov\u002Farticles\u002FPMC12510832\u002F",[262],[14,3375,3376],{},[18,3377,3378],{},"Backbone：",[542,3380,3383],{"className":3381,"code":3382,"language":547,"meta":548},[545],"DreamerV3\n+\nRSSM\n",[550,3384,3382],{"__ignoreMap":548},[131,3386],{},[537,3388,3389],{"id":3389},"核心",[542,3391,3394],{"className":3392,"code":3393,"language":547,"meta":548},[545],"Depth\n+\nStructured Local Occupancy Map\n+\nDynamic Obstacle History\n+\nPoints of Interest\n+\nA* Global Path\n        ↓\nDreamerV3 \u002F RSSM\n        ↓\nLocal Navigation Policy\n",[550,3395,3393],{"__ignoreMap":548},[14,3397,3398],{},"Among them:",[542,3400,3403],{"className":3401,"code":3402,"language":547,"meta":548},[545],"A*\n",[550,3404,3402],{"__ignoreMap":548},[14,3406,3407],{},"负责 global guidance；",[14,3409,3410],{},"DreamerV3：",[430,3412,3413],{},[14,3414,3415],{},"在 latent space 处理动态环境与 local decision。",[131,3417],{},[537,3419,3421],{"id":3420},"training-compute","Training Compute",[14,3423,2022],{},[542,3425,3428],{"className":3426,"code":3427,"language":547,"meta":548},[545],"1 × RTX 4090 24GB\n≈ 24.79 h\n≈ 495,000 policy steps\n",[550,3429,3427],{"__ignoreMap":548},[14,3431,3432],{},"相比另外几条路线非常友好。",[131,3434],{},[537,3436,3438],{"id":3437},"simulation","Simulation",[542,3440,3443],{"className":3441,"code":3442,"language":547,"meta":548},[545],"NVIDIA Isaac Sim\n",[550,3444,3442],{"__ignoreMap":548},[14,3446,3447],{},"动态障碍、warehouse environment、curriculum learning。",[131,3449],{},[537,3451,3453],{"id":3452},"real-robot","Real Robot",[14,3455,3456],{},"平台：",[542,3458,3461],{"className":3459,"code":3460,"language":547,"meta":548},[545],"Boston Dynamics Spot\nUnitree A1\n",[550,3462,3460],{"__ignoreMap":548},[14,3464,3465],{},"基本部署：",[542,3467,3470],{"className":3468,"code":3469,"language":547,"meta":548},[545],"Real Sensors\n   ↓\nROS Node\n   ↓\nDreamerNav Model\n   ↓\nVelocity Commands\n   ↓\nRobot\n",[550,3471,3469],{"__ignoreMap":548},[14,3473,3474],{},"同一 policy 部署两个 quadruped。",[131,3476],{},[537,3478,3036],{"id":3479},"已知-limitation-1",[14,3481,3482],{},"论文明确提到：",[430,3484,3485],{},[14,3486,3487],{},"rapidly approaching dynamic obstacles 下避障策略仍会失败。",[14,3489,3490],{},"作者提出未来：",[26,3492,3493,3496,3499,3502,3505],{},[29,3494,3495],{},"RNN \u002F attention；",[29,3497,3498],{},"motion prediction；",[29,3500,3501],{},"semantic segmentation；",[29,3503,3504],{},"domain randomization；",[29,3506,3507],{},"更多真实环境测试；",[26,3509,3510],{},[29,3511,3512],{},"ablation study。",[14,3514,3515],{},"这篇论文非常适合学习：",[430,3517,3518],{},[14,3519,3520],{},"一篇机器人硕士型完整论文从问题、方法、仿真、baseline 到实机应该怎么组织。",[131,3522],{},[537,3524,3095],{"id":3525},"当前定位-2",[430,3527,3528],{},[14,3529,3530],{},[18,3531,3532],{},"第一篇科研的低风险参考工作。",[14,3534,3535],{},"如果 X-MOBILITY 复现成本高于预期，可退一步从 DreamerNav \u002F DreamerV3 体系建立科研闭环。",[131,3537],{},[10,3539,191],{"id":3540},"v-jepa-2-v-jepa-2-ac",[537,3542,1291],{"id":3543},"基本信息-4",[14,3545,3546],{},[18,3547,1296],{},[14,3549,3550],{},"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning",[14,3552,3553],{},[18,3554,1327],{},[26,3556,3557,3563,3570],{},[29,3558,1332,3559],{},[258,3560,3561],{"href":3561,"rel":3562},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2506.09985",[262],[29,3564,3565,3566],{},"Official GitHub: ",[258,3567,3568],{"href":3568,"rel":3569},"https:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fvjepa2",[262],[29,3571,3572,3573],{},"Meta Blog: ",[258,3574,3575],{"href":3575,"rel":3576},"https:\u002F\u002Fai.meta.com\u002Fblog\u002Fv-jepa-2-world-model-benchmarks\u002F",[262],[131,3578],{},[537,3580,3581],{"id":3581},"核心路线",[14,3583,3584],{},"V-JEPA 2：",[542,3586,3589],{"className":3587,"code":3588,"language":547,"meta":548},[545],"Internet-Scale Video\n       ↓\nSelf-Supervised JEPA\n       ↓\nWorld Representation\n",[550,3590,3588],{"__ignoreMap":548},[14,3592,3593],{},"V-JEPA 2-AC：",[542,3595,3598],{"className":3596,"code":3597,"language":547,"meta":548},[545],"V-JEPA 2 Representation\n        +\nRobot Action\n        ↓\nAction-Conditioned Predictor\n        ↓\nFuture Latent State\n        ↓\nPlanning\n",[550,3599,3597],{"__ignoreMap":548},[131,3601],{},[537,3603,3604],{"id":3604},"数据规模",[14,3606,3607],{},"论文使用超过：",[542,3609,3612],{"className":3610,"code":3611,"language":547,"meta":548},[545],"1 million hours\n",[550,3613,3611],{"__ignoreMap":548},[14,3615,3616],{},"互联网视频做大规模预训练。",[14,3618,3619],{},"随后使用较少 robot interaction data 进行 action-conditioned post-training。",[131,3621],{},[537,3623,3624],{"id":3624},"与当前课题关系",[14,3626,3627],{},"目前机器人实验主要偏：",[542,3629,3632],{"className":3630,"code":3631,"language":547,"meta":548},[545],"Manipulation\n",[550,3633,3631],{"__ignoreMap":548},[14,3635,3636],{},"而不是移动导航。",[14,3638,3287],{},[430,3640,3641],{},[14,3642,3643],{},"不适合作为第一主 baseline，但必须关注 Foundation World Model 如何做预训练 + robot post-training。",[131,3645],{},[537,3647,3095],{"id":3648},"当前定位-3",[14,3650,3651],{},"重点学习：",[26,3653,3654,3657,3660,3663,3666,3669],{},[29,3655,3656],{},"JEPA；",[29,3658,3659],{},"Self-supervised representation learning；",[29,3661,3662],{},"Foundation video model；",[29,3664,3665],{},"Action-conditioned post-training；",[29,3667,3668],{},"latent planning；",[29,3670,3671],{},"大模型预训练与机器人小数据适配。",[131,3673],{},[10,3675,197],{"id":3676},"one-step-world-model",[537,3678,1291],{"id":3679},"基本信息-5",[14,3681,3682],{},[18,3683,1296],{},[14,3685,3686],{},"An Efficient and Multi-Modal Navigation System with One-Step World Model",[14,3688,3689],{},[18,3690,1327],{},[26,3692,3693,3699,3705],{},[29,3694,1332,3695],{},[258,3696,3697],{"href":3697,"rel":3698},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2601.12277",[262],[29,3700,1339,3701],{},[258,3702,3703],{"href":3703,"rel":3704},"https:\u002F\u002Frobotnav-bot.github.io\u002Fnav-onestepwm\u002F",[262],[29,3706,1346,3707],{},[258,3708,3709],{"href":3709,"rel":3710},"https:\u002F\u002Fgithub.com\u002Frobotnav-bot\u002FNOW",[262],[14,3712,3713],{},"机构包括：",[26,3715,3716,3719],{},[29,3717,3718],{},"Tsinghua University；",[29,3720,3721],{},"Xiaomi Robotics Lab。",[131,3723],{},[537,3725,3727],{"id":3726},"problems-addressed","Problems Addressed",[14,3729,3730],{},"针对传统 Navigation WM：",[542,3732,3735],{"className":3733,"code":3734,"language":547,"meta":548},[545],"Multi-Step Diffusion\n+\nAutoregressive Frame Generation\n        ↓\nHigh Latency\n",[550,3736,3734],{"__ignoreMap":548},[14,3738,3739],{},"提出：",[542,3741,3744],{"className":3742,"code":3743,"language":547,"meta":548},[545],"One-Step Generation\n",[550,3745,3743],{"__ignoreMap":548},[131,3747],{},[537,3749,3751],{"id":3750},"backbone","Backbone",[542,3753,3756],{"className":3754,"code":3755,"language":547,"meta":548},[545],"3D U-Net\n+\nEfficient Spatial-Temporal Attention\n",[550,3757,3755],{"__ignoreMap":548},[14,3759,2461],{},[430,3761,3762],{},[14,3763,3764],{},"在保留 future imagination 能力的同时，大幅降低推理延迟。",[131,3766],{},[537,3768,3770],{"id":3769},"navigation","Navigation",[14,3772,3773],{},"结合：",[542,3775,3778],{"className":3776,"code":3777,"language":547,"meta":548},[545],"Optimization-Based Planning\n+\nAnchor-Based Initialization\n",[550,3779,3777],{"__ignoreMap":548},[14,3781,3782],{},"支持：",[26,3784,3785,3788,3791],{},[29,3786,3787],{},"Image Goal；",[29,3789,3790],{},"Language Goal；",[29,3792,3793],{},"Point Goal。",[131,3795],{},[537,3797,3095],{"id":3798},"当前定位-4",[430,3800,3801],{},[14,3802,3803],{},[18,3804,3805],{},"实时 World Model 必读工作。",[14,3807,3808],{},"如果以后基于 X-MOBILITY 做 lightweight \u002F realtime WM，要重点对比。",[131,3810],{},[10,3812,206],{"id":3813},"ar-forcing",[537,3815,1291],{"id":3816},"基本信息-6",[14,3818,3819],{},[18,3820,1296],{},[14,3822,3823],{},"AR Forcing: Towards Long-Horizon Robot Navigation World Model",[14,3825,3826],{},[18,3827,1327],{},[26,3829,3830,3836],{},[29,3831,1332,3832],{},[258,3833,3834],{"href":3834,"rel":3835},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2605.31314",[262],[29,3837,3838],{},"Code: 当前 arXiv 信息称将发布，后续需要持续检查官方仓库",[131,3840],{},[537,3842,3843],{"id":3843},"问题",[14,3845,3846],{},"很多 Diffusion Navigation WM：",[14,3848,1987],{},[542,3850,3853],{"className":3851,"code":3852,"language":547,"meta":548},[545],"Ground Truth Context\n",[550,3854,3852],{"__ignoreMap":548},[14,3856,3857],{},"推理：",[542,3859,3862],{"className":3860,"code":3861,"language":547,"meta":548},[545],"Model Generated Context\n",[550,3863,3861],{"__ignoreMap":548},[14,3865,3866],{},"于是：",[542,3868,3871],{"className":3869,"code":3870,"language":547,"meta":548},[545],"Train-Test Distribution Shift\n        ↓\nAutoregressive Error Accumulation\n        ↓\nLong-Horizon Instability\n",[550,3872,3870],{"__ignoreMap":548},[131,3874],{},[537,3876,3878],{"id":3877},"method","Method",[14,3880,2851],{},[542,3882,3885],{"className":3883,"code":3884,"language":547,"meta":548},[545],"Autoregressive Training\n",[550,3886,3884],{"__ignoreMap":548},[14,3888,3889],{},"训练时显式把模型自己的 prediction 重新放入 context。",[14,3891,3892],{},"目的：",[430,3894,3895],{},[14,3896,3897],{},"让模型在训练阶段就暴露于真正 inference 时会遇到的 state distribution。",[131,3899],{},[537,3901,3903],{"id":3902},"dataset","Dataset",[14,3905,3906],{},"包括：",[26,3908,3909,3911,3913,3915],{},[29,3910,2936],{},[29,3912,2939],{},[29,3914,2945],{},[29,3916,3917],{},"TartanDrive。",[14,3919,3920],{},"与 NWM 系导航数据高度重合。",[131,3922],{},[537,3924,3095],{"id":3925},"当前定位-5",[430,3927,3928],{},[14,3929,3930],{},"NWM long-horizon problem 的重要 follow-up。",[14,3932,3933],{},"重点研究：",[26,3935,3936,3939,3942,3945],{},[29,3937,3938],{},"exposure bias；",[29,3940,3941],{},"autoregressive rollout；",[29,3943,3944],{},"diffusion training；",[29,3946,3947],{},"long-horizon navigation consistency。",[131,3949],{},[10,3951,215],{"id":3952},"navwam",[537,3954,1291],{"id":3955},"基本信息-7",[14,3957,3958],{},[18,3959,1296],{},[14,3961,3962],{},"NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation",[14,3964,3965],{},[18,3966,1327],{},[26,3968,3969,3975],{},[29,3970,1332,3971],{},[258,3972,3973],{"href":3973,"rel":3974},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.13494",[262],[29,3976,1339,3977],{},[258,3978,3979],{"href":3979,"rel":3980},"https:\u002F\u002Fdachii-azm.github.io\u002Fnavwam\u002F",[262],[131,3982],{},[537,3984,3180],{"id":3985},"核心问题-1",[14,3987,3988],{},"传统 Navigation WM：",[542,3990,3993],{"className":3991,"code":3992,"language":547,"meta":548},[545],"Observation\n   ↓\nWorld Model\n   ↓\nFuture\n   ↓\nExternal Planner \u002F CEM\n   ↓\nAction\n",[550,3994,3992],{"__ignoreMap":548},[14,3996,2377],{},[430,3998,3999],{},[14,4000,4001],{},"future prediction 本身不能直接执行，还需要 expensive planning。",[131,4003],{},[537,4005,215],{"id":4006},"navwam-1",[542,4008,4011],{"className":4009,"code":4010,"language":547,"meta":548},[545],"Observation + Goal\n        ↓\nWorld Action Model\n        ↓\nFuture Observation\n+\nGoal Progress\n+\nAction Chunk\n        ↓\nClosed-Loop Action\n",[550,4012,4010],{"__ignoreMap":548},[14,4014,2851],{},[430,4016,4017],{},[14,4018,4019],{},"把「预测未来」与「决定动作」联合建模。",[131,4021],{},[537,4023,4024],{"id":4024},"实机",[14,4026,4027],{},"使用：",[542,4029,4032],{"className":4030,"code":4031,"language":547,"meta":548},[545],"Diablo mobile robot\n",[550,4033,4031],{"__ignoreMap":548},[14,4035,4036],{},"并进行：",[542,4038,4041],{"className":4039,"code":4040,"language":547,"meta":548},[545],"Simulation Pretraining\n+\nReal-Robot Adaptation\n",[550,4042,4040],{"__ignoreMap":548},[131,4044],{},[537,4046,3095],{"id":4047},"当前定位-6",[430,4049,4050],{},[14,4051,4052],{},"用来观察 World Model 是否正在从「预测模型」演化到「World Action Model」。",[14,4054,4055],{},"这可能是未来非常重要的方向：",[542,4057,4060],{"className":4058,"code":4059,"language":547,"meta":548},[545],"WM\n↓\nWAM\n",[550,4061,4059],{"__ignoreMap":548},[131,4063],{},[10,4065,4067],{"id":4066},"gwmtowards-scalable-gaussian-world-models-for-robotic-manipulation","GWM：Towards Scalable Gaussian World Models for Robotic Manipulation",[537,4069,1291],{"id":4070},"基本信息-8",[14,4072,4073,4076],{},[18,4074,4075],{},"Venue：ICCV 2025。"," ICCV（International Conference on Computer Vision，国际计算机视觉大会）属于计算机视觉领域第一梯队顶会。",[14,4078,4079],{},[18,4080,1327],{},[26,4082,4083,4090,4096],{},[29,4084,4085,4086],{},"ICCV Open Access: ",[258,4087,4088],{"href":4088,"rel":4089},"https:\u002F\u002Fopenaccess.thecvf.com\u002Fcontent\u002FICCV2025\u002Fhtml\u002FLu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html",[262],[29,4091,1339,4092],{},[258,4093,4094],{"href":4094,"rel":4095},"https:\u002F\u002Fgaussian-world-model.github.io\u002F",[262],[29,4097,1346,4098],{},[258,4099,4100],{"href":4100,"rel":4101},"https:\u002F\u002Fgithub.com\u002FGaussian-World-Model\u002Fgaussianwm",[262],[537,4103,1463],{"id":4104},"一句话理解-1",[430,4106,4107],{},[14,4108,4109],{},[18,4110,4111],{},"GWM 的重点不是简单改变传感器输入，而是把 World Representation（世界表示）换成具有显式三维几何结构的 3D Gaussian，并预测动作作用后的 Future Gaussian Scene（未来高斯场景）。",[537,4113,4114],{"id":4114},"核心结构",[542,4116,4119],{"className":4117,"code":4118,"language":547,"meta":548},[545],"Current RGB Image(s)\n        ↓\n3D Reconstruction \u002F Lifting\n三维重建 \u002F 提升\n        ↓\nGaussian Splats\n3D 高斯场景\n        ↓\n3D Variational Autoencoder\n3D 变分自编码器\n        ↓\nCompact Gaussian Latent\n        ↓\nLatent Diffusion Transformer\n隐空间扩散 Transformer\n+\nRobot Action\n        ↓\nFuture Gaussian Latent\n        ↓\nFuture 3D Gaussian Scene\n未来 3D 高斯场景\n",[550,4120,4118],{"__ignoreMap":548},[14,4122,4123,4126],{},[18,4124,4125],{},"Gaussian Splatting（高斯泼溅 \u002F 3DGS）","：用大量带位置、大小、方向、颜色和透明度的三维高斯椭球表示场景。",[537,4128,4130],{"id":4129},"world-model-输出","World Model 输出",[14,4132,4133,4134,4137,4138,21],{},"主要是 ",[18,4135,4136],{},"Future 3D Gaussian Scene（未来 3D 高斯场景）","，不是直接 ",[550,4139,743],{},[537,4141,4142],{"id":4142},"怎么用于机器人",[26,4144,4145],{},[29,4146,4147,4150],{},[18,4148,4149],{},"Imitation Learning（模仿学习）","：用 GWM 学到的 3D representation 帮助 policy；",[26,4152,4153],{},[29,4154,4155,4158],{},[18,4156,4157],{},"Model-Based Reinforcement Learning（基于模型强化学习）","：把 GWM 当 Neural Simulator（神经网络模拟器）产生 imagined rollouts。",[537,4160,4024],{"id":4161},"实机-1",[14,4163,4164],{},"项目页展示 Franka Emika FR3 + Panda Gripper + RealSense D435i，真实观测使用第三视角 RGB-only 图像。因此 GWM 的关键创新是内部 3D representation 与 dynamics prediction，而不是单纯“加深度输入”。",[537,4166,3095],{"id":4167},"当前定位-7",[430,4169,4170],{},[14,4171,4172,4175,4176,21],{},[18,4173,4174],{},"3D Structured World Model \u002F Geometry-Aware World Model \u002F Simulator-oriented WM","，更偏 ",[18,4177,963],{},[131,4179],{},[10,4181,4183],{"id":4182},"dremadream-to-manipulate","DreMa：Dream to Manipulate",[537,4185,1291],{"id":4186},"基本信息-9",[14,4188,4189,4192],{},[18,4190,4191],{},"全名："," Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination",[14,4194,4195,4198],{},[18,4196,4197],{},"Venue：ICLR 2025。"," ICLR（International Conference on Learning Representations，国际学习表征会议）属于机器学习 \u002F 深度学习第一梯队顶会。",[14,4200,4201],{},[18,4202,1327],{},[26,4204,4205,4211,4218,4224],{},[29,4206,1332,4207],{},[258,4208,4209],{"href":4209,"rel":4210},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.14957",[262],[29,4212,4213,4214],{},"ICLR Proceedings: ",[258,4215,4216],{"href":4216,"rel":4217},"https:\u002F\u002Fproceedings.iclr.cc\u002Fpaper_files\u002Fpaper\u002F2025\u002Fhash\u002F8f0d446441a938d9de420a8ab8d7fd36-Abstract-Conference.html",[262],[29,4219,1339,4220],{},[258,4221,4222],{"href":4222,"rel":4223},"https:\u002F\u002Fdreamtomanipulate.github.io\u002F",[262],[29,4225,1346,4226],{},[258,4227,4228],{"href":4228,"rel":4229},"https:\u002F\u002Fgithub.com\u002Fleobarcellona\u002Fdrema_code",[262],[537,4231,1463],{"id":4232},"一句话理解-2",[430,4234,4235],{},[14,4236,4237],{},[18,4238,4239],{},"DreMa 把 World Model 做成 Learnable Digital Twin（可学习数字孪生），用 3D Gaussian Splatting + Physics Simulator 显式复制真实场景，然后在里面“做梦”，自动生成新的机器人训练示范。",[537,4241,4243],{"id":4242},"compositional-world-model组合式世界模型","Compositional World Model（组合式世界模型）",[14,4245,4246],{},"**Compositional（组合式）**表示场景中的物体、机器人和环境可以单独移动、变换和重新组合，而不只是作为一整张不可拆分的图像存在。",[542,4248,4251],{"className":4249,"code":4250,"language":547,"meta":548},[545],"Few Real Demonstrations\n少量真实示范\n        ↓\nLearnable Digital Twin\n可学习数字孪生\n        ↓\n改变物体 \u002F 目标 \u002F 场景配置\n        ↓\nPhysics Simulation\n物理模拟\n        ↓\nImagined Demonstrations\n想象出来的新示范\n        ↓\nImitation Learning\n模仿学习\n        ↓\nRobot Policy\n",[550,4252,4250],{"__ignoreMap":548},[537,4254,4255],{"id":4255},"核心用途",[14,4257,4258],{},"DreMa 不是主要做在线路径规划，而是：",[430,4260,4261],{},[14,4262,4263],{},[18,4264,4265],{},"World Model → Imagination → Data Generation → Policy Learning",[537,4267,4024],{"id":4268},"实机-2",[14,4270,4271],{},"使用 Franka Emika Panda，并展示 one-shot policy learning（单样本策略学习）：某些任务变化只需一个真实示范，再依靠 imagination 扩充训练数据。",[537,4273,3095],{"id":4274},"当前定位-8",[430,4276,4277],{},[14,4278,4279,4175,4282,21],{},[18,4280,4281],{},"3D Structured WM + Learnable Digital Twin + Compositional WM + Data Generation for Imitation Learning",[18,4283,4284],{},"Simulator + Robot Learning",[131,4286],{},[10,4288,4290],{"id":4289},"atlasa-world-model-for-spatial-intelligence","Atlas：A World Model for Spatial Intelligence",[537,4292,1291],{"id":4293},"基本信息-10",[14,4295,4296],{},[18,4297,4298],{},"发布方：World Labs",[14,4300,4301],{},[18,4302,4303],{},"时间：2026-09-01",[14,4305,4306,4309,4310,21],{},[18,4307,4308],{},"状态："," World Labs Research Release \u002F Product Research Model，",[18,4311,4312],{},"不是目前意义上的 CVPR \u002F ICML \u002F ICLR 正式会议论文",[14,4314,4315],{},[18,4316,1327],{},[26,4318,4319,4326,4333],{},[29,4320,4321,4322],{},"Official Blog: ",[258,4323,4324],{"href":4324,"rel":4325},"https:\u002F\u002Fwww.worldlabs.ai\u002Fblog\u002Fatlas",[262],[29,4327,4328,4329],{},"World Model Taxonomy: ",[258,4330,4331],{"href":4331,"rel":4332},"https:\u002F\u002Fwww.worldlabs.ai\u002Fblog\u002Ftaxonomy-of-world-models",[262],[29,4334,4335,4336],{},"World Labs: ",[258,4337,4338],{"href":4338,"rel":4339},"https:\u002F\u002Fwww.worldlabs.ai\u002F",[262],[537,4341,1463],{"id":4342},"一句话理解-3",[430,4344,4345],{},[14,4346,4347],{},[18,4348,4349],{},"Atlas 是面向 Spatial Intelligence（空间智能）的通用多模态 World Model，统一处理文本、图像、视频、相机位姿、深度和 3D，并进行世界生成、三维重建和时空模拟。",[537,4351,4353],{"id":4352},"spatial-intelligence空间智能","Spatial Intelligence（空间智能）",[14,4355,4356],{},"指 AI 不只知道“图像里有什么”，还理解物体在哪里、空间结构是什么、换视角会看到什么，以及世界如何随时间和动作变化。",[537,4358,4360],{"id":4359},"model-architecture模型架构","Model Architecture（模型架构）",[14,4362,4363],{},"官方描述为：",[430,4365,4366],{},[14,4367,4368],{},[18,4369,4370],{},"Multimodal Autoregressive Diffusion Transformer（多模态自回归扩散 Transformer）",[14,4372,4373],{},"目前可处理 Text（文本）、Image（图像）、Camera Pose（相机位姿）、Depth Map（深度图）、Video（视频序列）以及 3D spatial context（三维空间上下文）。",[537,4375,4377],{"id":4376},"atlas-能输出什么","Atlas 能输出什么",[14,4379,4380],{},"官方展示了：",[542,4382,4385],{"className":4383,"code":4384,"language":547,"meta":548},[545],"RGB Image \u002F Video\n+\nDepth\n+\nPoint Cloud\n+\n3D Gaussian Splats\n",[550,4386,4384],{"__ignoreMap":548},[14,4388,4389],{},"所以 Atlas 不只是“输出图像”，也可以产生 explicit 3D representation（显式三维表示）。",[537,4391,4393],{"id":4392},"robotics-simulation机器人仿真","Robotics Simulation（机器人仿真）",[542,4395,4398],{"className":4396,"code":4397,"language":547,"meta":548},[545],"真实环境手机视频\n        ↓\nAtlas\n        ↓\n3D Reconstruction\n三维重建\n        ↓\nVirtual Robot 沿给定路径运动\n        ↓\nAtlas 生成机器人将看到的 RGB + Depth\n",[550,4399,4397],{"__ignoreMap":548},[14,4401,4402,4403,4413],{},"这里要特别注意：",[18,4404,4405,4406,4409,4410,21],{},"当前公开演示更接近 ",[550,4407,4408],{},"Path → Atlas → Future Observation","，而不是 ",[550,4411,4412],{},"Atlas → Path"," 因此 Atlas 当前不是专门的导航 Planner。",[537,4415,3095],{"id":4416},"当前定位-9",[430,4418,4419],{},[14,4420,4421,4424,4425,21],{},[18,4422,4423],{},"Foundation World Model \u002F Spatial Intelligence Model（基础世界模型 \u002F 空间智能模型）","，目前更偏 ",[18,4426,4427],{},"CV + 3D Vision + Generative Model + Simulator",[131,4429],{},[10,4431,4432],{"id":4432},"统一论文阅读模板",[14,4434,4435],{},"以后每篇新论文都复制下面模板。",[537,4437,1291],{"id":4438},"基本信息-11",[14,4440,4441],{},[18,4442,4443],{},"Title：",[14,4445,4446],{},[18,4447,4448],{},"Authors：",[14,4450,4451],{},[18,4452,1304],{},[14,4454,4455],{},[18,4456,4457],{},"Year：",[14,4459,4460],{},[18,4461,4462],{},"Organization：",[14,4464,4465],{},[18,4466,4467],{},"Paper：",[14,4469,4470],{},[18,4471,4472],{},"arXiv：",[14,4474,4475],{},[18,4476,4477],{},"Project：",[14,4479,4480],{},[18,4481,4482],{},"GitHub：",[14,4484,4485],{},[18,4486,4487],{},"Model：",[14,4489,4490],{},[18,4491,4492],{},"Dataset：",[14,4494,4495],{},[18,4496,4497],{},"Citation \u002F BibTeX：",[131,4499],{},[537,4501,4502],{"id":4502},"一句话概括",[430,4504],{},[131,4506],{},[537,4508,4509],{"id":4509},"它解决什么问题",[131,4511],{},[537,4513,4514],{"id":4514},"为什么旧方法不行",[131,4516],{},[537,4518,4519],{"id":4519},"核心假设",[131,4521],{},[537,4523,4525],{"id":4524},"observation-input观测-输入","Observation \u002F Input（观测 \u002F 输入）",[131,4527],{},[537,4529,4531],{"id":4530},"world-representation世界表示","World Representation（世界表示）",[14,4533,4534],{},"记录模型内部怎么表示世界：Pixel \u002F Video latent、DINO feature、RSSM latent、BEV \u002F Occupancy、3D Gaussian、Explicit Digital Twin 等。",[131,4536],{},[537,4538,4540],{"id":4539},"world-model-output世界模型输出","World Model Output（世界模型输出）",[14,4542,4543],{},"明确记录：Future RGB \u002F Video、Future Latent、Future Depth、Future Occupancy、Future 3DGS、Reward \u002F Value \u002F Risk、Action Chunk 等。",[131,4545],{},[537,4547,4549],{"id":4548},"renderer-simulator-planner-定位","Renderer \u002F Simulator \u002F Planner 定位",[542,4551,4554],{"className":4552,"code":4553,"language":547,"meta":548},[545],"Renderer：\nSimulator：\nPlanner \u002F Policy：\n",[550,4555,4553],{"__ignoreMap":548},[131,4557],{},[537,4559,4561],{"id":4560},"cv-robotics-定位","CV ↔ Robotics 定位",[14,4563,4564],{},"记录论文主要创新更偏 CV \u002F 3D Vision，还是更偏 Planning \u002F Policy \u002F Robotics。",[131,4566],{},[537,4568,4570],{"id":4569},"最终-robot-output机器人执行输出","最终 Robot Output（机器人执行输出）",[14,4572,4573,4574,4576],{},"例如 ",[550,4575,743],{},"、vx \u002F vy \u002F wz、trajectory、joint position、end-effector pose、action chunk。",[131,4578],{},[537,4580,4582],{"id":4581},"world-model-定义","World Model 定义",[131,4584],{},[537,4586,3751],{"id":4587},"backbone-1",[131,4589],{},[537,4591,4592],{"id":4592},"参数量",[131,4594],{},[537,4596,4598],{"id":4597},"pretrained-model","Pretrained Model",[131,4600],{},[537,4602,3903],{"id":4603},"dataset-1",[131,4605],{},[537,4607,4609],{"id":4608},"training-pipeline","Training Pipeline",[131,4611],{},[537,4613,4615],{"id":4614},"loss","Loss",[131,4617],{},[537,4619,4621],{"id":4620},"optimizer-lr-batch","Optimizer \u002F LR \u002F Batch",[131,4623],{},[537,4625,3421],{"id":4626},"training-compute-1",[14,4628,4629],{},"记录：",[542,4631,4634],{"className":4632,"code":4633,"language":547,"meta":548},[545],"GPU：\nGPU 数量：\nGPU 显存：\n训练时间：\nEpoch \u002F Steps：\nPrecision：\nMulti-GPU Strategy：\n",[550,4635,4633],{"__ignoreMap":548},[131,4637],{},[537,4639,4641],{"id":4640},"inference-compute","Inference Compute",[14,4643,4629],{},[542,4645,4648],{"className":4646,"code":4647,"language":547,"meta":548},[545],"Device：\nP50 Latency：\nP95 Latency：\nFPS：\nVRAM：\nPower：\n",[550,4649,4647],{"__ignoreMap":548},[131,4651],{},[537,4653,4655],{"id":4654},"planner-policy","Planner \u002F Policy",[131,4657],{},[537,4659,4661],{"id":4660},"与-nav2-ros-的关系","与 Nav2 \u002F ROS 的关系",[131,4663],{},[537,4665,3438],{"id":4666},"simulation-1",[14,4668,4629],{},[542,4670,4673],{"className":4671,"code":4672,"language":547,"meta":548},[545],"Simulator：\nRobot：\nSensor：\nScene：\nDynamic Obstacle：\nDomain Randomization：\nControl Frequency：\n",[550,4674,4672],{"__ignoreMap":548},[131,4676],{},[537,4678,3453],{"id":4679},"real-robot-1",[14,4681,4629],{},[542,4683,4686],{"className":4684,"code":4685,"language":547,"meta":548},[545],"Robot：\nCompute：\nSensor：\nROS \u002F ROS2：\nControl Output：\nEnvironment：\nNumber of Trials：\nSuccess Rate：\n是否 Fine-tune：\n是否 Zero-Shot Sim2Real：\n",[550,4687,4685],{"__ignoreMap":548},[131,4689],{},[537,4691,4693],{"id":4692},"baselines","Baselines",[131,4695],{},[537,4697,4699],{"id":4698},"metrics","Metrics",[131,4701],{},[537,4703,4705],{"id":4704},"main-results","Main Results",[131,4707],{},[537,4709,4711],{"id":4710},"ablation","Ablation",[131,4713],{},[537,4715,4717],{"id":4716},"failure-cases","Failure Cases",[131,4719],{},[537,4721,4723],{"id":4722},"limitations","Limitations",[131,4725],{},[537,4727,4729],{"id":4728},"authors-future-work","Authors' Future Work",[131,4731],{},[537,4733,4734],{"id":4734},"我认为的潜在问题",[131,4736],{},[537,4738,4739],{"id":4739},"和已有工作的差异",[131,4741],{},[537,4743,4745],{"id":4744},"是否适合当我的-baseline","是否适合当我的 baseline",[14,4747,4748],{},"评分：",[542,4750,4753],{"className":4751,"code":4752,"language":547,"meta":548},[545],"代码完整度：\n数据完整度：\nCheckpoint：\n算力可承受：\n复现难度：\n移动机器人相关性：\n实机难度：\n创新空间：\n",[550,4754,4752],{"__ignoreMap":548},[131,4756],{},[537,4758,4759],{"id":4759},"复现结论",[131,4761],{},[10,4763,4765],{"id":4764},"research-question-池","Research Question 池",[430,4767,4768],{},[14,4769,4770],{},"这里只存「问题」，不直接写成“我的创新点”。",[537,4772,4773],{"id":4773},"template",[14,4775,4776],{},[18,4777,4778],{},"问题名称：",[14,4780,4781],{},[18,4782,4783],{},"来源论文：",[14,4785,4786],{},[18,4787,4788],{},"现象：",[14,4790,4791],{},[18,4792,4793],{},"证据：",[14,4795,4796],{},[18,4797,4798],{},"可能原因：",[14,4800,4801],{},[18,4802,4803],{},"已有方法怎么做：",[14,4805,4806],{},[18,4807,4808],{},"为什么现有方法还不够：",[14,4810,4811],{},[18,4812,4813],{},"我的 Hypothesis：",[14,4815,4816],{},[18,4817,4818],{},"最小验证实验：",[14,4820,4821],{},[18,4822,4823],{},"需要的 Baseline：",[14,4825,4826],{},[18,4827,4828],{},"需要的 Dataset：",[14,4830,4831],{},[18,4832,4833],{},"需要的 Compute：",[14,4835,4836],{},[18,4837,4838],{},"可能失败原因：",[14,4840,4841],{},[18,4842,4308],{},[542,4844,4847],{"className":4845,"code":4846,"language":547,"meta":548},[545],"未验证 \u002F 初步验证 \u002F 值得继续 \u002F 放弃\n",[550,4848,4846],{"__ignoreMap":548},[131,4850],{},[10,4852,4853],{"id":4853},"创新点候选池",[430,4855,4856],{},[14,4857,4858],{},"只有经过最小实验支持的 Research Question 才进入这里。",[14,4860,4861],{},"|Idea|来源|Problem|Hypothesis|修改位置|Main Experiment|Ablation|Compute|Risk|Status|",[14,4863,4864],{},"|---|---|---|---|---|---|---|---|---|---|\n|Dynamic WM|X-MOBILITY|高速\u002F多人动态障碍可能预测弱|显式 temporal motion modeling 能改善闭环避障|State Predictor \u002F Decoder|Dynamic Navigation|w\u002Fo motion module|In|In|待验证|",[14,4866,4867],{},"|Multi-Modal WM|X-MOBILITY|RGB geometry 不稳定|RGB + LiDAR\u002FDepth 提高鲁棒性|Encoder \u002F Fusion|OOD \u002F dark \u002F blur \u002F dynamic|RGB only \u002F LiDAR only \u002F Fusion|In|In|待验证|",[14,4869,4870],{},"|Navigation-Oriented WM|X-MOBILITY \u002F DINO-WM|RGB reconstruction 成本高且可能与导航弱相关|task-oriented latent\u002Foccupancy 更高效|Decoder \u002F Representation|SR + latency|RGB vs latent vs occupancy|In|In|待验证|",[14,4872,4873],{},"|Lightweight WM|X-MOBILITY \u002F NWM \u002F One-Step|WM 实时性差|distillation \u002F one-step \u002F pruning 可保性能降成本|WM \u002F Decoder|FPS \u002F SR \u002F VRAM|各压缩组件|In|In|待验证|",[14,4875,4876],{},"|Long-Horizon WM|NWM \u002F AR Forcing|AR rollout drift|AR-aware training 降低 exposure bias|Training Objective|2\u002F4\u002F8\u002F16s rollout|teacher context vs AR context|High|High|待验证|",[14,4878,4879],{},"|Uncertainty-Aware WM|X-MOBILITY \u002F Dreamer|单一未来不足|显式 uncertainty 可用于 risk-aware navigation|Latent distribution \u002F Policy|dynamic collision|deterministic vs uncertainty|中高|High|待验证|",[131,4881],{},[10,4883,4885],{"id":4884},"failure-case-日志","Failure Case 日志",[537,4887,4889],{"id":4888},"yyyy-mm-dd实验名称","YYYY-MM-DD：实验名称",[14,4891,4892],{},[18,4893,4487],{},[14,4895,4896],{},[18,4897,4898],{},"Checkpoint：",[14,4900,4901],{},[18,4902,4903],{},"Environment：",[14,4905,4906],{},[18,4907,4908],{},"Input：",[14,4910,4911],{},[18,4912,4913],{},"Expected：",[14,4915,4916],{},[18,4917,4918],{},"Actual：",[14,4920,4921],{},[18,4922,4923],{},"是否稳定复现：",[14,4925,4926],{},[18,4927,4928],{},"失败类型：",[26,4930,4932,4938,4944,4950,4956,4962,4968,4974,4980,4986,4992],{"className":4931},[2505],[29,4933,4935,4937],{"className":4934},[2509],[2511,4936],{"disabled":2513,"type":2514}," perception",[29,4939,4941,4943],{"className":4940},[2509],[2511,4942],{"disabled":2513,"type":2514}," world prediction",[29,4945,4947,4949],{"className":4946},[2509],[2511,4948],{"disabled":2513,"type":2514}," long-horizon drift",[29,4951,4953,4955],{"className":4952},[2509],[2511,4954],{"disabled":2513,"type":2514}," planner",[29,4957,4959,4961],{"className":4958},[2509],[2511,4960],{"disabled":2513,"type":2514}," policy",[29,4963,4965,4967],{"className":4964},[2509],[2511,4966],{"disabled":2513,"type":2514}," sim2real",[29,4969,4971,4973],{"className":4970},[2509],[2511,4972],{"disabled":2513,"type":2514}," latency",[29,4975,4977,4979],{"className":4976},[2509],[2511,4978],{"disabled":2513,"type":2514}," localization",[29,4981,4983,4985],{"className":4982},[2509],[2511,4984],{"disabled":2513,"type":2514}," sensor",[29,4987,4989,4991],{"className":4988},[2509],[2511,4990],{"disabled":2513,"type":2514}," control",[29,4993,4995,4997],{"className":4994},[2509],[2511,4996],{"disabled":2513,"type":2514}," other",[14,4999,5000],{},[18,5001,5002],{},"初步原因：",[14,5004,5005],{},[18,5006,5007],{},"需要做的对照实验：",[14,5009,5010],{},[18,5011,5012],{},"是否形成 Research Question：",[131,5014],{},[10,5016,5017],{"id":5017},"实验结果日志",[537,5019,5021],{"id":5020},"yyyy-mm-ddexperiment-id","YYYY-MM-DD：Experiment ID",[14,5023,5024],{},[18,5025,5026],{},"Goal：",[14,5028,5029],{},[18,5030,5031],{},"Git Commit：",[14,5033,5034],{},[18,5035,5036],{},"Config：",[14,5038,5039],{},[18,5040,4492],{},[14,5042,5043],{},[18,5044,5045],{},"GPU：",[14,5047,5048],{},[18,5049,5050],{},"Seed：",[14,5052,5053],{},[18,5054,5055],{},"Training Time：",[14,5057,5058],{},[18,5059,5060],{},"Metrics：",[5062,5063,5064,5084],"table",{},[5065,5066,5067],"thead",{},[5068,5069,5070,5074,5078,5081],"tr",{},[5071,5072,5073],"th",{},"Metric",[5071,5075,5077],{"align":5076},"right","Baseline",[5071,5079,5080],{"align":5076},"Ours",[5071,5082,5083],{"align":5076},"Delta",[5085,5086,5087],"tbody",{},[5068,5088,5089,5092,5094,5096],{},[5090,5091],"td",{},[5090,5093],{"align":5076},[5090,5095],{"align":5076},[5090,5097],{"align":5076},[14,5099,5100],{},[18,5101,5102],{},"结论：",[14,5104,5105],{},[18,5106,5107],{},"是否支持 Hypothesis：",[14,5109,5110],{},[18,5111,5112],{},"下一步：",[131,5114],{},[10,5116,5117],{"id":5117},"每日工作日志",[537,5119,5121],{"id":5120},"yyyy-mm-dd","YYYY-MM-DD",[14,5123,5124],{},[18,5125,5126],{},"今日目标：",[26,5128,5129],{},[29,5130],{},[14,5132,5133],{},[18,5134,5135],{},"今日阅读：",[26,5137,5138],{},[29,5139],{},[14,5141,5142],{},[18,5143,5144],{},"今日实验：",[26,5146,5147],{},[29,5148],{},[14,5150,5151],{},[18,5152,5153],{},"今天搞明白的问题：",[26,5155,5156],{},[29,5157],{},[14,5159,5160],{},[18,5161,5162],{},"仍然不理解：",[26,5164,5165],{},[29,5166],{},[14,5168,5169],{},[18,5170,5171],{},"Failure Case：",[26,5173,5174],{},[29,5175],{},[14,5177,5178],{},[18,5179,5180],{},"新的 Research Question：",[26,5182,5183],{},[29,5184],{},[14,5186,5187],{},[18,5188,5189],{},"新的 Idea：",[26,5191,5192],{},[29,5193],{},[14,5195,5196],{},[18,5197,5112],{},[26,5199,5200],{},[29,5201],{},[131,5203],{},[10,5205,5206],{"id":5206},"阶段性目标",[537,5208,5210],{"id":5209},"阶段-a建立方向认知","阶段 A：建立方向认知",[26,5212,5214],{"className":5213},[2505],[29,5215,5217,5219],{"className":5216},[2509],[2511,5218],{"disabled":2513,"type":2514}," 精读 X-MOBILITY",[26,5221,5223],{"className":5222},[2505],[29,5224,5226,5228],{"className":5225},[2509],[2511,5227],{"disabled":2513,"type":2514}," 精读 NWM",[26,5230,5232],{"className":5231},[2505],[29,5233,5235,5237],{"className":5234},[2509],[2511,5236],{"disabled":2513,"type":2514}," 精读 DINO-WM",[26,5239,5241],{"className":5240},[2505],[29,5242,5244,5246],{"className":5243},[2509],[2511,5245],{"disabled":2513,"type":2514}," 阅读 DreamerNav",[26,5248,5250],{"className":5249},[2505],[29,5251,5253,5255],{"className":5252},[2509],[2511,5254],{"disabled":2513,"type":2514}," 阅读 One-Step WM",[26,5257,5259],{"className":5258},[2505],[29,5260,5262,5264],{"className":5261},[2509],[2511,5263],{"disabled":2513,"type":2514}," 阅读 AR Forcing",[26,5266,5268],{"className":5267},[2505],[29,5269,5271,5273],{"className":5270},[2509],[2511,5272],{"disabled":2513,"type":2514}," 阅读 NavWAM",[26,5275,5277],{"className":5276},[2505],[29,5278,5280,5282],{"className":5279},[2509],[2511,5281],{"disabled":2513,"type":2514}," 精读 GWM",[26,5284,5286],{"className":5285},[2505],[29,5287,5289,5291],{"className":5288},[2509],[2511,5290],{"disabled":2513,"type":2514}," 阅读 DreMa \u002F Dream to Manipulate",[26,5293,5295],{"className":5294},[2505],[29,5296,5298,5300],{"className":5297},[2509],[2511,5299],{"disabled":2513,"type":2514}," 阅读 Atlas 官方技术说明",[26,5302,5304],{"className":5303},[2505],[29,5305,5307,5309],{"className":5306},[2509],[2511,5308],{"disabled":2513,"type":2514}," 理解 Renderer \u002F Simulator \u002F Planner 分类",[26,5311,5313],{"className":5312},[2505],[29,5314,5316,5318],{"className":5315},[2509],[2511,5317],{"disabled":2513,"type":2514}," 理解 RGB \u002F Latent \u002F 3DGS 等不同 WM 输出",[26,5320,5322],{"className":5321},[2505],[29,5323,5325,5327],{"className":5324},[2509],[2511,5326],{"disabled":2513,"type":2514}," 理解 World Model + Policy",[26,5329,5331],{"className":5330},[2505],[29,5332,5334,5336],{"className":5333},[2509],[2511,5335],{"disabled":2513,"type":2514}," 理解 World Model + Planning",[26,5338,5340],{"className":5339},[2505],[29,5341,5343,5345],{"className":5342},[2509],[2511,5344],{"disabled":2513,"type":2514}," 理解 Dreamer \u002F RSSM",[537,5347,5349],{"id":5348},"阶段-b建立-baseline","阶段 B：建立 Baseline",[26,5351,5353],{"className":5352},[2505],[29,5354,5356,5358],{"className":5355},[2509],[2511,5357],{"disabled":2513,"type":2514}," 跑通 X-MOBILITY official checkpoint",[26,5360,5362],{"className":5361},[2505],[29,5363,5365,2650],{"className":5364},[2509],[2511,5366],{"disabled":2513,"type":2514},[26,5368,5370],{"className":5369},[2505],[29,5371,5373,5375],{"className":5372},[2509],[2511,5374],{"disabled":2513,"type":2514}," 下载并检查 dataset",[26,5377,5379],{"className":5378},[2505],[29,5380,5382,5384],{"className":5381},[2509],[2511,5383],{"disabled":2513,"type":2514}," 跑一次 fine-tuning",[26,5386,5388],{"className":5387},[2505],[29,5389,5391,5393],{"className":5390},[2509],[2511,5392],{"disabled":2513,"type":2514}," 记录真实 compute cost",[26,5395,5397],{"className":5396},[2505],[29,5398,5400,5402],{"className":5399},[2509],[2511,5401],{"disabled":2513,"type":2514}," 在本实验室 GPU 上建立可复现配置",[537,5404,5406],{"id":5405},"阶段-cfailure-case-analysis","阶段 C：Failure Case Analysis",[26,5408,5410,5416,5422,5428,5434,5440,5446,5452,5458,5464],{"className":5409},[2505],[29,5411,5413,5415],{"className":5412},[2509],[2511,5414],{"disabled":2513,"type":2514}," static",[29,5417,5419,5421],{"className":5418},[2509],[2511,5420],{"disabled":2513,"type":2514}," cluttered",[29,5423,5425,5427],{"className":5424},[2509],[2511,5426],{"disabled":2513,"type":2514}," narrow corridor",[29,5429,5431,5433],{"className":5430},[2509],[2511,5432],{"disabled":2513,"type":2514}," dark",[29,5435,5437,5439],{"className":5436},[2509],[2511,5438],{"disabled":2513,"type":2514}," motion blur",[29,5441,5443,5445],{"className":5442},[2509],[2511,5444],{"disabled":2513,"type":2514}," fast dynamic obstacle",[29,5447,5449,5451],{"className":5448},[2509],[2511,5450],{"disabled":2513,"type":2514}," crossing pedestrian",[29,5453,5455,5457],{"className":5454},[2509],[2511,5456],{"disabled":2513,"type":2514}," multi-agent",[29,5459,5461,5463],{"className":5460},[2509],[2511,5462],{"disabled":2513,"type":2514}," OOD environment",[29,5465,5467,5469],{"className":5466},[2509],[2511,5468],{"disabled":2513,"type":2514}," long-horizon",[537,5471,5473],{"id":5472},"阶段-dresearch-question","阶段 D：Research Question",[26,5475,5477],{"className":5476},[2505],[29,5478,5480,5482],{"className":5479},[2509],[2511,5481],{"disabled":2513,"type":2514}," 选择一个稳定 failure",[26,5484,5486],{"className":5485},[2505],[29,5487,5489,5491],{"className":5488},[2509],[2511,5490],{"disabled":2513,"type":2514}," 找到可能原因",[26,5493,5495],{"className":5494},[2505],[29,5496,5498,5500],{"className":5497},[2509],[2511,5499],{"disabled":2513,"type":2514}," 查 related work",[26,5502,5504],{"className":5503},[2505],[29,5505,5507,5509],{"className":5506},[2509],[2511,5508],{"disabled":2513,"type":2514}," 提出 hypothesis",[26,5511,5513],{"className":5512},[2505],[29,5514,5516,5518],{"className":5515},[2509],[2511,5517],{"disabled":2513,"type":2514}," 做最小验证",[537,5520,5522],{"id":5521},"阶段-e第一篇论文","阶段 E：第一篇论文",[26,5524,5526,5532,5538,5544,5549,5555,5561,5567,5573,5579,5585],{"className":5525},[2505],[29,5527,5529,5531],{"className":5528},[2509],[2511,5530],{"disabled":2513,"type":2514}," Baselines",[29,5533,5535,5537],{"className":5534},[2509],[2511,5536],{"disabled":2513,"type":2514}," Ours",[29,5539,5541,5543],{"className":5540},[2509],[2511,5542],{"disabled":2513,"type":2514}," Main experiments",[29,5545,5547,2764],{"className":5546},[2509],[2511,5548],{"disabled":2513,"type":2514},[29,5550,5552,5554],{"className":5551},[2509],[2511,5553],{"disabled":2513,"type":2514}," Efficiency",[29,5556,5558,5560],{"className":5557},[2509],[2511,5559],{"disabled":2513,"type":2514}," Simulation",[29,5562,5564,5566],{"className":5563},[2509],[2511,5565],{"disabled":2513,"type":2514}," Real robot",[29,5568,5570,5572],{"className":5569},[2509],[2511,5571],{"disabled":2513,"type":2514}," Figures",[29,5574,5576,5578],{"className":5575},[2509],[2511,5577],{"disabled":2513,"type":2514}," Tables",[29,5580,5582,5584],{"className":5581},[2509],[2511,5583],{"disabled":2513,"type":2514}," Writing",[29,5586,5588,5590],{"className":5587},[2509],[2511,5589],{"disabled":2513,"type":2514}," Submission",{"title":548,"searchDepth":96,"depth":96,"links":5592},[5593,5594,5595,5596,5597,5598,5603,5604,5609,5610,5611,5612,5613,5614,5619,5641,5651,5658,5667,5674,5681,5688,5695,5704,5712,5721,5759,5762,5763,5766,5769,5772],{"id":12,"depth":96,"text":12},{"id":135,"depth":96,"text":135},{"id":248,"depth":96,"text":248},{"id":369,"depth":96,"text":369},{"id":428,"depth":96,"text":428},{"id":535,"depth":96,"text":535,"children":5599},[5600,5601,5602],{"id":539,"depth":102,"text":540},{"id":588,"depth":102,"text":589},{"id":645,"depth":102,"text":646},{"id":692,"depth":96,"text":693},{"id":749,"depth":96,"text":79,"children":5605},[5606,5607,5608],{"id":752,"depth":102,"text":753},{"id":768,"depth":102,"text":769},{"id":780,"depth":102,"text":781},{"id":837,"depth":96,"text":838},{"id":905,"depth":96,"text":906},{"id":932,"depth":96,"text":933},{"id":1019,"depth":96,"text":1020},{"id":1075,"depth":96,"text":1075},{"id":1126,"depth":96,"text":1126,"children":5615},[5616,5617,5618],{"id":1129,"depth":102,"text":37},{"id":1185,"depth":102,"text":1186},{"id":1237,"depth":102,"text":40},{"id":1287,"depth":96,"text":1288,"children":5620},[5621,5622,5623,5624,5625,5626,5627,5628,5629,5630,5631,5632,5633,5634,5635,5636,5637,5638,5639,5640],{"id":1291,"depth":102,"text":1291},{"id":1463,"depth":102,"text":1463},{"id":1502,"depth":102,"text":1502},{"id":1537,"depth":102,"text":1538},{"id":1591,"depth":102,"text":1592},{"id":1617,"depth":102,"text":1618},{"id":1654,"depth":102,"text":1655},{"id":1703,"depth":102,"text":1704},{"id":1748,"depth":102,"text":1748},{"id":1823,"depth":102,"text":1824},{"id":1862,"depth":102,"text":1862},{"id":1919,"depth":102,"text":1920},{"id":1975,"depth":102,"text":56},{"id":2033,"depth":102,"text":1387},{"id":2064,"depth":102,"text":2065},{"id":2123,"depth":102,"text":2124},{"id":2198,"depth":102,"text":2198},{"id":2245,"depth":102,"text":2246},{"id":2355,"depth":102,"text":2356},{"id":2500,"depth":102,"text":2501},{"id":2796,"depth":96,"text":161,"children":5642},[5643,5644,5645,5646,5647,5648,5649,5650],{"id":2799,"depth":102,"text":1291},{"id":2862,"depth":102,"text":2862},{"id":2894,"depth":102,"text":1862},{"id":2928,"depth":102,"text":2928},{"id":2960,"depth":102,"text":2961},{"id":3004,"depth":102,"text":3005},{"id":3035,"depth":102,"text":3036},{"id":3095,"depth":102,"text":3095},{"id":3135,"depth":96,"text":173,"children":5652},[5653,5654,5655,5656,5657],{"id":3138,"depth":102,"text":1291},{"id":3180,"depth":102,"text":3180},{"id":3209,"depth":102,"text":3209},{"id":3266,"depth":102,"text":3267},{"id":3297,"depth":102,"text":3095},{"id":3329,"depth":96,"text":182,"children":5659},[5660,5661,5662,5663,5664,5665,5666],{"id":3332,"depth":102,"text":1291},{"id":3389,"depth":102,"text":3389},{"id":3420,"depth":102,"text":3421},{"id":3437,"depth":102,"text":3438},{"id":3452,"depth":102,"text":3453},{"id":3479,"depth":102,"text":3036},{"id":3525,"depth":102,"text":3095},{"id":3540,"depth":96,"text":191,"children":5668},[5669,5670,5671,5672,5673],{"id":3543,"depth":102,"text":1291},{"id":3581,"depth":102,"text":3581},{"id":3604,"depth":102,"text":3604},{"id":3624,"depth":102,"text":3624},{"id":3648,"depth":102,"text":3095},{"id":3676,"depth":96,"text":197,"children":5675},[5676,5677,5678,5679,5680],{"id":3679,"depth":102,"text":1291},{"id":3726,"depth":102,"text":3727},{"id":3750,"depth":102,"text":3751},{"id":3769,"depth":102,"text":3770},{"id":3798,"depth":102,"text":3095},{"id":3813,"depth":96,"text":206,"children":5682},[5683,5684,5685,5686,5687],{"id":3816,"depth":102,"text":1291},{"id":3843,"depth":102,"text":3843},{"id":3877,"depth":102,"text":3878},{"id":3902,"depth":102,"text":3903},{"id":3925,"depth":102,"text":3095},{"id":3952,"depth":96,"text":215,"children":5689},[5690,5691,5692,5693,5694],{"id":3955,"depth":102,"text":1291},{"id":3985,"depth":102,"text":3180},{"id":4006,"depth":102,"text":215},{"id":4024,"depth":102,"text":4024},{"id":4047,"depth":102,"text":3095},{"id":4066,"depth":96,"text":4067,"children":5696},[5697,5698,5699,5700,5701,5702,5703],{"id":4070,"depth":102,"text":1291},{"id":4104,"depth":102,"text":1463},{"id":4114,"depth":102,"text":4114},{"id":4129,"depth":102,"text":4130},{"id":4142,"depth":102,"text":4142},{"id":4161,"depth":102,"text":4024},{"id":4167,"depth":102,"text":3095},{"id":4182,"depth":96,"text":4183,"children":5705},[5706,5707,5708,5709,5710,5711],{"id":4186,"depth":102,"text":1291},{"id":4232,"depth":102,"text":1463},{"id":4242,"depth":102,"text":4243},{"id":4255,"depth":102,"text":4255},{"id":4268,"depth":102,"text":4024},{"id":4274,"depth":102,"text":3095},{"id":4289,"depth":96,"text":4290,"children":5713},[5714,5715,5716,5717,5718,5719,5720],{"id":4293,"depth":102,"text":1291},{"id":4342,"depth":102,"text":1463},{"id":4352,"depth":102,"text":4353},{"id":4359,"depth":102,"text":4360},{"id":4376,"depth":102,"text":4377},{"id":4392,"depth":102,"text":4393},{"id":4416,"depth":102,"text":3095},{"id":4432,"depth":96,"text":4432,"children":5722},[5723,5724,5725,5726,5727,5728,5729,5730,5731,5732,5733,5734,5735,5736,5737,5738,5739,5740,5741,5742,5743,5744,5745,5746,5747,5748,5749,5750,5751,5752,5753,5754,5755,5756,5757,5758],{"id":4438,"depth":102,"text":1291},{"id":4502,"depth":102,"text":4502},{"id":4509,"depth":102,"text":4509},{"id":4514,"depth":102,"text":4514},{"id":4519,"depth":102,"text":4519},{"id":4524,"depth":102,"text":4525},{"id":4530,"depth":102,"text":4531},{"id":4539,"depth":102,"text":4540},{"id":4548,"depth":102,"text":4549},{"id":4560,"depth":102,"text":4561},{"id":4569,"depth":102,"text":4570},{"id":4581,"depth":102,"text":4582},{"id":4587,"depth":102,"text":3751},{"id":4592,"depth":102,"text":4592},{"id":4597,"depth":102,"text":4598},{"id":4603,"depth":102,"text":3903},{"id":4608,"depth":102,"text":4609},{"id":4614,"depth":102,"text":4615},{"id":4620,"depth":102,"text":4621},{"id":4626,"depth":102,"text":3421},{"id":4640,"depth":102,"text":4641},{"id":4654,"depth":102,"text":4655},{"id":4660,"depth":102,"text":4661},{"id":4666,"depth":102,"text":3438},{"id":4679,"depth":102,"text":3453},{"id":4692,"depth":102,"text":4693},{"id":4698,"depth":102,"text":4699},{"id":4704,"depth":102,"text":4705},{"id":4710,"depth":102,"text":4711},{"id":4716,"depth":102,"text":4717},{"id":4722,"depth":102,"text":4723},{"id":4728,"depth":102,"text":4729},{"id":4734,"depth":102,"text":4734},{"id":4739,"depth":102,"text":4739},{"id":4744,"depth":102,"text":4745},{"id":4759,"depth":102,"text":4759},{"id":4764,"depth":96,"text":4765,"children":5760},[5761],{"id":4773,"depth":102,"text":4773},{"id":4853,"depth":96,"text":4853},{"id":4884,"depth":96,"text":4885,"children":5764},[5765],{"id":4888,"depth":102,"text":4889},{"id":5017,"depth":96,"text":5017,"children":5767},[5768],{"id":5020,"depth":102,"text":5021},{"id":5117,"depth":96,"text":5117,"children":5770},[5771],{"id":5120,"depth":102,"text":5121},{"id":5206,"depth":96,"text":5206,"children":5773},[5774,5775,5776,5777,5778],{"id":5209,"depth":102,"text":5210},{"id":5348,"depth":102,"text":5349},{"id":5405,"depth":102,"text":5406},{"id":5472,"depth":102,"text":5473},{"id":5521,"depth":102,"text":5522},"\u002Fen-us\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie",null,"2026-09-02","md","posts\u002F2026-09-02-WM论文罗列",false,"en-US","en-us",{},{"title":5,"description":548},"\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","_i18n\u002Fen-us\u002Fposts\u002F2026-09-02-WM论文罗列","t53QgkGn0LJKOrJ7EkCgZ3kKH1j8Lrrh1ggV3N9_jlk",[5780,5793],{"path":5794,"title":5795,"date":5796,"localeSlug":5786,"i18nKey":5797},"\u002Fen-us\u002Fblog\u002F2026-07-21-vscode-ren-wu-lan-qi-dong-codex-cha-jian-da-bu-kai","Linux下从任务栏启动VS Code时Codex插件打不开的解决方法","2026-07-21","posts\u002F2026-07-21-VSCode任务栏启动Codex插件打不开",{"variants":5799},[5800,5801,5804,5807,5810],{"path":5779,"localeSlug":5786,"i18nKey":5783},{"path":5802,"localeSlug":5803,"i18nKey":5783},"\u002Fzh-hant\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-hant",{"path":5805,"localeSlug":5806,"i18nKey":5783},"\u002Fzh-hk\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-hk",{"path":5808,"localeSlug":5809,"i18nKey":5783},"\u002Fzh-tw\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-tw",{"path":5811,"localeSlug":5812,"i18nKey":5783},"\u002Fzh-cn\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-cn",[5779,5789,5802,5789,5805,5789,5808,5789,5811,5789],1788531234866]