[{"data":1,"prerenderedAt":6732},["ShallowReactive",2],{"page-\u002Fzh-hk\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":3,"surrounding-\u002Fzh-hk\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":6710,"language-switcher-data-\u002Fzh-hk\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":6716,"blog-i18n-paths-\u002Fzh-hk\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie":6731},{"id":4,"title":5,"body":6,"canonicalPath":6697,"chapterDepth":6698,"chapterOrder":6698,"date":6699,"description":1243,"docI18nKey":6698,"docKey":6698,"docRoot":6698,"docTitle":6698,"extension":6700,"i18nKey":6701,"isBlogPost":3450,"isWikiDoc":6702,"isWikiIndex":6702,"layout":6698,"legacyPath":6698,"locale":6703,"localeSlug":6704,"meta":6705,"navigation":3450,"path":6697,"seo":6706,"sourcePath":6707,"sourceStem":6701,"stem":6708,"wikiDepth":6698,"__hash__":6709},"content\u002F_i18n\u002Fzh-hk\u002Fposts\u002F2026-09-02-WM论文罗列.md","WM論文日誌",{"type":7,"value":8,"toc":6507},"minimark",[9,13,22,25,71,74,98,101,104,384,386,389,708,710,713,892,894,897,906,1226,1228,1231,1236,1247,1250,1273,1277,1283,1285,1308,1311,1317,1320,1324,1330,1332,1352,1355,1357,1361,1367,1370,1396,1406,1408,1411,1415,1421,1427,1431,1436,1439,1443,1448,1451,1454,1486,1488,1492,1616,1619,1621,1625,1723,1725,1729,1734,1740,1888,1890,1894,2071,2073,2076,2079,2114,2116,2119,2122,2125,2131,2134,2140,2143,2157,2160,2167,2169,2173,2175,2183,2186,2192,2194,2211,2213,2216,2218,2225,2227,2233,2235,2255,2257,2261,2264,2269,2272,2277,2279,2284,2295,2300,2332,2337,2359,2364,2371,2374,2406,2408,2411,2414,2419,2422,2428,2431,2437,2440,2445,2447,2450,2456,2459,2465,2468,2474,2477,2480,2482,2486,2489,2494,2497,2500,2506,2510,2513,2516,2522,2525,2528,2534,2536,2540,2543,2549,2552,2555,2560,2562,2566,2568,2574,2577,2580,2586,2589,2594,2597,2599,2603,2606,2609,2615,2618,2621,2627,2630,2636,2639,2646,2648,2652,2654,2660,2663,2669,2671,2674,2680,2682,2688,2691,2693,2696,2699,2702,2706,2712,2714,2719,2722,2728,2731,2736,2740,2746,2749,2755,2757,2763,2766,2768,2772,2776,2782,2785,2789,2795,2797,2802,2805,2807,2810,2813,2819,2822,2828,2831,2836,2839,2845,2848,2853,2856,2862,2864,2868,2871,2877,2880,2883,2889,2892,2898,2901,2906,2909,2915,2918,2920,2923,2926,2932,2935,2941,2944,2950,2953,2958,2961,2967,2970,2976,2978,2981,2984,2990,2993,2999,3002,3007,3009,3013,3016,3030,3033,3056,3058,3062,3065,3076,3079,3090,3093,3131,3133,3136,3139,3145,3149,3152,3156,3159,3165,3169,3172,3175,3178,3180,3184,3187,3190,3195,3198,3203,3207,3210,3216,3219,3225,3228,3233,3237,3243,3245,3250,3253,3273,3277,3280,3285,3288,3290,3294,3299,3303,3306,3312,3315,3320,3324,3327,3333,3335,3340,3344,3347,3353,3356,3362,3364,3369,3373,3376,3396,3399,3405,3409,3411,3417,3420,3426,3428,3433,3435,3439,3645,3647,3650,3653,3657,3659,3663,3666,3669,3673,3696,3701,3707,3709,3712,3715,3721,3724,3730,3733,3739,3741,3744,3747,3753,3756,3761,3764,3770,3773,3775,3777,3780,3797,3799,3804,3806,3810,3813,3817,3823,3826,3832,3835,3839,3842,3848,3850,3853,3856,3859,3870,3873,3878,3880,3884,3888,3891,3896,3900,3903,3908,3912,3915,3921,3924,3927,3938,3940,3942,3949,3952,3969,3971,3974,3977,3981,3984,3988,3990,3994,4011,4013,4016,4019,4024,4027,4033,4035,4040,4042,4045,4048,4054,4056,4062,4065,4079,4082,4088,4091,4093,4097,4100,4114,4117,4122,4124,4127,4134,4137,4154,4156,4159,4162,4166,4169,4173,4176,4180,4201,4206,4212,4214,4217,4223,4226,4232,4235,4238,4243,4245,4249,4251,4257,4260,4262,4266,4272,4275,4277,4281,4284,4290,4293,4299,4302,4304,4307,4310,4315,4318,4338,4341,4346,4348,4351,4358,4361,4363,4366,4369,4373,4376,4380,4399,4401,4403,4406,4412,4415,4421,4423,4426,4429,4435,4438,4441,4443,4446,4449,4455,4458,4460,4465,4467,4470,4473,4493,4495,4498,4501,4505,4508,4512,4529,4532,4540,4542,4545,4548,4554,4557,4563,4565,4569,4575,4577,4582,4584,4588,4591,4597,4600,4611,4613,4616,4623,4626,4628,4631,4634,4638,4641,4645,4655,4657,4660,4663,4665,4671,4674,4680,4683,4689,4691,4694,4696,4702,4705,4708,4713,4715,4719,4722,4733,4736,4738,4741,4746,4749,4763,4765,4768,4771,4775,4778,4782,4794,4796,4799,4802,4808,4810,4815,4817,4820,4826,4828,4833,4835,4837,4840,4846,4849,4855,4857,4860,4865,4868,4874,4876,4880,4883,4889,4893,4911,4914,4921,4924,4930,4936,4940,4949,4952,4966,4969,4972,4975,4985,4987,4991,4994,5000,5006,5010,5034,5037,5044,5048,5051,5057,5060,5063,5070,5073,5076,5079,5089,5091,5095,5098,5103,5108,5117,5121,5142,5145,5152,5156,5159,5163,5166,5173,5176,5180,5183,5189,5192,5196,5202,5216,5219,5230,5232,5235,5238,5241,5246,5251,5255,5260,5265,5270,5275,5280,5285,5290,5295,5300,5302,5305,5307,5309,5312,5314,5317,5319,5322,5324,5328,5330,5334,5337,5339,5343,5346,5348,5352,5358,5360,5364,5367,5369,5373,5379,5381,5385,5387,5390,5392,5395,5397,5401,5403,5406,5408,5412,5414,5418,5420,5424,5426,5429,5432,5438,5440,5444,5446,5452,5454,5457,5459,5463,5465,5468,5470,5476,5478,5481,5483,5489,5491,5495,5497,5501,5503,5507,5509,5513,5515,5519,5521,5525,5527,5531,5533,5536,5538,5541,5543,5547,5550,5556,5558,5561,5563,5567,5572,5575,5580,5585,5590,5595,5600,5605,5610,5615,5620,5625,5630,5635,5640,5644,5650,5652,5655,5660,5872,5874,5878,5882,5886,5891,5896,5901,5906,5911,5916,5921,5990,5995,6000,6005,6007,6010,6014,6019,6024,6029,6033,6038,6043,6048,6053,6083,6088,6093,6098,6100,6103,6107,6112,6116,6121,6125,6130,6134,6139,6143,6148,6152,6157,6161,6166,6170,6175,6179,6183,6187,6189,6192,6196,6289,6293,6331,6335,6398,6402,6435,6439],[10,11,12],"h2",{"id":12},"使用説明",[14,15,16,17,21],"p",{},"本文用於長期記錄 ",[18,19,20],"strong",{},"World Model（WM）在機器人導航、路徑規劃、具身智能方向的論文閲讀、復現、實驗與創新點分析","。",[14,23,24],{},"當前重點關注：",[26,27,28,32,35,38,41,44,47,50,53,56,59,62,65,68],"ul",{},[29,30,31],"li",{},"Navigation World Model",[29,33,34],{},"Latent World Model",[29,36,37],{},"World Model + Policy",[29,39,40],{},"World Model + Model-Based RL",[29,42,43],{},"World Model + MPC \u002F CEM \u002F MPPI",[29,45,46],{},"動態障礙預測與導航",[29,48,49],{},"World Model 實時化與輕量化",[29,51,52],{},"Sim2Real",[29,54,55],{},"ROS2 \u002F Nav2 \u002F 實機部署",[29,57,58],{},"3D Structured World Model（3D 結構化世界模型）",[29,60,61],{},"Gaussian World Model（高斯世界模型）",[29,63,64],{},"Learnable Digital Twin（可學習數字孿生）",[29,66,67],{},"Renderer \u002F Simulator \u002F Planner 功能分類",[29,69,70],{},"World Model 的輸入、世界表示、輸出與決策模塊之間的關係",[14,72,73],{},"當前階段的目標不是立即確定創新點，而是：",[75,76,77,80,83,86,89,92,95],"ol",{},[29,78,79],{},"建立 World Model + Navigation 方向的論文譜系；",[29,81,82],{},"找到適合作為第一篇工作的強 baseline；",[29,84,85],{},"完整復現至少一個 baseline；",[29,87,88],{},"分析 failure case 和 limitation；",[29,90,91],{},"從實際問題中尋找 research question；",[29,93,94],{},"再把 research question 轉化為可驗證的創新點；",[29,96,97],{},"最終完成仿真、消融、對比和實機閉環實驗。",[99,100],"hr",{},[10,102,103],{"id":103},"論文目錄",[105,106,107,132],"table",{},[108,109,110],"thead",{},[111,112,113,117,120,123,126,129],"tr",{},[114,115,116],"th",{},"論文",[114,118,119],{},"Venue \u002F 狀態",[114,121,122],{},"核心路線",[114,124,125],{},"與移動導航關係",[114,127,128],{},"當前定位",[114,130,131],{},"閲讀優先級",[133,134,135,164,188,211,234,255,277,298,319,341,363],"tbody",{},[111,136,137,143,148,151,156,161],{},[138,139,140],"td",{},[18,141,142],{},"X-MOBILITY",[138,144,145],{},[18,146,147],{},"ICRA 2025",[138,149,150],{},"Latent WM + Policy",[138,152,153],{},[18,154,155],{},"直接相關",[138,157,158],{},[18,159,160],{},"第一主 baseline 候選",[138,162,163],{},"⭐⭐⭐⭐⭐",[111,165,166,171,176,179,183,186],{},[138,167,168],{},[18,169,170],{},"Navigation World Models（NWM）",[138,172,173],{},[18,174,175],{},"CVPR 2025 Oral \u002F Best Paper Honorable Mention",[138,177,178],{},"Diffusion Video WM + Planning",[138,180,181],{},[18,182,155],{},[138,184,185],{},"Navigation WM 標誌性工作",[138,187,163],{},[111,189,190,195,200,203,206,209],{},[138,191,192],{},[18,193,194],{},"DINO-WM",[138,196,197],{},[18,198,199],{},"ICML 2025",[138,201,202],{},"Pretrained Visual Latent WM + Planning",[138,204,205],{},"間接相關",[138,207,208],{},"Latent WM 核心參考",[138,210,163],{},[111,212,213,218,221,224,228,231],{},[138,214,215],{},[18,216,217],{},"DreamerNav",[138,219,220],{},"Frontiers in Robotics and AI 2025",[138,222,223],{},"DreamerV3 + Model-Based RL",[138,225,226],{},[18,227,155],{},[138,229,230],{},"學習完整機器人論文流程",[138,232,233],{},"⭐⭐⭐⭐",[111,235,236,241,244,247,250,253],{},[138,237,238],{},[18,239,240],{},"V-JEPA 2 \u002F V-JEPA 2-AC",[138,242,243],{},"2025 Research Release \u002F arXiv",[138,245,246],{},"Foundation Video WM + Action Conditioning",[138,248,249],{},"當前偏 Manipulation",[138,251,252],{},"Foundation WM 核心參考",[138,254,233],{},[111,256,257,262,265,268,272,275],{},[138,258,259],{},[18,260,261],{},"One-Step World Model",[138,263,264],{},"2026 arXiv",[138,266,267],{},"One-Step Video WM + Optimization Planning",[138,269,270],{},[18,271,155],{},[138,273,274],{},"實時化重要工作",[138,276,163],{},[111,278,279,284,286,289,293,296],{},[138,280,281],{},[18,282,283],{},"AR Forcing",[138,285,264],{},[138,287,288],{},"Autoregressive Training for Navigation WM",[138,290,291],{},[18,292,155],{},[138,294,295],{},"長時序預測重要工作",[138,297,233],{},[111,299,300,305,307,310,314,317],{},[138,301,302],{},[18,303,304],{},"NavWAM",[138,306,264],{},[138,308,309],{},"World Model + Action Model",[138,311,312],{},[18,313,155],{},[138,315,316],{},"WM → World Action Model 新路線",[138,318,233],{},[111,320,321,326,331,334,336,339],{},[138,322,323],{},[18,324,325],{},"GWM",[138,327,328],{},[18,329,330],{},"ICCV 2025",[138,332,333],{},"3D Gaussian WM + Diffusion Transformer",[138,335,249],{},[138,337,338],{},"3D \u002F Geometry-aware WM 代表工作",[138,340,163],{},[111,342,343,348,353,356,358,361],{},[138,344,345],{},[18,346,347],{},"DreMa \u002F Dream to Manipulate",[138,349,350],{},[18,351,352],{},"ICLR 2025",[138,354,355],{},"Gaussian Digital Twin + Physics + Imagination",[138,357,249],{},[138,359,360],{},"組合式 WM \u002F 數據生成重要工作",[138,362,163],{},[111,364,365,370,373,376,379,382],{},[138,366,367],{},[18,368,369],{},"Atlas",[138,371,372],{},"World Labs 2026 Research Release",[138,374,375],{},"Omni WM：Generation + Reconstruction + Simulation",[138,377,378],{},"當前偏 Spatial Intelligence \u002F Simulation",[138,380,381],{},"Foundation Spatial WM 重要參考",[138,383,163],{},[99,385],{},[10,387,388],{"id":388},"論文鏈接總表",[105,390,391,409],{},[108,392,393],{},[111,394,395,397,400,403,406],{},[114,396,116],{},[114,398,399],{},"Paper \u002F arXiv",[114,401,402],{},"Project",[114,404,405],{},"GitHub \u002F Code",[114,407,408],{},"Models \u002F Dataset",[133,410,411,449,480,507,531,559,586,606,629,657,684],{},[111,412,413,417,425,431,437],{},[138,414,415],{},[18,416,142],{},[138,418,419],{},[420,421,422],"a",{"href":422,"rel":423},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2410.17491",[424],"nofollow",[138,426,427],{},[420,428,429],{"href":429,"rel":430},"https:\u002F\u002Fnvlabs.github.io\u002FX-MOBILITY\u002F",[424],[138,432,433],{},[420,434,435],{"href":435,"rel":436},"https:\u002F\u002Fgithub.com\u002FNVlabs\u002FX-MOBILITY",[424],[138,438,439,440,444,445],{},"Model: ",[420,441,442],{"href":442,"rel":443},"https:\u002F\u002Fhuggingface.co\u002Fnvidia\u002FX-Mobility",[424]," ；Dataset: ",[420,446,447],{"href":447,"rel":448},"https:\u002F\u002Fhuggingface.co\u002Fdatasets\u002Fnvidia\u002FX-Mobility",[424],[111,450,451,456,462,468,474],{},[138,452,453],{},[18,454,455],{},"Navigation World Models",[138,457,458],{},[420,459,460],{"href":460,"rel":461},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.03572",[424],[138,463,464],{},[420,465,466],{"href":466,"rel":467},"https:\u002F\u002Fwww.amirbar.net\u002Fnwm\u002F",[424],[138,469,470],{},[420,471,472],{"href":472,"rel":473},"https:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fnwm",[424],[138,475,476],{},[420,477,478],{"href":478,"rel":479},"https:\u002F\u002Fhuggingface.co\u002Ffacebook\u002Fnwm",[424],[111,481,482,486,492,498,504],{},[138,483,484],{},[18,485,194],{},[138,487,488],{},[420,489,490],{"href":490,"rel":491},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2411.04983",[424],[138,493,494],{},[420,495,496],{"href":496,"rel":497},"https:\u002F\u002Fdino-wm.github.io\u002F",[424],[138,499,500],{},[420,501,502],{"href":502,"rel":503},"https:\u002F\u002Fgithub.com\u002Fgaoyuezhou\u002Fdino_wm",[424],[138,505,506],{},"Checkpoints \u002F data instructions are in the official GitHub repository",[111,508,509,513,519,525,528],{},[138,510,511],{},[18,512,217],{},[138,514,515],{},[420,516,517],{"href":517,"rel":518},"https:\u002F\u002Fdoi.org\u002F10.3389\u002Ffrobt.2025.1655171",[424],[138,520,521],{},[420,522,523],{"href":523,"rel":524},"https:\u002F\u002Fwww.frontiersin.org\u002Fjournals\u002Frobotics-and-ai\u002Farticles\u002F10.3389\u002Ffrobt.2025.1655171\u002Ffull",[424],[138,526,527],{},"暫未記錄到可靠的官方獨立代碼倉庫",[138,529,530],{},"Paper states raw data will be made available; details need further verification",[111,532,533,538,544,550,556],{},[138,534,535],{},[18,536,537],{},"V-JEPA 2",[138,539,540],{},[420,541,542],{"href":542,"rel":543},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2506.09985",[424],[138,545,546],{},[420,547,548],{"href":548,"rel":549},"https:\u002F\u002Fai.meta.com\u002Fblog\u002Fv-jepa-2-world-model-benchmarks\u002F",[424],[138,551,552],{},[420,553,554],{"href":554,"rel":555},"https:\u002F\u002Fgithub.com\u002Ffacebookresearch\u002Fvjepa2",[424],[138,557,558],{},"Official repository contains model\u002Fevaluation resources",[111,560,561,565,571,577,583],{},[138,562,563],{},[18,564,261],{},[138,566,567],{},[420,568,569],{"href":569,"rel":570},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2601.12277",[424],[138,572,573],{},[420,574,575],{"href":575,"rel":576},"https:\u002F\u002Frobotnav-bot.github.io\u002Fnav-onestepwm\u002F",[424],[138,578,579],{},[420,580,581],{"href":581,"rel":582},"https:\u002F\u002Fgithub.com\u002Frobotnav-bot\u002FNOW",[424],[138,584,585],{},"See official repository",[111,587,588,592,598,601,604],{},[138,589,590],{},[18,591,283],{},[138,593,594],{},[420,595,596],{"href":596,"rel":597},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2605.31314",[424],[138,599,600],{},"待補充",[138,602,603],{},"arXiv 頁面稱將發佈代碼，當前先標記待確認",[138,605,600],{},[111,607,608,612,618,624,627],{},[138,609,610],{},[18,611,304],{},[138,613,614],{},[420,615,616],{"href":616,"rel":617},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.13494",[424],[138,619,620],{},[420,621,622],{"href":622,"rel":623},"https:\u002F\u002Fdachii-azm.github.io\u002Fnavwam\u002F",[424],[138,625,626],{},"待確認官方獨立倉庫",[138,628,600],{},[111,630,631,635,642,648,654],{},[138,632,633],{},[18,634,325],{},[138,636,637,638],{},"ICCV: ",[420,639,640],{"href":640,"rel":641},"https:\u002F\u002Fopenaccess.thecvf.com\u002Fcontent\u002FICCV2025\u002Fhtml\u002FLu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html",[424],[138,643,644],{},[420,645,646],{"href":646,"rel":647},"https:\u002F\u002Fgaussian-world-model.github.io\u002F",[424],[138,649,650],{},[420,651,652],{"href":652,"rel":653},"https:\u002F\u002Fgithub.com\u002FGaussian-World-Model\u002Fgaussianwm",[424],[138,655,656],{},"官方倉庫仍在持續整理",[111,658,659,663,669,675,681],{},[138,660,661],{},[18,662,347],{},[138,664,665],{},[420,666,667],{"href":667,"rel":668},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2412.14957",[424],[138,670,671],{},[420,672,673],{"href":673,"rel":674},"https:\u002F\u002Fdreamtomanipulate.github.io\u002F",[424],[138,676,677],{},[420,678,679],{"href":679,"rel":680},"https:\u002F\u002Fgithub.com\u002Fleobarcellona\u002Fdrema_code",[424],[138,682,683],{},"官方代碼已公開",[111,685,686,690,696,702,705],{},[138,687,688],{},[18,689,369],{},[138,691,692],{},[420,693,694],{"href":694,"rel":695},"https:\u002F\u002Fwww.worldlabs.ai\u002Fblog\u002Fatlas",[424],[138,697,698],{},[420,699,700],{"href":700,"rel":701},"https:\u002F\u002Fwww.worldlabs.ai\u002F",[424],[138,703,704],{},"暫無公開訓練代碼",[138,706,707],{},"Early Access；不是傳統會議論文項目",[99,709],{},[10,711,712],{"id":712},"論文定位與影響力",[105,714,715,730],{},[108,716,717],{},[111,718,719,721,724,727],{},[114,720,116],{},[114,722,723],{},"學術定位",[114,725,726],{},"主要貢獻類型",[114,728,729],{},"對我的價值",[133,731,732,748,763,780,793,806,820,833,846,861,877],{},[111,733,734,739,742,745],{},[138,735,736],{},[18,737,738],{},"NWM",[138,740,741],{},"Navigation World Model 標誌性工作",[138,743,744],{},"大規模生成式 WM、CDiT、視頻想象 + 規劃",[138,746,747],{},"理解最前沿 Navigation WM 應該做到什麼程度",[111,749,750,754,757,760],{},[138,751,752],{},[18,753,194],{},[138,755,756],{},"Latent WM 代表工作",[138,758,759],{},"不重建 RGB，直接預測預訓練視覺特徵",[138,761,762],{},"理解「不生成圖像也能做 World Model」",[111,764,765,769,772,775],{},[138,766,767],{},[18,768,142],{},[138,770,771],{},"機器人導航 WM 代表工作",[138,773,774],{},"World Model + Policy、Sim2Real、Cross-Embodiment",[138,776,777],{},[18,778,779],{},"最適合作為第一主 baseline",[111,781,782,784,787,790],{},[138,783,217],{},[138,785,786],{},"系統型 WM 導航工作",[138,788,789],{},"DreamerV3 + 動態導航 + 混合規劃",[138,791,792],{},"學完整機器人科研鏈條",[111,794,795,797,800,803],{},[138,796,537],{},[138,798,799],{},"Foundation WM 重要路線",[138,801,802],{},"大規模視頻自監督 + Action-conditioned WM",[138,804,805],{},"理解 Foundation World Model",[111,807,808,811,814,817],{},[138,809,810],{},"One-Step WM",[138,812,813],{},"實時化路線",[138,815,816],{},"One-Step generation + planning",[138,818,819],{},"研究如何把 WM 真正跑實時",[111,821,822,824,827,830],{},[138,823,283],{},[138,825,826],{},"長時序穩定性路線",[138,828,829],{},"緩解 AR rollout 的 train-test mismatch",[138,831,832],{},"研究 long-horizon prediction",[111,834,835,837,840,843],{},[138,836,304],{},[138,838,839],{},"World Action Model 路線",[138,841,842],{},"聯合 future \u002F value \u002F action chunk",[138,844,845],{},"觀察 WM 是否向 WAM 演化",[111,847,848,852,855,858],{},[138,849,850],{},[18,851,325],{},[138,853,854],{},"3D Structured WM \u002F Gaussian WM 代表工作",[138,856,857],{},"用 3D Gaussian 顯式表示並預測未來三維場景",[138,859,860],{},"理解 Geometry-aware World Model",[111,862,863,868,871,874],{},[138,864,865],{},[18,866,867],{},"DreMa",[138,869,870],{},"Compositional WM \u002F Learnable Digital Twin 代表工作",[138,872,873],{},"Gaussian Splatting + Physics，用 imagination 生成訓練數據",[138,875,876],{},"理解 WM 不只用於在線規劃，也可用於數據生成",[111,878,879,883,886,889],{},[138,880,881],{},[18,882,369],{},[138,884,885],{},"Foundation Spatial World Model",[138,887,888],{},"統一文本、圖像、視頻、深度與 3D，做生成、重建和模擬",[138,890,891],{},"理解現代大型 WM 為什麼越來越像 CV \u002F 3D Vision",[99,893],{},[10,895,896],{"id":896},"復現與工程成本",[898,899,900],"blockquote",{},[14,901,902,903],{},"這一表重點用於判斷：",[18,904,905],{},"能不能作為 baseline、算力夠不夠、復現成本多高、實機鏈路是否成熟。",[105,907,908,942],{},[108,909,910],{},[111,911,912,914,917,921,924,927,930,933,936,939],{},[114,913,116],{},[114,915,916],{},"主要 WM \u002F Backbone",[114,918,920],{"align":919},"right","規模",[114,922,923],{},"原論文訓練資源",[114,925,926],{},"數據",[114,928,929],{},"仿真 \u002F 環境",[114,931,932],{},"規劃 \u002F Policy",[114,934,935],{},"實機",[114,937,938],{},"開源成熟度",[114,940,941],{},"我的復現難度",[133,943,944,983,1022,1057,1093,1126,1161,1191],{},[111,945,946,950,953,956,961,964,967,970,975,980],{},[138,947,948],{},[18,949,142],{},[138,951,952],{},"DINOv2 + GRU Probabilistic Latent WM + Policy",[138,954,955],{"align":919},"WM 主體較小；RGB Diffuser ≈ 962M",[138,957,958],{},[18,959,960],{},"8 × H100",[138,962,963],{},"Isaac Sim：160K Random + 100K Nav2 Teacher",[138,965,966],{},"Isaac Sim",[138,968,969],{},"Learned Action Policy",[138,971,972],{},[18,973,974],{},"Nova Carter",[138,976,977],{},[18,978,979],{},"高：Code + Dataset + Checkpoint + TensorRT\u002FROS2",[138,981,982],{},"⭐⭐⭐",[111,984,985,989,992,997,1003,1006,1009,1012,1015,1020],{},[138,986,987],{},[18,988,738],{},[138,990,991],{},"Conditional Diffusion Transformer（CDiT）",[138,993,994],{"align":919},[18,995,996],{},"50M \u002F 200M \u002F 最大 1B",[138,998,999,1000],{},"XL：",[18,1001,1002],{},"8 台 × 8 H100 = 64 × H100",[138,1004,1005],{},"RECON \u002F SCAND \u002F TartanDrive \u002F HuRoN \u002F Ego4D 等",[138,1007,1008],{},"Offline robot\u002Fhuman navigation datasets",[138,1010,1011],{},"CEM \u002F trajectory ranking \u002F MPC-style planning",[138,1013,1014],{},"原論文重點不是完整真機閉環",[138,1016,1017],{},[18,1018,1019],{},"高：Code + Weights",[138,1021,163],{},[111,1023,1024,1028,1031,1034,1037,1040,1043,1046,1049,1054],{},[138,1025,1026],{},[18,1027,194],{},[138,1029,1030],{},"DINOv2 patch feature + ViT predictor",[138,1032,1033],{"align":919},"Predictor 約 19M（論文配置需進一步逐項核對）",[138,1035,1036],{},"原論文未在當前日誌中記錄明確 GPU 配置",[138,1038,1039],{},"Offline trajectories",[138,1041,1042],{},"PointMaze \u002F PushT \u002F Wall \u002F Reacher 等",[138,1044,1045],{},"CEM \u002F gradient planning",[138,1047,1048],{},"無移動機器人真機",[138,1050,1051],{},[18,1052,1053],{},"高：Code + checkpoints",[138,1055,1056],{},"⭐⭐",[111,1058,1059,1063,1066,1069,1074,1077,1080,1083,1088,1091],{},[138,1060,1061],{},[18,1062,217],{},[138,1064,1065],{},"DreamerV3 \u002F RSSM",[138,1067,1068],{"align":919},"中小型",[138,1070,1071],{},[18,1072,1073],{},"1 × RTX 4090 24GB；約 24.79h；495K policy steps",[138,1075,1076],{},"Isaac Sim 在線交互",[138,1078,1079],{},"Isaac Sim Warehouse",[138,1081,1082],{},"Actor-Critic policy + A* global guidance",[138,1084,1085],{},[18,1086,1087],{},"Spot + Unitree A1",[138,1089,1090],{},"中：論文完整，代碼需繼續確認",[138,1092,1056],{},[111,1094,1095,1100,1103,1106,1109,1112,1115,1118,1121,1124],{},[138,1096,1097],{},[18,1098,1099],{},"V-JEPA 2-AC",[138,1101,1102],{},"V-JEPA 2 + Action-Conditioned Predictor",[138,1104,1105],{"align":919},"ViT-L\u002FH\u002Fg，最大約 1B 級",[138,1107,1108],{},"Foundation-scale，具體訓練資源待單獨整理",[138,1110,1111],{},">1M hours internet video + robot interaction data",[138,1113,1114],{},"Manipulation \u002F video benchmarks",[138,1116,1117],{},"latent-space planning",[138,1119,1120],{},"Franka 等 manipulation",[138,1122,1123],{},"高：Official repo \u002F models",[138,1125,163],{},[111,1127,1128,1132,1135,1138,1140,1143,1146,1149,1154,1159],{},[138,1129,1130],{},[18,1131,810],{},[138,1133,1134],{},"3D U-Net + spatial-temporal attention",[138,1136,1137],{"align":919},"待核實",[138,1139,1137],{},[138,1141,1142],{},"Public navigation data + Habitat\u002FMP3D 等",[138,1144,1145],{},"Habitat + real robot",[138,1147,1148],{},"Optimization-based planning \u002F anchors",[138,1150,1151],{},[18,1152,1153],{},"有實機",[138,1155,1156],{},[18,1157,1158],{},"較高：Paper + Project + Code",[138,1160,982],{},[111,1162,1163,1167,1170,1173,1175,1178,1181,1184,1186,1189],{},[138,1164,1165],{},[18,1166,283],{},[138,1168,1169],{},"Diffusion Navigation WM",[138,1171,1172],{"align":919},"基於 NWM 類框架",[138,1174,1137],{},[138,1176,1177],{},"RECON \u002F SCAND \u002F HuRoN \u002F TartanDrive",[138,1179,1180],{},"Offline navigation datasets",[138,1182,1183],{},"保留原 diffusion planning framework",[138,1185,1137],{},[138,1187,1188],{},"中低：目前代碼狀態需確認",[138,1190,233],{},[111,1192,1193,1197,1200,1203,1205,1208,1211,1216,1221,1224],{},[138,1194,1195],{},[18,1196,304],{},[138,1198,1199],{},"Diffusion Transformer World-Action Model",[138,1201,1202],{"align":919},"待詳細整理",[138,1204,1137],{},[138,1206,1207],{},"Simulation pretraining + real-robot adaptation",[138,1209,1210],{},"Simulation + real robot",[138,1212,1213],{},[18,1214,1215],{},"直接輸出 action chunk，無需默認 CEM",[138,1217,1218],{},[18,1219,1220],{},"Diablo",[138,1222,1223],{},"中：Paper + Project 已公開",[138,1225,233],{},[99,1227],{},[10,1229,1230],{"id":1230},"當前實驗室計算資源",[1232,1233,1235],"h3",{"id":1234},"gpu-server-a","GPU Server A",[1237,1238,1244],"pre",{"className":1239,"code":1241,"language":1242,"meta":1243},[1240],"language-text","1 × RTX 5090\n","text","",[1245,1246,1241],"code",{"__ignoreMap":1243},[14,1248,1249],{},"用途：",[26,1251,1252,1255,1258,1261,1264,1267,1270],{},[29,1253,1254],{},"單卡開發；",[29,1256,1257],{},"訓練 Debug；",[29,1259,1260],{},"小中型 World Model fine-tuning；",[29,1262,1263],{},"單卡 ablation；",[29,1265,1266],{},"inference；",[29,1268,1269],{},"ONNX \u002F TensorRT；",[29,1271,1272],{},"實機部署前性能測試。",[1232,1274,1276],{"id":1275},"gpu-server-b","GPU Server B",[1237,1278,1281],{"className":1279,"code":1280,"language":1242,"meta":1243},[1240],"3 × RTX A6000 48GB\n",[1245,1282,1280],{"__ignoreMap":1243},[14,1284,1249],{},[26,1286,1287,1290,1293,1296,1299,1302,1305],{},[29,1288,1289],{},"當前主要訓練資源；",[29,1291,1292],{},"DDP 多卡訓練；",[29,1294,1295],{},"World Model fine-tuning；",[29,1297,1298],{},"中型 Transformer \u002F Diffusion；",[29,1300,1301],{},"多組 ablation；",[29,1303,1304],{},"較大 batch；",[29,1306,1307],{},"部分模型並行 \u002F FSDP。",[14,1309,1310],{},"注意：",[1237,1312,1315],{"className":1313,"code":1314,"language":1242,"meta":1243},[1240],"3 × 48GB != 单进程天然拥有 144GB 显存\n",[1245,1316,1314],{"__ignoreMap":1243},[14,1318,1319],{},"需要 DDP \u002F FSDP \u002F model parallel 等方式利用多卡。",[1232,1321,1323],{"id":1322},"gpu-server-c","GPU Server C",[1237,1325,1328],{"className":1326,"code":1327,"language":1242,"meta":1243},[1240],"4 × GTX 1080 Ti\n",[1245,1329,1327],{"__ignoreMap":1243},[14,1331,1249],{},[26,1333,1334,1337,1340,1343,1346,1349],{},[29,1335,1336],{},"數據預處理；",[29,1338,1339],{},"CPU\u002FGPU 混合的數據生成；",[29,1341,1342],{},"傳統 baseline；",[29,1344,1345],{},"老模型；",[29,1347,1348],{},"部分仿真任務；",[29,1350,1351],{},"不依賴現代 Tensor Core \u002F BF16 的任務。",[14,1353,1354],{},"不優先用於現代大規模 Transformer \u002F Diffusion 訓練。",[99,1356],{},[10,1358,1360],{"id":1359},"world-model-放在完整機器人鏈條中的位置","World Model 放在完整機器人鏈條中的位置",[1237,1362,1365],{"className":1363,"code":1364,"language":1242,"meta":1243},[1240],"Sensor \u002F Observation\n传感器 \u002F 当前观测\n        ↓\nPerception \u002F Representation\n感知 \u002F 世界表示\n        ↓\nWorld Model\n世界模型\n        ↓\nFuture Prediction\n未来预测\n        ↓\nPlanner \u002F Policy\n规划器 \u002F 策略\n        ↓\nController\n控制器\n        ↓\nRobot Command\n机器人执行命令\n",[1245,1366,1364],{"__ignoreMap":1243},[14,1368,1369],{},"最簡單的記憶方式：",[26,1371,1372,1378,1384,1390],{},[29,1373,1374,1377],{},[18,1375,1376],{},"Computer Vision（計算機視覺，CV）","：回答“現在世界是什麼樣”；",[29,1379,1380,1383],{},[18,1381,1382],{},"World Model（世界模型，WM）","：回答“如果執行某個動作，未來世界會變成什麼樣”；",[29,1385,1386,1389],{},[18,1387,1388],{},"Planner（規劃器） \u002F Policy（策略）","：回答“我應該做什麼動作”；",[29,1391,1392,1395],{},[18,1393,1394],{},"Controller（控制器）","：把高層動作變成速度、關節或力矩命令。",[14,1397,1398,1399,1405],{},"因此，",[18,1400,1401,1402],{},"World Model 的輸出通常不等於 ",[1245,1403,1404],{},"cmd_vel","。常見輸出包括 Future RGB（未來圖像）、Future Latent State（未來隱狀態）、Future Depth（未來深度）、Future Occupancy（未來佔據）、Future 3D Gaussian Scene（未來 3D 高斯場景）、Reward \u002F Value \u002F Risk（獎勵 \u002F 價值 \u002F 風險）等。",[99,1407],{},[10,1409,67],{"id":1410},"renderer-simulator-planner-功能分類",[1232,1412,1414],{"id":1413},"renderer渲染器","Renderer（渲染器）",[14,1416,1417,1418],{},"主要回答：",[18,1419,1420],{},"世界看起來會是什麼樣？",[14,1422,1423,1424,21],{},"典型輸出：RGB、Video、Novel View（新視角）、Depth、3D rendering。更偏 ",[18,1425,1426],{},"CV \u002F Generative Vision（計算機視覺 \u002F 生成視覺）",[1232,1428,1430],{"id":1429},"simulator模擬器","Simulator（模擬器）",[14,1432,1417,1433],{},[18,1434,1435],{},"世界在時間和動作作用下會怎樣變化？",[14,1437,1438],{},"典型輸出：Future State（未來狀態）、Future Geometry（未來幾何）、Object Pose（物體位姿）、Future Latent（未來隱狀態）、Future 3DGS（未來三維高斯）、Reward \u002F Risk \u002F Dynamics（獎勵 \u002F 風險 \u002F 動態）。",[1232,1440,1442],{"id":1441},"planner規劃器","Planner（規劃器）",[14,1444,1417,1445],{},[18,1446,1447],{},"為了達到目標，我應該做什麼？",[14,1449,1450],{},"典型輸出：Action（動作）、Action Sequence（動作序列）、Trajectory（軌跡）、Velocity Command（速度命令）。",[14,1452,1453],{},"常見術語：",[26,1455,1456,1462,1468,1474,1480],{},[29,1457,1458,1461],{},[18,1459,1460],{},"CEM（Cross-Entropy Method，交叉熵方法）","：採樣很多候選動作，保留表現更好的，再繼續搜索；",[29,1463,1464,1467],{},[18,1465,1466],{},"MPC（Model Predictive Control，模型預測控制）","：不斷向前預測一小段，只執行當前最優動作，然後重新規劃；",[29,1469,1470,1473],{},[18,1471,1472],{},"MPPI（Model Predictive Path Integral，模型預測路徑積分）","：一種採樣式 MPC；",[29,1475,1476,1479],{},[18,1477,1478],{},"Learned Policy（學習策略）","：神經網絡直接根據狀態選擇動作；",[29,1481,1482,1485],{},[18,1483,1484],{},"Actor-Critic（演員-評論家）","：強化學習中的策略學習結構。",[99,1487],{},[10,1489,1491],{"id":1490},"按-world-model-輸出形式分類","按 World Model 輸出形式分類",[105,1493,1494,1510],{},[108,1495,1496],{},[111,1497,1498,1501,1504,1507],{},[114,1499,1500],{},"輸出類型",[114,1502,1503],{},"中文解釋",[114,1505,1506],{},"代表工作",[114,1508,1509],{},"後續怎麼決策",[133,1511,1512,1530,1548,1565,1582,1599],{},[111,1513,1514,1519,1522,1527],{},[138,1515,1516],{},[18,1517,1518],{},"Future RGB \u002F Video",[138,1520,1521],{},"未來 RGB \u002F 視頻，直接“畫”未來",[138,1523,1524],{},[18,1525,1526],{},"NWM、One-Step WM",[138,1528,1529],{},"CEM \u002F trajectory ranking",[111,1531,1532,1537,1540,1545],{},[138,1533,1534],{},[18,1535,1536],{},"Future Latent State",[138,1538,1539],{},"未來隱狀態，不畫圖，只預測壓縮後的內部表示",[138,1541,1542],{},[18,1543,1544],{},"DINO-WM、X-MOBILITY、V-JEPA 2-AC、DreamerNav",[138,1546,1547],{},"CEM \u002F Learned Policy \u002F RL",[111,1549,1550,1555,1558,1562],{},[138,1551,1552],{},[18,1553,1554],{},"Future 3D Gaussian Scene",[138,1556,1557],{},"未來 3D 高斯場景，顯式三維結構",[138,1559,1560],{},[18,1561,325],{},[138,1563,1564],{},"Imitation Learning \u002F Model-Based RL",[111,1566,1567,1572,1575,1579],{},[138,1568,1569],{},[18,1570,1571],{},"Digital Twin Future State",[138,1573,1574],{},"數字孿生中的未來狀態",[138,1576,1577],{},[18,1578,867],{},[138,1580,1581],{},"生成 imagined demonstrations，再訓練 Policy",[111,1583,1584,1589,1592,1596],{},[138,1585,1586],{},[18,1587,1588],{},"RGB + Depth + Explicit 3D",[138,1590,1591],{},"RGB、深度、點雲或 3DGS",[138,1593,1594],{},[18,1595,369],{},[138,1597,1598],{},"當前主要用於 reconstruction \u002F simulation",[111,1600,1601,1606,1609,1613],{},[138,1602,1603],{},[18,1604,1605],{},"Future + Action Chunk",[138,1607,1608],{},"預測未來的同時直接給出動作序列",[138,1610,1611],{},[18,1612,304],{},[138,1614,1615],{},"模型自身承擔更多 Planner \u002F Policy 功能",[14,1617,1618],{},"**Latent State（隱空間狀態）**可以理解成：把複雜圖像、三維結構、語義和動態壓縮成一組機器可處理的數字特徵，人通常不能直接看懂，但模型可以拿它做預測和決策。",[99,1620],{},[10,1622,1624],{"id":1623},"按-world-representation世界表示分類","按 World Representation（世界表示）分類",[105,1626,1627,1642],{},[108,1628,1629],{},[111,1630,1631,1634,1637,1639],{},[114,1632,1633],{},"World Representation",[114,1635,1636],{},"中文",[114,1638,1506],{},[114,1640,1641],{},"特點",[133,1643,1644,1657,1670,1684,1697,1710],{},[111,1645,1646,1649,1652,1654],{},[138,1647,1648],{},"Pixel \u002F Video Latent",[138,1650,1651],{},"像素 \u002F 視頻隱空間",[138,1653,1526],{},[138,1655,1656],{},"視覺生成強，但計算量可能較大",[111,1658,1659,1662,1665,1667],{},[138,1660,1661],{},"Pretrained Visual Feature",[138,1663,1664],{},"預訓練視覺特徵",[138,1666,194],{},[138,1668,1669],{},"不必重建 RGB，更強調語義特徵",[111,1671,1672,1675,1678,1681],{},[138,1673,1674],{},"Probabilistic Latent State",[138,1676,1677],{},"概率隱狀態",[138,1679,1680],{},"X-MOBILITY、DreamerNav",[138,1682,1683],{},"更適合 Policy \u002F RL \u002F 時序狀態估計",[111,1685,1686,1689,1692,1694],{},[138,1687,1688],{},"Explicit 3D Gaussian",[138,1690,1691],{},"顯式 3D 高斯",[138,1693,325],{},[138,1695,1696],{},"三維幾何結構更明確",[111,1698,1699,1702,1705,1707],{},[138,1700,1701],{},"Gaussian Digital Twin + Physics",[138,1703,1704],{},"高斯數字孿生 + 物理模擬",[138,1706,867],{},[138,1708,1709],{},"場景可組合、可變換、可生成訓練數據",[111,1711,1712,1715,1718,1720],{},[138,1713,1714],{},"Unified Spatial Context",[138,1716,1717],{},"統一空間上下文",[138,1719,369],{},[138,1721,1722],{},"文本、圖像、視頻、相機位姿、深度、3D 統一建模",[99,1724],{},[10,1726,1728],{"id":1727},"按更偏-cv-還是更偏-planner-robotics分類","按“更偏 CV 還是更偏 Planner \u002F Robotics”分類",[898,1730,1731],{},[14,1732,1733],{},"不是嚴格學科劃分，只是標記主要創新發生在哪一段。",[1237,1735,1738],{"className":1736,"code":1737,"language":1242,"meta":1243},[1240],"更偏 CV \u002F 3D Vision                              更偏 Planning \u002F Robotics\n\nAtlas\nGWM\nDreMa\nDINO-WM\nNWM ---------------------------- CEM Planning\nOne-Step WM -------------------- CEM \u002F Optimizer\nV-JEPA 2-AC -------------------- Latent Planning\nX-MOBILITY --------------------- Learned Policy\nDreamerNav --------------------- Model-Based RL\nNavWAM ------------------------- World + Action Joint Modeling\n",[1245,1739,1737],{"__ignoreMap":1243},[105,1741,1742,1755],{},[108,1743,1744],{},[111,1745,1746,1749,1752],{},[114,1747,1748],{},"工作",[114,1750,1751],{},"主要偏向",[114,1753,1754],{},"直白解釋",[133,1756,1757,1771,1785,1799,1811,1823,1834,1846,1860,1874],{},[111,1758,1759,1763,1768],{},[138,1760,1761],{},[18,1762,369],{},[138,1764,1765],{},[18,1766,1767],{},"CV \u002F 3D Vision \u002F Spatial Intelligence",[138,1769,1770],{},"強項是生成、三維重建、Real-to-Sim 和機器人傳感器模擬，不是專門導航 Planner",[111,1772,1773,1777,1782],{},[138,1774,1775],{},[18,1776,325],{},[138,1778,1779],{},[18,1780,1781],{},"3D Vision + Simulator",[138,1783,1784],{},"最大創新在 3D Gaussian 世界表示和未來三維狀態預測",[111,1786,1787,1791,1796],{},[138,1788,1789],{},[18,1790,867],{},[138,1792,1793],{},[18,1794,1795],{},"3D Vision + Simulator + Robot Learning",[138,1797,1798],{},"3DGS + Physics 構建數字孿生，再生成 imagined data",[111,1800,1801,1805,1808],{},[138,1802,1803],{},[18,1804,194],{},[138,1806,1807],{},"CV ↔ Planning 中間",[138,1809,1810],{},"前半段用 DINOv2 特徵，後半段把未來 latent 用於規劃",[111,1812,1813,1817,1820],{},[138,1814,1815],{},[18,1816,738],{},[138,1818,1819],{},"CV \u002F Video WM → Planning",[138,1821,1822],{},"先生成未來視覺，再通過 CEM 選擇動作",[111,1824,1825,1829,1831],{},[138,1826,1827],{},[18,1828,810],{},[138,1830,1819],{},[138,1832,1833],{},"重點是把未來生成做快，再接優化式規劃",[111,1835,1836,1840,1843],{},[138,1837,1838],{},[18,1839,1099],{},[138,1841,1842],{},"Representation Learning → Planning",[138,1844,1845],{},"foundation latent representation + action-conditioned prediction",[111,1847,1848,1852,1857],{},[138,1849,1850],{},[18,1851,142],{},[138,1853,1854],{},[18,1855,1856],{},"Robot Learning \u002F Policy",[138,1858,1859],{},"WM 學 dynamics，Action Policy 最終輸出速度和路徑",[111,1861,1862,1866,1871],{},[138,1863,1864],{},[18,1865,217],{},[138,1867,1868],{},[18,1869,1870],{},"Model-Based RL \u002F Navigation",[138,1872,1873],{},"WM 用於 imagination，Actor-Critic 學導航策略",[111,1875,1876,1880,1885],{},[138,1877,1878],{},[18,1879,304],{},[138,1881,1882],{},[18,1883,1884],{},"Planner \u002F Policy 更強",[138,1886,1887],{},"不只預測未來，還聯合輸出 Action Chunk",[99,1889],{},[10,1891,1893],{"id":1892},"按-renderer-simulator-planner-重新看這些工作","按 Renderer \u002F Simulator \u002F Planner 重新看這些工作",[105,1895,1896,1914],{},[108,1897,1898],{},[111,1899,1900,1902,1905,1908,1911],{},[114,1901,1748],{},[114,1903,1904],{"align":919},"Renderer",[114,1906,1907],{"align":919},"Simulator",[114,1909,1910],{"align":919},"Planner \u002F Policy",[114,1912,1913],{},"直白理解",[133,1915,1916,1934,1950,1965,1981,1996,2011,2026,2041,2056],{},[111,1917,1918,1922,1925,1928,1931],{},[138,1919,1920],{},[18,1921,369],{},[138,1923,1924],{"align":919},"★★★★★",[138,1926,1927],{"align":919},"★★★★☆",[138,1929,1930],{"align":919},"★★☆☆☆",[138,1932,1933],{},"強生成 \u002F 重建 \u002F 仿真，當前不是專門導航 Planner",[111,1935,1936,1940,1942,1944,1947],{},[138,1937,1938],{},[18,1939,738],{},[138,1941,1924],{"align":919},[138,1943,1927],{"align":919},[138,1945,1946],{"align":919},"★★★☆☆",[138,1948,1949],{},"先生成未來視覺，再用 CEM 規劃",[111,1951,1952,1956,1958,1960,1962],{},[138,1953,1954],{},[18,1955,810],{},[138,1957,1927],{"align":919},[138,1959,1927],{"align":919},[138,1961,1946],{"align":919},[138,1963,1964],{},"把未來視覺生成做得更快，再規劃",[111,1966,1967,1971,1974,1976,1978],{},[138,1968,1969],{},[18,1970,194],{},[138,1972,1973],{"align":919},"★☆☆☆☆",[138,1975,1927],{"align":919},[138,1977,1927],{"align":919},[138,1979,1980],{},"不畫未來圖，直接在 latent space 預測並規劃",[111,1982,1983,1987,1989,1991,1993],{},[138,1984,1985],{},[18,1986,325],{},[138,1988,1927],{"align":919},[138,1990,1924],{"align":919},[138,1992,1930],{"align":919},[138,1994,1995],{},"顯式模擬未來 3D Gaussian 世界",[111,1997,1998,2002,2004,2006,2008],{},[138,1999,2000],{},[18,2001,867],{},[138,2003,1927],{"align":919},[138,2005,1924],{"align":919},[138,2007,1930],{"align":919},[138,2009,2010],{},"構建數字孿生，用模擬結果擴充訓練數據",[111,2012,2013,2017,2019,2021,2023],{},[138,2014,2015],{},[18,2016,1099],{},[138,2018,1973],{"align":919},[138,2020,1927],{"align":919},[138,2022,1927],{"align":919},[138,2024,2025],{},"latent prediction + action-conditioned planning",[111,2027,2028,2032,2034,2036,2038],{},[138,2029,2030],{},[18,2031,142],{},[138,2033,1930],{"align":919},[138,2035,1927],{"align":919},[138,2037,1924],{"align":919},[138,2039,2040],{},"WM 主要服務 Learned Policy",[111,2042,2043,2047,2049,2051,2053],{},[138,2044,2045],{},[18,2046,217],{},[138,2048,1973],{"align":919},[138,2050,1927],{"align":919},[138,2052,1924],{"align":919},[138,2054,2055],{},"RSSM imagination + Actor-Critic navigation",[111,2057,2058,2062,2064,2066,2068],{},[138,2059,2060],{},[18,2061,304],{},[138,2063,1946],{"align":919},[138,2065,1927],{"align":919},[138,2067,1924],{"align":919},[138,2069,2070],{},"未來預測和動作生成聯合",[99,2072],{},[10,2074,2075],{"id":2075},"一個統一的五問閲讀法",[14,2077,2078],{},"以後看到任何 World Model 論文，優先回答：",[75,2080,2081,2087,2093,2099,2105],{},[29,2082,2083,2086],{},[18,2084,2085],{},"Observation（觀測）是什麼？"," RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal？",[29,2088,2089,2092],{},[18,2090,2091],{},"Representation（世界表示）是什麼？"," Pixel、Latent、DINO feature、BEV、Occupancy、3D Gaussian、Digital Twin？",[29,2094,2095,2098],{},[18,2096,2097],{},"World Model Output（世界模型輸出）是什麼？"," Future RGB、Future Latent、Future Occupancy、Future 3DGS、Reward \u002F Risk、Action-conditioned future？",[29,2100,2101,2104],{},[18,2102,2103],{},"Planner \u002F Policy（規劃器 \u002F 策略）怎麼決定動作？"," CEM、MPC、MPPI、Neural Policy、Actor-Critic、World Action Model？",[29,2106,2107,2110,2111,2113],{},[18,2108,2109],{},"Robot Output（機器人最終輸出）是什麼？"," ",[1245,2112,1404],{},"、trajectory、joint position、end-effector pose、action chunk？",[99,2115],{},[10,2117,2118],{"id":2118},"當前路線判斷",[1232,2120,37],{"id":2121},"world-model-policy",[14,2123,2124],{},"代表：",[26,2126,2127,2129],{},[29,2128,142],{},[29,2130,304],{},[14,2132,2133],{},"基本結構：",[1237,2135,2138],{"className":2136,"code":2137,"language":1242,"meta":1243},[1240],"Observation\n    ↓\nWorld Model\n    ↓\nLatent State\n    ↓\nPolicy\n    ↓\nAction\n",[1245,2139,2137],{"__ignoreMap":1243},[14,2141,2142],{},"特點：",[26,2144,2145,2148,2151,2154],{},[29,2146,2147],{},"適合真實機器人閉環；",[29,2149,2150],{},"不一定需要每個控制週期進行大量 CEM 搜索；",[29,2152,2153],{},"推理更容易做實時；",[29,2155,2156],{},"容易形成 World Model + robot deployment 的完整故事。",[14,2158,2159],{},"當前判斷：",[898,2161,2162],{},[14,2163,2164],{},[18,2165,2166],{},"最適合第一篇工作的主路線。",[99,2168],{},[1232,2170,2172],{"id":2171},"world-model-planning","World Model + Planning",[14,2174,2124],{},[26,2176,2177,2179,2181],{},[29,2178,455],{},[29,2180,194],{},[29,2182,810],{},[14,2184,2185],{},"結構：",[1237,2187,2190],{"className":2188,"code":2189,"language":1242,"meta":1243},[1240],"Observation\n    ↓\nWorld Model\n    ↓\nImagine Future\n    ↓\nCEM \u002F MPC \u002F Optimizer\n    ↓\nAction\n",[1245,2191,2189],{"__ignoreMap":1243},[14,2193,2142],{},[26,2195,2196,2199,2202,2205,2208],{},[29,2197,2198],{},"World Model 與 Planner 解耦；",[29,2200,2201],{},"可顯式測試 counterfactual actions；",[29,2203,2204],{},"學術上很有 World Model 味；",[29,2206,2207],{},"生成式 WM 往往存在推理延遲；",[29,2209,2210],{},"planner 需要大量 candidate rollout 時計算成本很高。",[99,2212],{},[1232,2214,40],{"id":2215},"world-model-model-based-rl",[14,2217,2124],{},[26,2219,2220,2222],{},[29,2221,217],{},[29,2223,2224],{},"DreamerV3 系列",[14,2226,2185],{},[1237,2228,2231],{"className":2229,"code":2230,"language":1242,"meta":1243},[1240],"Observation\n    ↓\nRSSM World Model\n    ↓\nImagined Rollouts\n    ↓\nActor-Critic\n    ↓\nPolicy\n",[1245,2232,2230],{"__ignoreMap":1243},[14,2234,2142],{},[26,2236,2237,2240,2243,2246,2249,2252],{},[29,2238,2239],{},"latent imagination；",[29,2241,2242],{},"sample efficiency；",[29,2244,2245],{},"reward design 很重要；",[29,2247,2248],{},"training stability 是核心問題；",[29,2250,2251],{},"很適合動態環境與複雜決策；",[29,2253,2254],{},"需要理解 RL，不只是模型結構。",[99,2256],{},[10,2258,2260],{"id":2259},"第一主-baseline-候選x-mobility","第一主 baseline 候選：X-MOBILITY",[1232,2262,2263],{"id":2263},"基本信息",[14,2265,2266],{},[18,2267,2268],{},"論文：",[14,2270,2271],{},"X-MOBILITY: End-To-End Generalizable Navigation via World Modeling",[14,2273,2274],{},[18,2275,2276],{},"Venue：",[14,2278,147],{},[14,2280,2281],{},[18,2282,2283],{},"機構：",[26,2285,2286,2289,2292],{},[29,2287,2288],{},"NVIDIA",[29,2290,2291],{},"UC Berkeley",[29,2293,2294],{},"UT Austin",[14,2296,2297],{},[18,2298,2299],{},"鏈接：",[26,2301,2302,2308,2314,2320,2326],{},[29,2303,2304,2305],{},"arXiv: ",[420,2306,422],{"href":422,"rel":2307},[424],[29,2309,2310,2311],{},"Project: ",[420,2312,429],{"href":429,"rel":2313},[424],[29,2315,2316,2317],{},"GitHub: ",[420,2318,435],{"href":435,"rel":2319},[424],[29,2321,2322,2323],{},"Hugging Face Model: ",[420,2324,442],{"href":442,"rel":2325},[424],[29,2327,2328,2329],{},"Hugging Face Dataset: ",[420,2330,447],{"href":447,"rel":2331},[424],[14,2333,2334],{},[18,2335,2336],{},"方向：",[26,2338,2339,2342,2345,2348,2351,2353,2356],{},[29,2340,2341],{},"World Model",[29,2343,2344],{},"Robot Navigation",[29,2346,2347],{},"Imitation Learning",[29,2349,2350],{},"End-to-End Navigation",[29,2352,52],{},[29,2354,2355],{},"Cross-Embodiment",[29,2357,2358],{},"Edge Deployment",[14,2360,2361],{},[18,2362,2363],{},"當前定位：",[898,2365,2366],{},[14,2367,2368],{},[18,2369,2370],{},"第一主 baseline 候選。",[14,2372,2373],{},"選擇原因：",[75,2375,2376,2379,2382,2385,2388,2391,2394,2397,2400,2403],{},[29,2377,2378],{},"本身就是移動機器人導航，不需要強行把一個 manipulation WM 改成 navigation；",[29,2380,2381],{},"World Model 與 Action Policy 解耦，適合在 World Model 部分做研究；",[29,2383,2384],{},"有 Isaac Sim；",[29,2386,2387],{},"Teacher 直接使用 Nav2；",[29,2389,2390],{},"有 Dataset；",[29,2392,2393],{},"有 Checkpoint；",[29,2395,2396],{},"有 ONNX \u002F TensorRT \u002F ROS2 部署鏈；",[29,2398,2399],{},"有 Nova Carter 實機；",[29,2401,2402],{},"算力雖然原論文高，但比從零復現 NWM 1B 更現實；",[29,2404,2405],{},"和未來 ROS2 \u002F Nav2 \u002F 實機方向高度兼容。",[99,2407],{},[1232,2409,2410],{"id":2410},"一句話理解",[14,2412,2413],{},"X-MOBILITY 的核心思想：",[898,2415,2416],{},[14,2417,2418],{},"利用 World Model 學習一個包含環境狀態與動態信息的 latent representation，再利用這個 latent state 學習導航 Action Policy。",[14,2420,2421],{},"普通 Behavior Cloning：",[1237,2423,2426],{"className":2424,"code":2425,"language":1242,"meta":1243},[1240],"Image\n  ↓\nNetwork\n  ↓\nAction\n",[1245,2427,2425],{"__ignoreMap":1243},[14,2429,2430],{},"X-MOBILITY：",[1237,2432,2435],{"className":2433,"code":2434,"language":1242,"meta":1243},[1240],"Image + Robot State\n        ↓\n    World Model\n        ↓\n    Latent State\n        ↓\n   Action Policy\n        ↓\n      Action\n",[1245,2436,2434],{"__ignoreMap":1243},[14,2438,2439],{},"關鍵區別：",[898,2441,2442],{},[14,2443,2444],{},"Latent State 不只是為了擬合 teacher action，而是通過 World Modeling 與 multi-task decoder 被迫學習環境與動態信息。",[99,2446],{},[1232,2448,2449],{"id":2449},"總體網絡結構",[1237,2451,2454],{"className":2452,"code":2453,"language":1242,"meta":1243},[1240],"                     Image\n                       ↓\n                    DINOv2\n\nRobot State → MLP ─────┤\n                       ↓\n              Observation Embedding\n                       ↓\n               State Estimator\n                       ↓\n                Belief State\n                       ↓\n               Latent State z\n                 ↙     ↓      ↘\n                \u002F      │       \\\n               ↓       ↓        ↓\n          RGB Decoder Semantic  Action Policy\n                         Decoder      ↓\n                                   Velocity\n                                     +\n                                    Path\n",[1245,2455,2453],{"__ignoreMap":1243},[14,2457,2458],{},"另有：",[1237,2460,2463],{"className":2461,"code":2462,"language":1242,"meta":1243},[1240],"State Predictor\n",[1245,2464,2462],{"__ignoreMap":1243},[14,2466,2467],{},"負責：",[1237,2469,2472],{"className":2470,"code":2471,"language":1242,"meta":1243},[1240],"History\n+\nAction\n  ↓\nFuture Belief State\n",[1245,2473,2471],{"__ignoreMap":1243},[14,2475,2476],{},"World Model 的關鍵本質：",[14,2478,2479],{},"[\np(s_{t+1}\\mid s_t,a_t)\n]",[99,2481],{},[1232,2483,2485],{"id":2484},"observation-encoder","Observation Encoder",[14,2487,2488],{},"輸入主要包括：",[2490,2491,2493],"h4",{"id":2492},"rgb","RGB",[14,2495,2496],{},"前視相機圖像。",[14,2498,2499],{},"視覺特徵：",[1237,2501,2504],{"className":2502,"code":2503,"language":1242,"meta":1243},[1240],"DINOv2\n",[1245,2505,2503],{"__ignoreMap":1243},[2490,2507,2509],{"id":2508},"robot-state","Robot State",[14,2511,2512],{},"主要包括機器人速度等狀態量。",[14,2514,2515],{},"通過：",[1237,2517,2520],{"className":2518,"code":2519,"language":1242,"meta":1243},[1240],"MLP\n",[1245,2521,2519],{"__ignoreMap":1243},[14,2523,2524],{},"編碼。",[14,2526,2527],{},"最終：",[1237,2529,2532],{"className":2530,"code":2531,"language":1242,"meta":1243},[1240],"Image Embedding\n+\nRobot State Embedding\n      ↓\nObservation Embedding\n",[1245,2533,2531],{"__ignoreMap":1243},[99,2535],{},[1232,2537,2539],{"id":2538},"state-estimator","State Estimator",[14,2541,2542],{},"輸入：",[1237,2544,2547],{"className":2545,"code":2546,"language":1242,"meta":1243},[1240],"History\n+\nPrevious Action\n+\nCurrent Observation\n",[1245,2548,2546],{"__ignoreMap":1243},[14,2550,2551],{},"輸出 probabilistic belief state。",[14,2553,2554],{},"用於估計：",[898,2556,2557],{},[14,2558,2559],{},"在已經看到真實 observation 的情況下，當前世界 latent state 應該是什麼。",[99,2561],{},[1232,2563,2565],{"id":2564},"state-predictor","State Predictor",[14,2567,2542],{},[1237,2569,2572],{"className":2570,"code":2571,"language":1242,"meta":1243},[1240],"History\n+\nAction\n",[1245,2573,2571],{"__ignoreMap":1243},[14,2575,2576],{},"不使用未來 observation。",[14,2578,2579],{},"輸出：",[1237,2581,2584],{"className":2582,"code":2583,"language":1242,"meta":1243},[1240],"Predicted Future Belief State\n",[1245,2585,2583],{"__ignoreMap":1243},[14,2587,2588],{},"也就是：",[898,2590,2591],{},[14,2592,2593],{},"如果我執行這個 action，未來 latent world state 會變成什麼。",[14,2595,2596],{},"State Predictor 與 State Estimator 之間通過 KL 約束，使預測出來的 latent distribution 接近真實觀察得到的 posterior。",[99,2598],{},[1232,2600,2602],{"id":2601},"multi-task-decoder","Multi-Task Decoder",[14,2604,2605],{},"作者希望 latent state 不是隻會擬合 action，因此使用多個 decoder 給 latent state 提供監督。",[14,2607,2608],{},"主要包括：",[1237,2610,2613],{"className":2611,"code":2612,"language":1242,"meta":1243},[1240],"RGB Reconstruction\n+\nSemantic Segmentation\n",[1245,2614,2612],{"__ignoreMap":1243},[14,2616,2617],{},"RGB Reconstruction 使用 Latent Diffusion Model。",[14,2619,2620],{},"論文 appendix 給出的模型規模中：",[1237,2622,2625],{"className":2623,"code":2624,"language":1242,"meta":1243},[1240],"RGB Diffuser ≈ 962M\n",[1245,2626,2624],{"__ignoreMap":1243},[14,2628,2629],{},"但真正負責 world dynamics 的組件小得多，例如：",[1237,2631,2634],{"className":2632,"code":2633,"language":1242,"meta":1243},[1240],"State Estimator ≈ 5.5M\nState Predictor ≈ 2.3M\n",[1245,2635,2633],{"__ignoreMap":1243},[14,2637,2638],{},"這一點非常值得關注：",[898,2640,2641],{},[14,2642,2643],{},[18,2644,2645],{},"Navigation World Model 是否真的需要一個近 1B 的 RGB Diffuser？",[99,2647],{},[1232,2649,2651],{"id":2650},"action-policy","Action Policy",[14,2653,2542],{},[1237,2655,2658],{"className":2656,"code":2657,"language":1242,"meta":1243},[1240],"Latent State\n+\nRoute Feature\n",[1245,2659,2657],{"__ignoreMap":1243},[14,2661,2662],{},"Route 使用：",[1237,2664,2667],{"className":2665,"code":2666,"language":1242,"meta":1243},[1240],"VectorNet\n",[1245,2668,2666],{"__ignoreMap":1243},[14,2670,2524],{},[14,2672,2673],{},"之後：",[1237,2675,2678],{"className":2676,"code":2677,"language":1242,"meta":1243},[1240],"Self-Attention Fusion\n        ↓\nAction Decoder\n",[1245,2679,2677],{"__ignoreMap":1243},[14,2681,2579],{},[1237,2683,2686],{"className":2684,"code":2685,"language":1242,"meta":1243},[1240],"Linear \u002F Angular Velocity\n+\nOptional Local Path\n",[1245,2687,2685],{"__ignoreMap":1243},[14,2689,2690],{},"Policy 使用 imitation learning 學習 teacher。",[99,2692],{},[1232,2694,2695],{"id":2695},"數據集",[14,2697,2698],{},"訓練數據來自 Isaac Sim 中的 Nova Carter。",[14,2700,2701],{},"分為兩類。",[2490,2703,2705],{"id":2704},"random-action-dataset","Random Action Dataset",[1237,2707,2710],{"className":2708,"code":2709,"language":1242,"meta":1243},[1240],"≈ 160K frames\n",[1245,2711,2709],{"__ignoreMap":1243},[14,2713,1249],{},[898,2715,2716],{},[14,2717,2718],{},"World Model pretraining。",[14,2720,2721],{},"核心目標不是學導航，而是儘量探索：",[1237,2723,2726],{"className":2724,"code":2725,"language":1242,"meta":1243},[1240],"state-action coverage\n",[1245,2727,2725],{"__ignoreMap":1243},[14,2729,2730],{},"讓 WM 學習：",[898,2732,2733],{},[14,2734,2735],{},"執行動作後世界怎麼變化。",[2490,2737,2739],{"id":2738},"nav2-teacher-dataset","Nav2 Teacher Dataset",[1237,2741,2744],{"className":2742,"code":2743,"language":1242,"meta":1243},[1240],"≈ 100K frames\n",[1245,2745,2743],{"__ignoreMap":1243},[14,2747,2748],{},"Nav2 在 Isaac Sim 中閉環運行：",[1237,2750,2753],{"className":2751,"code":2752,"language":1242,"meta":1243},[1240],"Random Start\n+\nRandom Goal\n      ↓\nNav2\n      ↓\nTeacher Trajectory\n",[1245,2754,2752],{"__ignoreMap":1243},[14,2756,1249],{},[1237,2758,2761],{"className":2759,"code":2760,"language":1242,"meta":1243},[1240],"World Model\n+\nAction Policy\n",[1245,2762,2760],{"__ignoreMap":1243},[14,2764,2765],{},"聯合訓練。",[99,2767],{},[1232,2769,2771],{"id":2770},"multi-stage-training","Multi-Stage Training",[2490,2773,2775],{"id":2774},"stage-1world-model-pretraining","Stage 1：World Model Pretraining",[1237,2777,2780],{"className":2778,"code":2779,"language":1242,"meta":1243},[1240],"Random Action Dataset\n        ↓\nWorld Model\n",[1245,2781,2779],{"__ignoreMap":1243},[14,2783,2784],{},"Policy 關閉。",[2490,2786,2788],{"id":2787},"stage-2world-model-action-policy","Stage 2：World Model + Action Policy",[1237,2790,2793],{"className":2791,"code":2792,"language":1242,"meta":1243},[1240],"Nav2 Teacher Dataset\n        ↓\nWorld Model + Policy\n",[1245,2794,2792],{"__ignoreMap":1243},[14,2796,2142],{},[898,2798,2799],{},[14,2800,2801],{},"World Modeling 與 Policy Learning 解耦。",[14,2803,2804],{},"這可能是 X-MOBILITY 最值得作為 baseline 的設計之一。",[99,2806],{},[1232,2808,2809],{"id":2809},"原論文計算資源",[14,2811,2812],{},"原始訓練配置：",[1237,2814,2817],{"className":2815,"code":2816,"language":1242,"meta":1243},[1240],"8 × NVIDIA H100\n",[1245,2818,2816],{"__ignoreMap":1243},[14,2820,2821],{},"World Model：",[1237,2823,2826],{"className":2824,"code":2825,"language":1242,"meta":1243},[1240],"100 epochs\n",[1245,2827,2825],{"__ignoreMap":1243},[14,2829,2830],{},"World Model + Policy：",[1237,2832,2834],{"className":2833,"code":2825,"language":1242,"meta":1243},[1240],[1245,2835,2825],{"__ignoreMap":1243},[14,2837,2838],{},"Batch：",[1237,2840,2843],{"className":2841,"code":2842,"language":1242,"meta":1243},[1240],"32\n",[1245,2844,2842],{"__ignoreMap":1243},[14,2846,2847],{},"因此不建議第一步直接嘗試：",[898,2849,2850],{},[14,2851,2852],{},"從零 100% 復現 NVIDIA 的完整訓練規模。",[14,2854,2855],{},"更現實：",[1237,2857,2860],{"className":2858,"code":2859,"language":1242,"meta":1243},[1240],"Official Checkpoint\n        ↓\nReproduce Evaluation\n        ↓\nFine-tuning\n        ↓\nModify Module\n        ↓\nAblation\n",[1245,2861,2859],{"__ignoreMap":1243},[99,2863],{},[1232,2865,2867],{"id":2866},"推理與-edge-deployment","推理與 Edge Deployment",[14,2869,2870],{},"作者在：",[1237,2872,2875],{"className":2873,"code":2874,"language":1242,"meta":1243},[1240],"Jetson AGX Orin\n",[1245,2876,2874],{"__ignoreMap":1243},[14,2878,2879],{},"測試推理。",[14,2881,2882],{},"Policy Only：",[1237,2884,2887],{"className":2885,"code":2886,"language":1242,"meta":1243},[1240],"P50 ≈ 38.6 ms\nP95 ≈ 42.0 ms\nGPU Memory ≈ 594 MB\n",[1245,2888,2886],{"__ignoreMap":1243},[14,2890,2891],{},"Policy + Semantic：",[1237,2893,2896],{"className":2894,"code":2895,"language":1242,"meta":1243},[1240],"P50 ≈ 55.6 ms\nGPU Memory ≈ 804 MB\n",[1245,2897,2895],{"__ignoreMap":1243},[14,2899,2900],{},"説明：",[898,2902,2903],{},[14,2904,2905],{},"真正用於 navigation inference 的主體並沒有 962M RGB diffuser 看上去那麼誇張。",[14,2907,2908],{},"官方工程鏈：",[1237,2910,2913],{"className":2911,"code":2912,"language":1242,"meta":1243},[1240],"PyTorch\n   ↓\nONNX\n   ↓\nTensorRT\n   ↓\nROS2\n   ↓\nRobot\n",[1245,2914,2912],{"__ignoreMap":1243},[14,2916,2917],{},"這對未來實機很重要。",[99,2919],{},[1232,2921,52],{"id":2922},"sim2real",[14,2924,2925],{},"真實平台：",[1237,2927,2930],{"className":2928,"code":2929,"language":1242,"meta":1243},[1240],"NVIDIA Nova Carter\n",[1245,2931,2929],{"__ignoreMap":1243},[14,2933,2934],{},"訓練：",[1237,2936,2939],{"className":2937,"code":2938,"language":1242,"meta":1243},[1240],"Isaac Sim\n",[1245,2940,2938],{"__ignoreMap":1243},[14,2942,2943],{},"真實部署：",[1237,2945,2948],{"className":2946,"code":2947,"language":1242,"meta":1243},[1240],"Zero-Shot Sim2Real\n",[1245,2949,2947],{"__ignoreMap":1243},[14,2951,2952],{},"即：",[898,2954,2955],{},[14,2956,2957],{},"不針對真實實驗室環境額外 fine-tune。",[14,2959,2960],{},"實機 benchmark 包括：",[1237,2962,2965],{"className":2963,"code":2964,"language":1242,"meta":1243},[1240],"Single Obstacle\nMulti Obstacles\n\nNormal Lighting\nDark Lighting\n",[1245,2966,2964],{"__ignoreMap":1243},[14,2968,2969],{},"論文報告：",[1237,2971,2974],{"className":2972,"code":2973,"language":1242,"meta":1243},[1240],"Single \u002F Normal    10 \u002F 10\nSingle \u002F Dark      10 \u002F 10\nMulti \u002F Normal      8 \u002F 9\nMulti \u002F Dark        8 \u002F 9\n",[1245,2975,2973],{"__ignoreMap":1243},[99,2977],{},[1232,2979,2355],{"id":2980},"cross-embodiment",[14,2982,2983],{},"Isaac Sim 中進一步測試：",[1237,2985,2988],{"className":2986,"code":2987,"language":1242,"meta":1243},[1240],"Nova Carter\nForklift\nUnitree Go2\nUnitree G1\n",[1245,2989,2987],{"__ignoreMap":1243},[14,2991,2992],{},"對應：",[1237,2994,2997],{"className":2995,"code":2996,"language":1242,"meta":1243},[1240],"Differential Drive\nAckermann\nQuadruped\nHumanoid\n",[1245,2998,2996],{"__ignoreMap":1243},[14,3000,3001],{},"研究意義：",[898,3003,3004],{},[14,3005,3006],{},"latent representation 與標準化 input\u002Foutput 是否可以跨 embodiment 泛化。",[99,3008],{},[1232,3010,3012],{"id":3011},"原論文-baselines","原論文 Baselines",[14,3014,3015],{},"當前記錄：",[26,3017,3018,3021,3024,3027],{},[29,3019,3020],{},"Nav2 Teacher；",[29,3022,3023],{},"Behavior Cloning；",[29,3025,3026],{},"MILE；",[29,3028,3029],{},"X-MOBILITY。",[14,3031,3032],{},"後續需要繼續詳細整理：",[26,3034,3035,3038,3041,3044,3047,3050,3053],{},[29,3036,3037],{},"每個 baseline 的 network；",[29,3039,3040],{},"是否使用同一 dataset；",[29,3042,3043],{},"是否 retrain；",[29,3045,3046],{},"訓練預算是否一致；",[29,3048,3049],{},"open-loop 與 closed-loop 分別怎麼比；",[29,3051,3052],{},"statistical significance；",[29,3054,3055],{},"是否有 hidden implementation advantage。",[99,3057],{},[1232,3059,3061],{"id":3060},"evaluation-metrics","Evaluation Metrics",[14,3063,3064],{},"Open-loop：",[26,3066,3067,3070,3073],{},[29,3068,3069],{},"Linear Speed MAE；",[29,3071,3072],{},"Angular Speed MAE；",[29,3074,3075],{},"Path MAE。",[14,3077,3078],{},"Closed-loop：",[26,3080,3081,3084,3087],{},[29,3082,3083],{},"Success Rate；",[29,3085,3086],{},"Weighted Trip Time；",[29,3088,3089],{},"Average Absolute Angular Acceleration。",[14,3091,3092],{},"未來自己的論文可以追加：",[26,3094,3095,3098,3101,3104,3107,3110,3113,3116,3119,3122,3125,3128],{},[29,3096,3097],{},"Collision Rate；",[29,3099,3100],{},"Minimum Obstacle Distance；",[29,3102,3103],{},"Path Length；",[29,3105,3106],{},"Navigation Time；",[29,3108,3109],{},"SPL；",[29,3111,3112],{},"FPS；",[29,3114,3115],{},"P50 \u002F P95 latency；",[29,3117,3118],{},"GPU memory；",[29,3120,3121],{},"Parameters；",[29,3123,3124],{},"Energy \u002F power；",[29,3126,3127],{},"Dynamic obstacle collision rate；",[29,3129,3130],{},"OOD success rate。",[99,3132],{},[1232,3134,3135],{"id":3135},"當前認為的優點",[2490,3137,3138],{"id":3138},"工程鏈完整",[1237,3140,3143],{"className":3141,"code":3142,"language":1242,"meta":1243},[1240],"Isaac Sim\n↓\nDataset\n↓\nWorld Model\n↓\nPolicy\n↓\nTensorRT\n↓\nROS2\n↓\nReal Robot\n",[1245,3144,3142],{"__ignoreMap":1243},[2490,3146,3148],{"id":3147},"dataset-checkpoint-code-都有","Dataset \u002F Checkpoint \u002F Code 都有",[14,3150,3151],{},"降低復現門檻。",[2490,3153,3155],{"id":3154},"world-model-與-policy-解耦","World Model 與 Policy 解耦",[14,3157,3158],{},"非常適合：",[1237,3160,3163],{"className":3161,"code":3162,"language":1242,"meta":1243},[1240],"保持 Policy Pipeline\n      ↓\n重点改 WM\n",[1245,3164,3162],{"__ignoreMap":1243},[2490,3166,3168],{"id":3167},"nav2-可以同時當-teacher-和傳統-baseline","Nav2 可以同時當 Teacher 和傳統 baseline",[14,3170,3171],{},"這與移動機器人研究非常自然。",[2490,3173,3174],{"id":3174},"可上實機",[14,3176,3177],{},"不是隻在 offline benchmark 上比較 prediction metric。",[99,3179],{},[1232,3181,3183],{"id":3182},"當前認為的不足-待驗證問題","當前認為的不足 \u002F 待驗證問題",[2490,3185,3186],{"id":3186},"動態障礙研究仍不充分",[14,3188,3189],{},"作者未來工作明確提到：",[898,3191,3192],{},[14,3193,3194],{},"需要增加更多 diverse dynamic-obstacle scenes，進一步研究 world model 對 action policy 的作用。",[14,3196,3197],{},"可能的 research question：",[898,3199,3200],{},[14,3201,3202],{},"X-MOBILITY 的 latent dynamics 在高速、多人、交叉運動動態環境中是否仍然可靠？",[2490,3204,3206],{"id":3205},"感知主要依賴-rgb","感知主要依賴 RGB",[14,3208,3209],{},"當前核心輸入：",[1237,3211,3214],{"className":3212,"code":3213,"language":1242,"meta":1243},[1240],"RGB\n+\nRobot State\n",[1245,3215,3213],{"__ignoreMap":1243},[14,3217,3218],{},"機器人導航還有：",[1237,3220,3223],{"className":3221,"code":3222,"language":1242,"meta":1243},[1240],"LiDAR\nDepth\nBEV\nOccupancy\n",[1245,3224,3222],{"__ignoreMap":1243},[14,3226,3227],{},"待驗證：",[898,3229,3230],{},[14,3231,3232],{},"RGB latent 是否缺少穩定 geometry grounding？",[2490,3234,3236],{"id":3235},"rgb-diffuser-很大","RGB Diffuser 很大",[1237,3238,3241],{"className":3239,"code":3240,"language":1242,"meta":1243},[1240],"≈ 962M\n",[1245,3242,3240],{"__ignoreMap":1243},[14,3244,3227],{},[898,3246,3247],{},[14,3248,3249],{},"對導航來説，有沒有必要生成 \u002F 重建 RGB？",[14,3251,3252],{},"可能替代：",[26,3254,3255,3258,3261,3264,3267,3270],{},[29,3256,3257],{},"Future Latent；",[29,3259,3260],{},"Depth；",[29,3262,3263],{},"Occupancy；",[29,3265,3266],{},"Traversability；",[29,3268,3269],{},"Dynamic Motion；",[29,3271,3272],{},"Collision Risk。",[2490,3274,3276],{"id":3275},"world-model-prediction-與-navigation-performance-的因果關係不夠直觀","World Model prediction 與 navigation performance 的因果關係不夠直觀",[14,3278,3279],{},"必須問：",[898,3281,3282],{},[14,3283,3284],{},"prediction metric 更好，是否一定帶來 closed-loop navigation 更好？",[14,3286,3287],{},"未來 ablation 應該專門分析。",[99,3289],{},[1232,3291,3293],{"id":3292},"潛在-research-questions","潛在 Research Questions",[898,3295,3296],{},[14,3297,3298],{},"以下只進入「問題池」，不能直接當作論文創新點。",[2490,3300,3302],{"id":3301},"dynamic-world-modeling","Dynamic World Modeling",[14,3304,3305],{},"現象候選：",[1237,3307,3310],{"className":3308,"code":3309,"language":1242,"meta":1243},[1240],"Fast Pedestrian\nCrossing Pedestrian\nMulti-Agent Interaction\nSudden Appearance\n",[1245,3311,3309],{"__ignoreMap":1243},[14,3313,3314],{},"問題：",[898,3316,3317],{},[14,3318,3319],{},"現有 latent dynamics 是否能可靠預測動態實體？",[2490,3321,3323],{"id":3322},"multi-modal-world-modeling","Multi-Modal World Modeling",[14,3325,3326],{},"候選：",[1237,3328,3331],{"className":3329,"code":3330,"language":1242,"meta":1243},[1240],"RGB\n+\nLiDAR \u002F Depth \u002F BEV\n",[1245,3332,3330],{"__ignoreMap":1243},[14,3334,3314],{},[898,3336,3337],{},[14,3338,3339],{},"顯式 geometry modality 是否提高 OOD、暗光、運動模糊和動態導航魯棒性？",[2490,3341,3343],{"id":3342},"navigation-oriented-representation","Navigation-Oriented Representation",[14,3345,3346],{},"從：",[1237,3348,3351],{"className":3349,"code":3350,"language":1242,"meta":1243},[1240],"RGB Reconstruction\n",[1245,3352,3350],{"__ignoreMap":1243},[14,3354,3355],{},"轉向：",[1237,3357,3360],{"className":3358,"code":3359,"language":1242,"meta":1243},[1240],"Future Occupancy\nDepth\nTraversability\nDynamic Motion\nCollision Risk\n",[1245,3361,3359],{"__ignoreMap":1243},[14,3363,3314],{},[898,3365,3366],{},[14,3367,3368],{},"對 navigation 來説，task-oriented prediction 是否比 photorealistic reconstruction 更有效？",[2490,3370,3372],{"id":3371},"lightweight-world-model","Lightweight World Model",[14,3374,3375],{},"研究：",[26,3377,3378,3381,3384,3387,3390,3393],{},[29,3379,3380],{},"Distillation；",[29,3382,3383],{},"Quantization；",[29,3385,3386],{},"Efficient temporal model；",[29,3388,3389],{},"Decoder pruning \u002F replacement；",[29,3391,3392],{},"Adapter；",[29,3394,3395],{},"low-rank fine-tuning。",[14,3397,3398],{},"目標：",[1237,3400,3403],{"className":3401,"code":3402,"language":1242,"meta":1243},[1240],"Lower Latency\nLower VRAM\nSimilar \u002F Better Navigation SR\n",[1245,3404,3402],{"__ignoreMap":1243},[2490,3406,3408],{"id":3407},"uncertainty-aware-wm","Uncertainty-Aware WM",[14,3410,3346],{},[1237,3412,3415],{"className":3413,"code":3414,"language":1242,"meta":1243},[1240],"One Future\n",[1245,3416,3414],{"__ignoreMap":1243},[14,3418,3419],{},"變為：",[1237,3421,3424],{"className":3422,"code":3423,"language":1242,"meta":1243},[1240],"P(Future | State, Action)\n",[1245,3425,3423],{"__ignoreMap":1243},[14,3427,3375],{},[898,3429,3430],{},[14,3431,3432],{},"uncertainty 是否能用於 risk-aware navigation？",[99,3434],{},[1232,3436,3438],{"id":3437},"x-mobility-復現-checklist","X-MOBILITY 復現 Checklist",[26,3440,3443,3453,3459,3465,3471,3477,3483,3489,3495,3501,3507,3513,3519,3525,3531,3537,3543,3549,3555,3561,3567,3573,3579,3585,3591,3597,3603,3609,3615,3621,3627,3633,3639],{"className":3441},[3442],"contains-task-list",[29,3444,3447,3452],{"className":3445},[3446],"task-list-item",[3448,3449],"input",{"disabled":3450,"type":3451},true,"checkbox"," 通讀論文第一遍",[29,3454,3456,3458],{"className":3455},[3446],[3448,3457],{"disabled":3450,"type":3451}," 畫出總體網絡圖",[29,3460,3462,3464],{"className":3461},[3446],[3448,3463],{"disabled":3450,"type":3451}," 搞懂 Observation Encoder",[29,3466,3468,3470],{"className":3467},[3446],[3448,3469],{"disabled":3450,"type":3451}," 搞懂 State Estimator",[29,3472,3474,3476],{"className":3473},[3446],[3448,3475],{"disabled":3450,"type":3451}," 搞懂 State Predictor",[29,3478,3480,3482],{"className":3479},[3446],[3448,3481],{"disabled":3450,"type":3451}," 搞懂 KL Loss",[29,3484,3486,3488],{"className":3485},[3446],[3448,3487],{"disabled":3450,"type":3451}," 搞懂 RGB Decoder",[29,3490,3492,3494],{"className":3491},[3446],[3448,3493],{"disabled":3450,"type":3451}," 搞懂 Semantic Decoder",[29,3496,3498,3500],{"className":3497},[3446],[3448,3499],{"disabled":3450,"type":3451}," 搞懂 Route Encoder",[29,3502,3504,3506],{"className":3503},[3446],[3448,3505],{"disabled":3450,"type":3451}," 搞懂 Action Policy",[29,3508,3510,3512],{"className":3509},[3446],[3448,3511],{"disabled":3450,"type":3451}," 下載 GitHub",[29,3514,3516,3518],{"className":3515},[3446],[3448,3517],{"disabled":3450,"type":3451}," 搭建 Docker 環境",[29,3520,3522,3524],{"className":3521},[3446],[3448,3523],{"disabled":3450,"type":3451}," 下載 official checkpoint",[29,3526,3528,3530],{"className":3527},[3446],[3448,3529],{"disabled":3450,"type":3451}," 下載 official dataset",[29,3532,3534,3536],{"className":3533},[3446],[3448,3535],{"disabled":3450,"type":3451}," 跑通官方 inference",[29,3538,3540,3542],{"className":3539},[3446],[3448,3541],{"disabled":3450,"type":3451}," 跑通 official evaluation",[29,3544,3546,3548],{"className":3545},[3446],[3448,3547],{"disabled":3450,"type":3451}," 跑通 Isaac Sim demo \u002F 數據鏈",[29,3550,3552,3554],{"className":3551},[3446],[3448,3553],{"disabled":3450,"type":3451}," 嘗試一次 fine-tuning",[29,3556,3558,3560],{"className":3557},[3446],[3448,3559],{"disabled":3450,"type":3451}," 記錄單卡顯存",[29,3562,3564,3566],{"className":3563},[3446],[3448,3565],{"disabled":3450,"type":3451}," 記錄單 iteration 時間",[29,3568,3570,3572],{"className":3569},[3446],[3448,3571],{"disabled":3450,"type":3451}," 記錄多卡訓練效率",[29,3574,3576,3578],{"className":3575},[3446],[3448,3577],{"disabled":3450,"type":3451}," 復現主要 open-loop 指標",[29,3580,3582,3584],{"className":3581},[3446],[3448,3583],{"disabled":3450,"type":3451}," 復現主要 closed-loop 指標",[29,3586,3588,3590],{"className":3587},[3446],[3448,3589],{"disabled":3450,"type":3451}," 建 Failure Case Dataset",[29,3592,3594,3596],{"className":3593},[3446],[3448,3595],{"disabled":3450,"type":3451}," Failure Case Analysis",[29,3598,3600,3602],{"className":3599},[3446],[3448,3601],{"disabled":3450,"type":3451}," 提出第一個 hypothesis",[29,3604,3606,3608],{"className":3605},[3446],[3448,3607],{"disabled":3450,"type":3451}," 做最小修改驗證 hypothesis",[29,3610,3612,3614],{"className":3611},[3446],[3448,3613],{"disabled":3450,"type":3451}," 通過後進入正式創新點設計",[29,3616,3618,3620],{"className":3617},[3446],[3448,3619],{"disabled":3450,"type":3451}," Ablation",[29,3622,3624,3626],{"className":3623},[3446],[3448,3625],{"disabled":3450,"type":3451}," 與強 baseline 對比",[29,3628,3630,3632],{"className":3629},[3446],[3448,3631],{"disabled":3450,"type":3451}," TensorRT",[29,3634,3636,3638],{"className":3635},[3446],[3448,3637],{"disabled":3450,"type":3451}," ROS2",[29,3640,3642,3644],{"className":3641},[3446],[3448,3643],{"disabled":3450,"type":3451}," 實機",[99,3646],{},[10,3648,170],{"id":3649},"navigation-world-modelsnwm",[1232,3651,2263],{"id":3652},"基本信息-1",[14,3654,3655],{},[18,3656,2268],{},[14,3658,455],{},[14,3660,3661],{},[18,3662,2276],{},[14,3664,3665],{},"CVPR 2025 Oral",[14,3667,3668],{},"Best Paper Honorable Mention。",[14,3670,3671],{},[18,3672,2299],{},[26,3674,3675,3680,3685,3690],{},[29,3676,2304,3677],{},[420,3678,460],{"href":460,"rel":3679},[424],[29,3681,2310,3682],{},[420,3683,466],{"href":466,"rel":3684},[424],[29,3686,2316,3687],{},[420,3688,472],{"href":472,"rel":3689},[424],[29,3691,3692,3693],{},"Hugging Face: ",[420,3694,478],{"href":478,"rel":3695},[424],[14,3697,3698],{},[18,3699,3700],{},"核心：",[1237,3702,3705],{"className":3703,"code":3704,"language":1242,"meta":1243},[1240],"Observation\n+\nNavigation Action\n        ↓\nConditional Diffusion Transformer\n        ↓\nFuture Observation\n        ↓\nCEM \u002F Trajectory Ranking\n        ↓\nNavigation\n",[1245,3706,3704],{"__ignoreMap":1243},[99,3708],{},[1232,3710,3711],{"id":3711},"模型",[14,3713,3714],{},"核心提出：",[1237,3716,3719],{"className":3717,"code":3718,"language":1242,"meta":1243},[1240],"CDiT\nConditional Diffusion Transformer\n",[1245,3720,3718],{"__ignoreMap":1243},[14,3722,3723],{},"模型公開規模包括：",[1237,3725,3728],{"className":3726,"code":3727,"language":1242,"meta":1243},[1240],"CDiT\u002FS ≈ 50M\nCDiT\u002FB ≈ 200M\nCDiT\u002FXL ≈ 1B\n",[1245,3729,3727],{"__ignoreMap":1243},[14,3731,3732],{},"最大模型：",[1237,3734,3737],{"className":3735,"code":3736,"language":1242,"meta":1243},[1240],"≈ 1B\n",[1245,3738,3736],{"__ignoreMap":1243},[99,3740],{},[1232,3742,2809],{"id":3743},"原論文計算資源-1",[14,3745,3746],{},"CDiT-XL：",[1237,3748,3751],{"className":3749,"code":3750,"language":1242,"meta":1243},[1240],"8 machines\n×\n8 H100 \u002F machine\n=\n64 × H100\n",[1245,3752,3750],{"__ignoreMap":1243},[14,3754,3755],{},"這意味着：",[898,3757,3758],{},[14,3759,3760],{},"不適合當前階段把 1B XL 從零完整訓練作為第一篇論文的必要前置條件。",[14,3762,3763],{},"但：",[1237,3765,3768],{"className":3766,"code":3767,"language":1242,"meta":1243},[1240],"50M \u002F 200M pretrained model\n",[1245,3769,3767],{"__ignoreMap":1243},[14,3771,3772],{},"可以作為以後小規模實驗入口。",[99,3774],{},[1232,3776,926],{"id":926},[14,3778,3779],{},"主要：",[26,3781,3782,3785,3788,3791,3794],{},[29,3783,3784],{},"RECON；",[29,3786,3787],{},"SCAND；",[29,3789,3790],{},"TartanDrive；",[29,3792,3793],{},"HuRoN；",[29,3795,3796],{},"Ego4D 等。",[14,3798,2142],{},[898,3800,3801],{},[14,3802,3803],{},"使用機器人、人類 egocentric video 與 navigation action 學世界動態。",[99,3805],{},[1232,3807,3809],{"id":3808},"planning","Planning",[14,3811,3812],{},"NWM 可以：",[2490,3814,3816],{"id":3815},"standalone-planning","Standalone Planning",[1237,3818,3821],{"className":3819,"code":3820,"language":1242,"meta":1243},[1240],"Sample Candidate Actions\n        ↓\nNWM Imagine Future\n        ↓\nCompare Future with Goal\n        ↓\nCEM\n        ↓\nBest Action\n",[1245,3822,3820],{"__ignoreMap":1243},[14,3824,3825],{},"官方 planning 示例一次可以採：",[1237,3827,3830],{"className":3828,"code":3829,"language":1242,"meta":1243},[1240],"120 candidate trajectories\n",[1245,3831,3829],{"__ignoreMap":1243},[14,3833,3834],{},"這也是它實時部署成本很高的原因之一。",[2490,3836,3838],{"id":3837},"rank-external-policy","Rank External Policy",[14,3840,3841],{},"也可以：",[1237,3843,3846],{"className":3844,"code":3845,"language":1242,"meta":1243},[1240],"External Policy\n      ↓\nCandidate Trajectories\n      ↓\nNWM Rank\n      ↓\nBest Trajectory\n",[1245,3847,3845],{"__ignoreMap":1243},[99,3849],{},[1232,3851,3852],{"id":3852},"實時性",[14,3854,3855],{},"原始 NWM 推理較慢。",[14,3857,3858],{},"論文討論了：",[26,3860,3861,3864,3867],{},[29,3862,3863],{},"Time Skip；",[29,3865,3866],{},"Diffusion Distillation；",[29,3868,3869],{},"4-bit Quantization（論文中作為潛在方向）。",[14,3871,3872],{},"這直接説明：",[898,3874,3875],{},[14,3876,3877],{},"實時 World Model 是該路線的重要研究問題。",[99,3879],{},[1232,3881,3883],{"id":3882},"已知-limitation","已知 Limitation",[2490,3885,3887],{"id":3886},"ood-mode-collapse","OOD Mode Collapse",[14,3889,3890],{},"在未知環境 autoregressive rollout 時：",[898,3892,3893],{},[14,3894,3895],{},"prediction 逐漸丟失當前環境 context，並向訓練分佈中的場景靠攏。",[2490,3897,3899],{"id":3898},"pedestrian-temporal-dynamics","Pedestrian Temporal Dynamics",[14,3901,3902],{},"論文明確指出：",[898,3904,3905],{},[14,3906,3907],{},"對 pedestrian motion 等 temporal dynamics 模擬仍然困難。",[2490,3909,3911],{"id":3910},"long-horizon-drift","Long-Horizon Drift",[14,3913,3914],{},"隨着 autoregressive rollout 變長：",[1237,3916,3919],{"className":3917,"code":3918,"language":1242,"meta":1243},[1240],"Error Accumulation\n",[1245,3920,3918],{"__ignoreMap":1243},[14,3922,3923],{},"越來越嚴重。",[14,3925,3926],{},"這些問題後來直接衍生出：",[26,3928,3929,3932,3935],{},[29,3930,3931],{},"AR Forcing；",[29,3933,3934],{},"One-Step WM；",[29,3936,3937],{},"NavWAM 等新工作。",[99,3939],{},[1232,3941,128],{"id":128},[898,3943,3944],{},[14,3945,3946],{},[18,3947,3948],{},"必須精讀，但暫時不作為第一篇從零訓練主 baseline。",[14,3950,3951],{},"主要用途：",[75,3953,3954,3957,3960,3963,3966],{},[29,3955,3956],{},"理解 Navigation World Model 最前沿問題；",[29,3958,3959],{},"學 Diffusion World Model；",[29,3961,3962],{},"學 action-conditioned future generation；",[29,3964,3965],{},"學 CEM planning；",[29,3967,3968],{},"找 long-horizon \u002F realtime \u002F dynamic motion 的研究問題。",[99,3970],{},[10,3972,194],{"id":3973},"dino-wm",[1232,3975,2263],{"id":3976},"基本信息-2",[14,3978,3979],{},[18,3980,2268],{},[14,3982,3983],{},"DINO-WM: World Models on Pre-trained Visual Features Enable Zero-shot Planning",[14,3985,3986],{},[18,3987,2276],{},[14,3989,199],{},[14,3991,3992],{},[18,3993,2299],{},[26,3995,3996,4001,4006],{},[29,3997,2304,3998],{},[420,3999,490],{"href":490,"rel":4000},[424],[29,4002,2310,4003],{},[420,4004,496],{"href":496,"rel":4005},[424],[29,4007,2316,4008],{},[420,4009,502],{"href":502,"rel":4010},[424],[99,4012],{},[1232,4014,4015],{"id":4015},"核心問題",[14,4017,4018],{},"它挑戰一個非常重要的問題：",[898,4020,4021],{},[14,4022,4023],{},"World Model 為什麼一定要重建未來 RGB？",[14,4025,4026],{},"DINO-WM：",[1237,4028,4031],{"className":4029,"code":4030,"language":1242,"meta":1243},[1240],"Image\n ↓\nDINOv2\n ↓\nPatch Features\n ↓\nWorld Model\n ↓\nFuture Patch Features\n ↓\nPlanning\n",[1245,4032,4030],{"__ignoreMap":1243},[14,4034,2952],{},[898,4036,4037],{},[14,4038,4039],{},"直接在 pretrained visual feature space 預測未來。",[99,4041],{},[1232,4043,4044],{"id":4044},"重要意義",[14,4046,4047],{},"相比：",[1237,4049,4052],{"className":4050,"code":4051,"language":1242,"meta":1243},[1240],"World Model\n↓\nGenerate Future RGB\n",[1245,4053,4051],{"__ignoreMap":1243},[14,4055,4026],{},[1237,4057,4060],{"className":4058,"code":4059,"language":1242,"meta":1243},[1240],"World Model\n↓\nPredict Future Representation\n",[1245,4061,4059],{"__ignoreMap":1243},[14,4063,4064],{},"可能具有：",[26,4066,4067,4070,4073,4076],{},[29,4068,4069],{},"更低計算成本；",[29,4071,4072],{},"更少無關 pixel reconstruction；",[29,4074,4075],{},"更強語義 representation；",[29,4077,4078],{},"更容易用於 task-oriented planning。",[14,4080,4081],{},"這與未來想研究的：",[1237,4083,4086],{"className":4084,"code":4085,"language":1242,"meta":1243},[1240],"Navigation-Oriented Latent World Model\n",[1245,4087,4085],{"__ignoreMap":1243},[14,4089,4090],{},"高度相關。",[99,4092],{},[1232,4094,4096],{"id":4095},"tasks","Tasks",[14,4098,4099],{},"官方代碼主要覆蓋：",[26,4101,4102,4105,4108,4111],{},[29,4103,4104],{},"PointMaze；",[29,4106,4107],{},"PushT；",[29,4109,4110],{},"Wall；",[29,4112,4113],{},"Reacher 等。",[14,4115,4116],{},"因此：",[898,4118,4119],{},[14,4120,4121],{},"學術價值很高，但不是最直接的真實移動機器人導航 baseline。",[99,4123],{},[1232,4125,128],{"id":4126},"當前定位-1",[898,4128,4129],{},[14,4130,4131],{},[18,4132,4133],{},"Latent World Model 必讀論文。",[14,4135,4136],{},"重點看：",[26,4138,4139,4142,4145,4148,4151],{},[29,4140,4141],{},"pretrained representation；",[29,4143,4144],{},"patch-level latent dynamics；",[29,4146,4147],{},"CEM planning；",[29,4149,4150],{},"gradient-based planning；",[29,4152,4153],{},"task-agnostic world representation。",[99,4155],{},[10,4157,217],{"id":4158},"dreamernav",[1232,4160,2263],{"id":4161},"基本信息-3",[14,4163,4164],{},[18,4165,2268],{},[14,4167,4168],{},"DreamerNav: learning-based autonomous navigation in dynamic indoor environments using world models",[14,4170,4171],{},[18,4172,2276],{},[14,4174,4175],{},"Frontiers in Robotics and AI，2025",[14,4177,4178],{},[18,4179,2299],{},[26,4181,4182,4188,4194],{},[29,4183,4184,4185],{},"DOI: ",[420,4186,517],{"href":517,"rel":4187},[424],[29,4189,4190,4191],{},"Full Text: ",[420,4192,523],{"href":523,"rel":4193},[424],[29,4195,4196,4197],{},"PMC: ",[420,4198,4199],{"href":4199,"rel":4200},"https:\u002F\u002Fpmc.ncbi.nlm.nih.gov\u002Farticles\u002FPMC12510832\u002F",[424],[14,4202,4203],{},[18,4204,4205],{},"Backbone：",[1237,4207,4210],{"className":4208,"code":4209,"language":1242,"meta":1243},[1240],"DreamerV3\n+\nRSSM\n",[1245,4211,4209],{"__ignoreMap":1243},[99,4213],{},[1232,4215,4216],{"id":4216},"核心",[1237,4218,4221],{"className":4219,"code":4220,"language":1242,"meta":1243},[1240],"Depth\n+\nStructured Local Occupancy Map\n+\nDynamic Obstacle History\n+\nPoints of Interest\n+\nA* Global Path\n        ↓\nDreamerV3 \u002F RSSM\n        ↓\nLocal Navigation Policy\n",[1245,4222,4220],{"__ignoreMap":1243},[14,4224,4225],{},"其中：",[1237,4227,4230],{"className":4228,"code":4229,"language":1242,"meta":1243},[1240],"A*\n",[1245,4231,4229],{"__ignoreMap":1243},[14,4233,4234],{},"負責 global guidance；",[14,4236,4237],{},"DreamerV3：",[898,4239,4240],{},[14,4241,4242],{},"在 latent space 處理動態環境與 local decision。",[99,4244],{},[1232,4246,4248],{"id":4247},"training-compute","Training Compute",[14,4250,2969],{},[1237,4252,4255],{"className":4253,"code":4254,"language":1242,"meta":1243},[1240],"1 × RTX 4090 24GB\n≈ 24.79 h\n≈ 495,000 policy steps\n",[1245,4256,4254],{"__ignoreMap":1243},[14,4258,4259],{},"相比另外幾條路線非常友好。",[99,4261],{},[1232,4263,4265],{"id":4264},"simulation","Simulation",[1237,4267,4270],{"className":4268,"code":4269,"language":1242,"meta":1243},[1240],"NVIDIA Isaac Sim\n",[1245,4271,4269],{"__ignoreMap":1243},[14,4273,4274],{},"動態障礙、warehouse environment、curriculum learning。",[99,4276],{},[1232,4278,4280],{"id":4279},"real-robot","Real Robot",[14,4282,4283],{},"平台：",[1237,4285,4288],{"className":4286,"code":4287,"language":1242,"meta":1243},[1240],"Boston Dynamics Spot\nUnitree A1\n",[1245,4289,4287],{"__ignoreMap":1243},[14,4291,4292],{},"基本部署：",[1237,4294,4297],{"className":4295,"code":4296,"language":1242,"meta":1243},[1240],"Real Sensors\n   ↓\nROS Node\n   ↓\nDreamerNav Model\n   ↓\nVelocity Commands\n   ↓\nRobot\n",[1245,4298,4296],{"__ignoreMap":1243},[14,4300,4301],{},"同一 policy 部署兩個 quadruped。",[99,4303],{},[1232,4305,3883],{"id":4306},"已知-limitation-1",[14,4308,4309],{},"論文明確提到：",[898,4311,4312],{},[14,4313,4314],{},"rapidly approaching dynamic obstacles 下避障策略仍會失敗。",[14,4316,4317],{},"作者提出未來：",[26,4319,4320,4323,4326,4329,4332,4335],{},[29,4321,4322],{},"RNN \u002F attention；",[29,4324,4325],{},"motion prediction；",[29,4327,4328],{},"semantic segmentation；",[29,4330,4331],{},"domain randomization；",[29,4333,4334],{},"更多真實環境測試；",[29,4336,4337],{},"ablation study。",[14,4339,4340],{},"這篇論文非常適合學習：",[898,4342,4343],{},[14,4344,4345],{},"一篇機器人碩士型完整論文從問題、方法、仿真、baseline 到實機應該怎麼組織。",[99,4347],{},[1232,4349,128],{"id":4350},"當前定位-2",[898,4352,4353],{},[14,4354,4355],{},[18,4356,4357],{},"第一篇科研的低風險參考工作。",[14,4359,4360],{},"如果 X-MOBILITY 復現成本高於預期，可退一步從 DreamerNav \u002F DreamerV3 體系建立科研閉環。",[99,4362],{},[10,4364,240],{"id":4365},"v-jepa-2-v-jepa-2-ac",[1232,4367,2263],{"id":4368},"基本信息-4",[14,4370,4371],{},[18,4372,2268],{},[14,4374,4375],{},"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning",[14,4377,4378],{},[18,4379,2299],{},[26,4381,4382,4387,4393],{},[29,4383,2304,4384],{},[420,4385,542],{"href":542,"rel":4386},[424],[29,4388,4389,4390],{},"Official GitHub: ",[420,4391,554],{"href":554,"rel":4392},[424],[29,4394,4395,4396],{},"Meta Blog: ",[420,4397,548],{"href":548,"rel":4398},[424],[99,4400],{},[1232,4402,122],{"id":122},[14,4404,4405],{},"V-JEPA 2：",[1237,4407,4410],{"className":4408,"code":4409,"language":1242,"meta":1243},[1240],"Internet-Scale Video\n       ↓\nSelf-Supervised JEPA\n       ↓\nWorld Representation\n",[1245,4411,4409],{"__ignoreMap":1243},[14,4413,4414],{},"V-JEPA 2-AC：",[1237,4416,4419],{"className":4417,"code":4418,"language":1242,"meta":1243},[1240],"V-JEPA 2 Representation\n        +\nRobot Action\n        ↓\nAction-Conditioned Predictor\n        ↓\nFuture Latent State\n        ↓\nPlanning\n",[1245,4420,4418],{"__ignoreMap":1243},[99,4422],{},[1232,4424,4425],{"id":4425},"數據規模",[14,4427,4428],{},"論文使用超過：",[1237,4430,4433],{"className":4431,"code":4432,"language":1242,"meta":1243},[1240],"1 million hours\n",[1245,4434,4432],{"__ignoreMap":1243},[14,4436,4437],{},"互聯網視頻做大規模預訓練。",[14,4439,4440],{},"隨後使用較少 robot interaction data 進行 action-conditioned post-training。",[99,4442],{},[1232,4444,4445],{"id":4445},"與當前課題關係",[14,4447,4448],{},"目前機器人實驗主要偏：",[1237,4450,4453],{"className":4451,"code":4452,"language":1242,"meta":1243},[1240],"Manipulation\n",[1245,4454,4452],{"__ignoreMap":1243},[14,4456,4457],{},"而不是移動導航。",[14,4459,4116],{},[898,4461,4462],{},[14,4463,4464],{},"不適合作為第一主 baseline，但必須關注 Foundation World Model 如何做預訓練 + robot post-training。",[99,4466],{},[1232,4468,128],{"id":4469},"當前定位-3",[14,4471,4472],{},"重點學習：",[26,4474,4475,4478,4481,4484,4487,4490],{},[29,4476,4477],{},"JEPA；",[29,4479,4480],{},"Self-supervised representation learning；",[29,4482,4483],{},"Foundation video model；",[29,4485,4486],{},"Action-conditioned post-training；",[29,4488,4489],{},"latent planning；",[29,4491,4492],{},"大模型預訓練與機器人小數據適配。",[99,4494],{},[10,4496,261],{"id":4497},"one-step-world-model",[1232,4499,2263],{"id":4500},"基本信息-5",[14,4502,4503],{},[18,4504,2268],{},[14,4506,4507],{},"An Efficient and Multi-Modal Navigation System with One-Step World Model",[14,4509,4510],{},[18,4511,2299],{},[26,4513,4514,4519,4524],{},[29,4515,2304,4516],{},[420,4517,569],{"href":569,"rel":4518},[424],[29,4520,2310,4521],{},[420,4522,575],{"href":575,"rel":4523},[424],[29,4525,2316,4526],{},[420,4527,581],{"href":581,"rel":4528},[424],[14,4530,4531],{},"機構包括：",[26,4533,4534,4537],{},[29,4535,4536],{},"Tsinghua University；",[29,4538,4539],{},"Xiaomi Robotics Lab。",[99,4541],{},[1232,4543,4544],{"id":4544},"解決的問題",[14,4546,4547],{},"針對傳統 Navigation WM：",[1237,4549,4552],{"className":4550,"code":4551,"language":1242,"meta":1243},[1240],"Multi-Step Diffusion\n+\nAutoregressive Frame Generation\n        ↓\nHigh Latency\n",[1245,4553,4551],{"__ignoreMap":1243},[14,4555,4556],{},"提出：",[1237,4558,4561],{"className":4559,"code":4560,"language":1242,"meta":1243},[1240],"One-Step Generation\n",[1245,4562,4560],{"__ignoreMap":1243},[99,4564],{},[1232,4566,4568],{"id":4567},"backbone","Backbone",[1237,4570,4573],{"className":4571,"code":4572,"language":1242,"meta":1243},[1240],"3D U-Net\n+\nEfficient Spatial-Temporal Attention\n",[1245,4574,4572],{"__ignoreMap":1243},[14,4576,3398],{},[898,4578,4579],{},[14,4580,4581],{},"在保留 future imagination 能力的同時，大幅降低推理延遲。",[99,4583],{},[1232,4585,4587],{"id":4586},"navigation","Navigation",[14,4589,4590],{},"結合：",[1237,4592,4595],{"className":4593,"code":4594,"language":1242,"meta":1243},[1240],"Optimization-Based Planning\n+\nAnchor-Based Initialization\n",[1245,4596,4594],{"__ignoreMap":1243},[14,4598,4599],{},"支持：",[26,4601,4602,4605,4608],{},[29,4603,4604],{},"Image Goal；",[29,4606,4607],{},"Language Goal；",[29,4609,4610],{},"Point Goal。",[99,4612],{},[1232,4614,128],{"id":4615},"當前定位-4",[898,4617,4618],{},[14,4619,4620],{},[18,4621,4622],{},"實時 World Model 必讀工作。",[14,4624,4625],{},"如果以後基於 X-MOBILITY 做 lightweight \u002F realtime WM，要重點對比。",[99,4627],{},[10,4629,283],{"id":4630},"ar-forcing",[1232,4632,2263],{"id":4633},"基本信息-6",[14,4635,4636],{},[18,4637,2268],{},[14,4639,4640],{},"AR Forcing: Towards Long-Horizon Robot Navigation World Model",[14,4642,4643],{},[18,4644,2299],{},[26,4646,4647,4652],{},[29,4648,2304,4649],{},[420,4650,596],{"href":596,"rel":4651},[424],[29,4653,4654],{},"Code: 當前 arXiv 信息稱將發佈，後續需要持續檢查官方倉庫",[99,4656],{},[1232,4658,4659],{"id":4659},"問題",[14,4661,4662],{},"很多 Diffusion Navigation WM：",[14,4664,2934],{},[1237,4666,4669],{"className":4667,"code":4668,"language":1242,"meta":1243},[1240],"Ground Truth Context\n",[1245,4670,4668],{"__ignoreMap":1243},[14,4672,4673],{},"推理：",[1237,4675,4678],{"className":4676,"code":4677,"language":1242,"meta":1243},[1240],"Model Generated Context\n",[1245,4679,4677],{"__ignoreMap":1243},[14,4681,4682],{},"於是：",[1237,4684,4687],{"className":4685,"code":4686,"language":1242,"meta":1243},[1240],"Train-Test Distribution Shift\n        ↓\nAutoregressive Error Accumulation\n        ↓\nLong-Horizon Instability\n",[1245,4688,4686],{"__ignoreMap":1243},[99,4690],{},[1232,4692,4693],{"id":4693},"方法",[14,4695,3700],{},[1237,4697,4700],{"className":4698,"code":4699,"language":1242,"meta":1243},[1240],"Autoregressive Training\n",[1245,4701,4699],{"__ignoreMap":1243},[14,4703,4704],{},"訓練時顯式把模型自己的 prediction 重新放入 context。",[14,4706,4707],{},"目的：",[898,4709,4710],{},[14,4711,4712],{},"讓模型在訓練階段就暴露於真正 inference 時會遇到的 state distribution。",[99,4714],{},[1232,4716,4718],{"id":4717},"dataset","Dataset",[14,4720,4721],{},"包括：",[26,4723,4724,4726,4728,4730],{},[29,4725,3784],{},[29,4727,3787],{},[29,4729,3793],{},[29,4731,4732],{},"TartanDrive。",[14,4734,4735],{},"與 NWM 系導航數據高度重合。",[99,4737],{},[1232,4739,128],{"id":4740},"當前定位-5",[898,4742,4743],{},[14,4744,4745],{},"NWM long-horizon problem 的重要 follow-up。",[14,4747,4748],{},"重點研究：",[26,4750,4751,4754,4757,4760],{},[29,4752,4753],{},"exposure bias；",[29,4755,4756],{},"autoregressive rollout；",[29,4758,4759],{},"diffusion training；",[29,4761,4762],{},"long-horizon navigation consistency。",[99,4764],{},[10,4766,304],{"id":4767},"navwam",[1232,4769,2263],{"id":4770},"基本信息-7",[14,4772,4773],{},[18,4774,2268],{},[14,4776,4777],{},"NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation",[14,4779,4780],{},[18,4781,2299],{},[26,4783,4784,4789],{},[29,4785,2304,4786],{},[420,4787,616],{"href":616,"rel":4788},[424],[29,4790,2310,4791],{},[420,4792,622],{"href":622,"rel":4793},[424],[99,4795],{},[1232,4797,4015],{"id":4798},"核心問題-1",[14,4800,4801],{},"傳統 Navigation WM：",[1237,4803,4806],{"className":4804,"code":4805,"language":1242,"meta":1243},[1240],"Observation\n   ↓\nWorld Model\n   ↓\nFuture\n   ↓\nExternal Planner \u002F CEM\n   ↓\nAction\n",[1245,4807,4805],{"__ignoreMap":1243},[14,4809,3314],{},[898,4811,4812],{},[14,4813,4814],{},"future prediction 本身不能直接執行，還需要 expensive planning。",[99,4816],{},[1232,4818,304],{"id":4819},"navwam-1",[1237,4821,4824],{"className":4822,"code":4823,"language":1242,"meta":1243},[1240],"Observation + Goal\n        ↓\nWorld Action Model\n        ↓\nFuture Observation\n+\nGoal Progress\n+\nAction Chunk\n        ↓\nClosed-Loop Action\n",[1245,4825,4823],{"__ignoreMap":1243},[14,4827,3700],{},[898,4829,4830],{},[14,4831,4832],{},"把「預測未來」與「決定動作」聯合建模。",[99,4834],{},[1232,4836,935],{"id":935},[14,4838,4839],{},"使用：",[1237,4841,4844],{"className":4842,"code":4843,"language":1242,"meta":1243},[1240],"Diablo mobile robot\n",[1245,4845,4843],{"__ignoreMap":1243},[14,4847,4848],{},"並進行：",[1237,4850,4853],{"className":4851,"code":4852,"language":1242,"meta":1243},[1240],"Simulation Pretraining\n+\nReal-Robot Adaptation\n",[1245,4854,4852],{"__ignoreMap":1243},[99,4856],{},[1232,4858,128],{"id":4859},"當前定位-6",[898,4861,4862],{},[14,4863,4864],{},"用來觀察 World Model 是否正在從「預測模型」演化到「World Action Model」。",[14,4866,4867],{},"這可能是未來非常重要的方向：",[1237,4869,4872],{"className":4870,"code":4871,"language":1242,"meta":1243},[1240],"WM\n↓\nWAM\n",[1245,4873,4871],{"__ignoreMap":1243},[99,4875],{},[10,4877,4879],{"id":4878},"gwmtowards-scalable-gaussian-world-models-for-robotic-manipulation","GWM：Towards Scalable Gaussian World Models for Robotic Manipulation",[1232,4881,2263],{"id":4882},"基本信息-8",[14,4884,4885,4888],{},[18,4886,4887],{},"Venue：ICCV 2025。"," ICCV（International Conference on Computer Vision，國際計算機視覺大會）屬於計算機視覺領域第一梯隊頂會。",[14,4890,4891],{},[18,4892,2299],{},[26,4894,4895,4901,4906],{},[29,4896,4897,4898],{},"ICCV Open Access: ",[420,4899,640],{"href":640,"rel":4900},[424],[29,4902,2310,4903],{},[420,4904,646],{"href":646,"rel":4905},[424],[29,4907,2316,4908],{},[420,4909,652],{"href":652,"rel":4910},[424],[1232,4912,2410],{"id":4913},"一句話理解-1",[898,4915,4916],{},[14,4917,4918],{},[18,4919,4920],{},"GWM 的重點不是簡單改變傳感器輸入，而是把 World Representation（世界表示）換成具有顯式三維幾何結構的 3D Gaussian，並預測動作作用後的 Future Gaussian Scene（未來高斯場景）。",[1232,4922,4923],{"id":4923},"核心結構",[1237,4925,4928],{"className":4926,"code":4927,"language":1242,"meta":1243},[1240],"Current RGB Image(s)\n        ↓\n3D Reconstruction \u002F Lifting\n三维重建 \u002F 提升\n        ↓\nGaussian Splats\n3D 高斯场景\n        ↓\n3D Variational Autoencoder\n3D 变分自编码器\n        ↓\nCompact Gaussian Latent\n        ↓\nLatent Diffusion Transformer\n隐空间扩散 Transformer\n+\nRobot Action\n        ↓\nFuture Gaussian Latent\n        ↓\nFuture 3D Gaussian Scene\n未来 3D 高斯场景\n",[1245,4929,4927],{"__ignoreMap":1243},[14,4931,4932,4935],{},[18,4933,4934],{},"Gaussian Splatting（高斯潑濺 \u002F 3DGS）","：用大量帶位置、大小、方向、顏色和透明度的三維高斯橢球表示場景。",[1232,4937,4939],{"id":4938},"world-model-輸出","World Model 輸出",[14,4941,4942,4943,4946,4947,21],{},"主要是 ",[18,4944,4945],{},"Future 3D Gaussian Scene（未來 3D 高斯場景）","，不是直接 ",[1245,4948,1404],{},[1232,4950,4951],{"id":4951},"怎麼用於機器人",[26,4953,4954,4960],{},[29,4955,4956,4959],{},[18,4957,4958],{},"Imitation Learning（模仿學習）","：用 GWM 學到的 3D representation 幫助 policy；",[29,4961,4962,4965],{},[18,4963,4964],{},"Model-Based Reinforcement Learning（基於模型強化學習）","：把 GWM 當 Neural Simulator（神經網絡模擬器）產生 imagined rollouts。",[1232,4967,935],{"id":4968},"實機-1",[14,4970,4971],{},"項目頁展示 Franka Emika FR3 + Panda Gripper + RealSense D435i，真實觀測使用第三視角 RGB-only 圖像。因此 GWM 的關鍵創新是內部 3D representation 與 dynamics prediction，而不是單純“加深度輸入”。",[1232,4973,128],{"id":4974},"當前定位-7",[898,4976,4977],{},[14,4978,4979,4982,4983,21],{},[18,4980,4981],{},"3D Structured World Model \u002F Geometry-Aware World Model \u002F Simulator-oriented WM","，更偏 ",[18,4984,1781],{},[99,4986],{},[10,4988,4990],{"id":4989},"dremadream-to-manipulate","DreMa：Dream to Manipulate",[1232,4992,2263],{"id":4993},"基本信息-9",[14,4995,4996,4999],{},[18,4997,4998],{},"全名："," Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination",[14,5001,5002,5005],{},[18,5003,5004],{},"Venue：ICLR 2025。"," ICLR（International Conference on Learning Representations，國際學習表徵會議）屬於機器學習 \u002F 深度學習第一梯隊頂會。",[14,5007,5008],{},[18,5009,2299],{},[26,5011,5012,5017,5024,5029],{},[29,5013,2304,5014],{},[420,5015,667],{"href":667,"rel":5016},[424],[29,5018,5019,5020],{},"ICLR Proceedings: ",[420,5021,5022],{"href":5022,"rel":5023},"https:\u002F\u002Fproceedings.iclr.cc\u002Fpaper_files\u002Fpaper\u002F2025\u002Fhash\u002F8f0d446441a938d9de420a8ab8d7fd36-Abstract-Conference.html",[424],[29,5025,2310,5026],{},[420,5027,673],{"href":673,"rel":5028},[424],[29,5030,2316,5031],{},[420,5032,679],{"href":679,"rel":5033},[424],[1232,5035,2410],{"id":5036},"一句話理解-2",[898,5038,5039],{},[14,5040,5041],{},[18,5042,5043],{},"DreMa 把 World Model 做成 Learnable Digital Twin（可學習數字孿生），用 3D Gaussian Splatting + Physics Simulator 顯式複製真實場景，然後在裏面“做夢”，自動生成新的機器人訓練示範。",[1232,5045,5047],{"id":5046},"compositional-world-model組合式世界模型","Compositional World Model（組合式世界模型）",[14,5049,5050],{},"**Compositional（組合式）**表示場景中的物體、機器人和環境可以單獨移動、變換和重新組合，而不只是作為一整張不可拆分的圖像存在。",[1237,5052,5055],{"className":5053,"code":5054,"language":1242,"meta":1243},[1240],"Few Real Demonstrations\n少量真实示范\n        ↓\nLearnable Digital Twin\n可学习数字孪生\n        ↓\n改变物体 \u002F 目标 \u002F 场景配置\n        ↓\nPhysics Simulation\n物理模拟\n        ↓\nImagined Demonstrations\n想象出来的新示范\n        ↓\nImitation Learning\n模仿学习\n        ↓\nRobot Policy\n",[1245,5056,5054],{"__ignoreMap":1243},[1232,5058,5059],{"id":5059},"核心用途",[14,5061,5062],{},"DreMa 不是主要做在線路徑規劃，而是：",[898,5064,5065],{},[14,5066,5067],{},[18,5068,5069],{},"World Model → Imagination → Data Generation → Policy Learning",[1232,5071,935],{"id":5072},"實機-2",[14,5074,5075],{},"使用 Franka Emika Panda，並展示 one-shot policy learning（單樣本策略學習）：某些任務變化只需一個真實示範，再依靠 imagination 擴充訓練數據。",[1232,5077,128],{"id":5078},"當前定位-8",[898,5080,5081],{},[14,5082,5083,4982,5086,21],{},[18,5084,5085],{},"3D Structured WM + Learnable Digital Twin + Compositional WM + Data Generation for Imitation Learning",[18,5087,5088],{},"Simulator + Robot Learning",[99,5090],{},[10,5092,5094],{"id":5093},"atlasa-world-model-for-spatial-intelligence","Atlas：A World Model for Spatial Intelligence",[1232,5096,2263],{"id":5097},"基本信息-10",[14,5099,5100],{},[18,5101,5102],{},"發佈方：World Labs",[14,5104,5105],{},[18,5106,5107],{},"時間：2026-09-01",[14,5109,5110,5113,5114,21],{},[18,5111,5112],{},"狀態："," World Labs Research Release \u002F Product Research Model，",[18,5115,5116],{},"不是目前意義上的 CVPR \u002F ICML \u002F ICLR 正式會議論文",[14,5118,5119],{},[18,5120,2299],{},[26,5122,5123,5129,5136],{},[29,5124,5125,5126],{},"Official Blog: ",[420,5127,694],{"href":694,"rel":5128},[424],[29,5130,5131,5132],{},"World Model Taxonomy: ",[420,5133,5134],{"href":5134,"rel":5135},"https:\u002F\u002Fwww.worldlabs.ai\u002Fblog\u002Ftaxonomy-of-world-models",[424],[29,5137,5138,5139],{},"World Labs: ",[420,5140,700],{"href":700,"rel":5141},[424],[1232,5143,2410],{"id":5144},"一句話理解-3",[898,5146,5147],{},[14,5148,5149],{},[18,5150,5151],{},"Atlas 是面向 Spatial Intelligence（空間智能）的通用多模態 World Model，統一處理文本、圖像、視頻、相機位姿、深度和 3D，並進行世界生成、三維重建和時空模擬。",[1232,5153,5155],{"id":5154},"spatial-intelligence空間智能","Spatial Intelligence（空間智能）",[14,5157,5158],{},"指 AI 不只知道“圖像裏有什麼”，還理解物體在哪裏、空間結構是什麼、換視角會看到什麼，以及世界如何隨時間和動作變化。",[1232,5160,5162],{"id":5161},"model-architecture模型架構","Model Architecture（模型架構）",[14,5164,5165],{},"官方描述為：",[898,5167,5168],{},[14,5169,5170],{},[18,5171,5172],{},"Multimodal Autoregressive Diffusion Transformer（多模態自迴歸擴散 Transformer）",[14,5174,5175],{},"目前可處理 Text（文本）、Image（圖像）、Camera Pose（相機位姿）、Depth Map（深度圖）、Video（視頻序列）以及 3D spatial context（三維空間上下文）。",[1232,5177,5179],{"id":5178},"atlas-能輸出什麼","Atlas 能輸出什麼",[14,5181,5182],{},"官方展示了：",[1237,5184,5187],{"className":5185,"code":5186,"language":1242,"meta":1243},[1240],"RGB Image \u002F Video\n+\nDepth\n+\nPoint Cloud\n+\n3D Gaussian Splats\n",[1245,5188,5186],{"__ignoreMap":1243},[14,5190,5191],{},"所以 Atlas 不只是“輸出圖像”，也可以產生 explicit 3D representation（顯式三維表示）。",[1232,5193,5195],{"id":5194},"robotics-simulation機器人仿真","Robotics Simulation（機器人仿真）",[1237,5197,5200],{"className":5198,"code":5199,"language":1242,"meta":1243},[1240],"真实环境手机视频\n        ↓\nAtlas\n        ↓\n3D Reconstruction\n三维重建\n        ↓\nVirtual Robot 沿给定路径运动\n        ↓\nAtlas 生成机器人将看到的 RGB + Depth\n",[1245,5201,5199],{"__ignoreMap":1243},[14,5203,5204,5205,5215],{},"這裏要特別注意：",[18,5206,5207,5208,5211,5212,21],{},"當前公開演示更接近 ",[1245,5209,5210],{},"Path → Atlas → Future Observation","，而不是 ",[1245,5213,5214],{},"Atlas → Path"," 因此 Atlas 當前不是專門的導航 Planner。",[1232,5217,128],{"id":5218},"當前定位-9",[898,5220,5221],{},[14,5222,5223,5226,5227,21],{},[18,5224,5225],{},"Foundation World Model \u002F Spatial Intelligence Model（基礎世界模型 \u002F 空間智能模型）","，目前更偏 ",[18,5228,5229],{},"CV + 3D Vision + Generative Model + Simulator",[99,5231],{},[10,5233,5234],{"id":5234},"統一論文閲讀模板",[14,5236,5237],{},"以後每篇新論文都複製下面模板。",[1232,5239,2263],{"id":5240},"基本信息-11",[14,5242,5243],{},[18,5244,5245],{},"Title：",[14,5247,5248],{},[18,5249,5250],{},"Authors：",[14,5252,5253],{},[18,5254,2276],{},[14,5256,5257],{},[18,5258,5259],{},"Year：",[14,5261,5262],{},[18,5263,5264],{},"Organization：",[14,5266,5267],{},[18,5268,5269],{},"Paper：",[14,5271,5272],{},[18,5273,5274],{},"arXiv：",[14,5276,5277],{},[18,5278,5279],{},"Project：",[14,5281,5282],{},[18,5283,5284],{},"GitHub：",[14,5286,5287],{},[18,5288,5289],{},"Model：",[14,5291,5292],{},[18,5293,5294],{},"Dataset：",[14,5296,5297],{},[18,5298,5299],{},"Citation \u002F BibTeX：",[99,5301],{},[1232,5303,5304],{"id":5304},"一句話概括",[898,5306],{},[99,5308],{},[1232,5310,5311],{"id":5311},"它解決什麼問題",[99,5313],{},[1232,5315,5316],{"id":5316},"為什麼舊方法不行",[99,5318],{},[1232,5320,5321],{"id":5321},"核心假設",[99,5323],{},[1232,5325,5327],{"id":5326},"observation-input觀測-輸入","Observation \u002F Input（觀測 \u002F 輸入）",[99,5329],{},[1232,5331,5333],{"id":5332},"world-representation世界表示","World Representation（世界表示）",[14,5335,5336],{},"記錄模型內部怎麼表示世界：Pixel \u002F Video latent、DINO feature、RSSM latent、BEV \u002F Occupancy、3D Gaussian、Explicit Digital Twin 等。",[99,5338],{},[1232,5340,5342],{"id":5341},"world-model-output世界模型輸出","World Model Output（世界模型輸出）",[14,5344,5345],{},"明確記錄：Future RGB \u002F Video、Future Latent、Future Depth、Future Occupancy、Future 3DGS、Reward \u002F Value \u002F Risk、Action Chunk 等。",[99,5347],{},[1232,5349,5351],{"id":5350},"renderer-simulator-planner-定位","Renderer \u002F Simulator \u002F Planner 定位",[1237,5353,5356],{"className":5354,"code":5355,"language":1242,"meta":1243},[1240],"Renderer：\nSimulator：\nPlanner \u002F Policy：\n",[1245,5357,5355],{"__ignoreMap":1243},[99,5359],{},[1232,5361,5363],{"id":5362},"cv-robotics-定位","CV ↔ Robotics 定位",[14,5365,5366],{},"記錄論文主要創新更偏 CV \u002F 3D Vision，還是更偏 Planning \u002F Policy \u002F Robotics。",[99,5368],{},[1232,5370,5372],{"id":5371},"最終-robot-output機器人執行輸出","最終 Robot Output（機器人執行輸出）",[14,5374,5375,5376,5378],{},"例如 ",[1245,5377,1404],{},"、vx \u002F vy \u002F wz、trajectory、joint position、end-effector pose、action chunk。",[99,5380],{},[1232,5382,5384],{"id":5383},"world-model-定義","World Model 定義",[99,5386],{},[1232,5388,4568],{"id":5389},"backbone-1",[99,5391],{},[1232,5393,5394],{"id":5394},"參數量",[99,5396],{},[1232,5398,5400],{"id":5399},"pretrained-model","Pretrained Model",[99,5402],{},[1232,5404,4718],{"id":5405},"dataset-1",[99,5407],{},[1232,5409,5411],{"id":5410},"training-pipeline","Training Pipeline",[99,5413],{},[1232,5415,5417],{"id":5416},"loss","Loss",[99,5419],{},[1232,5421,5423],{"id":5422},"optimizer-lr-batch","Optimizer \u002F LR \u002F Batch",[99,5425],{},[1232,5427,4248],{"id":5428},"training-compute-1",[14,5430,5431],{},"記錄：",[1237,5433,5436],{"className":5434,"code":5435,"language":1242,"meta":1243},[1240],"GPU：\nGPU 数量：\nGPU 显存：\n训练时间：\nEpoch \u002F Steps：\nPrecision：\nMulti-GPU Strategy：\n",[1245,5437,5435],{"__ignoreMap":1243},[99,5439],{},[1232,5441,5443],{"id":5442},"inference-compute","Inference Compute",[14,5445,5431],{},[1237,5447,5450],{"className":5448,"code":5449,"language":1242,"meta":1243},[1240],"Device：\nP50 Latency：\nP95 Latency：\nFPS：\nVRAM：\nPower：\n",[1245,5451,5449],{"__ignoreMap":1243},[99,5453],{},[1232,5455,1910],{"id":5456},"planner-policy",[99,5458],{},[1232,5460,5462],{"id":5461},"與-nav2-ros-的關係","與 Nav2 \u002F ROS 的關係",[99,5464],{},[1232,5466,4265],{"id":5467},"simulation-1",[14,5469,5431],{},[1237,5471,5474],{"className":5472,"code":5473,"language":1242,"meta":1243},[1240],"Simulator：\nRobot：\nSensor：\nScene：\nDynamic Obstacle：\nDomain Randomization：\nControl Frequency：\n",[1245,5475,5473],{"__ignoreMap":1243},[99,5477],{},[1232,5479,4280],{"id":5480},"real-robot-1",[14,5482,5431],{},[1237,5484,5487],{"className":5485,"code":5486,"language":1242,"meta":1243},[1240],"Robot：\nCompute：\nSensor：\nROS \u002F ROS2：\nControl Output：\nEnvironment：\nNumber of Trials：\nSuccess Rate：\n是否 Fine-tune：\n是否 Zero-Shot Sim2Real：\n",[1245,5488,5486],{"__ignoreMap":1243},[99,5490],{},[1232,5492,5494],{"id":5493},"baselines","Baselines",[99,5496],{},[1232,5498,5500],{"id":5499},"metrics","Metrics",[99,5502],{},[1232,5504,5506],{"id":5505},"main-results","Main Results",[99,5508],{},[1232,5510,5512],{"id":5511},"ablation","Ablation",[99,5514],{},[1232,5516,5518],{"id":5517},"failure-cases","Failure Cases",[99,5520],{},[1232,5522,5524],{"id":5523},"limitations","Limitations",[99,5526],{},[1232,5528,5530],{"id":5529},"authors-future-work","Authors' Future Work",[99,5532],{},[1232,5534,5535],{"id":5535},"我認為的潛在問題",[99,5537],{},[1232,5539,5540],{"id":5540},"和已有工作的差異",[99,5542],{},[1232,5544,5546],{"id":5545},"是否適合當我的-baseline","是否適合當我的 baseline",[14,5548,5549],{},"評分：",[1237,5551,5554],{"className":5552,"code":5553,"language":1242,"meta":1243},[1240],"代码完整度：\n数据完整度：\nCheckpoint：\n算力可承受：\n复现难度：\n移动机器人相关性：\n实机难度：\n创新空间：\n",[1245,5555,5553],{"__ignoreMap":1243},[99,5557],{},[1232,5559,5560],{"id":5560},"復現結論",[99,5562],{},[10,5564,5566],{"id":5565},"research-question-池","Research Question 池",[898,5568,5569],{},[14,5570,5571],{},"這裏只存「問題」，不直接寫成“我的創新點”。",[1232,5573,5574],{"id":5574},"模板",[14,5576,5577],{},[18,5578,5579],{},"問題名稱：",[14,5581,5582],{},[18,5583,5584],{},"來源論文：",[14,5586,5587],{},[18,5588,5589],{},"現象：",[14,5591,5592],{},[18,5593,5594],{},"證據：",[14,5596,5597],{},[18,5598,5599],{},"可能原因：",[14,5601,5602],{},[18,5603,5604],{},"已有方法怎麼做：",[14,5606,5607],{},[18,5608,5609],{},"為什麼現有方法還不夠：",[14,5611,5612],{},[18,5613,5614],{},"我的 Hypothesis：",[14,5616,5617],{},[18,5618,5619],{},"最小驗證實驗：",[14,5621,5622],{},[18,5623,5624],{},"需要的 Baseline：",[14,5626,5627],{},[18,5628,5629],{},"需要的 Dataset：",[14,5631,5632],{},[18,5633,5634],{},"需要的 Compute：",[14,5636,5637],{},[18,5638,5639],{},"可能失敗原因：",[14,5641,5642],{},[18,5643,5112],{},[1237,5645,5648],{"className":5646,"code":5647,"language":1242,"meta":1243},[1240],"未验证 \u002F 初步验证 \u002F 值得继续 \u002F 放弃\n",[1245,5649,5647],{"__ignoreMap":1243},[99,5651],{},[10,5653,5654],{"id":5654},"創新點候選池",[898,5656,5657],{},[14,5658,5659],{},"只有經過最小實驗支持的 Research Question 才進入這裏。",[105,5661,5662,5695],{},[108,5663,5664],{},[111,5665,5666,5669,5672,5675,5678,5681,5684,5686,5689,5692],{},[114,5667,5668],{},"Idea",[114,5670,5671],{},"來源",[114,5673,5674],{},"Problem",[114,5676,5677],{},"Hypothesis",[114,5679,5680],{},"修改位置",[114,5682,5683],{},"Main Experiment",[114,5685,5512],{},[114,5687,5688],{},"Compute",[114,5690,5691],{},"風險",[114,5693,5694],{},"狀態",[133,5696,5697,5727,5755,5784,5813,5843],{},[111,5698,5699,5702,5704,5707,5710,5713,5716,5719,5722,5724],{},[138,5700,5701],{},"Dynamic WM",[138,5703,142],{},[138,5705,5706],{},"高速\u002F多人動態障礙可能預測弱",[138,5708,5709],{},"顯式 temporal motion modeling 能改善閉環避障",[138,5711,5712],{},"State Predictor \u002F Decoder",[138,5714,5715],{},"Dynamic Navigation",[138,5717,5718],{},"w\u002Fo motion module",[138,5720,5721],{},"中",[138,5723,5721],{},[138,5725,5726],{},"待驗證",[111,5728,5729,5732,5734,5737,5740,5743,5746,5749,5751,5753],{},[138,5730,5731],{},"Multi-Modal WM",[138,5733,142],{},[138,5735,5736],{},"RGB geometry 不穩定",[138,5738,5739],{},"RGB + LiDAR\u002FDepth 提高魯棒性",[138,5741,5742],{},"Encoder \u002F Fusion",[138,5744,5745],{},"OOD \u002F dark \u002F blur \u002F dynamic",[138,5747,5748],{},"RGB only \u002F LiDAR only \u002F Fusion",[138,5750,5721],{},[138,5752,5721],{},[138,5754,5726],{},[111,5756,5757,5760,5763,5766,5769,5772,5775,5778,5780,5782],{},[138,5758,5759],{},"Navigation-Oriented WM",[138,5761,5762],{},"X-MOBILITY \u002F DINO-WM",[138,5764,5765],{},"RGB reconstruction 成本高且可能與導航弱相關",[138,5767,5768],{},"task-oriented latent\u002Foccupancy 更高效",[138,5770,5771],{},"Decoder \u002F Representation",[138,5773,5774],{},"SR + latency",[138,5776,5777],{},"RGB vs latent vs occupancy",[138,5779,5721],{},[138,5781,5721],{},[138,5783,5726],{},[111,5785,5786,5789,5792,5795,5798,5801,5804,5807,5809,5811],{},[138,5787,5788],{},"Lightweight WM",[138,5790,5791],{},"X-MOBILITY \u002F NWM \u002F One-Step",[138,5793,5794],{},"WM 實時性差",[138,5796,5797],{},"distillation \u002F one-step \u002F pruning 可保性能降成本",[138,5799,5800],{},"WM \u002F Decoder",[138,5802,5803],{},"FPS \u002F SR \u002F VRAM",[138,5805,5806],{},"各壓縮組件",[138,5808,5721],{},[138,5810,5721],{},[138,5812,5726],{},[111,5814,5815,5818,5821,5824,5827,5830,5833,5836,5839,5841],{},[138,5816,5817],{},"Long-Horizon WM",[138,5819,5820],{},"NWM \u002F AR Forcing",[138,5822,5823],{},"AR rollout drift",[138,5825,5826],{},"AR-aware training 降低 exposure bias",[138,5828,5829],{},"Training Objective",[138,5831,5832],{},"2\u002F4\u002F8\u002F16s rollout",[138,5834,5835],{},"teacher context vs AR context",[138,5837,5838],{},"高",[138,5840,5838],{},[138,5842,5726],{},[111,5844,5845,5847,5850,5853,5856,5859,5862,5865,5868,5870],{},[138,5846,3408],{},[138,5848,5849],{},"X-MOBILITY \u002F Dreamer",[138,5851,5852],{},"單一未來不足",[138,5854,5855],{},"顯式 uncertainty 可用於 risk-aware navigation",[138,5857,5858],{},"Latent distribution \u002F Policy",[138,5860,5861],{},"dynamic collision",[138,5863,5864],{},"deterministic vs uncertainty",[138,5866,5867],{},"中高",[138,5869,5838],{},[138,5871,5726],{},[99,5873],{},[10,5875,5877],{"id":5876},"failure-case-日誌","Failure Case 日誌",[1232,5879,5881],{"id":5880},"yyyy-mm-dd實驗名稱","YYYY-MM-DD：實驗名稱",[14,5883,5884],{},[18,5885,5289],{},[14,5887,5888],{},[18,5889,5890],{},"Checkpoint：",[14,5892,5893],{},[18,5894,5895],{},"Environment：",[14,5897,5898],{},[18,5899,5900],{},"Input：",[14,5902,5903],{},[18,5904,5905],{},"Expected：",[14,5907,5908],{},[18,5909,5910],{},"Actual：",[14,5912,5913],{},[18,5914,5915],{},"是否穩定復現：",[14,5917,5918],{},[18,5919,5920],{},"失敗類型：",[26,5922,5924,5930,5936,5942,5948,5954,5960,5966,5972,5978,5984],{"className":5923},[3442],[29,5925,5927,5929],{"className":5926},[3446],[3448,5928],{"disabled":3450,"type":3451}," perception",[29,5931,5933,5935],{"className":5932},[3446],[3448,5934],{"disabled":3450,"type":3451}," world prediction",[29,5937,5939,5941],{"className":5938},[3446],[3448,5940],{"disabled":3450,"type":3451}," long-horizon drift",[29,5943,5945,5947],{"className":5944},[3446],[3448,5946],{"disabled":3450,"type":3451}," planner",[29,5949,5951,5953],{"className":5950},[3446],[3448,5952],{"disabled":3450,"type":3451}," policy",[29,5955,5957,5959],{"className":5956},[3446],[3448,5958],{"disabled":3450,"type":3451}," sim2real",[29,5961,5963,5965],{"className":5962},[3446],[3448,5964],{"disabled":3450,"type":3451}," latency",[29,5967,5969,5971],{"className":5968},[3446],[3448,5970],{"disabled":3450,"type":3451}," localization",[29,5973,5975,5977],{"className":5974},[3446],[3448,5976],{"disabled":3450,"type":3451}," sensor",[29,5979,5981,5983],{"className":5980},[3446],[3448,5982],{"disabled":3450,"type":3451}," control",[29,5985,5987,5989],{"className":5986},[3446],[3448,5988],{"disabled":3450,"type":3451}," other",[14,5991,5992],{},[18,5993,5994],{},"初步原因：",[14,5996,5997],{},[18,5998,5999],{},"需要做的對照實驗：",[14,6001,6002],{},[18,6003,6004],{},"是否形成 Research Question：",[99,6006],{},[10,6008,6009],{"id":6009},"實驗結果日誌",[1232,6011,6013],{"id":6012},"yyyy-mm-ddexperiment-id","YYYY-MM-DD：Experiment ID",[14,6015,6016],{},[18,6017,6018],{},"Goal：",[14,6020,6021],{},[18,6022,6023],{},"Git Commit：",[14,6025,6026],{},[18,6027,6028],{},"Config：",[14,6030,6031],{},[18,6032,5294],{},[14,6034,6035],{},[18,6036,6037],{},"GPU：",[14,6039,6040],{},[18,6041,6042],{},"Seed：",[14,6044,6045],{},[18,6046,6047],{},"Training Time：",[14,6049,6050],{},[18,6051,6052],{},"Metrics：",[105,6054,6055,6071],{},[108,6056,6057],{},[111,6058,6059,6062,6065,6068],{},[114,6060,6061],{},"Metric",[114,6063,6064],{"align":919},"Baseline",[114,6066,6067],{"align":919},"Ours",[114,6069,6070],{"align":919},"Delta",[133,6072,6073],{},[111,6074,6075,6077,6079,6081],{},[138,6076],{},[138,6078],{"align":919},[138,6080],{"align":919},[138,6082],{"align":919},[14,6084,6085],{},[18,6086,6087],{},"結論：",[14,6089,6090],{},[18,6091,6092],{},"是否支持 Hypothesis：",[14,6094,6095],{},[18,6096,6097],{},"下一步：",[99,6099],{},[10,6101,6102],{"id":6102},"每日工作日誌",[1232,6104,6106],{"id":6105},"yyyy-mm-dd","YYYY-MM-DD",[14,6108,6109],{},[18,6110,6111],{},"今日目標：",[26,6113,6114],{},[29,6115],{},[14,6117,6118],{},[18,6119,6120],{},"今日閲讀：",[26,6122,6123],{},[29,6124],{},[14,6126,6127],{},[18,6128,6129],{},"今日實驗：",[26,6131,6132],{},[29,6133],{},[14,6135,6136],{},[18,6137,6138],{},"今天搞明白的問題：",[26,6140,6141],{},[29,6142],{},[14,6144,6145],{},[18,6146,6147],{},"仍然不理解：",[26,6149,6150],{},[29,6151],{},[14,6153,6154],{},[18,6155,6156],{},"Failure Case：",[26,6158,6159],{},[29,6160],{},[14,6162,6163],{},[18,6164,6165],{},"新的 Research Question：",[26,6167,6168],{},[29,6169],{},[14,6171,6172],{},[18,6173,6174],{},"新的 Idea：",[26,6176,6177],{},[29,6178],{},[14,6180,6181],{},[18,6182,6097],{},[26,6184,6185],{},[29,6186],{},[99,6188],{},[10,6190,6191],{"id":6191},"階段性目標",[1232,6193,6195],{"id":6194},"階段-a建立方向認知","階段 A：建立方向認知",[26,6197,6199,6205,6211,6217,6223,6229,6235,6241,6247,6253,6259,6265,6271,6277,6283],{"className":6198},[3442],[29,6200,6202,6204],{"className":6201},[3446],[3448,6203],{"disabled":3450,"type":3451}," 精讀 X-MOBILITY",[29,6206,6208,6210],{"className":6207},[3446],[3448,6209],{"disabled":3450,"type":3451}," 精讀 NWM",[29,6212,6214,6216],{"className":6213},[3446],[3448,6215],{"disabled":3450,"type":3451}," 精讀 DINO-WM",[29,6218,6220,6222],{"className":6219},[3446],[3448,6221],{"disabled":3450,"type":3451}," 閲讀 DreamerNav",[29,6224,6226,6228],{"className":6225},[3446],[3448,6227],{"disabled":3450,"type":3451}," 閲讀 One-Step WM",[29,6230,6232,6234],{"className":6231},[3446],[3448,6233],{"disabled":3450,"type":3451}," 閲讀 AR Forcing",[29,6236,6238,6240],{"className":6237},[3446],[3448,6239],{"disabled":3450,"type":3451}," 閲讀 NavWAM",[29,6242,6244,6246],{"className":6243},[3446],[3448,6245],{"disabled":3450,"type":3451}," 精讀 GWM",[29,6248,6250,6252],{"className":6249},[3446],[3448,6251],{"disabled":3450,"type":3451}," 閲讀 DreMa \u002F Dream to Manipulate",[29,6254,6256,6258],{"className":6255},[3446],[3448,6257],{"disabled":3450,"type":3451}," 閲讀 Atlas 官方技術説明",[29,6260,6262,6264],{"className":6261},[3446],[3448,6263],{"disabled":3450,"type":3451}," 理解 Renderer \u002F Simulator \u002F Planner 分類",[29,6266,6268,6270],{"className":6267},[3446],[3448,6269],{"disabled":3450,"type":3451}," 理解 RGB \u002F Latent \u002F 3DGS 等不同 WM 輸出",[29,6272,6274,6276],{"className":6273},[3446],[3448,6275],{"disabled":3450,"type":3451}," 理解 World Model + Policy",[29,6278,6280,6282],{"className":6279},[3446],[3448,6281],{"disabled":3450,"type":3451}," 理解 World Model + Planning",[29,6284,6286,6288],{"className":6285},[3446],[3448,6287],{"disabled":3450,"type":3451}," 理解 Dreamer \u002F RSSM",[1232,6290,6292],{"id":6291},"階段-b建立-baseline","階段 B：建立 Baseline",[26,6294,6296,6302,6307,6313,6319,6325],{"className":6295},[3442],[29,6297,6299,6301],{"className":6298},[3446],[3448,6300],{"disabled":3450,"type":3451}," 跑通 X-MOBILITY official checkpoint",[29,6303,6305,3542],{"className":6304},[3446],[3448,6306],{"disabled":3450,"type":3451},[29,6308,6310,6312],{"className":6309},[3446],[3448,6311],{"disabled":3450,"type":3451}," 下載並檢查 dataset",[29,6314,6316,6318],{"className":6315},[3446],[3448,6317],{"disabled":3450,"type":3451}," 跑一次 fine-tuning",[29,6320,6322,6324],{"className":6321},[3446],[3448,6323],{"disabled":3450,"type":3451}," 記錄真實 compute cost",[29,6326,6328,6330],{"className":6327},[3446],[3448,6329],{"disabled":3450,"type":3451}," 在本實驗室 GPU 上建立可復現配置",[1232,6332,6334],{"id":6333},"階段-cfailure-case-analysis","階段 C：Failure Case Analysis",[26,6336,6338,6344,6350,6356,6362,6368,6374,6380,6386,6392],{"className":6337},[3442],[29,6339,6341,6343],{"className":6340},[3446],[3448,6342],{"disabled":3450,"type":3451}," static",[29,6345,6347,6349],{"className":6346},[3446],[3448,6348],{"disabled":3450,"type":3451}," cluttered",[29,6351,6353,6355],{"className":6352},[3446],[3448,6354],{"disabled":3450,"type":3451}," narrow corridor",[29,6357,6359,6361],{"className":6358},[3446],[3448,6360],{"disabled":3450,"type":3451}," dark",[29,6363,6365,6367],{"className":6364},[3446],[3448,6366],{"disabled":3450,"type":3451}," motion blur",[29,6369,6371,6373],{"className":6370},[3446],[3448,6372],{"disabled":3450,"type":3451}," fast dynamic obstacle",[29,6375,6377,6379],{"className":6376},[3446],[3448,6378],{"disabled":3450,"type":3451}," crossing pedestrian",[29,6381,6383,6385],{"className":6382},[3446],[3448,6384],{"disabled":3450,"type":3451}," multi-agent",[29,6387,6389,6391],{"className":6388},[3446],[3448,6390],{"disabled":3450,"type":3451}," OOD environment",[29,6393,6395,6397],{"className":6394},[3446],[3448,6396],{"disabled":3450,"type":3451}," long-horizon",[1232,6399,6401],{"id":6400},"階段-dresearch-question","階段 D：Research Question",[26,6403,6405,6411,6417,6423,6429],{"className":6404},[3442],[29,6406,6408,6410],{"className":6407},[3446],[3448,6409],{"disabled":3450,"type":3451}," 選擇一個穩定 failure",[29,6412,6414,6416],{"className":6413},[3446],[3448,6415],{"disabled":3450,"type":3451}," 找到可能原因",[29,6418,6420,6422],{"className":6419},[3446],[3448,6421],{"disabled":3450,"type":3451}," 查 related work",[29,6424,6426,6428],{"className":6425},[3446],[3448,6427],{"disabled":3450,"type":3451}," 提出 hypothesis",[29,6430,6432,6434],{"className":6431},[3446],[3448,6433],{"disabled":3450,"type":3451}," 做最小驗證",[1232,6436,6438],{"id":6437},"階段-e第一篇論文","階段 E：第一篇論文",[26,6440,6442,6448,6454,6460,6465,6471,6477,6483,6489,6495,6501],{"className":6441},[3442],[29,6443,6445,6447],{"className":6444},[3446],[3448,6446],{"disabled":3450,"type":3451}," Baselines",[29,6449,6451,6453],{"className":6450},[3446],[3448,6452],{"disabled":3450,"type":3451}," Ours",[29,6455,6457,6459],{"className":6456},[3446],[3448,6458],{"disabled":3450,"type":3451}," Main experiments",[29,6461,6463,3620],{"className":6462},[3446],[3448,6464],{"disabled":3450,"type":3451},[29,6466,6468,6470],{"className":6467},[3446],[3448,6469],{"disabled":3450,"type":3451}," Efficiency",[29,6472,6474,6476],{"className":6473},[3446],[3448,6475],{"disabled":3450,"type":3451}," Simulation",[29,6478,6480,6482],{"className":6479},[3446],[3448,6481],{"disabled":3450,"type":3451}," Real robot",[29,6484,6486,6488],{"className":6485},[3446],[3448,6487],{"disabled":3450,"type":3451}," Figures",[29,6490,6492,6494],{"className":6491},[3446],[3448,6493],{"disabled":3450,"type":3451}," Tables",[29,6496,6498,6500],{"className":6497},[3446],[3448,6499],{"disabled":3450,"type":3451}," Writing",[29,6502,6504,6506],{"className":6503},[3446],[3448,6505],{"disabled":3450,"type":3451}," Submission",{"title":1243,"searchDepth":6508,"depth":6508,"links":6509},2,[6510,6511,6512,6513,6514,6515,6521,6522,6527,6528,6529,6530,6531,6532,6537,6559,6569,6576,6585,6592,6599,6606,6613,6622,6630,6639,6677,6680,6681,6684,6687,6690],{"id":12,"depth":6508,"text":12},{"id":103,"depth":6508,"text":103},{"id":388,"depth":6508,"text":388},{"id":712,"depth":6508,"text":712},{"id":896,"depth":6508,"text":896},{"id":1230,"depth":6508,"text":1230,"children":6516},[6517,6519,6520],{"id":1234,"depth":6518,"text":1235},3,{"id":1275,"depth":6518,"text":1276},{"id":1322,"depth":6518,"text":1323},{"id":1359,"depth":6508,"text":1360},{"id":1410,"depth":6508,"text":67,"children":6523},[6524,6525,6526],{"id":1413,"depth":6518,"text":1414},{"id":1429,"depth":6518,"text":1430},{"id":1441,"depth":6518,"text":1442},{"id":1490,"depth":6508,"text":1491},{"id":1623,"depth":6508,"text":1624},{"id":1727,"depth":6508,"text":1728},{"id":1892,"depth":6508,"text":1893},{"id":2075,"depth":6508,"text":2075},{"id":2118,"depth":6508,"text":2118,"children":6533},[6534,6535,6536],{"id":2121,"depth":6518,"text":37},{"id":2171,"depth":6518,"text":2172},{"id":2215,"depth":6518,"text":40},{"id":2259,"depth":6508,"text":2260,"children":6538},[6539,6540,6541,6542,6543,6544,6545,6546,6547,6548,6549,6550,6551,6552,6553,6554,6555,6556,6557,6558],{"id":2263,"depth":6518,"text":2263},{"id":2410,"depth":6518,"text":2410},{"id":2449,"depth":6518,"text":2449},{"id":2484,"depth":6518,"text":2485},{"id":2538,"depth":6518,"text":2539},{"id":2564,"depth":6518,"text":2565},{"id":2601,"depth":6518,"text":2602},{"id":2650,"depth":6518,"text":2651},{"id":2695,"depth":6518,"text":2695},{"id":2770,"depth":6518,"text":2771},{"id":2809,"depth":6518,"text":2809},{"id":2866,"depth":6518,"text":2867},{"id":2922,"depth":6518,"text":52},{"id":2980,"depth":6518,"text":2355},{"id":3011,"depth":6518,"text":3012},{"id":3060,"depth":6518,"text":3061},{"id":3135,"depth":6518,"text":3135},{"id":3182,"depth":6518,"text":3183},{"id":3292,"depth":6518,"text":3293},{"id":3437,"depth":6518,"text":3438},{"id":3649,"depth":6508,"text":170,"children":6560},[6561,6562,6563,6564,6565,6566,6567,6568],{"id":3652,"depth":6518,"text":2263},{"id":3711,"depth":6518,"text":3711},{"id":3743,"depth":6518,"text":2809},{"id":926,"depth":6518,"text":926},{"id":3808,"depth":6518,"text":3809},{"id":3852,"depth":6518,"text":3852},{"id":3882,"depth":6518,"text":3883},{"id":128,"depth":6518,"text":128},{"id":3973,"depth":6508,"text":194,"children":6570},[6571,6572,6573,6574,6575],{"id":3976,"depth":6518,"text":2263},{"id":4015,"depth":6518,"text":4015},{"id":4044,"depth":6518,"text":4044},{"id":4095,"depth":6518,"text":4096},{"id":4126,"depth":6518,"text":128},{"id":4158,"depth":6508,"text":217,"children":6577},[6578,6579,6580,6581,6582,6583,6584],{"id":4161,"depth":6518,"text":2263},{"id":4216,"depth":6518,"text":4216},{"id":4247,"depth":6518,"text":4248},{"id":4264,"depth":6518,"text":4265},{"id":4279,"depth":6518,"text":4280},{"id":4306,"depth":6518,"text":3883},{"id":4350,"depth":6518,"text":128},{"id":4365,"depth":6508,"text":240,"children":6586},[6587,6588,6589,6590,6591],{"id":4368,"depth":6518,"text":2263},{"id":122,"depth":6518,"text":122},{"id":4425,"depth":6518,"text":4425},{"id":4445,"depth":6518,"text":4445},{"id":4469,"depth":6518,"text":128},{"id":4497,"depth":6508,"text":261,"children":6593},[6594,6595,6596,6597,6598],{"id":4500,"depth":6518,"text":2263},{"id":4544,"depth":6518,"text":4544},{"id":4567,"depth":6518,"text":4568},{"id":4586,"depth":6518,"text":4587},{"id":4615,"depth":6518,"text":128},{"id":4630,"depth":6508,"text":283,"children":6600},[6601,6602,6603,6604,6605],{"id":4633,"depth":6518,"text":2263},{"id":4659,"depth":6518,"text":4659},{"id":4693,"depth":6518,"text":4693},{"id":4717,"depth":6518,"text":4718},{"id":4740,"depth":6518,"text":128},{"id":4767,"depth":6508,"text":304,"children":6607},[6608,6609,6610,6611,6612],{"id":4770,"depth":6518,"text":2263},{"id":4798,"depth":6518,"text":4015},{"id":4819,"depth":6518,"text":304},{"id":935,"depth":6518,"text":935},{"id":4859,"depth":6518,"text":128},{"id":4878,"depth":6508,"text":4879,"children":6614},[6615,6616,6617,6618,6619,6620,6621],{"id":4882,"depth":6518,"text":2263},{"id":4913,"depth":6518,"text":2410},{"id":4923,"depth":6518,"text":4923},{"id":4938,"depth":6518,"text":4939},{"id":4951,"depth":6518,"text":4951},{"id":4968,"depth":6518,"text":935},{"id":4974,"depth":6518,"text":128},{"id":4989,"depth":6508,"text":4990,"children":6623},[6624,6625,6626,6627,6628,6629],{"id":4993,"depth":6518,"text":2263},{"id":5036,"depth":6518,"text":2410},{"id":5046,"depth":6518,"text":5047},{"id":5059,"depth":6518,"text":5059},{"id":5072,"depth":6518,"text":935},{"id":5078,"depth":6518,"text":128},{"id":5093,"depth":6508,"text":5094,"children":6631},[6632,6633,6634,6635,6636,6637,6638],{"id":5097,"depth":6518,"text":2263},{"id":5144,"depth":6518,"text":2410},{"id":5154,"depth":6518,"text":5155},{"id":5161,"depth":6518,"text":5162},{"id":5178,"depth":6518,"text":5179},{"id":5194,"depth":6518,"text":5195},{"id":5218,"depth":6518,"text":128},{"id":5234,"depth":6508,"text":5234,"children":6640},[6641,6642,6643,6644,6645,6646,6647,6648,6649,6650,6651,6652,6653,6654,6655,6656,6657,6658,6659,6660,6661,6662,6663,6664,6665,6666,6667,6668,6669,6670,6671,6672,6673,6674,6675,6676],{"id":5240,"depth":6518,"text":2263},{"id":5304,"depth":6518,"text":5304},{"id":5311,"depth":6518,"text":5311},{"id":5316,"depth":6518,"text":5316},{"id":5321,"depth":6518,"text":5321},{"id":5326,"depth":6518,"text":5327},{"id":5332,"depth":6518,"text":5333},{"id":5341,"depth":6518,"text":5342},{"id":5350,"depth":6518,"text":5351},{"id":5362,"depth":6518,"text":5363},{"id":5371,"depth":6518,"text":5372},{"id":5383,"depth":6518,"text":5384},{"id":5389,"depth":6518,"text":4568},{"id":5394,"depth":6518,"text":5394},{"id":5399,"depth":6518,"text":5400},{"id":5405,"depth":6518,"text":4718},{"id":5410,"depth":6518,"text":5411},{"id":5416,"depth":6518,"text":5417},{"id":5422,"depth":6518,"text":5423},{"id":5428,"depth":6518,"text":4248},{"id":5442,"depth":6518,"text":5443},{"id":5456,"depth":6518,"text":1910},{"id":5461,"depth":6518,"text":5462},{"id":5467,"depth":6518,"text":4265},{"id":5480,"depth":6518,"text":4280},{"id":5493,"depth":6518,"text":5494},{"id":5499,"depth":6518,"text":5500},{"id":5505,"depth":6518,"text":5506},{"id":5511,"depth":6518,"text":5512},{"id":5517,"depth":6518,"text":5518},{"id":5523,"depth":6518,"text":5524},{"id":5529,"depth":6518,"text":5530},{"id":5535,"depth":6518,"text":5535},{"id":5540,"depth":6518,"text":5540},{"id":5545,"depth":6518,"text":5546},{"id":5560,"depth":6518,"text":5560},{"id":5565,"depth":6508,"text":5566,"children":6678},[6679],{"id":5574,"depth":6518,"text":5574},{"id":5654,"depth":6508,"text":5654},{"id":5876,"depth":6508,"text":5877,"children":6682},[6683],{"id":5880,"depth":6518,"text":5881},{"id":6009,"depth":6508,"text":6009,"children":6685},[6686],{"id":6012,"depth":6518,"text":6013},{"id":6102,"depth":6508,"text":6102,"children":6688},[6689],{"id":6105,"depth":6518,"text":6106},{"id":6191,"depth":6508,"text":6191,"children":6691},[6692,6693,6694,6695,6696],{"id":6194,"depth":6518,"text":6195},{"id":6291,"depth":6518,"text":6292},{"id":6333,"depth":6518,"text":6334},{"id":6400,"depth":6518,"text":6401},{"id":6437,"depth":6518,"text":6438},"\u002Fzh-hk\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie",null,"2026-09-02","md","posts\u002F2026-09-02-WM论文罗列",false,"zh-HK","zh-hk",{},{"title":5,"description":1243},"\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","_i18n\u002Fzh-hk\u002Fposts\u002F2026-09-02-WM论文罗列","RS5a84Dm-OqA_FnF4spmvSBD84phG0y5myZ9Fc0zfWM",[6698,6711],{"path":6712,"title":6713,"date":6714,"localeSlug":6704,"i18nKey":6715},"\u002Fzh-hk\u002Fblog\u002F2026-07-21-vscode-ren-wu-lan-qi-dong-codex-cha-jian-da-bu-kai","Linux下從任務欄啓動VS Code時Codex插件打不開的解決方法","2026-07-21","posts\u002F2026-07-21-VSCode任务栏启动Codex插件打不开",{"variants":6717},[6718,6721,6724,6725,6728],{"path":6719,"localeSlug":6720,"i18nKey":6701},"\u002Fen-us\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","en-us",{"path":6722,"localeSlug":6723,"i18nKey":6701},"\u002Fzh-hant\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-hant",{"path":6697,"localeSlug":6704,"i18nKey":6701},{"path":6726,"localeSlug":6727,"i18nKey":6701},"\u002Fzh-tw\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-tw",{"path":6729,"localeSlug":6730,"i18nKey":6701},"\u002Fzh-cn\u002Fblog\u002F2026-09-02-wm-lun-wen-luo-lie","zh-cn",[6719,6707,6722,6707,6697,6707,6726,6707,6729,6707],1788531236034]