Metody uczone (learning-based)
Imitation (BC, DAgger, Action Chunking), RL (PPO, SAC, Dreamer), MπNets, Neural RRT*, dyfuzja (Diffuser, MPD, Diffusion Policy), neural SDF/NeRF-Nav, GNN.
TL;DR
Klasyczne planery (moduły 05-10) wymagają jawnego modelu: geometrii, dynamiki, kosztu. Co gdy:
- Mamy demonstracje ekspertów, nie wzór kosztu?
- Model dynamiki jest uczone (sieć neuronowa)?
- Chcemy generalizować do nowych zadań?
- Klasyczne planery są zbyt wolne (sampling 100ms+ na Pandzie)?
Learning-based motion planning używa uczenia maszynowego jako element (lub zastępca) klasycznego stacka:
- Imitation Learning (IL): BC, DAgger, Action Chunking — naśladuj eksperta.
- Reinforcement Learning (RL): PPO, SAC, model-based — odkryj politykę przez eksperymenty.
- Neuronowe planery: MπNets, Neural RRT* — przyspiesz klasyczne planery uczonym sterownikiem.
- Diffusion models: Diffuser, MPD, Diffusion Policy — generuj trajektorie przez iteracyjne odszumowywanie.
- Implicit reprezentacje: neural SDF, NeRF-Nav — ciągłe modele sceny.
- GNN dla planowania: MPNet, GNN-MP — message passing nad grafami konfiguracji.
Imitation Learning
Behavior Cloning (BC)
Dany dataset z demonstracji ekspertów. Trenuj sieć by minimalizować . Prosty supervised learning.
Problem: distribution shift. Policy zbiera własne stany (na inference); jeśli stan nigdy nie był w datasecie, policy „nie wie" co robić → kaskadowy błąd.
DAgger (Ross 2011)
Iteracyjny: uruchom policy, ekspert etykietuje co powinno być w trudnych stanach, dodaj do datasetu, retrain. Eliminuje distribution shift kosztem ekspertowych zapytań.
Action Chunking (Zhao 2023)
Zamiast (jedna akcja), predykuj sekwencję . Robust na noise, sprzyja smooth trajektoriom. Standard w ACT, Diffusion Policy.
Reinforcement Learning
Model-free
- PPO (Schulman 2017) — Proximal Policy Optimization. Trust region update. Najpopularniejszy on-policy.
- SAC (Haarnoja 2018) — Soft Actor-Critic. Off-policy, entropy regularization. State-of-the-art dla continuous control.
- TD3 (Fujimoto 2018) — twin delayed DDPG. Stabilniejsze niż DDPG.
Model-based
- Dreamer (Hafner 2019, 2023) — world model w latent space, planowanie przez rolling out latent dynamics.
- MBPO (Janner 2019) — Model-Based Policy Optimization. Trenuj model dynamics, używaj go do augmentacji danych.
- PETS (Chua 2018) — Probabilistic Ensemble + Trajectory Sampling. CEM nad nauczonym ensemble dynamics.
Sim-to-real gap: policy uczona w symulacji ma problem na real Pandzie. Domain randomization (randomize masy, tarcia, opóźnienia) + system identification są standardem.
Neuronowe planery uczone na ekspertach
MπNets (Motion Policy Networks, Fishman 2022)
Trenuj sieć bezpośrednio na ekspertach (np. rozwiązaniach RRT-Connect dla 3.6M scen Pandy). Inference 30 Hz na CPU. Zero-shot transfer na nowe sceny w tym samym workspace.
Neural RRT* (Qureshi 2021)
Sieć uczona z RRT*-expansion patterns. Predykuje kolejne sample dla RRT*. Combine: tradycyjny RRT* + sieć jako biased sampler. Daje 5-10× speedup.
MPNet (Qureshi 2020)
Konektywista: dla dwóch konfiguracji sieć zwraca — punkt na ścieżce między nimi. Rekursywne wywołanie → ścieżka. Działa dla 7-DOF i 14-DOF (dual arm).
Diffusion models dla trajektorii
Diffusion (Ho 2020, oryginalnie do generowania obrazów) trafiło do robotyki w 2022 (Janner, Chi). Idea:
- Forward process (training): bierz clean trajektorię, stopniowo dodawaj noise — przez T kroków od clean do pure noise.
- Reverse process (inference): startuj z pure noise, ucz sieć stopniowo odszumowywać krok po kroku — po T krokach masz trajektorię z rozkładu danych.
Conditioning: sieć dostaje także warunek (np. start, goal, obstacles) — różne warunki dają różne trajektorie z tego samego modelu.
Diffusion denoising — krok 0 / 50 (T=50-0)
Diffuser (Janner 2022)
Diffusion nad całą trajektorią . Generuje spójną sekwencję stanów + akcji. Conditioning przez classifier-free guidance.
MPD (Motion Planning Diffusion, Carvalho 2023)
Wersja Diffusera dla 7-DOF manipulatorów. Generuje trajektorie warunkowane na scenę. ~100ms per trajektoria na GPU.
Diffusion Policy (Chi 2023)
Diffusion nad sterowaniem: rozkład sekwencji akcji. State-of-the-art dla imitation learning na real Pandzie. 50-100 Hz inference.
Plusy / minusy diffusion
- + Multimodal: sieć może wygenerować różne ścieżki dla tej samej sceny (różne strategie).
- + Conditioning: łatwo dodać constraints przez warunki / classifier guidance.
- + Naturalnie smooth: process denoising wymusza spójność wzdłuż trajektorii.
- − Inference czas: T=100 kroków × ~5ms = 500ms. Wolniejsze niż prosty MLP.
- − Brak gwarancji collision-free — trzeba osobno verify.
Implicit reprezentacje sceny
Neural SDF (DeepSDF — Park 2019)
Sieć — Signed Distance Function jako MLP. Bardzo zwarte (kilka MB) i smooth (analytical gradient via autodiff).
NeRF (Mildenhall 2020)
Neural Radiance Fields — koderowanie sceny jako . Generuje fotorealistyczne obrazy z dowolnego widoku po treningu na kilkudziesięciu zdjęciach.
NeRF-Nav (Adamkiewicz 2022)
Używa pre-trained NeRF jako mapy. Planer wykorzystujedensity field NeRFa jako proxy collision. Action: dron nawiguje w pomieszczeniu reprezentowanym przez NeRF.
GNN dla planowania
Graph Neural Networks naturalnie reprezentują roadmapy (PRM) jako grafy:
- GNN-MP (Khan 2020) — Graph Neural Motion Planning. Message passing nad PRM-em uczone na expert paths. Predykuje kolejny węzeł.
- Transformer-based planners (PaLM-E, RT-1) — attention nad sceną + tekst opisujący zadanie.
Warm-starting NLP modelami uczonymi
Klasyczne planery (CHOMP, TrajOpt — moduł 07) są wrażliwe na initial guess. Sieć neuronowa może dostarczyć dobry start:
- Sieć generuje wstępną trajektorię (fast, ~10ms).
- CHOMP / TrajOpt dopracowuje (gwarancje, constraint-handling).
Hybryda łączy zalety: szybkość uczonego + niezawodność klasycznego. Wykorzystywane w cuRobo (NVIDIA), MotionPolicyTransformer (RAI Toulouse).
Ściąga
Imitation Learning
- BC — supervised, distribution shift problem
- DAgger — iterative expert relabeling
- Action Chunking — predykuj sekwencję, robust na noise
RL
- PPO — on-policy, popular baseline
- SAC — off-policy, entropy, SOTA continuous
- Dreamer — world model w latent space
- PETS / MBPO — model-based
Diffusion
x_T = noise → iteratywne denoising → x_0 = clean trajectory. Conditioning na start/goal/scene. Diffuser, MPD, Diffusion Policy.
Neuronowe planery
- MπNets — direct π(s, g) → q̇
- Neural RRT* — biased sampler
- MPNet — connectivist q_mid(q_a, q_b)
Implicit reprezentacje
- DeepSDF — neural distance field
- NeRF — radiance + density
- NeRF-Nav — planowanie nad NeRF
Hybryda klasyczny + uczony
Sieć generuje warm-start → klasyczny solver dopracowuje. cuRobo, MotionPolicyTransformer.
Referencje
- Ross, Gordon & Bagnell, „A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning" (AISTATS 2011) — DAgger.
- Zhao, Kumar, Levine & Finn, „Learning Fine- Grained Bimanual Manipulation with Low-Cost Hardware" (RSS 2023) — ACT.
- Schulman et al., „Proximal Policy Optimization Algorithms" (arXiv 2017) — PPO.
- Haarnoja et al., „Soft Actor-Critic" (ICML 2018) — SAC.
- Hafner et al., „Dream to Control: Learning Behaviors by Latent Imagination" (ICLR 2020) — Dreamer.
- Fishman, Murali, Eppner, Peele, Boots, Fox, „Motion Policy Networks" (CoRL 2022) — MπNets.
- Qureshi, Miao, Simeonov, Yip, „Motion Planning Networks: Bridging the Gap Between Learning-based and Classical Motion Planners" (IEEE TRO 2020) — MPNet.
- Ho, Jain & Abbeel, „Denoising Diffusion Probabilistic Models" (NeurIPS 2020).
- Janner, Du, Tenenbaum, Levine, „Planning with Diffusion for Flexible Behavior Synthesis" (ICML 2022) — Diffuser.
- Chi, Feng, Du, Xu, Cousineau, Burchfiel, Song, „Diffusion Policy: Visuomotor Policy Learning via Action Diffusion" (RSS 2023).
- Park, Florence, Straub, Newcombe & Lovegrove, „DeepSDF" (CVPR 2019).
- Mildenhall et al., „NeRF: Representing Scenes as Neural Radiance Fields" (ECCV 2020).
- Adamkiewicz et al., „Vision-Only Robot Navigation in a Neural Radiance World" (IEEE RA-L 2022) — NeRF-Nav.