Moduł 14 · Metody uczone

Metody uczone (learning-based)

Imitation (BC, DAgger, Action Chunking), RL (PPO, SAC, Dreamer), MπNets, Neural RRT*, dyfuzja (Diffuser, MPD, Diffusion Policy), neural SDF/NeRF-Nav, GNN.

TL;DR

Klasyczne planery (moduły 05-10) wymagają jawnego modelu: geometrii, dynamiki, kosztu. Co gdy:

  • Mamy demonstracje ekspertów, nie wzór kosztu?
  • Model dynamiki jest uczone (sieć neuronowa)?
  • Chcemy generalizować do nowych zadań?
  • Klasyczne planery są zbyt wolne (sampling 100ms+ na Pandzie)?

Learning-based motion planning używa uczenia maszynowego jako element (lub zastępca) klasycznego stacka:

  • Imitation Learning (IL): BC, DAgger, Action Chunking — naśladuj eksperta.
  • Reinforcement Learning (RL): PPO, SAC, model-based — odkryj politykę przez eksperymenty.
  • Neuronowe planery: MπNets, Neural RRT* — przyspiesz klasyczne planery uczonym sterownikiem.
  • Diffusion models: Diffuser, MPD, Diffusion Policy — generuj trajektorie przez iteracyjne odszumowywanie.
  • Implicit reprezentacje: neural SDF, NeRF-Nav — ciągłe modele sceny.
  • GNN dla planowania: MPNet, GNN-MP — message passing nad grafami konfiguracji.

Imitation Learning

Behavior Cloning (BC)

Dany dataset {(si,ai)}i=1N\{(s_i, a_i)\}_{i=1}^N z demonstracji ekspertów. Trenuj sieć πθ(s)a\pi_\theta(s) \to a by minimalizować aπθ(s)2\|a - \pi_\theta(s)\|^2. Prosty supervised learning.

Problem: distribution shift. Policy zbiera własne stany (na inference); jeśli stan nigdy nie był w datasecie, policy „nie wie" co robić → kaskadowy błąd.

DAgger (Ross 2011)

Iteracyjny: uruchom policy, ekspert etykietuje co powinno być w trudnych stanach, dodaj do datasetu, retrain. Eliminuje distribution shift kosztem ekspertowych zapytań.

Action Chunking (Zhao 2023)

Zamiast π(s)a\pi(s) \to a (jedna akcja), predykuj sekwencję π(s)(a1,,aH)\pi(s) \to (a_1, \ldots, a_H). Robust na noise, sprzyja smooth trajektoriom. Standard w ACT, Diffusion Policy.

Reinforcement Learning

Model-free

  • PPO (Schulman 2017) — Proximal Policy Optimization. Trust region update. Najpopularniejszy on-policy.
  • SAC (Haarnoja 2018) — Soft Actor-Critic. Off-policy, entropy regularization. State-of-the-art dla continuous control.
  • TD3 (Fujimoto 2018) — twin delayed DDPG. Stabilniejsze niż DDPG.

Model-based

  • Dreamer (Hafner 2019, 2023) — world model w latent space, planowanie przez rolling out latent dynamics.
  • MBPO (Janner 2019) — Model-Based Policy Optimization. Trenuj model dynamics, używaj go do augmentacji danych.
  • PETS (Chua 2018) — Probabilistic Ensemble + Trajectory Sampling. CEM nad nauczonym ensemble dynamics.

Sim-to-real gap: policy uczona w symulacji ma problem na real Pandzie. Domain randomization (randomize masy, tarcia, opóźnienia) + system identification są standardem.

Neuronowe planery uczone na ekspertach

MπNets (Motion Policy Networks, Fishman 2022)

Trenuj sieć π(s,g)q˙\pi(s, g) \to \dot q bezpośrednio na ekspertach (np. rozwiązaniach RRT-Connect dla 3.6M scen Pandy). Inference 30 Hz na CPU. Zero-shot transfer na nowe sceny w tym samym workspace.

Neural RRT* (Qureshi 2021)

Sieć uczona z RRT*-expansion patterns. Predykuje kolejne sample dla RRT*. Combine: tradycyjny RRT* + sieć jako biased sampler. Daje 5-10× speedup.

MPNet (Qureshi 2020)

Konektywista: dla dwóch konfiguracji (qa,qb)(q_a, q_b) sieć zwraca qmidq_{\text{mid}} — punkt na ścieżce między nimi. Rekursywne wywołanie → ścieżka. Działa dla 7-DOF i 14-DOF (dual arm).

Diffusion models dla trajektorii

Diffusion (Ho 2020, oryginalnie do generowania obrazów) trafiło do robotyki w 2022 (Janner, Chi). Idea:

  1. Forward process (training): bierz clean trajektorię, stopniowo dodawaj noise — przez T kroków od clean do pure noise.
  2. Reverse process (inference): startuj z pure noise, ucz sieć stopniowo odszumowywać krok po kroku — po T krokach masz trajektorię z rozkładu danych.

Conditioning: sieć dostaje także warunek (np. start, goal, obstacles) — różne warunki dają różne trajektorie z tego samego modelu.

Diffusion denoising — krok 0 / 50 (T=50-0)

SG
Co zobaczyć: krok 0 = pure noise (każdy waypoint losowy gaussowski). Krok T = clean trajektoria (cel). Model uczy się odszumowania krok po kroku — w każdej iteracji predykuje jak zmniejszyć szum, dochodzi do gładkiej ścieżki omijającej obstacle. Real diffusion: ~100-1000 kroków denoising. Conditioning: sieć dostaje start, goal, scenę jako input — z różnymi konfiguracjami daje różne trajektorie. Diffuser, MPD, Diffusion Policy używają tej idei dla robotyki.

Diffuser (Janner 2022)

Diffusion nad całą trajektorią ξ=(s0,a0,s1,a1,)\xi = (s_0, a_0, s_1, a_1, \ldots). Generuje spójną sekwencję stanów + akcji. Conditioning przez classifier-free guidance.

MPD (Motion Planning Diffusion, Carvalho 2023)

Wersja Diffusera dla 7-DOF manipulatorów. Generuje trajektorie qR7q \in \mathbb{R}^7 warunkowane na scenę. ~100ms per trajektoria na GPU.

Diffusion Policy (Chi 2023)

Diffusion nad sterowaniem: π(s)\pi(s) \to rozkład sekwencji akcji. State-of-the-art dla imitation learning na real Pandzie. 50-100 Hz inference.

Plusy / minusy diffusion

  • + Multimodal: sieć może wygenerować różne ścieżki dla tej samej sceny (różne strategie).
  • + Conditioning: łatwo dodać constraints przez warunki / classifier guidance.
  • + Naturalnie smooth: process denoising wymusza spójność wzdłuż trajektorii.
  • Inference czas: T=100 kroków × ~5ms = 500ms. Wolniejsze niż prosty MLP.
  • Brak gwarancji collision-free — trzeba osobno verify.

Implicit reprezentacje sceny

Neural SDF (DeepSDF — Park 2019)

Sieć fθ(p)Φ(p)f_\theta(p) \approx \Phi(p) — Signed Distance Function jako MLP. Bardzo zwarte (kilka MB) i smooth (analytical gradient via autodiff).

NeRF (Mildenhall 2020)

Neural Radiance Fields — koderowanie sceny jako (x,y,z,view)(color,density)(x, y, z, \text{view}) \to (\text{color}, \text{density}). Generuje fotorealistyczne obrazy z dowolnego widoku po treningu na kilkudziesięciu zdjęciach.

NeRF-Nav (Adamkiewicz 2022)

Używa pre-trained NeRF jako mapy. Planer wykorzystujedensity field NeRFa jako proxy collision. Action: dron nawiguje w pomieszczeniu reprezentowanym przez NeRF.

GNN dla planowania

Graph Neural Networks naturalnie reprezentują roadmapy (PRM) jako grafy:

  • GNN-MP (Khan 2020) — Graph Neural Motion Planning. Message passing nad PRM-em uczone na expert paths. Predykuje kolejny węzeł.
  • Transformer-based planners (PaLM-E, RT-1) — attention nad sceną + tekst opisujący zadanie.

Warm-starting NLP modelami uczonymi

Klasyczne planery (CHOMP, TrajOpt — moduł 07) są wrażliwe na initial guess. Sieć neuronowa może dostarczyć dobry start:

  1. Sieć generuje wstępną trajektorię (fast, ~10ms).
  2. CHOMP / TrajOpt dopracowuje (gwarancje, constraint-handling).

Hybryda łączy zalety: szybkość uczonego + niezawodność klasycznego. Wykorzystywane w cuRobo (NVIDIA), MotionPolicyTransformer (RAI Toulouse).

Ściąga

Imitation Learning

  • BC — supervised, distribution shift problem
  • DAgger — iterative expert relabeling
  • Action Chunking — predykuj sekwencję, robust na noise

RL

  • PPO — on-policy, popular baseline
  • SAC — off-policy, entropy, SOTA continuous
  • Dreamer — world model w latent space
  • PETS / MBPO — model-based

Diffusion

x_T = noise → iteratywne denoising → x_0 = clean trajectory. Conditioning na start/goal/scene. Diffuser, MPD, Diffusion Policy.

Neuronowe planery

  • MπNets — direct π(s, g) → q̇
  • Neural RRT* — biased sampler
  • MPNet — connectivist q_mid(q_a, q_b)

Implicit reprezentacje

  • DeepSDF — neural distance field
  • NeRF — radiance + density
  • NeRF-Nav — planowanie nad NeRF

Hybryda klasyczny + uczony

Sieć generuje warm-start → klasyczny solver dopracowuje. cuRobo, MotionPolicyTransformer.

Referencje

  • Ross, Gordon & Bagnell, „A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning" (AISTATS 2011) — DAgger.
  • Zhao, Kumar, Levine & Finn, „Learning Fine- Grained Bimanual Manipulation with Low-Cost Hardware" (RSS 2023) — ACT.
  • Schulman et al., „Proximal Policy Optimization Algorithms" (arXiv 2017) — PPO.
  • Haarnoja et al., „Soft Actor-Critic" (ICML 2018) — SAC.
  • Hafner et al., „Dream to Control: Learning Behaviors by Latent Imagination" (ICLR 2020) — Dreamer.
  • Fishman, Murali, Eppner, Peele, Boots, Fox, „Motion Policy Networks" (CoRL 2022) — MπNets.
  • Qureshi, Miao, Simeonov, Yip, „Motion Planning Networks: Bridging the Gap Between Learning-based and Classical Motion Planners" (IEEE TRO 2020) — MPNet.
  • Ho, Jain & Abbeel, „Denoising Diffusion Probabilistic Models" (NeurIPS 2020).
  • Janner, Du, Tenenbaum, Levine, „Planning with Diffusion for Flexible Behavior Synthesis" (ICML 2022) — Diffuser.
  • Chi, Feng, Du, Xu, Cousineau, Burchfiel, Song, „Diffusion Policy: Visuomotor Policy Learning via Action Diffusion" (RSS 2023).
  • Park, Florence, Straub, Newcombe & Lovegrove, „DeepSDF" (CVPR 2019).
  • Mildenhall et al., „NeRF: Representing Scenes as Neural Radiance Fields" (ECCV 2020).
  • Adamkiewicz et al., „Vision-Only Robot Navigation in a Neural Radiance World" (IEEE RA-L 2022) — NeRF-Nav.