Moduł 20 · Podsumowanie

Podsumowanie i kierunki badań

Otwarte problemy, trendy (diffusion planning, foundation models, neuro-symbolic TAMP), kierunki dla redundancji i cobotów.

Co przerobiliśmy

20 modułów obejmujących pełen pipeline od postawienia problemu planowania do wdrożenia na realnym robocie. Centralnym robotem referencyjnym był 7-DOF Franka Emika Panda, z 2D toy examples gdy wymiar był nieintuicyjny.

Najważniejsze wzory

Krótka ściąga, którą warto pamiętać po przejściu kursu:

  • Jakobian: J(q)R6×7J(q) \in \mathbb{R}^{6 \times 7}, redundancja Pandy = 1. Damped pseudoinverse: J+=J(JJ+λ2I)1J^+ = J^\top (J J^\top + \lambda^2 I)^{-1}.
  • Manipulowalność Yoshikawy: w(q)=det(JJ)w(q) = \sqrt{\det(J J^\top)}. Zero = singularność.
  • Null-space: q˙=J+x˙+(IJ+J)h˙0\dot q = J^+ \dot x + (I - J^+ J) \dot h_0.
  • SDF: Φ(p)\Phi(p), Φ\nabla \Phi unit. CHOMP używa Φ-\nabla \Phi jako repulsion.
  • RRT: probabilistic complete; RRT* + r(n)(logn/n)1/dr(n) \propto (\log n / n)^{1/d} = asymptotically optimal.
  • CHOMP: ξ(k+1)=ξ(k)αJ(ξ(k))\xi^{(k+1)} = \xi^{(k)} - \alpha \nabla J(\xi^{(k)}), J=wsJsmooth+woJobsJ = w_s J_{\text{smooth}} + w_o J_{\text{obs}}.
  • MPPI: uu+kwkεku \leftarrow u + \sum_k w_k \varepsilon_k, wk=eJk/λ/Zw_k = e^{-J_k/\lambda} / Z.
  • CBF: h˙+αh0\dot h + \alpha h \geq 0 → forward invariant safe set.

Otwarte problemy

Pomimo dekad pracy, planowanie ruchu w robotyce ma istotne nierozwiązane problemy:

1. Generalizacja

Klasyczne planery trzeba uruchomić od początku dla każdej nowej sceny. Uczone (MπNets, Diffusion Policy) generalizują w obrębie distribution, ale słabo extrapolują do strukturalnie nowych zadań. Foundation models (RT-1, RT-2, PaLM-E) ofierują obietnicę zero-shot, ale wciąż wymagają fine-tune.

2. Formalne gwarancje w obecności uczenia

CBF, Lyapunov dają gwarancje DLA znanych modeli. Gdy model jest sieci neuronowej, gwarancje są trudne. Verification (Marabou, dReal) skaluje się tylko do MLPs ~100k parametrów. Wciąż otwarte: jak certyfikować bezpieczeństwo multi-million-parameter policy z LLM core'em?

3. Real-time w wysokich wymiarach

Klasyczne planery dla 7-DOF Pandy: 50-500 ms. Dla 30-DOF humanoida: sekundy do minut. Cel: 100 Hz online dla dowolnego robota z reaktywnym omijaniem. cuRobo (GPU, 2023) zbliża się — ale tylko dla ograniczonego zbioru przypadków.

4. Long-horizon TAMP

„Posprzątaj kuchnię" wymaga 100+ atomowych akcji. Planery grafowe + ciągłe nie skalują się tak długo. LLM-based TAMP (Code as Policies, SayCan) działają na poziomie demo, ale brakuje guarantees i deterministycznej replayowalności.

5. Sim-to-real gap

Mimo postępu w domain randomization, polityki uczone w sim nadal mają problemy w realu — szczególnie w manipulacji contact-rich (gripping, in-hand). Hydroelastic contact, system identification, model-based RL bliżej rzeczywistości — ale wciąż otwarte.

6. Multi-robot coordination

Centralizowane planery dla 2 ramion: OK. Dla swarm 100 robotów: niewykonalne. Decentralized algorithms (ORCA, social force) działają dla nawigacji 2D, ale nie dla manipulacji multi-arm coordinated.

Trendy 2024-2025

Diffusion-based planning

Diffuser, MPD, Diffusion Policy — moduł 14. State-of-the-art w imitation learning. Open question: jak je hardware-łyko inkorporować constraints (CBF + diffusion)?

Foundation models dla manipulacji

RT-1, RT-2, PaLM-E, Octo — multi-task policies trenowane na milionach demonstracji. Zero-shot transfer na nowe obiekty. Połączenie z LLM dla task understanding. Open problem: bezpieczeństwo, koszt obliczeniowy, sample efficiency.

Neuro-symbolic TAMP

LLM jako sequence planner + klasyczny motion planner per akcja. Code as Policies (Liang 2022) — LLM generuje Python kod wywołujący APIs. SayCan (Ahn 2022) — LLM filtruje wykonalne akcje przez prawdopodobieństwo.

Differentiable simulation

MuJoCo MJX, Tiny Differentiable Simulator, Brax — symulatory z analitycznym gradientem przez kontakt. Pozwala na end-to-end optimization (policy + dynamics) z gradient descent. Jeszcze nie mainstream, ale rosnący impact w 2024.

Embodied AI ekosystemy

Isaac Lab / Isaac Gym (NVIDIA) — GPU parallelization dla 10000+ równoległych instancji. Open X-Embodiment — dataset 1M+ demonstracji 22 różnych robotów. RT-X — generalist model trenowany na wszystkich.

Hardware: cobots stają się standardem

Po Pandzie pojawili się: UR e-series, Kuka iiwa, Fanuc CR. Wbudowane czujniki momentu w każdym joincie umożliwiają implementację ISO/TS 15066 standardami. Cena spada (Panda 2024: ~€20k vs €100k pierwszej generacji), co przyspiesza adopcję.

Konkretne kierunki dla redundancji i cobotów (7-DOF)

1. Adaptive HQP z uczeniem priorytetów

Klasyczne HQP (moduł 11) ma stałąhierarchię. W praktyce priority może zmieniać się dynamicznie: w contact mode → primary = utrzymanie kontaktu; w reach mode → primary = tracking TCP. Uczenie meta-policy która wybiera hierarchię.

2. Hybrid planning + reactive control

Off-line plan jako warm-start dla on-line MPC. Plan może być z uczonego generatora (Diffusion Policy), MPC z CBF safety filter. Combine: szybkość plus bezpieczeństwo plus generalizacja.

3. Whole-arm manipulation

Dotychczas: chwytak na końcu = jedyny kontakt. Whole-arm: cylindryczne ogniwa jako powierzchnie kontaktu dla caging lub force closure. Wymaga zmiany całej warstwy collision (z "bad" na "narzędzie").

4. Soft robotics integration

Sztywne Panda + soft gripper (Soft Robotics) lub miękkie palce (Festo). Pozwala na delikatną manipulację (truskawki, jajka). Nowy paradygmat: część robota jest nielinearna i deformowalna, wymaga distributed control + uczonego modelu.

5. Human-collaborative TAMP

Robot i człowiek wykonują wspólne zadanie. Predykcja zamiarów + shared autonomy + role assignment. Praktyczne wdrożenia: linia montażowa (BMW, Mercedes) gdzie człowiek zakłada elementy, robot wykonuje montaż.

Ściąga

Kluczowe punkty kursu

  1. Planowanie = znajdź ciągłą krzywą w 𝓠_free od start do goal, spełniającą constraints, minimalizującą koszt.
  2. Grid-based dla 2-4 DOF (mobile robots), sampling-based dla 7-30 DOF (manipulatory, humanoidy).
  3. Trajectory optimization dla gładkich, optymalnych ścieżek; sampling-MPC dla nieróżniczkowalnych kosztów.
  4. Redundancja Pandy (1 DOF) wykorzystywana przez null-space projection.
  5. Bezpieczeństwo formalne: CBF, ISO/TS 15066, Lyapunov.
  6. Learning-based generalize, but wymagają verification + sim-to-real.

Stack 2024 dla Pandy

  • Driver: franka_ros2
  • Planning: MoveIt2 + cuRobo
  • Simulation: MuJoCo (research), Isaac Lab (RL/GPU)
  • Real-time: PREEMPT_RT + DDS

Otwarte problemy

  • Generalizacja
  • Gwarancje przy uczeniu
  • Real-time wysokie wymiary
  • Long-horizon TAMP
  • Sim-to-real
  • Multi-robot coordination

Dalsza lektura

  • LaValle, Planning Algorithms (Cambridge 2006) — kanoniczny podręcznik, darmo online: lavalle.pl/planning.
  • Lynch & Park, Modern Robotics (Cambridge 2017) — Lie groups jako centralne narzędzie.
  • Siciliano et al., Robotics: Modelling, Planning, and Control (Springer 2009).
  • Murray, Li & Sastry, A Mathematical Introduction to Robotic Manipulation (CRC 1994) — dostępna online.
  • Sutton & Barto, Reinforcement Learning: An Introduction (MIT Press 2018) — RL fundament.
  • Annual Review of Control, Robotics, and Autonomous Systems — annual surveys z latest research.
  • Konferencje: ICRA, IROS, RSS, CoRL — najlepsze papery robotics.

Powodzenia w dalszej pracy nad planowaniem trajektorii. Materiał powstał z założeniem, że studenci wrócą tu wielokrotnie — albo jako przypomnienie konkretnego algorytmu, albo jako punkt startowy do własnego badania. Jeśli znajdziecie błąd lub uważasz że któreś objaśnienie wymaga poprawy — kod jest open-source.