Podsumowanie i kierunki badań
Otwarte problemy, trendy (diffusion planning, foundation models, neuro-symbolic TAMP), kierunki dla redundancji i cobotów.
Co przerobiliśmy
20 modułów obejmujących pełen pipeline od postawienia problemu planowania do wdrożenia na realnym robocie. Centralnym robotem referencyjnym był 7-DOF Franka Emika Panda, z 2D toy examples gdy wymiar był nieintuicyjny.
Najważniejsze wzory
Krótka ściąga, którą warto pamiętać po przejściu kursu:
- Jakobian: , redundancja Pandy = 1. Damped pseudoinverse: .
- Manipulowalność Yoshikawy: . Zero = singularność.
- Null-space: .
- SDF: , unit. CHOMP używa jako repulsion.
- RRT: probabilistic complete; RRT* + = asymptotically optimal.
- CHOMP: , .
- MPPI: , .
- CBF: → forward invariant safe set.
Otwarte problemy
Pomimo dekad pracy, planowanie ruchu w robotyce ma istotne nierozwiązane problemy:
1. Generalizacja
Klasyczne planery trzeba uruchomić od początku dla każdej nowej sceny. Uczone (MπNets, Diffusion Policy) generalizują w obrębie distribution, ale słabo extrapolują do strukturalnie nowych zadań. Foundation models (RT-1, RT-2, PaLM-E) ofierują obietnicę zero-shot, ale wciąż wymagają fine-tune.
2. Formalne gwarancje w obecności uczenia
CBF, Lyapunov dają gwarancje DLA znanych modeli. Gdy model jest sieci neuronowej, gwarancje są trudne. Verification (Marabou, dReal) skaluje się tylko do MLPs ~100k parametrów. Wciąż otwarte: jak certyfikować bezpieczeństwo multi-million-parameter policy z LLM core'em?
3. Real-time w wysokich wymiarach
Klasyczne planery dla 7-DOF Pandy: 50-500 ms. Dla 30-DOF humanoida: sekundy do minut. Cel: 100 Hz online dla dowolnego robota z reaktywnym omijaniem. cuRobo (GPU, 2023) zbliża się — ale tylko dla ograniczonego zbioru przypadków.
4. Long-horizon TAMP
„Posprzątaj kuchnię" wymaga 100+ atomowych akcji. Planery grafowe + ciągłe nie skalują się tak długo. LLM-based TAMP (Code as Policies, SayCan) działają na poziomie demo, ale brakuje guarantees i deterministycznej replayowalności.
5. Sim-to-real gap
Mimo postępu w domain randomization, polityki uczone w sim nadal mają problemy w realu — szczególnie w manipulacji contact-rich (gripping, in-hand). Hydroelastic contact, system identification, model-based RL bliżej rzeczywistości — ale wciąż otwarte.
6. Multi-robot coordination
Centralizowane planery dla 2 ramion: OK. Dla swarm 100 robotów: niewykonalne. Decentralized algorithms (ORCA, social force) działają dla nawigacji 2D, ale nie dla manipulacji multi-arm coordinated.
Trendy 2024-2025
Diffusion-based planning
Diffuser, MPD, Diffusion Policy — moduł 14. State-of-the-art w imitation learning. Open question: jak je hardware-łyko inkorporować constraints (CBF + diffusion)?
Foundation models dla manipulacji
RT-1, RT-2, PaLM-E, Octo — multi-task policies trenowane na milionach demonstracji. Zero-shot transfer na nowe obiekty. Połączenie z LLM dla task understanding. Open problem: bezpieczeństwo, koszt obliczeniowy, sample efficiency.
Neuro-symbolic TAMP
LLM jako sequence planner + klasyczny motion planner per akcja. Code as Policies (Liang 2022) — LLM generuje Python kod wywołujący APIs. SayCan (Ahn 2022) — LLM filtruje wykonalne akcje przez prawdopodobieństwo.
Differentiable simulation
MuJoCo MJX, Tiny Differentiable Simulator, Brax — symulatory z analitycznym gradientem przez kontakt. Pozwala na end-to-end optimization (policy + dynamics) z gradient descent. Jeszcze nie mainstream, ale rosnący impact w 2024.
Embodied AI ekosystemy
Isaac Lab / Isaac Gym (NVIDIA) — GPU parallelization dla 10000+ równoległych instancji. Open X-Embodiment — dataset 1M+ demonstracji 22 różnych robotów. RT-X — generalist model trenowany na wszystkich.
Hardware: cobots stają się standardem
Po Pandzie pojawili się: UR e-series, Kuka iiwa, Fanuc CR. Wbudowane czujniki momentu w każdym joincie umożliwiają implementację ISO/TS 15066 standardami. Cena spada (Panda 2024: ~€20k vs €100k pierwszej generacji), co przyspiesza adopcję.
Konkretne kierunki dla redundancji i cobotów (7-DOF)
1. Adaptive HQP z uczeniem priorytetów
Klasyczne HQP (moduł 11) ma stałąhierarchię. W praktyce priority może zmieniać się dynamicznie: w contact mode → primary = utrzymanie kontaktu; w reach mode → primary = tracking TCP. Uczenie meta-policy która wybiera hierarchię.
2. Hybrid planning + reactive control
Off-line plan jako warm-start dla on-line MPC. Plan może być z uczonego generatora (Diffusion Policy), MPC z CBF safety filter. Combine: szybkość plus bezpieczeństwo plus generalizacja.
3. Whole-arm manipulation
Dotychczas: chwytak na końcu = jedyny kontakt. Whole-arm: cylindryczne ogniwa jako powierzchnie kontaktu dla caging lub force closure. Wymaga zmiany całej warstwy collision (z "bad" na "narzędzie").
4. Soft robotics integration
Sztywne Panda + soft gripper (Soft Robotics) lub miękkie palce (Festo). Pozwala na delikatną manipulację (truskawki, jajka). Nowy paradygmat: część robota jest nielinearna i deformowalna, wymaga distributed control + uczonego modelu.
5. Human-collaborative TAMP
Robot i człowiek wykonują wspólne zadanie. Predykcja zamiarów + shared autonomy + role assignment. Praktyczne wdrożenia: linia montażowa (BMW, Mercedes) gdzie człowiek zakłada elementy, robot wykonuje montaż.
Ściąga
Kluczowe punkty kursu
- Planowanie = znajdź ciągłą krzywą w 𝓠_free od start do goal, spełniającą constraints, minimalizującą koszt.
- Grid-based dla 2-4 DOF (mobile robots), sampling-based dla 7-30 DOF (manipulatory, humanoidy).
- Trajectory optimization dla gładkich, optymalnych ścieżek; sampling-MPC dla nieróżniczkowalnych kosztów.
- Redundancja Pandy (1 DOF) wykorzystywana przez null-space projection.
- Bezpieczeństwo formalne: CBF, ISO/TS 15066, Lyapunov.
- Learning-based generalize, but wymagają verification + sim-to-real.
Stack 2024 dla Pandy
- Driver: franka_ros2
- Planning: MoveIt2 + cuRobo
- Simulation: MuJoCo (research), Isaac Lab (RL/GPU)
- Real-time: PREEMPT_RT + DDS
Otwarte problemy
- Generalizacja
- Gwarancje przy uczeniu
- Real-time wysokie wymiary
- Long-horizon TAMP
- Sim-to-real
- Multi-robot coordination
Dalsza lektura
- LaValle, Planning Algorithms (Cambridge 2006) — kanoniczny podręcznik, darmo online: lavalle.pl/planning.
- Lynch & Park, Modern Robotics (Cambridge 2017) — Lie groups jako centralne narzędzie.
- Siciliano et al., Robotics: Modelling, Planning, and Control (Springer 2009).
- Murray, Li & Sastry, A Mathematical Introduction to Robotic Manipulation (CRC 1994) — dostępna online.
- Sutton & Barto, Reinforcement Learning: An Introduction (MIT Press 2018) — RL fundament.
- Annual Review of Control, Robotics, and Autonomous Systems — annual surveys z latest research.
- Konferencje: ICRA, IROS, RSS, CoRL — najlepsze papery robotics.
Powodzenia w dalszej pracy nad planowaniem trajektorii. Materiał powstał z założeniem, że studenci wrócą tu wielokrotnie — albo jako przypomnienie konkretnego algorytmu, albo jako punkt startowy do własnego badania. Jeśli znajdziecie błąd lub uważasz że któreś objaśnienie wymaga poprawy — kod jest open-source.