Robotics & Autonomous Manipulation · RSS 2023 / IJRR
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Authors: Cheng Chi, Siyuan Feng, Yilun Du, Zhenjia Xu, Eric Cousineau, Benjamin Burchfiel, Shuran Song (Columbia University, MIT, Toyota Research Institute) · arXiv: 2303.04137
Core Methodological Innovation
Formulates robot visuomotor control as conditional denoising score matching over receding-horizon action sequences, naturally capturing multimodal human demonstration distributions without mode-averaging collapse.
Key Quantitative & Theoretical Takeaway: Predicting closed-loop action sequences of horizon T_p while executing T_a steps via receding-horizon control combines temporal action smoothness with real-time visual reactivity.
Abstract
This paper introduces Diffusion Policy, a new way of generating robot behavior by representing a robots visuomotor policy as a conditional denoising diffusion process. We benchmark Diffusion Policy across 12 different tasks from 4 different robot manipulation benchmarks.
Step-by-Step Equation & Methodology Breakdown
Why does Diffusion Policy outperform behavioral cloning and Gaussian Mixture policies on multimodal manipulation tasks?
Standard MSE regression averages distinct valid trajectories (such as passing left vs right around an obstacle) into an invalid midpoint collision, whereas iterative Langevin denoising follows the score gradient into a single coherent trajectory mode.