@article{kim2026meanflow,title={Score-Based One-step MeanFlow Policy Optimization},author={Kim, Kyungyoon and Ki, Donghyeon and Ahn, Hee-Jun and Lee, Byung-Jun},journal={arXiv preprint arXiv:2605.23365},year={2026},url={https://arxiv.org/abs/2605.23365},}
arXiv
Direct Soft-Policy Sampling via Langevin Dynamics
Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim, and Byung-Jun Lee
@article{ki2026langevin,title={Direct Soft-Policy Sampling via Langevin Dynamics},author={Ki, Donghyeon and Ahn, Hee-Jun and Kim, Kyungyoon and Lee, Byung-Jun},journal={arXiv preprint arXiv:2602.07873},year={2026},url={https://arxiv.org/abs/2602.07873},}