Total papers: 129
| # | Paper | Authors | Date | Links |
|---|---|---|---|---|
| 1 | DIAL: Decoupling Intent and Action via Latent World Modeling for En... | Yi Chen, Yuying Ge et al. | 2026-03-31 | arXiv |
| 2 | FocusVLA: Focused Visual Utilization for Vision-Language-Action Models | Yichi Zhang, Weihao Yuan et al. | 2026-03-30 | arXiv |
| 3 | StreamingVLA: Streaming Vision-Language-Action Model with Action Fl... | Yiran Shi, Dongqi Guo et al. | 2026-03-30 | arXiv |
| 4 | ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language R... | Hongyu Yan, Qiwei Li et al. | 2026-03-29 | arXiv |
| 5 | Uni-World VLA: Interleaved World Modeling and Planning for Autonomo... | Qiqi Liu, Huan Xu et al. | 2026-03-28 | arXiv |
| 6 | VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Act... | Zhide Zhong, Haodong Yan et al. | 2026-03-27 | arXiv |
| 7 | Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate | Chen Yang, Yucheng Hu et al. | 2026-03-27 | arXiv |
| 8 | DFM-VLA: Iterative Action Refinement for Robot Manipulation via Dis... | Jiayi Chen, Wenxuan Song et al. | 2026-03-27 | arXiv |
| 9 | Drive My Way: Preference Alignment of Vision-Language-Action Model ... | Zehao Wang, Huaide Jiang et al. | 2026-03-26 | arXiv |
| 10 | Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Perform... | Wenxuan Song, Jiayi Chen et al. | 2026-03-26 | arXiv |
| 11 | MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unifie... | Yang Liu, Pengxiang Ding et al. | 2026-03-26 | arXiv |
| 12 | LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow a... | Xinkai Wang, Chenyi Wang et al. | 2026-03-26 | arXiv |
| 13 | ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-L... | Yiru Wang, Anqing Jiang et al. | 2026-03-26 | arXiv |
| 14 | ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic P... | Young-Chae Son, Dae-Kwan Ko et al. | 2026-03-26 | arXiv |
| 15 |
|
Johnathan Tucker, Denis Liu et al. | 2026-03-26 | arXiv |
| 16 | Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency... | Peiju Liu, Jinming Liu et al. | 2026-03-26 | arXiv |
| 17 | SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Lan... | Xiyang Wu, Guangyao Shi et al. | 2026-03-26 | arXiv |
| 18 | TAG: Target-Agnostic Guidance for Stable Object-Centric Inference i... | Jiaying Zhou, Zhihao Zhan et al. | 2026-03-25 | arXiv |
| 19 | 3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3... | Bin Yu, Shijie Lian et al. | 2026-03-25 | arXiv |
| 20 | SOMA: Strategic Orchestration and Memory-Augmented System for Visio... | Zhuoran Li, Zhiyang Li et al. | 2026-03-25 | arXiv |
| 21 | VTAM: Video-Tactile-Action Models for Complex Physical Interaction ... | Haoran Yuan, Weigang Yi et al. | 2026-03-24 | arXiv |
| 22 | Gaze-Regularized Vision-Language-Action Models for Robotic Manipula... | Anupam Pani, Yanchao Yang | 2026-03-24 | arXiv |
| 23 | VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignme... | Jintao Cheng, Haozhe Wang et al. | 2026-03-24 | arXiv |
| 24 | Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affo... | Teng Yan, Zhengyang Pei et al. | 2026-03-24 | arXiv |
| 25 | Grounding Sim-to-Real Generalization in Dexterous Manipulation: An ... | Ruixing Jin, Zicheng Zhu et al. | 2026-03-24 | arXiv |
| 26 | CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vis... | Youzhi Liu, Li Gao et al. | 2026-03-24 | arXiv |
| 27 | Do World Action Models Generalize Better than VLAs? A Robustness Study | Zhanguang Zhang, Zhiyuan Li et al. | 2026-03-23 | arXiv |
| 28 | Towards Practical World Model-based Reinforcement Learning for Visi... | Zhilong Zhang, Haoxiang Ren et al. | 2026-03-21 | arXiv |
| 29 | AtomVLA: Scalable Post-Training for Robotic Manipulation via Predic... | Xiaoquan Sun, Zetian Xu et al. | 2026-03-09 | arXiv |
| 30 | VLANeXt: Recipes for Building Strong VLA Models | Liu, Xiangyu et al. | 2026-02-18 | arXiv |
| 31 | VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Langu... | Changhua Xu, Jie Lu et al. | 2026-02-07 | arXiv |
| 32 | HoloBrain-0 Technical Report | Horizon Robotics | 2026-02-07 | arXiv |
| 33 | SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attac... | Bingxin Xu, Yuzhang Shang et al. | 2026-01-20 | arXiv |
| 34 | VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cl... | Si-Cheng Wang, Tian-Yu Xiang et al. | 2025-09-30 | arXiv |
| 35 | Leave No Observation Behind: Real-time Correction for VLA Action Ch... | Kohei Sendai, Maxime Alvarez et al. | 2025-09-27 | arXiv |
| 36 | PD-VLA: Accelerating Vision-Language-Action Model Integrated with A... | Wenxuan Song, Jiayi Chen et al. | 2025-03-04 | arXiv |
| 37 | OpenVLA: An Open-Source Vision-Language-Action Model | Kim, Moo et al. | 2024-06-12 | arXiv |
| 38 | Octo: An Open-Source Generalist Robot Policy | Ghosh, Dasari et al. | 2024-05-21 | arXiv |
| 39 | RT-2: Vision-Language-Action Models | Brohan, Brown et al. | 2023-07-31 | arXiv |
| 40 | RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robot... | Anthony Brohan, Noah Brown et al. | 2023-07-28 | arXiv |
| 41 | RT-1: Robotics Transformer | Brohan, Brown et al. | 2022-12-05 | arXiv |
| # | Paper | Authors | Date | Links |
|---|---|---|---|---|
| 1 | HCLSM: Hierarchical Causal Latent State Machines for Object-Centric... | Jaber Jaber, Osama Jaber | 2026-03-31 | arXiv |
| 2 | LOME: Learning Human-Object Manipulation with Action-Conditioned Eg... | Quankai Gao, Jiawei Yang et al. | 2026-03-28 | arXiv |
| 3 | Persistent Robot World Models: Stabilizing Multi-Step Rollouts via ... | Jai Bardhan, Patrik Drozdik et al. | 2026-03-26 | arXiv |
| 4 | Latent-WAM: Latent World Action Modeling for End-to-End Autonomous ... | Linbo Wang, Yupeng Zheng et al. | 2026-03-25 | arXiv |
| 5 | OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Mani... | Yuhang Zheng, Songen Gu et al. | 2026-03-19 | arXiv |
| 6 | EVA: Aligning Video World Models with Executable Robot Actions via ... | Ruixiang Wang, Qingming Liu et al. | 2026-03-18 | arXiv |
| 7 | DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language P... | Emily Yue-Ting Jia, Weiduo Yuan et al. | 2026-03-17 | arXiv |
| 8 | Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied S... | Mutian Xu, Tianbao Zhang et al. | 2026-03-17 | arXiv |
| 9 | Fast-WAM: Do World Action Models Need Test-time Future Imagination? | Tianyuan Yuan, Zibin Dong et al. | 2026-03-17 | arXiv |
| 10 | Simulation Distillation: Pretraining World Models in Simulation for... | Jacob Levy, Tyler Westenbroek et al. | 2026-03-16 | arXiv |
| 11 | NavThinker: Action-Conditioned World Models for Coupled Prediction ... | Tianshuai Hu, Zeying Gong et al. | 2026-03-16 | arXiv |
| 12 | WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for ... | Yuchen Wang, Jiangtao Kong et al. | 2026-03-15 | arXiv |
| 13 | Building Explicit World Model for Zero-Shot Open-World Object Manip... | Xiaotong Li, Gang Chen et al. | 2026-03-14 | arXiv |
| 14 | Beyond Dense Futures: World Models as Structured Planners for Robot... | Minghao Jin, Mozheng Liao et al. | 2026-03-13 | arXiv |
| 15 | ResWM: Residual-Action World Model for Visual RL | Jseen Zhang, Gabriel Adineera et al. | 2026-03-11 | arXiv |
| 16 | World2Act: Latent Action Post-Training via Skill-Compositional Worl... | An Dinh Vuong, Tuan Van Vo et al. | 2026-03-11 | arXiv |
| 17 | PlayWorld: Learning Robot World Models from Autonomous Play | Tenny Yin, Zhiting Mei et al. | 2026-03-09 | arXiv |
| 18 | MetaWorld-X: Hierarchical World Modeling via VLM-Orchestrated Exper... | Yutong Shen, Hangxu Liu et al. | 2026-03-09 | arXiv |
| 19 | Foundational World Models Accurately Detect Bimanual Manipulator Fa... | Isaac R. Ward, Michelle Ho et al. | 2026-03-07 | arXiv |
| 20 | What if? Emulative Simulation with World Models for Situated Reasoning | Ruiping Liu, Yufan Chen et al. | 2026-03-06 | arXiv |
| 21 | Self-adapting Robotic Agents through Online Continual Reinforcement... | Fabian Domberg, Georg Schildbach | 2026-03-04 | arXiv |
| 22 | Chain of World: World Model Thinking in Latent Motion | Fuxiang Yang, Donglin Di et al. | 2026-03-03 | arXiv |
| 23 | FRAPPE: Infusing World Modeling into Generalist Policies via Multip... | Han Zhao, Jingbo Wang et al. | 2026-02-19 | arXiv |
| 24 | DreamZero: World Action Models are Zero-shot Policies | Chen, Zhe et al. | 2026-02-10 | arXiv |
| # | Paper | Authors | Date | Links |
|---|---|---|---|---|
| 1 | Encoding Predictability and Legibility for Style-Conditioned Diffus... | Adrien Jacquet Crétides, Mouad Abrini et al. | 2026-03-17 | arXiv |
| 2 | ReMAP-DP: Reprojected Multi-view Aligned PointMaps for Diffusion Po... | Xinzhang Yang, Renjun Wu et al. | 2026-03-16 | arXiv |
| 3 | REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulat... | Zhaoyuan Gu, Yipu Chen et al. | 2026-03-14 | arXiv |
| 4 | SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for ... | Youqiang Gui, Yuxuan Zhou et al. | 2026-03-05 | arXiv |
| 5 | Diffusion Policy through Conditional Proximal Policy Optimization | Ben Liu, Shunpeng Yang et al. | 2026-03-05 | arXiv |
| 6 | Closed-Loop Action Chunks with Dynamic Corrections for Training-Fre... | Pengyuan Wu, Pingrui Zhang et al. | 2026-03-02 | arXiv |
| 7 | ADM-DP: Adaptive Dynamic Modality Diffusion Policy through Vision-T... | Enyi Wang, Wen Fan et al. | 2026-02-25 | arXiv |
| 8 | AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Ada... | Ge Yuan, Qiyuan Qiao et al. | 2026-02-23 | arXiv |
| 9 | Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguatio... | Yuxuan Hu, Xiangyu Chen et al. | 2026-02-07 | arXiv |
| 10 | Self-Imitated Diffusion Policy for Efficient and Robust Visual Navi... | Runhua Zhang, Junyi Hou et al. | 2026-01-30 | arXiv |
| 11 | ForeDiffusion: Foresight-Conditioned Diffusion Policy via Future Vi... | Weize Xie, Yi Ding et al. | 2026-01-19 | arXiv |
| 12 | Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning | Kangye Ji, Yuan Meng et al. | 2026-01-19 | arXiv |
| 13 | Learning Diffusion Policy from Primitive Skills for Robot Manipulation | Zhihao Gu, Ming Yang et al. | 2026-01-05 | arXiv |
| 14 | A Review of Online Diffusion Policy RL Algorithms for Scalable Robo... | Wonhyeok Choi, Shutong Ding et al. | 2026-01-05 | arXiv |
| 15 | Flexible Multitask Learning with Factorized Diffusion Policy | Chaoqi Liu, Haonan Chen et al. | 2025-12-26 | arXiv |
| 16 | Kinematics-Aware Diffusion Policy with Consistent 3D Observation an... | Kangchen Lv, Mingrui Yu et al. | 2025-12-19 | arXiv |
| 17 | ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision | Wenlong Xia, Jinhao Zhang et al. | 2025-12-17 | arXiv |
| 18 | Delay-Aware Diffusion Policy: Bridging the Observation-Execution Ga... | Aileen Liao, Dong-Ki Kim et al. | 2025-12-08 | arXiv |
| 19 | Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio... | Yueru Jia, Jiaming Liu et al. | 2025-12-02 | arXiv |
| 20 | CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion fo... | Rui Heng Yang, Xuan Zhao et al. | 2025-11-27 | arXiv |
| 21 | UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware... | Ruoqu Chen, Xiangjie Yan et al. | 2025-11-19 | arXiv |
| 22 | Diffusion Policy | Chi, Mukadam et al. | 2023-03-07 | arXiv |
| # | Paper | Authors | Date | Links |
|---|---|---|---|---|
| 1 | Enhancing Policy Learning with World-Action Model | Yuci Han, Alper Yilmaz | 2026-03-30 | arXiv |
| 2 | Chunk-Boundary Artifact in Action-Chunked Generative Policies: A No... | Rui Wang | 2026-03-12 | arXiv |
| 3 | Learning Native Continuation for Action Chunking Flow Policies | Yufeng Liu, Hang Yu et al. | 2026-02-13 | arXiv |
| 4 | SERFN: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via... | Chenyu Yang, Denis Tarasov et al. | 2026-02-10 | arXiv |
| 5 | Moving On, Even When You're Broken: Fail-Active Trajectory Generati... | Gilberto G. Briscoe-Martinez, Yaashia Gautam et al. | 2026-02-02 | arXiv |
| 6 | Abstracting Robot Manipulation Skills via Mixture-of-Experts Diffus... | Ce Hao, Xuanran Zhai et al. | 2026-01-29 | arXiv |
| 7 | Real-Time Robot Execution with Masked Action Chunking | Haoxuan Wang, Gengyu Zhang et al. | 2026-01-27 | arXiv |
| 8 | CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learn... | Bingyi Liu, Jinbo He et al. | 2026-01-09 | arXiv |
| 9 | Mixture of Horizons in Action Chunking | Dong Jing, Gang Wang et al. | 2025-11-24 | arXiv |
| 10 | Bi-AQUA: Bilateral Control-Based Imitation Learning for Underwater ... | Takeru Tsunoori, Masato Kobayashi et al. | 2025-11-20 | arXiv |
| 11 | Temporal Action Selection for Action Chunking | Yueyang Weng, Xiaopeng Zhang et al. | 2025-11-06 | arXiv |
| 12 | FTACT: Force Torque aware Action Chunking Transformer for Pick-and-... | Ryo Watanabe, Maxime Alvarez et al. | 2025-09-27 | arXiv |
| 13 | Action Chunking with Transformers for Image-Based Spacecraft Guidan... | Alejandro Posadas-Nava, Andrea Scorsoglio et al. | 2025-09-04 | arXiv |
| 14 | Actor-Critic for Continuous Action Chunks: A Reinforcement Learning... | Jiarui Yang, Bin Zhu et al. | 2025-08-15 | arXiv |
| 15 | Reinforcement Learning with Action Chunking | Qiyang Li, Zhiyuan Zhou et al. | 2025-07-10 | arXiv |
| 16 | Real-Time Execution of Action Chunking Flow Policies | Kevin Black, Manuel Y. Galliker et al. | 2025-06-09 | arXiv |
| 17 | LiPo: A Lightweight Post-optimization Framework for Smoothing Actio... | Dongwoo Son, Suhan Park | 2025-06-05 | arXiv |
| 18 | Bi-LAT: Bilateral Control-Based Imitation Learning via Natural Lang... | Takumi Kobayashi, Masato Kobayashi et al. | 2025-04-02 | arXiv |
| 19 | Learning Bimanual Manipulation via Action Chunking and Inter-Arm Co... | Tomohiro Motoda, Ryo Hanai et al. | 2025-03-18 | arXiv |
| 20 | Memorized action chunking with Transformers: Imitation learning for... | Bochen Yang, Kaizhong Deng et al. | 2024-11-06 | arXiv |
| 21 | VQ-ACE: Efficient Policy Search for Dexterous Robotic Manipulation ... | Chenyu Yang, Davide Liconti et al. | 2024-11-05 | arXiv |
| 22 | InterACT: Inter-dependency Aware Action Chunking with Hierarchical ... | Andrew Lee, Ian Chuang et al. | 2024-09-12 | arXiv |
| 23 | Bidirectional Decoding: Improving Action Chunking via Guided Test-T... | Yuejiang Liu, Jubayer Ibn Hamid et al. | 2024-08-30 | arXiv |
| 24 | Logically Constrained Robotics Transformers for Enhanced Perception... | Parv Kapoor, Sai Vemprala et al. | 2024-08-09 | arXiv |
| 25 | ACT/ALOHA: Action Chunking Transformer | Zhao, Lee et al. | 2023-04-26 | arXiv |
| 26 | Behavior Transformers (BeT) | Shafiullah, Xiao et al. | 2022-06-22 | arXiv |
| # | Paper | Authors | Date | Links |
|---|---|---|---|---|
| 1 | Surgical Robot Transformer (SRT): Imitation Learning for Surgical T... | Ji Woong Kim, Tony Z. Zhao et al. | 2024-07-17 | arXiv |
| # | Paper | Authors | Date | Links |
|---|---|---|---|---|
| 1 | Learning Multi-View Spatial Reasoning from Cross-View Relations | Suchae Jeong, Jaehwi Song et al. | 2026-03-30 | arXiv |
| 2 | Vega: Learning to Drive with Natural Language Instructions | Sicheng Zuo, Yuxuan Li et al. | 2026-03-26 | arXiv |
| 3 | LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Lo... | Motonari Kambara, Koki Seno et al. | 2026-03-26 | arXiv |
| 4 | PPGuide: Steering Diffusion Policies with Performance Predictive Gu... | Zixing Wang, Devesh K. Jha et al. | 2026-03-11 | arXiv |
| 5 | Preference Aligned Visuomotor Diffusion Policies for Deformable Obj... | Marco Moletta, Michael C. Welle et al. | 2026-02-10 | arXiv |
| 6 | RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupt... | Amitesh Vatsa, Zhixian Xie et al. | 2026-01-31 | arXiv |
| 7 | Learning Diffusion Policies for Robotic Manipulation of Timber Join... | Salma Mozaffari, Daniel Ruan et al. | 2025-11-21 | arXiv |
| 8 | Cross-Embodiment Robotic Manipulation Synthesis via Guided Demonstr... | Apan Dastider, Hao Fang et al. | 2025-03-11 | arXiv |
| 9 | MissionGPT: Mission Planner for Mobile Robot based on Robotics Tran... | Vladimir Berman, Artem Bazhenov et al. | 2024-11-07 | arXiv |
| 10 | HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers | Jianke Zhang, Yanjiang Guo et al. | 2024-09-12 | arXiv |
| 11 | Bringing the RT-1-X Foundation Model to a SCARA robot | Jonathan Salzer, Arnoud Visser | 2024-09-05 | arXiv |
| 12 | SARA-RT: Scaling up Robotics Transformers with Self-Adaptive Robust... | Isabel Leal, Krzysztof Choromanski et al. | 2023-12-04 | arXiv |
| 13 | RT-1: Robotics Transformer for Real-World Control at Scale | Anthony Brohan, Noah Brown et al. | 2022-12-13 | arXiv |
| Category | Count |
|---|---|
| VLA | 41 |
| Action Learning | 26 |
| World Model | 24 |
| Diffusion Policy | 22 |
| Robotics | 13 |
| VLA with Reasoning | 1 |
| Efficient VLA | 1 |
| Imitation Learning | 1 |