Skip to content

Latest commit

 

History

History
177 lines (160 loc) · 21.5 KB

File metadata and controls

177 lines (160 loc) · 21.5 KB

Complete Paper List

Total papers: 129


VLA (41)

# Paper Authors Date Links
1 DIAL: Decoupling Intent and Action via Latent World Modeling for En... Yi Chen, Yuying Ge et al. 2026-03-31 arXiv
2 FocusVLA: Focused Visual Utilization for Vision-Language-Action Models Yichi Zhang, Weihao Yuan et al. 2026-03-30 arXiv
3 StreamingVLA: Streaming Vision-Language-Action Model with Action Fl... Yiran Shi, Dongqi Guo et al. 2026-03-30 arXiv
4 ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language R... Hongyu Yan, Qiwei Li et al. 2026-03-29 arXiv
5 Uni-World VLA: Interleaved World Modeling and Planning for Autonomo... Qiqi Liu, Huan Xu et al. 2026-03-28 arXiv
6 VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Act... Zhide Zhong, Haodong Yan et al. 2026-03-27 arXiv
7 Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate Chen Yang, Yucheng Hu et al. 2026-03-27 arXiv
8 DFM-VLA: Iterative Action Refinement for Robot Manipulation via Dis... Jiayi Chen, Wenxuan Song et al. 2026-03-27 arXiv
9 Drive My Way: Preference Alignment of Vision-Language-Action Model ... Zehao Wang, Huaide Jiang et al. 2026-03-26 arXiv
10 Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Perform... Wenxuan Song, Jiayi Chen et al. 2026-03-26 arXiv
11 MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unifie... Yang Liu, Pengxiang Ding et al. 2026-03-26 arXiv
12 LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow a... Xinkai Wang, Chenyi Wang et al. 2026-03-26 arXiv
13 ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-L... Yiru Wang, Anqing Jiang et al. 2026-03-26 arXiv
14 ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic P... Young-Chae Son, Dae-Kwan Ko et al. 2026-03-26 arXiv
15 $π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aeri... Johnathan Tucker, Denis Liu et al. 2026-03-26 arXiv
16 Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency... Peiju Liu, Jinming Liu et al. 2026-03-26 arXiv
17 SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Lan... Xiyang Wu, Guangyao Shi et al. 2026-03-26 arXiv
18 TAG: Target-Agnostic Guidance for Stable Object-Centric Inference i... Jiaying Zhou, Zhihao Zhan et al. 2026-03-25 arXiv
19 3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3... Bin Yu, Shijie Lian et al. 2026-03-25 arXiv
20 SOMA: Strategic Orchestration and Memory-Augmented System for Visio... Zhuoran Li, Zhiyang Li et al. 2026-03-25 arXiv
21 VTAM: Video-Tactile-Action Models for Complex Physical Interaction ... Haoran Yuan, Weigang Yi et al. 2026-03-24 arXiv
22 Gaze-Regularized Vision-Language-Action Models for Robotic Manipula... Anupam Pani, Yanchao Yang 2026-03-24 arXiv
23 VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignme... Jintao Cheng, Haozhe Wang et al. 2026-03-24 arXiv
24 Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affo... Teng Yan, Zhengyang Pei et al. 2026-03-24 arXiv
25 Grounding Sim-to-Real Generalization in Dexterous Manipulation: An ... Ruixing Jin, Zicheng Zhu et al. 2026-03-24 arXiv
26 CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vis... Youzhi Liu, Li Gao et al. 2026-03-24 arXiv
27 Do World Action Models Generalize Better than VLAs? A Robustness Study Zhanguang Zhang, Zhiyuan Li et al. 2026-03-23 arXiv
28 Towards Practical World Model-based Reinforcement Learning for Visi... Zhilong Zhang, Haoxiang Ren et al. 2026-03-21 arXiv
29 AtomVLA: Scalable Post-Training for Robotic Manipulation via Predic... Xiaoquan Sun, Zetian Xu et al. 2026-03-09 arXiv
30 VLANeXt: Recipes for Building Strong VLA Models Liu, Xiangyu et al. 2026-02-18 arXiv
31 VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Langu... Changhua Xu, Jie Lu et al. 2026-02-07 arXiv
32 HoloBrain-0 Technical Report Horizon Robotics 2026-02-07 arXiv
33 SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attac... Bingxin Xu, Yuzhang Shang et al. 2026-01-20 arXiv
34 VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cl... Si-Cheng Wang, Tian-Yu Xiang et al. 2025-09-30 arXiv
35 Leave No Observation Behind: Real-time Correction for VLA Action Ch... Kohei Sendai, Maxime Alvarez et al. 2025-09-27 arXiv
36 PD-VLA: Accelerating Vision-Language-Action Model Integrated with A... Wenxuan Song, Jiayi Chen et al. 2025-03-04 arXiv
37 OpenVLA: An Open-Source Vision-Language-Action Model Kim, Moo et al. 2024-06-12 arXiv
38 Octo: An Open-Source Generalist Robot Policy Ghosh, Dasari et al. 2024-05-21 arXiv
39 RT-2: Vision-Language-Action Models Brohan, Brown et al. 2023-07-31 arXiv
40 RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robot... Anthony Brohan, Noah Brown et al. 2023-07-28 arXiv
41 RT-1: Robotics Transformer Brohan, Brown et al. 2022-12-05 arXiv

World Model (24)

# Paper Authors Date Links
1 HCLSM: Hierarchical Causal Latent State Machines for Object-Centric... Jaber Jaber, Osama Jaber 2026-03-31 arXiv
2 LOME: Learning Human-Object Manipulation with Action-Conditioned Eg... Quankai Gao, Jiawei Yang et al. 2026-03-28 arXiv
3 Persistent Robot World Models: Stabilizing Multi-Step Rollouts via ... Jai Bardhan, Patrik Drozdik et al. 2026-03-26 arXiv
4 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous ... Linbo Wang, Yupeng Zheng et al. 2026-03-25 arXiv
5 OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Mani... Yuhang Zheng, Songen Gu et al. 2026-03-19 arXiv
6 EVA: Aligning Video World Models with Executable Robot Actions via ... Ruixiang Wang, Qingming Liu et al. 2026-03-18 arXiv
7 DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language P... Emily Yue-Ting Jia, Weiduo Yuan et al. 2026-03-17 arXiv
8 Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied S... Mutian Xu, Tianbao Zhang et al. 2026-03-17 arXiv
9 Fast-WAM: Do World Action Models Need Test-time Future Imagination? Tianyuan Yuan, Zibin Dong et al. 2026-03-17 arXiv
10 Simulation Distillation: Pretraining World Models in Simulation for... Jacob Levy, Tyler Westenbroek et al. 2026-03-16 arXiv
11 NavThinker: Action-Conditioned World Models for Coupled Prediction ... Tianshuai Hu, Zeying Gong et al. 2026-03-16 arXiv
12 WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for ... Yuchen Wang, Jiangtao Kong et al. 2026-03-15 arXiv
13 Building Explicit World Model for Zero-Shot Open-World Object Manip... Xiaotong Li, Gang Chen et al. 2026-03-14 arXiv
14 Beyond Dense Futures: World Models as Structured Planners for Robot... Minghao Jin, Mozheng Liao et al. 2026-03-13 arXiv
15 ResWM: Residual-Action World Model for Visual RL Jseen Zhang, Gabriel Adineera et al. 2026-03-11 arXiv
16 World2Act: Latent Action Post-Training via Skill-Compositional Worl... An Dinh Vuong, Tuan Van Vo et al. 2026-03-11 arXiv
17 PlayWorld: Learning Robot World Models from Autonomous Play Tenny Yin, Zhiting Mei et al. 2026-03-09 arXiv
18 MetaWorld-X: Hierarchical World Modeling via VLM-Orchestrated Exper... Yutong Shen, Hangxu Liu et al. 2026-03-09 arXiv
19 Foundational World Models Accurately Detect Bimanual Manipulator Fa... Isaac R. Ward, Michelle Ho et al. 2026-03-07 arXiv
20 What if? Emulative Simulation with World Models for Situated Reasoning Ruiping Liu, Yufan Chen et al. 2026-03-06 arXiv
21 Self-adapting Robotic Agents through Online Continual Reinforcement... Fabian Domberg, Georg Schildbach 2026-03-04 arXiv
22 Chain of World: World Model Thinking in Latent Motion Fuxiang Yang, Donglin Di et al. 2026-03-03 arXiv
23 FRAPPE: Infusing World Modeling into Generalist Policies via Multip... Han Zhao, Jingbo Wang et al. 2026-02-19 arXiv
24 DreamZero: World Action Models are Zero-shot Policies Chen, Zhe et al. 2026-02-10 arXiv

Diffusion Policy (22)

# Paper Authors Date Links
1 Encoding Predictability and Legibility for Style-Conditioned Diffus... Adrien Jacquet Crétides, Mouad Abrini et al. 2026-03-17 arXiv
2 ReMAP-DP: Reprojected Multi-view Aligned PointMaps for Diffusion Po... Xinzhang Yang, Renjun Wu et al. 2026-03-16 arXiv
3 REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulat... Zhaoyuan Gu, Yipu Chen et al. 2026-03-14 arXiv
4 SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for ... Youqiang Gui, Yuxuan Zhou et al. 2026-03-05 arXiv
5 Diffusion Policy through Conditional Proximal Policy Optimization Ben Liu, Shunpeng Yang et al. 2026-03-05 arXiv
6 Closed-Loop Action Chunks with Dynamic Corrections for Training-Fre... Pengyuan Wu, Pingrui Zhang et al. 2026-03-02 arXiv
7 ADM-DP: Adaptive Dynamic Modality Diffusion Policy through Vision-T... Enyi Wang, Wen Fan et al. 2026-02-25 arXiv
8 AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Ada... Ge Yuan, Qiyuan Qiao et al. 2026-02-23 arXiv
9 Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguatio... Yuxuan Hu, Xiangyu Chen et al. 2026-02-07 arXiv
10 Self-Imitated Diffusion Policy for Efficient and Robust Visual Navi... Runhua Zhang, Junyi Hou et al. 2026-01-30 arXiv
11 ForeDiffusion: Foresight-Conditioned Diffusion Policy via Future Vi... Weize Xie, Yi Ding et al. 2026-01-19 arXiv
12 Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning Kangye Ji, Yuan Meng et al. 2026-01-19 arXiv
13 Learning Diffusion Policy from Primitive Skills for Robot Manipulation Zhihao Gu, Ming Yang et al. 2026-01-05 arXiv
14 A Review of Online Diffusion Policy RL Algorithms for Scalable Robo... Wonhyeok Choi, Shutong Ding et al. 2026-01-05 arXiv
15 Flexible Multitask Learning with Factorized Diffusion Policy Chaoqi Liu, Haonan Chen et al. 2025-12-26 arXiv
16 Kinematics-Aware Diffusion Policy with Consistent 3D Observation an... Kangchen Lv, Mingrui Yu et al. 2025-12-19 arXiv
17 ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision Wenlong Xia, Jinhao Zhang et al. 2025-12-17 arXiv
18 Delay-Aware Diffusion Policy: Bridging the Observation-Execution Ga... Aileen Liao, Dong-Ki Kim et al. 2025-12-08 arXiv
19 Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio... Yueru Jia, Jiaming Liu et al. 2025-12-02 arXiv
20 CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion fo... Rui Heng Yang, Xuan Zhao et al. 2025-11-27 arXiv
21 UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware... Ruoqu Chen, Xiangjie Yan et al. 2025-11-19 arXiv
22 Diffusion Policy Chi, Mukadam et al. 2023-03-07 arXiv

Action Learning (26)

# Paper Authors Date Links
1 Enhancing Policy Learning with World-Action Model Yuci Han, Alper Yilmaz 2026-03-30 arXiv
2 Chunk-Boundary Artifact in Action-Chunked Generative Policies: A No... Rui Wang 2026-03-12 arXiv
3 Learning Native Continuation for Action Chunking Flow Policies Yufeng Liu, Hang Yu et al. 2026-02-13 arXiv
4 SERFN: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via... Chenyu Yang, Denis Tarasov et al. 2026-02-10 arXiv
5 Moving On, Even When You're Broken: Fail-Active Trajectory Generati... Gilberto G. Briscoe-Martinez, Yaashia Gautam et al. 2026-02-02 arXiv
6 Abstracting Robot Manipulation Skills via Mixture-of-Experts Diffus... Ce Hao, Xuanran Zhai et al. 2026-01-29 arXiv
7 Real-Time Robot Execution with Masked Action Chunking Haoxuan Wang, Gengyu Zhang et al. 2026-01-27 arXiv
8 CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learn... Bingyi Liu, Jinbo He et al. 2026-01-09 arXiv
9 Mixture of Horizons in Action Chunking Dong Jing, Gang Wang et al. 2025-11-24 arXiv
10 Bi-AQUA: Bilateral Control-Based Imitation Learning for Underwater ... Takeru Tsunoori, Masato Kobayashi et al. 2025-11-20 arXiv
11 Temporal Action Selection for Action Chunking Yueyang Weng, Xiaopeng Zhang et al. 2025-11-06 arXiv
12 FTACT: Force Torque aware Action Chunking Transformer for Pick-and-... Ryo Watanabe, Maxime Alvarez et al. 2025-09-27 arXiv
13 Action Chunking with Transformers for Image-Based Spacecraft Guidan... Alejandro Posadas-Nava, Andrea Scorsoglio et al. 2025-09-04 arXiv
14 Actor-Critic for Continuous Action Chunks: A Reinforcement Learning... Jiarui Yang, Bin Zhu et al. 2025-08-15 arXiv
15 Reinforcement Learning with Action Chunking Qiyang Li, Zhiyuan Zhou et al. 2025-07-10 arXiv
16 Real-Time Execution of Action Chunking Flow Policies Kevin Black, Manuel Y. Galliker et al. 2025-06-09 arXiv
17 LiPo: A Lightweight Post-optimization Framework for Smoothing Actio... Dongwoo Son, Suhan Park 2025-06-05 arXiv
18 Bi-LAT: Bilateral Control-Based Imitation Learning via Natural Lang... Takumi Kobayashi, Masato Kobayashi et al. 2025-04-02 arXiv
19 Learning Bimanual Manipulation via Action Chunking and Inter-Arm Co... Tomohiro Motoda, Ryo Hanai et al. 2025-03-18 arXiv
20 Memorized action chunking with Transformers: Imitation learning for... Bochen Yang, Kaizhong Deng et al. 2024-11-06 arXiv
21 VQ-ACE: Efficient Policy Search for Dexterous Robotic Manipulation ... Chenyu Yang, Davide Liconti et al. 2024-11-05 arXiv
22 InterACT: Inter-dependency Aware Action Chunking with Hierarchical ... Andrew Lee, Ian Chuang et al. 2024-09-12 arXiv
23 Bidirectional Decoding: Improving Action Chunking via Guided Test-T... Yuejiang Liu, Jubayer Ibn Hamid et al. 2024-08-30 arXiv
24 Logically Constrained Robotics Transformers for Enhanced Perception... Parv Kapoor, Sai Vemprala et al. 2024-08-09 arXiv
25 ACT/ALOHA: Action Chunking Transformer Zhao, Lee et al. 2023-04-26 arXiv
26 Behavior Transformers (BeT) Shafiullah, Xiao et al. 2022-06-22 arXiv

Imitation Learning (1)

# Paper Authors Date Links
1 Surgical Robot Transformer (SRT): Imitation Learning for Surgical T... Ji Woong Kim, Tony Z. Zhao et al. 2024-07-17 arXiv

Robotics (13)

# Paper Authors Date Links
1 Learning Multi-View Spatial Reasoning from Cross-View Relations Suchae Jeong, Jaehwi Song et al. 2026-03-30 arXiv
2 Vega: Learning to Drive with Natural Language Instructions Sicheng Zuo, Yuxuan Li et al. 2026-03-26 arXiv
3 LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Lo... Motonari Kambara, Koki Seno et al. 2026-03-26 arXiv
4 PPGuide: Steering Diffusion Policies with Performance Predictive Gu... Zixing Wang, Devesh K. Jha et al. 2026-03-11 arXiv
5 Preference Aligned Visuomotor Diffusion Policies for Deformable Obj... Marco Moletta, Michael C. Welle et al. 2026-02-10 arXiv
6 RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupt... Amitesh Vatsa, Zhixian Xie et al. 2026-01-31 arXiv
7 Learning Diffusion Policies for Robotic Manipulation of Timber Join... Salma Mozaffari, Daniel Ruan et al. 2025-11-21 arXiv
8 Cross-Embodiment Robotic Manipulation Synthesis via Guided Demonstr... Apan Dastider, Hao Fang et al. 2025-03-11 arXiv
9 MissionGPT: Mission Planner for Mobile Robot based on Robotics Tran... Vladimir Berman, Artem Bazhenov et al. 2024-11-07 arXiv
10 HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers Jianke Zhang, Yanjiang Guo et al. 2024-09-12 arXiv
11 Bringing the RT-1-X Foundation Model to a SCARA robot Jonathan Salzer, Arnoud Visser 2024-09-05 arXiv
12 SARA-RT: Scaling up Robotics Transformers with Self-Adaptive Robust... Isabel Leal, Krzysztof Choromanski et al. 2023-12-04 arXiv
13 RT-1: Robotics Transformer for Real-World Control at Scale Anthony Brohan, Noah Brown et al. 2022-12-13 arXiv

Summary

Category Count
VLA 41
Action Learning 26
World Model 24
Diffusion Policy 22
Robotics 13
VLA with Reasoning 1
Efficient VLA 1
Imitation Learning 1