VLA-JEPA Enhancing Vision-Language-Action Model with Latent World Model

Source

@misc{sun_2026_vlajepa,
    title={{VLA-JEPA}: Enhancing Vision-Language-Action Model with Latent World Model}, 
    author={Jingwen Sun and Wenyao Zhang and Zekun Qi and Shaojie Ren and Zezhi Liu and Hanxin Zhu and Guangzhong Sun and Xin Jin and Zhibo Chen},
    year={2026},
    eprint={2602.10098},
    archivePrefix={arXiv},
    primaryClass={cs.RO},
    url={https://arxiv.org/abs/2602.10098}, 
}

(USTC) arXiv

TL;DR

General pipeline

Flash Reading

References