@article{lin2025evo0,title={Evo-0: Vision-language-action model with implicit spatial understanding},author={Lin, Tao and Li, Gen and Zhong, Y. and Zou, Y. and Du, Yuxin and Liu, J. and Gu, E. and Zhao, B.},journal={arXiv preprint arXiv:2507.00416},year={2025},}
VLA-Pruner: Temporal-Aware Dual-Level Visual Token Pruning for Efficient Vision-Language-Action Inference
Z. Liu, Y. Chen, H. Cai, T Lin, and 3 more authors
@article{liu2025vlapruner,title={VLA-Pruner: Temporal-Aware Dual-Level Visual Token Pruning for Efficient Vision-Language-Action Inference},author={Liu, Z. and Chen, Y. and Cai, H. and Lin, Tao and Yang, S. and Liu, Z. and Zhao, B.},journal={arXiv preprint arXiv:2511.16449},year={2025},}