Yupeng Zheng*, Xiang Li*, Songen Gu*, Yuhang Zheng*, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding(* equal contribution)
Preprint 2026
We propose PokéVLA, a lightweight yet powerful foundation model for embodied manipulation that effectively infuses vision-language understanding into action learning.
Yuhang Zheng, Songen Gu, Weize Li, Yupeng Zheng, Yujie Zang, Shuai Tian, Xiang Li, Ce Hao, Chen Gao, Si Liu, Haoran Li, Yilun Chen, Shuicheng Yan, Wenchao Ding
Preprint 2026
We introduce OmniViTac, a large-scale visuo-tactile-action dataset, and OmniVTA, a world-model-based framework that combines predictive contact modeling with high-frequency tactile feedback for robust contact-rich manipulation.
Yupeng Zheng, Jichao Peng, Weize Li, Yuhang Zheng, Xiang Li, Yujie Jin, Julong Wei, Guanhua Zhang, Ruiling Zheng, Ming Cao, Songen Gu, Zhenhong Zou, Kaige Li, Ke Wu, Mingmin Yang, Jiahao Liu, Pengfei Li, Hengjie Si, Feiyu Zhu, Wang Fu, Likun Wang, Ruiwen Yao, Jieru Zhao, Yilun Chen, Wenchao Ding
Preprint 2025
We introduce World In Your Hands (WIYH), a large-scale open-source ecosystem with over 1,000 hours of in-the-wild human manipulation data, rich multimodal annotations, and benchmarks for human-centric manipulation learning.