Publications

Preprints and an indexed list are also on my Google Scholar page.

2026

  1. ASSEMBLE: Atomic Skills for Evidence-Grounded Video Reasoning [arXiv]

    Xiyang Wu, Zongxia Li, Shengxin Zhang, Zhichao Liu, Dinesh Manocha

    arXiv 2026

    • Learning
    • RL Post-training
    • Video Reasoning
    • Skill Composition
  2. COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks [arXiv]

    Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

    arXiv 2026

    • Learning
    • RL Post-training
    • Skill Learning
    • Long-horizon Agents
  3. SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models [arXiv]

    Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

    IROS 2026 · Oral Presentation

    • Acting
    • VLA Models
    • Adversarial Robustness
    • Red Teaming
  4. MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models [arXiv]

    Xiyang Wu*, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

    CVPR 2026

    • Understanding
    • World Model
    • VLM
    • Video Understanding
  5. COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows [arXiv]

    Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

    arXiv 2026

    • Learning
    • Self-improving Agents
    • Agent Skills
    • Image Generation
  6. Recursive Agentic Reasoning [arXiv]

    Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie

    arXiv 2026

    • Learning
    • Agentic Reasoning
    • Test-time Scaling
  7. Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading [arXiv]

    Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

    arXiv 2026

    • Learning
    • Agent Evaluation
    • Long-horizon Agents
    • Reward Design
  8. Causeway: Restoring Task Accessibility for Instruction Switching in VLA Policies [arXiv]

    Qingzi Wang, Kaixi Feng, Guangyao Shi, Xiyang Wu, Ang Li, Dinesh Manocha

    arXiv 2026

    • Acting
    • VLA Models
    • Instruction Following
    • Task Recovery
  9. Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models [arXiv]

    Qingzi Wang, Xiyang Wu, Guangyao Shi, Dianwei Chen, Xianfeng Yang, Dinesh Manocha

    arXiv 2026

    • Acting
    • VLA Models
    • Robot Safety
    • Social Navigation
  10. First Frame Is the Place to Go for Video Content Customization [arXiv]

    Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y. Feng, Yiannis Aloimonos

    CVPR 2026

    • Understanding
    • Video Generation
    • Content Customization
  11. MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data [arXiv]

    Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

    EMNLP 2026

    • Learning
    • RL Post-training
    • Self-improving Models
    • Multimodal Reasoning
  12. Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills [arXiv]

    Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun

    EMNLP 2026

    • Learning
    • Skill Retrieval
    • Skill Composition
    • Agent Skills
  13. FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition [arXiv]

    Ruiqi Xian, Xiyang Wu, Tianrui Guan, Xijun Wang, Boqing Gong, Dinesh Manocha

    IROS 2026

    • Acting
    • UAV Action Recognition
    • Self-supervised Learning
  14. Multimodal Video Generation Models with Audio: Present and Future [Paper]

    Zongxia Li, Hongyang Du, Dawei Liu, Xiyang Wu, Lantao Yu, Jingxi Chen, Fuxiao Liu, Xiaomin Wu, Jing Xie, Chengsong Huang, Yicheng He, Guangyao Shi

    Preprint 2026

    • Understanding
    • Video Generation
    • Multimodal Models
    • Audio Generation

2025

  1. On the Vulnerability of LLM/VLM-Controlled Robotics [arXiv]

    Xiyang Wu, Souradip Chakraborty, Ruiqi Xian, Jing Liang, Tianrui Guan, Fuxiao Liu, Brian Sadler, Dinesh Manocha, Amrit Singh Bedi

    IROS 2025

    • Acting
    • Embodied AI
    • Adversarial Robustness
    • AI Safety
  2. VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding [arXiv]

    Xiyang Wu*, Zongxia Li*, Yubin Qin, Guangyao Shi, Hongyang Du, Dinesh Manocha, Tianyi Zhou, Jordan Lee Boyd-Graber

    NeurIPS 2025

    • Understanding
    • World Model
    • VLM
    • Video Understanding
  3. CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning [arXiv]

    Ming Li, Chenguang Wang, Yijun Liang, Xiyao Wang, Yuhang Zhou, Xiyang Wu, Yuqing Zhang, Ruiyi Zhang, Tianyi Zhou

    arXiv 2025

    • Understanding
    • Visual Perception
    • Multimodal Reasoning
  4. Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation [arXiv]

    Zongxia Li, Yapei Chang, Yuhang Zhou, Xiyang Wu, Zichao Liang, Yoo Yeon Sung, Jordan Lee Boyd-Graber

    arXiv 2025

    • Learning
    • RL Post-training
    • Reward Design
    • Free-form Generation
  5. A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges [arXiv]

    Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi

    CVPRW 2025

    • Understanding
    • Vision-Language Models
    • Multimodal Evaluation
  6. LLM-as-a-Judge Failures at Automating the Identification of Poor Quality Outputs in Free-Form Texts [Paper]

    Zongxia Li, Xiyang Wu, Ishani Mondal, Alexa Siu, Jordan Boyd-Graber, Ani Nenkova

    NewSum 2025

    • Understanding
    • LLM Evaluation
    • LLM-as-a-Judge
    • Evaluation Reliability
  7. Taming Large Language Models for Free-Form Generation Via Reinforcement Learning With Verifiable Rewards [Paper]

    Zongxia Li, Yapei Chang, Yuhang Zhou, Xiyang Wu, Yoo Yeon Sung, Zichao Liang, Jordan Lee Boyd-Graber

    Manuscript 2025

    • Learning
    • RL Post-training
    • Verifiable Rewards

2024

  1. AUTOHALLUSION: Automatic Generation of Hallucination Benchmarks for Vision-Language Models [arXiv]

    Xiyang Wu*, Tianrui Guan*, Dianqi Li, Shuaiyi Huang, Xiaoyu Liu, Xijun Wang, Ruiqi Xian, Abhinav Shrivastava, Furong Huang, Jordan Lee Boyd-Graber, Tianyi Zhou, Dinesh Manocha

    EMNLP 2024

    • Understanding
    • Synthetic Data Curation
    • Multimodal Evaluation
    • Hallucination
  2. LANCAR: Leveraging Language for Context-Aware Robot Locomotion in Unstructured Environments [arXiv]

    Xiyang Wu*, Chak Lam Shek*, Wesley A. Suttle, Carl Busart, Erin Zaroukian, Dinesh Manocha, Pratap Tokekar, Amrit Singh Bedi

    IROS 2024

    • Acting
    • Robot Learning
    • Reinforcement Learning
    • Language Grounding
  3. HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models [arXiv]

    Tianrui Guan*, Fuxiao Liu*, Xiyang Wu, Ruiqi Xian, Zongxia Li, Xiaoyu Liu, Xijun Wang, Lichang Chen, Furong Huang, Yaser Yacoob, Dinesh Manocha, Tianyi Zhou

    CVPR 2024

    • Understanding
    • Multimodal Evaluation
    • Visual Reasoning
    • Hallucination
  4. AGL-NET: Aerial-Ground Cross-Modal Global Localization with Varying Scales [arXiv]

    Tianrui Guan*, Ruiqi Xian*, Xijun Wang, Xiyang Wu, Mohamed Elnoor, Daeun Song, Dinesh Manocha

    IROS 2024

    • Acting
    • Cross-modal Localization
    • Aerial-ground Matching

2023

  1. iPLAN: Intent-Aware Planning in Heterogeneous Traffic via Distributed Multi-Agent Reinforcement Learning [arXiv]

    Xiyang Wu, Rohan Chandra, Tianrui Guan, Amrit Singh Bedi, Dinesh Manocha

    CoRL 2023 Oral

    • Learning
    • Multi-agent RL
    • Intent-aware Planning
    • Autonomous Driving
  2. A novel image registration-based dynamic photometric stereo method for online defect detection in aluminum alloy castings [Paper]

    Haoyue Liu, Xiyang Wu, Ning Yan, Zexiao Li, Xiaodong Zhang

    DSP 2023

    • Acting
    • Photometric Stereo
    • Defect Detection

2020

  1. FireCommander: An Interactive, Probabilistic Multi-agent Environment for Heterogeneous Robot Teams [arXiv]

    Esmaeil Seraj, Xiyang Wu, Matthew Gombolay

    arXiv 2020

    • Learning
    • Multi-agent Systems
    • Heterogeneous Robots