Preprints and an indexed list are also on my Google Scholar page.
2026
-
ASSEMBLE: Atomic Skills for Evidence-Grounded Video Reasoning [arXiv]
Xiyang Wu, Zongxia Li, Shengxin Zhang, Zhichao Liu, Dinesh Manocha
arXiv 2026
-
COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks [arXiv]
Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha
arXiv 2026
-
SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models [arXiv]
Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha
IROS 2026 · Oral Presentation
-
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models [arXiv]
Xiyang Wu*, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha
CVPR 2026
-
COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows [arXiv]
Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun
arXiv 2026
-
Recursive Agentic Reasoning [arXiv]
Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie
arXiv 2026
-
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading [arXiv]
Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang
arXiv 2026
-
Causeway: Restoring Task Accessibility for Instruction Switching in VLA Policies [arXiv]
Qingzi Wang, Kaixi Feng, Guangyao Shi, Xiyang Wu, Ang Li, Dinesh Manocha
arXiv 2026
-
Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models [arXiv]
Qingzi Wang, Xiyang Wu, Guangyao Shi, Dianwei Chen, Xianfeng Yang, Dinesh Manocha
arXiv 2026
-
First Frame Is the Place to Go for Video Content Customization [arXiv]
Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y. Feng, Yiannis Aloimonos
CVPR 2026
-
MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data [arXiv]
Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu
EMNLP 2026
-
Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills [arXiv]
Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun
EMNLP 2026
-
FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition [arXiv]
Ruiqi Xian, Xiyang Wu, Tianrui Guan, Xijun Wang, Boqing Gong, Dinesh Manocha
IROS 2026
-
Multimodal Video Generation Models with Audio: Present and Future [Paper]
Zongxia Li, Hongyang Du, Dawei Liu, Xiyang Wu, Lantao Yu, Jingxi Chen, Fuxiao Liu, Xiaomin Wu, Jing Xie, Chengsong Huang, Yicheng He, Guangyao Shi
Preprint 2026
2025
-
On the Vulnerability of LLM/VLM-Controlled Robotics [arXiv]
Xiyang Wu, Souradip Chakraborty, Ruiqi Xian, Jing Liang, Tianrui Guan, Fuxiao Liu, Brian Sadler, Dinesh Manocha, Amrit Singh Bedi
IROS 2025
-
VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding [arXiv]
Xiyang Wu*, Zongxia Li*, Yubin Qin, Guangyao Shi, Hongyang Du, Dinesh Manocha, Tianyi Zhou, Jordan Lee Boyd-Graber
NeurIPS 2025
-
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning [arXiv]
Ming Li, Chenguang Wang, Yijun Liang, Xiyao Wang, Yuhang Zhou, Xiyang Wu, Yuqing Zhang, Ruiyi Zhang, Tianyi Zhou
arXiv 2025
-
Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation [arXiv]
Zongxia Li, Yapei Chang, Yuhang Zhou, Xiyang Wu, Zichao Liang, Yoo Yeon Sung, Jordan Lee Boyd-Graber
arXiv 2025
-
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges [arXiv]
Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi
CVPRW 2025
-
LLM-as-a-Judge Failures at Automating the Identification of Poor Quality Outputs in Free-Form Texts [Paper]
Zongxia Li, Xiyang Wu, Ishani Mondal, Alexa Siu, Jordan Boyd-Graber, Ani Nenkova
NewSum 2025
-
Taming Large Language Models for Free-Form Generation Via Reinforcement Learning With Verifiable Rewards [Paper]
Zongxia Li, Yapei Chang, Yuhang Zhou, Xiyang Wu, Yoo Yeon Sung, Zichao Liang, Jordan Lee Boyd-Graber
Manuscript 2025
2024
-
AUTOHALLUSION: Automatic Generation of Hallucination Benchmarks for Vision-Language Models [arXiv]
Xiyang Wu*, Tianrui Guan*, Dianqi Li, Shuaiyi Huang, Xiaoyu Liu, Xijun Wang, Ruiqi Xian, Abhinav Shrivastava, Furong Huang, Jordan Lee Boyd-Graber, Tianyi Zhou, Dinesh Manocha
EMNLP 2024
-
LANCAR: Leveraging Language for Context-Aware Robot Locomotion in Unstructured Environments [arXiv]
Xiyang Wu*, Chak Lam Shek*, Wesley A. Suttle, Carl Busart, Erin Zaroukian, Dinesh Manocha, Pratap Tokekar, Amrit Singh Bedi
IROS 2024
-
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models [arXiv]
Tianrui Guan*, Fuxiao Liu*, Xiyang Wu, Ruiqi Xian, Zongxia Li, Xiaoyu Liu, Xijun Wang, Lichang Chen, Furong Huang, Yaser Yacoob, Dinesh Manocha, Tianyi Zhou
CVPR 2024
-
AGL-NET: Aerial-Ground Cross-Modal Global Localization with Varying Scales [arXiv]
Tianrui Guan*, Ruiqi Xian*, Xijun Wang, Xiyang Wu, Mohamed Elnoor, Daeun Song, Dinesh Manocha
IROS 2024
2023
-
iPLAN: Intent-Aware Planning in Heterogeneous Traffic via Distributed Multi-Agent Reinforcement Learning [arXiv]
Xiyang Wu, Rohan Chandra, Tianrui Guan, Amrit Singh Bedi, Dinesh Manocha
CoRL 2023 Oral
-
A novel image registration-based dynamic photometric stereo method for online defect detection in aluminum alloy castings [Paper]
Haoyue Liu, Xiyang Wu, Ning Yan, Zexiao Li, Xiaodong Zhang
DSP 2023
2020
-
FireCommander: An Interactive, Probabilistic Multi-agent Environment for Heterogeneous Robot Teams [arXiv]
Esmaeil Seraj, Xiyang Wu, Matthew Gombolay
arXiv 2020