Agent RL & Self-Evolving AI

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Zongxia Li†, Zhongzhi Li†, Yucheng Shi†, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang
arXiv 2026 · Paper · Project · Code · Leaderboard
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
Yucheng Shi, Zhenwen Liang, Kishan Panaganti, Dian Yu, Wenhao Yu, Haitao Mi
Preprint 2026
TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL
Tianze Yang*, Yucheng Shi*, Ruitong Sun, Jingyuan Huang, Ninghao Liu, Jin Sun
Preprint 2026
Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning
Jiangnan Xia, Yucheng Shi, Yu Yang, Kishan Panaganti, Zhenwen Liang, Ninghao Liu
Preprint 2026
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang
Research note 2026 · Blog
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
Yucheng Shi*, Wenhao Yu*, Zaitang Li, Yonglin Wang, Hongming Zhang, Ninghao Liu, Haitao Mi, Dong Yu
arXiv 2025 · Paper
From Logs to Language: Learning Optimal Verbalization for LLM-Based Recommendation in Production
Yucheng Shi, Ying Li, Yu Wang, Yesu Feng, Arjun Rao, Rein Houthooft, Shradha Sehgal, Jin Wang, Hao Zhen, Ninghao Liu
Preprint 2025
Self-Improving Small Object Localization for Large Vision-Language Models
Tianze Yang, Yucheng Shi, Ruitong Sun, Ninghao Liu, Jin Sun
Preprint 2025
Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data
Yucheng Shi, Quanzheng Li, Jin Sun, Xiang Li, Ninghao Liu
ICLR 2025 · Paper · Code · Model · 5k+ HF downloads
MGH Radiology Llama: A Llama 3 70B Model for Radiology
Yucheng Shi, Peng Shu, Zhengliang Liu, Zihao Wu, Quanzheng Li, Tianming Liu, Ninghao Liu, Xiang Li
Tech Report 2024 · Paper

Trustworthy & Explainable AI

CORTEX: Concept-Oriented Token Explanation in Vector-Quantized Generative Models
Tianze Yang*, Yucheng Shi*, Mengnan Du, Xuansheng Wu, Qiaoyu Tan, Jin Sun, Ninghao Liu
ICML 2025 · Paper · Code
Towards Trustworthy GUI Agents: A Survey
Yucheng Shi, Wenhao Yu, Wenlin Yao, Wenhu Chen, Ninghao Liu
Preprint 2025 · Paper · Repo
Black-box Backdoor Defense via Zero-shot Image Purification
Yucheng Shi, Mengnan Du, Xuansheng Wu, Zihan Guan, Jin Sun, Ninghao Liu
NeurIPS 2023 · Paper · Code
Quantifying Multilingual Performance of Large Language Models Across Languages
Zihao Li, Yucheng Shi, Zirui Liu, Fan Yang, Ali Payani, Ninghao Liu, Mengnan Du
AAAI 2025 · Paper · Code
Usable XAI: 10 Strategies Towards Exploiting Explainability in the LLM Era
Xuansheng Wu*, Haiyan Zhao*, Yaochen Zhu*, Yucheng Shi*, Fan Yang, Tianming Liu, Xiaoming Zhai, Wenlin Yao, Jundong Li, Mengnan Du, Ninghao Liu
Preprint · Paper · Code

Retrieval-Augmented Generation

SearchRAG: Can Search Engines Be Helpful for LLM-based Medical Question Answering?
Yucheng Shi, Tianze Yang, Canyu Chen, Quanzheng Li, Tianming Liu, Xiang Li, Ninghao Liu
arXiv 2025 · Paper
Retrieval-Enhanced Knowledge Editing for Multi-Hop Question Answering in Language Models
Yucheng Shi, Qiaoyu Tan, Xuansheng Wu, Shaochen Zhong, Kaixiong Zhou, Ninghao Liu
CIKM 2024 · Paper · Code · Slides
MKRAG: Medical Knowledge Retrieval Augmented Generation for Medical Question Answering
Yucheng Shi*, Shaochen Xu*, Tianze Yang*, Zhengliang Liu, Tianming Liu, Quanzheng Li, Xiang Li, Ninghao Liu
AMIA 2024 · Paper · Code · Distinguished Paper Award

Graph Self-Supervised Learning

GiGaMAE: Generalizable Graph Masked Autoencoder via Collaborative Latent Space Reconstruction
Yucheng Shi, Yushun Dong, Qiaoyu Tan, Jundong Li, Ninghao Liu
CIKM 2023 · Paper · Code
ENGAGE: Explanation Guided Data Augmentation for Graph Representation Learning
Yucheng Shi, Kaixiong Zhou, Ninghao Liu
ECML-PKDD 2023 · Paper · Code

Some 2026 manuscripts are in staged release; links will be added as public versions become available.