PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
Yuhao Zhan*, Bingxiang He*, Zecong Tang, Chaojun Xiao
Findings of EMNLP 2026
Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory
Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang.
EMNLP 2026 Grounding Language Models Workshop
StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?
Yinghao Chen*, Zixi Chen*, Bingxiang He*, et al., Yuhao Zhan, Chaojun Xiao.
Findings of EMNLP 2026
JELV: A Judge of Edit-Level Validity for Evaluation and Automated Reference Expansion in Grammatical Error Correction
Yuhao Zhan, Yuqing Zhang, Jing Yuan, Qixiang Ma, Zhiqi Yang, Yu Gu, Zemin Liu, Fei Wu.
AAAI 2026 (Oral)