Publications

Publications

Research Monograph

Springer 2025
sym

Visual Object Tracking: An Evaluation Perspective
X. Zhao, Shiyu Hu, X. Yin
Springer, Part of the book series: Advances in Computer Vision and Pattern Recognition (ACVPR)
๐Ÿ“Œ Dynamic Vision ๐Ÿ“Œ Visual Intelligence Evaluation ๐Ÿ“Œ Task-Space Diagnosis
๐Ÿ“ƒ Book

Peer-Reviewed Publications

Lead or Corresponding Author

TPAMI 2023
sym

Global Instance Tracking: Locating Target More Like Humans
Shiyu Hu, X. Zhao, L. Huang, K. Huang
IEEE Transactions on Pattern Analysis and Machine Intelligence (CCF-A Journal)
๐Ÿ“Œ Open-World Tracking ๐Ÿ“Œ Global Instance Localization ๐Ÿ“Œ Human-Referenced Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐Ÿชง Poster ๐ŸŒ Platform ๐Ÿ”ง Toolkit ๐Ÿ’พ Dataset

IJCV 2024
sym

SOTVerse: A User-defined Task Space of Single Object Tracking
Shiyu Hu, X. Zhao, K. Huang
International Journal of Computer Vision (CCF-A Journal)
๐Ÿ“Œ Open-World Tracking ๐Ÿ“Œ Task-Space Modeling ๐Ÿ“Œ Diagnostic Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐Ÿชง Poster ๐ŸŒ Platform

IJCV 2024
sym

BioDrone: A Bionic Drone-based Single Object Tracking Benchmark for Robust Vision
X. Zhao, Shiyu Huโœ‰๏ธ, Y. Wang, J. Zhang, Y. Hu, R. Liu, H. Lin, Y. Li, R. Li, K. Liu, J. Li
International Journal of Computer Vision (CCF-A Journal)
๐Ÿ“Œ Robust Visual Tracking ๐Ÿ“Œ Open-Environment Vision ๐Ÿ“Œ UAV Benchmark
๐Ÿ“ƒ Paper ๐ŸŒ Platform ๐Ÿ“‘ PDF ๐Ÿ”ง Toolkit ๐Ÿ’พ Dataset

NeurIPS 2023
sym

A Multi-modal Global Instance Tracking Benchmark (MGIT): Better Locating Target in Complex Spatio-temporal and causal Relationship
Shiyu Hu, D. Zhang, M. Wu, X. Feng, X. Li, X. Zhao, K. Huang
Conference on Neural Information Processing Systems (CCF-A Conference, Poster)
๐Ÿ“Œ Multimodal Video Understanding ๐Ÿ“Œ Global Instance Tracking ๐Ÿ“Œ Spatiotemporal-Causal Reasoning
๐Ÿ“ƒ Paper ๐Ÿ“ƒ PDF ๐Ÿชง Poster ๐Ÿ“น Slides ๐ŸŒ Platform ๐Ÿ”ง Toolkit ๐Ÿ’พ Dataset

ICCV 2025
sym

ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking
X. Feng*, Shiyu Hu*, X. Li, D. Zhang, M. Wu, J. Zhang, X. Chen, K. Huang (*Equal Contributions)
International Conference on Computer Vision (CCF-A Conference, Highlight)
๐Ÿ“Œ Vision-Language Tracking ๐Ÿ“Œ Dynamic State Alignment ๐Ÿ“Œ Multimodal Memory
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

ICRA 2026
sym

MATrack: Efficient Multiscale Adaptive Tracker for Real-Time Nighttime UAV Operations
X. Li*, X. Li*, Shiyu Huโœ‰๏ธ
International Conference on Robotics and Automation (CCF-B Conference)
๐Ÿ“Œ Robust Visual Tracking ๐Ÿ“Œ Nighttime UAV Vision ๐Ÿ“Œ Real-Time Adaptation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

ICMR 2025
sym

DARTer: Dynamic Adaptive Representation Tracker for Nighttime UAV Tracking
X. Li*, X. Li*, Shiyu Huโœ‰๏ธ
International Conference on Multimedia Retrieval (CCF-B Conference)
๐Ÿ“Œ Robust Visual Tracking ๐Ÿ“Œ Nighttime UAV Vision ๐Ÿ“Œ Dynamic Representation Learning
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

ไธญๅ›ฝๅ›พ่ฑกๅ›พๅฝขๅญฆๆŠฅ 2024
sym

Visual Intelligence Evaluation Techniques for Single Object Tracking: A Survey (ๅ•็›ฎๆ ‡่ทŸ่ธชไธญ็š„่ง†่ง‰ๆ™บ่ƒฝ่ฏ„ไผฐๆŠ€ๆœฏ็ปผ่ฟฐ)
Shiyu Hu, X. Zhao, K. Huang
Journal of Images and Graphics (ใ€Šไธญๅ›ฝๅ›พ่ฑกๅ›พๅฝขๅญฆๆŠฅใ€‹, CCF-B Chinese Journal)
๐Ÿ“Œ Dynamic Vision ๐Ÿ“Œ Visual Intelligence Evaluation ๐Ÿ“Œ Capability Diagnosis
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

IET-CVI 2025
sym

Improved SAR Aircraft Detection Algorithm Based on Visual State Space Models
Y. Wang, J. Zhang, Y. Wang, Shiyu Huโœ‰๏ธ, B. Shen, Z. Hou, W. Zhou
IET Computer Vision (CCF-C Journal)
๐Ÿ“Œ Remote Sensing ๐Ÿ“Œ SAR Aircraft Detection ๐Ÿ“Œ Vision State-Space Models

Collaborative Work

CVPR 2026
sym

Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
X. Li*, X. Li*, Shiyu Hu, K. Huang
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CCF-A Conference)
๐Ÿ“Œ Video-LLM Reasoning ๐Ÿ“Œ Evidence Purity ๐Ÿ“Œ Agentic Frame Selection
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

AAAI 2026
sym

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
X. Li*, X. Li*, Shiyu Hu, K. Huang, W. Zhang
Proceedings of the AAAI Conference on Artificial Intelligence (CCF-A Conference, Oral)
๐Ÿ“Œ Video-LLM Reasoning ๐Ÿ“Œ Stepwise Causal Reasoning ๐Ÿ“Œ Diagnostic Benchmark
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐Ÿ“น Slides

AAAI 2026
sym

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
X. Li*, X. Li*, Shiyu Hu, Y. Guo, W. Zhang
Proceedings of the AAAI Conference on Artificial Intelligence (CCF-A Conference, Oral)
๐Ÿ“Œ LLM Reasoning ๐Ÿ“Œ Reasoning Verifiers ๐Ÿ“Œ RLVR Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐Ÿ“น Slides

ICLR 2026
sym

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation Models
X. Feng, H. Yu, M. Wu, Shiyu Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang
International Conference on Learning Representations (CCF-A Conference)
๐Ÿ“Œ Generative Video Models ๐Ÿ“Œ Narrative Coherence ๐Ÿ“Œ Narrative-Centric Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

ACL 2026
sym

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
X. Li*, X. Li*, J. Gao, R. Pi, Shiyu Hu, W. Zhang
Annual Meeting of the Association for Computational Linguistics (CCF-A Conference)
๐Ÿ“Œ Multimodal Reasoning ๐Ÿ“Œ Grounded Visual Evidence ๐Ÿ“Œ Adaptive Pixel-Space Reasoning
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

PR 2026
sym

Tracking by Detection and Query: An Efficient End-to-End Framework for Multi-Object Tracking
S. Jia, Shiyu Hu, Y. Cao, F. Yang, X. Lu, X. Lu
Pattern Recognition (CCF-B Journal)
๐Ÿ“Œ Multi-Object Tracking ๐Ÿ“Œ Query-Based Association ๐Ÿ“Œ Efficient End-to-End Learning
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

TCSVT 2026
sym

Talk with Your Fingers: A Depth-Aware Benchmark for Air-Writing Recognition
M. Wu, Y. Zhao, X. Li, Shiyu Hu, Y. Cai, J. Wu, W. Wang, K. Huang
IEEE Transactions on Circuits and Systems for Video Technology (CCF-B Journal)
๐Ÿ“Œ Human-Centered Vision ๐Ÿ“Œ Depth-Aware Air-Writing ๐Ÿ“Œ Multimodal Benchmark
๐Ÿ“ƒ Paper

IJCAI 2026
sym

COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking
S. Jia, Shiyu Hu, Y. Wang, X. Cheng, Y. Cao, X. Lu
International Joint Conference on Artificial Intelligence (CCF-B Conference)
๐Ÿ“Œ Referring Multi-Object Tracking ๐Ÿ“Œ Robust Language Grounding ๐Ÿ“Œ Counterfactual Alignment Learning

ECCV 2026
Complete DASTrack figure

DASTrack: Rethinking Temporal Modeling in Visual Object Tracking via Decoupled Auxiliary Supervision
D. Zhang, Shiyu Hu, H. Fu, X. Feng, Y. Wang, KH Cheong, K. Huang
European Conference on Computer Vision (CCF-B Conference)
๐Ÿ“Œ Visual Object Tracking ๐Ÿ“Œ Temporal Representation Learning ๐Ÿ“Œ Decoupled Auxiliary Supervision

EMBC 2026
sym

Global-Local Semi-Supervised Modeling for Retinal Layer Boundary Estimation in OCT
K. Li, B. Parikh, H. Yue, Shiyu Hu, S. W. Tan, W. Y. Low, X. Su, KH Cheong
Annual International Conference of the IEEE Engineering in Medicine and Biology Society (CAAI-B Conference)
๐Ÿ“Œ Medical Imaging ๐Ÿ“Œ Retinal Boundary Estimation ๐Ÿ“Œ Semi-Supervised Structure Learning

TNSE 2026
sym

Constraint-Driven Evolution of Multimodal Video Intelligence: A Network and System Perspective
X. Li*, X. Li*, Shiyu Hu, Z. Zhang, KH Cheong
IEEE Transactions on Network Science and Engineering
๐Ÿ“Œ Multimodal Video Intelligence ๐Ÿ“Œ Constraint-Aware AI ๐Ÿ“Œ System-Level Reliability
๐Ÿ“ƒ Paper

Mathematics 2026
sym

CalcTutor: Multi-Agent LLM Grading of Handwritten Mathematics with RAG-Grounded Feedback for Adaptive Learning Support
L. Tan, B. Zhu, Shiyu Hu, A. Mishra, Darren J. Yeo, KH Cheong
Mathematics
๐Ÿ“Œ AI for Education ๐Ÿ“Œ Multi-Agent Assessment ๐Ÿ“Œ RAG-Grounded Feedback
๐Ÿ“ƒ Paper

ICML 2025
sym

CSTrack: Enhancing RGB-X Tracking via Compact Spatiotemporal Features
X. Feng, D. Zhang, Shiyu Hu, X. Li, M. Wu, J. Zhang, X. Chen, K. Huang
International Conference on Machine Learning (CCF-A Conference, Poster)
๐Ÿ“Œ Multimodal Tracking ๐Ÿ“Œ Spatiotemporal Representation Learning ๐Ÿ“Œ Efficient Sensor Fusion
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

ICASSP 2025
sym

Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
X. Feng, D. Zhang, Shiyu Hu, X. Li, M. Wu, J. Zhang, X. Chen, K. Huang
IEEE International Conference on Acoustics, Speech, and Signal Processing (CCF-B Conference, Poster)
๐Ÿ“Œ Vision-Language Tracking ๐Ÿ“Œ Visual Grounding ๐Ÿ“Œ Foundation Model Transfer
๐Ÿ“ƒ Paper ๐Ÿ“ƒ PDF

C&E:AI 2025
sym

Artificial Intelligence-Enabled Adaptive Learning Platforms: A Review
L. Tan, Shiyu Hu, Darren J. Yeo, KH Cheong
Computers & Education: Artificial Intelligence
๐Ÿ“Œ AI for Education ๐Ÿ“Œ Personalized Learning ๐Ÿ“Œ Adaptive Learning Systems
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Mathematics 2025
sym

A Comprehensive Review on Automated Grading Systems in STEM Using AI Techniques
L. Tan, Shiyu Hu, Darren J. Yeo, KH Cheong
Mathematics
๐Ÿ“Œ AI for Education ๐Ÿ“Œ Automated STEM Assessment ๐Ÿ“Œ Learning Analytics
๐Ÿ“ƒ Paper

Innovation and Emerging Technologies 2025
sym

Trustworthy AI in education: Framework, cases, and governance strategies
Y. Ma, X. Li, Shiyu Hu, S. Liu, KH Cheong
Innovation and Emerging Technologies
๐Ÿ“Œ Trustworthy AI ๐Ÿ“Œ AI for Education ๐Ÿ“Œ Governance and Fairness
๐Ÿ“ƒ Paper

ไธญๅ›ฝๅฟƒ็†ๅซ็”Ÿๆ‚ๅฟ— 2025
sym

A Review of Intelligent Psychological Assessment Based on Interactive Environment (ๅŸบไบŽไบคไบ’็Žฏๅขƒ็š„ๆ™บ่ƒฝๅŒ–ๅฟƒ็†ๆต‹่ฏ„)
K. Huang, Y. Kang, C. Yan, Shiyu Hu, L. Wang, T. Tao, W. Gao
Chinese Mental Health Journal (ใ€Šไธญๅ›ฝๅฟƒ็†ๅซ็”Ÿๆ‚ๅฟ—ใ€‹, CSSCI Journal, Top Psychological Journal in China)
๐Ÿ“Œ Human-Centered AI ๐Ÿ“Œ Interactive Psychological Assessment ๐Ÿ“Œ Validity and Ethics

NeurIPS 2024
sym

Beyond Accuracy: Tracking more like Human via Visual Search
D. Zhang, Shiyu Hu, X. Feng, X. Li, M. Wu, J. Zhang, K. Huang
Conference on Neural Information Processing Systems (CCF-A Conference, Poster)
๐Ÿ“Œ Human-Centered Vision ๐Ÿ“Œ Visual Search ๐Ÿ“Œ Process-Level Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

NeurIPS 2024
sym

MemVLT: Vision-Language Tracking with Adaptive Memory-based Prompts
X. Feng, X. Li, Shiyu Hu, D. Zhang, M. Wu, J. Zhang, X. Chen, K. Huang
Conference on Neural Information Processing Systems (CCF-A Conference, Poster)
๐Ÿ“Œ Vision-Language Tracking ๐Ÿ“Œ Long-Term Memory ๐Ÿ“Œ Adaptive Prompting
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

ICASSP 2024
sym

Robust Single-particle Cryo-EM Image Denoising and Restoration
J. Zhang, T. Zhao, Shiyu Hu, X. Zhao
IEEE International Conference on Acoustics, Speech, and Signal Processing (CCF-B Conference, Poster)
๐Ÿ“Œ AI for Science ๐Ÿ“Œ Cryo-EM Restoration ๐Ÿ“Œ Diffusion Models
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

TCSVT 2024
sym

Finger in Camera Speaks Everything: Unconstrained Air-Writing for Real-World
M. Wu, K. Huang, Y. Cai, Shiyu Hu, Y. Zhao, W. Wang
IEEE Transactions on Circuits and Systems for Video Technology (CCF-B Journal)
๐Ÿ“Œ Human-Computer Interaction ๐Ÿ“Œ Unconstrained Air-Writing ๐Ÿ“Œ Real-World Benchmark
๐Ÿ“ƒ Paper ๐Ÿ“ƒ PDF ๐Ÿ”ง Toolkit

PRCV 2024
sym

VS-LLM: Visual-Semantic Depression Assessment based on LLM for Drawing Projection Test
M. Wu, Y. Kang, X. Li, Shiyu Hu, X. Chen, Y. kang, W. Wang, K. Huang
Chinese Conference on Pattern Recognition and Computer Vision (CCF-C Conference)
๐Ÿ“Œ Human-Centered AI ๐Ÿ“Œ Multimodal Mental Health Assessment ๐Ÿ“Œ LLM-Assisted Interpretation
๐Ÿ“ƒ Paper ๐Ÿ“ƒ PDF

PRCV 2023
sym

A Hierarchical Theme Recognition Model for Sandplay Therapy
X. Feng, Shiyu Hu, X. Chen, K. Huang
Chinese Conference on Pattern Recognition and Computer Vision (CCF-C Conference, Poster)
๐Ÿ“Œ Human-Centered AI ๐Ÿ“Œ Computational Mental Health ๐Ÿ“Œ Knowledge-Guided Recognition
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐Ÿ”– Supplementary ๐Ÿชง Poster

CSAI 2023
sym

Rethinking Similar Object Interference in Single Object Tracking
Y. Wang, Shiyu Hu, X. Zhao
International Conference on Computer Science and Artificial Intelligence (EI Conference, Oral)
๐Ÿ“Œ Robust Visual Tracking ๐Ÿ“Œ Similar-Object Interference ๐Ÿ“Œ Failure Diagnosis
๐Ÿ“ƒ Paper ๐Ÿ—’ bibTex ๐Ÿ“‘ PDF

Neurocomputing 2022
sym

Revisiting Instance Search: A New Benchmark Using Cycle Self-training
Y. Zhang, C. Liu, W. Chen, X. Xu, F. Wang, H. Li, Shiyu Hu, X. Zhao
Neurocomputing (CCF-C Journal)
๐Ÿ“Œ Open-World Retrieval ๐Ÿ“Œ Cross-Camera Instance Search ๐Ÿ“Œ Cycle Self-Training
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐ŸŒ Project

ๅ›พๅญฆๅญฆๆŠฅ 2021
sym

Visual Turing: The Next Development of Computer Vision in The View of Human-computer Gaming (่ง†่ง‰ๅ›พ็ต๏ผšไปŽไบบๆœบๅฏนๆŠ—็œ‹่ฎก็ฎ—ๆœบ่ง†่ง‰ไธ‹ไธ€ๆญฅๅ‘ๅฑ•)
K. Huang, X. Zhao, Q. Li, Shiyu Hu
Journal of Graphics (ใ€Šๅ›พๅญฆๅญฆๆŠฅใ€‹, CCF-C Chinese Journal)
๐Ÿ“Œ Human-Centered AI ๐Ÿ“Œ Visual Intelligence Evaluation ๐Ÿ“Œ Human-Machine Benchmarking
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Workshop

Selected collaborative publications are shown for concise browsing.

Preprints

Preprint
Complete figure for the survey of streaming video understanding

How to Respond, How to Memorize, How to Be Fast: A Survey of Streaming Video Understanding
X. Li*, Shiyu Hu*, X. Feng, J. Zhao, K. Huang (*Equal Contributions)
๐Ÿ“Œ Streaming Video Understanding ๐Ÿ“Œ Long-Term Memory ๐Ÿ“Œ Efficient Inference
๐Ÿ“ƒ Paper

Preprint
sym

FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
Shiyu Hu*, X. Li*, X. Li, J. Zhang, Y. Wang, X. Zhao, KH Cheong (*Equal Contributions)
๐Ÿ“Œ Large Vision-Language Models ๐Ÿ“Œ Human-Aligned Video Understanding ๐Ÿ“Œ Multi-Annotator Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐ŸŒ Project

Preprint
sym

When LLMs Learn to be Students: The SOEI Framework for Modeling and Evaluating Virtual Student Agents in Educational Interaction
Y. Ma*, Shiyu Hu*, X. Li, Y. Wang, Y. Chen, S. Liu, KH Cheong (*Equal Contributions)
๐Ÿ“Œ AI for Education ๐Ÿ“Œ Virtual Student Agents ๐Ÿ“Œ Interaction-Centered Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
sym

EduVerse: A User-Defined Multi-Agent Simulation Space for Education Scenario
Y. Ma*, Shiyu Hu*, B. Zhu, Y. Wang, Y. Kang, S. Liu, KH Cheong (*Equal Contributions)
๐Ÿ“Œ AI for Education ๐Ÿ“Œ Multi-Agent Simulation ๐Ÿ“Œ User-Defined Classroom Space
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
sym

EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents
B. Zhu*, Shiyu Hu*, Y. Ma, Y. Zhang, KH Cheong (*Equal Contributions)
๐Ÿ“Œ AI for Education ๐Ÿ“Œ Persona-Aware Agents ๐Ÿ“Œ Subjective Ability Diagnosis
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
sym

SOI is the Root of All Evil: Quantifying and Breaking Similar Object Interference in Single Object Tracking
Y. Wang*, Shiyu Hu*, S. Jia, P. Xu, H. Ma, Y. Ma, J. Zhang, X. Lu, X. Zhao (*Equal Contributions)
๐Ÿ“Œ Robust Visual Tracking ๐Ÿ“Œ Similar-Object Interference ๐Ÿ“Œ VLM-Guided Correction
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
sym

How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
X. Li*, Shiyu Hu*, X. Feng, D. Zhang, M. Wu, J. Zhang, K. Huang (*Equal Contributions)
๐Ÿ“Œ Vision-Language Tracking ๐Ÿ“Œ Language Utility Diagnosis ๐Ÿ“Œ Fine-Grained Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
Complete STEMVerse diagnostic framework for STEM reasoning

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models
X. Li, X. Li, J. Zhao, Shiyu Huโœ‰๏ธ
๐Ÿ“Œ AI for Education ๐Ÿ“Œ STEM Reasoning ๐Ÿ“Œ Cognitive Diagnosis
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
sym

DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
X. Li, Shiyu Hu, X. Feng, D. Zhang, M. Wu, J. Zhang, K. Huang
๐Ÿ“Œ Vision-Language Tracking ๐Ÿ“Œ Data-Centric AI ๐Ÿ“Œ Diverse Text Benchmark
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐ŸŒ Project

Preprint
sym

Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
X. Li, Shiyu Hu, X. Feng, D. Zhang, M. Wu, J. Zhang, K. Huang
๐Ÿ“Œ Vision-Language Tracking ๐Ÿ“Œ Multimodal Interaction ๐Ÿ“Œ Interactive Robustness Evaluation
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF ๐ŸŒ Project

Preprint
sym

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
X. Li*, X. Li*, R. Pi, Shiyu Hu, J. Zhao,J. Gao
๐Ÿ“Œ Agentic Visual Reasoning ๐Ÿ“Œ Grounded Visual Evidence ๐Ÿ“Œ Dual-Axis Diagnosis
๐Ÿ“ƒ Paper ๐Ÿ“‘ PDF

Preprint
sym

Nearing or Surpassing: Overall Evaluation of Human-Machine Dynamic Vision Ability
Shiyu Hu, X. Zhao, Y. Wang, Y. Shan, K. Huang
๐Ÿ“Œ Human-Centered AI ๐Ÿ“Œ Dynamic Vision Capability ๐Ÿ“Œ Human-Machine Evaluation
๐Ÿ“‘ PDF

Selected preprints are shown for concise browsing.