publications

Selected publications in audio-visual learning, multimodal intelligence, tracking, and trustworthy AI.

2026

  1. TASLP
    Semantic Modulated Prompting for Few-Shot Audio-Visual Classification
    Guanjie Huang, Yawen Cui, Danny Hin Kwok Tsang, and 2 more authors
    IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2026
    Audio-Visual LearningFew-Shot LearningPrompt TuningModality Rebalancing
  2. ICASSP
    Lend a Hand: Semi Training-Free Cued Speech Recognition via MLLM-Driven Hand Modeling
    Guanjie Huang, Danny H. K. Tsang, Xiao-Ping Zhang, and 1 more author
    In IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026
    Cued Speech RecognitionMultimodal LLMTraining-Free LearningVisual Speech
  3. ACM MM
    PhyAVBench: A Physical-Centric Audio-Visual Benchmark for Video Generation
    Tianxin Xie, Wentao Lei, Guanjie Huang, and 1 more author
    In Proceedings of the ACM International Conference on MultimediaOral presentation, 2026
    Audio-Visual GenerationPhysical GroundingEvaluation BenchmarkText-to-Audio-Video

2025

  1. ACM MM
    Cued-Agent: A Multi-Agent Framework for Automatic Cued Speech Recognition
    Guanjie Huang, Danny H. K. Tsang, Shan Yang, and 2 more authors
    In Proceedings of the ACM International Conference on MultimediaOral presentation, 2025
    Cued Speech RecognitionMulti-Agent SystemsMultimodal LearningLLM Self-Correction
  2. CVPRW
    Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
    Chunhui Zhang, Li Liu, Guanjie Huang, and 5 more authors
    In IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops, 2025
    Underwater TrackingCamouflaged ObjectsVision-Language ModelsSAM2

2024

  1. NeurIPS
    WebUOT-1M: Advancing Deep Underwater Object Tracking with a Million-Scale Benchmark
    Chunhui Zhang, Li Liu, Guanjie Huang, and 3 more authors
    In Advances in Neural Information Processing Systems, 2024
    Underwater TrackingLarge-Scale BenchmarkMultimodal TrackingObject Tracking
  2. ICSR
    Content-Aware Efficient Learner for Audio-Visual Emotion Recognition
    Guanjie Huang, Weilin Lin, and Li Liu
    In Social Robotics, 2024
    Audio-Visual Emotion RecognitionParameter-Efficient LearningMultimodal FusionAffective Computing

2023

  1. TPAMI
    WebUAV-3M: A Benchmark Unveiling the Power of Million-Scale Deep UAV Tracking
    Chunhui Zhang, Guanjie Huang, Li Liu, and 5 more authors
    IEEE Transactions on Pattern Analysis and Machine IntelligenceCo-first author. , 2023
    UAV TrackingMultimodal TrackingLarge-Scale DatasetVisual Object Tracking