中文简历

黄冠杰的教育经历、科研与工作经历、代表论文、项目和奖项。

下载详细中文简历(PDF)

个人简介

香港科技大学(广州)人工智能博士研究生,具备 5 年以上多模态算法研发与科研经历,方向覆盖音视频学习、低资源语音识别、多模态大模型、多智能体、音频伪造检测与大模型不确定性。论文及成果发表于 IEEE TPAMI、NeurIPS、IEEE/ACM TASLP、ACM Multimedia、ICASSP 等;兼具学术研究、数据集与评测基准构建和工业视觉算法经验。

核心能力

  • 研究方向: 多模态表示与对齐、音视频理解、语音识别、多模态大模型与多智能体、模型不确定性、音频伪造检测
  • 算法方法: Transformer、Adapter 与参数高效学习、注意力与原型学习、自监督学习、CNN、U-Net/GAN、多任务与证据学习
  • 工程实践: Python、数据处理与半自动标注流水线、模型训练评测与可视化、算法接口与自动化测试

教育经历

  • 香港科技大学(广州),人工智能博士研究生,2023.09 - 至今
    导师:刘李教授、曾宪国教授;研究方向为高效音视频学习、自动线索语识别、音视频伪造检测与大模型不确定性。
  • 澳大利亚国立大学,人工智能硕士,2018.07 - 2020.12
  • 电子科技大学,软件工程学士,2014.09 - 2018.06;优秀毕业生

科研与工作经历

香港科技大学(广州) · 博士生研究员 · 2023.05 - 至今

  • 研究面向听障者的多模态线索语评估、低资源自动线索语识别与个性化发音反馈。
  • 提出语义调制提示框架,在少样本音视频分类中同时处理过拟合、时序异步和模态失衡。
  • 构建 STF-ACSR 与 Cued-Agent,以多模态大模型、专用智能体和极简融合实现高效线索语识别。
  • 参与 PhyAVBench、音频伪造检测及上下文学习不确定性量化研究。

苏州 INSNEX 图像软件技术有限公司 · 深度学习算法工程师 · 2022.05 - 2023.05

  • 研发掩膜引导的缺陷图像生成与多任务缺陷检测算法,相关成果用于国家发明专利研发。

深圳市大数据研究院 · 算法工程师 · 2021.04 - 2022.05

  • 共同构建 WebUAV-3M:330 万帧、4500 个视频、223 个目标类别,并开发可扩展半自动标注流程。
  • 参与学习辅助线性规划求解器研发,负责 Python 交互接口、自动化测试与性能分析工具。

澳大利亚国立大学 / CSIRO · 硕士研究与研究助理 · 2019 - 2020

  • 研究统一风格迁移与统计风格分析;基于 PyVista 开发三维岩性可视化与数据处理管线。

代表项目

  • Cued-Agent:多智能体自动线索语识别,ACM Multimedia 2025 口头报告与 学生差旅奖。
  • STF-ACSR:基于多模态大模型手势建模的半免训练线索语识别,ICASSP 2026。
  • Semantic Modulated Prompting:参数高效的小样本音视频分类,IEEE/ACM TASLP 2026。
  • PhyAVBench:面向文本到音视频生成的物理规律评测基准,ACM Multimedia 2026 口头报告。
  • WebUAV-3M:百万级多模态无人机跟踪基准,IEEE TPAMI 2023,共同第一作者。

论文与奖项

完整论文列表见论文页面。主要奖项包括:

  • 2026:ICME ESDD2 环境音频伪造检测挑战赛第 4 名
  • 2025:ACM Multimedia 学生差旅奖;CVPR Workshop CV4Animals 杰出论文
  • 2024:ICSR 最佳学生论文提名
  • 2023:深圳市优秀科技学术论文
  • 2018:电子科技大学优秀毕业生