|
2024 Conference Publication Benchmarking audio visual segmentation for long-untrimmed videosLiu, Chen, Li, Peike Patrick, Yu, Qingtao, Sheng, Hongwei, Wang, Dadong, Li, Lincheng and Yu, Xin (2024). Benchmarking audio visual segmentation for long-untrimmed videos. 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, WA, United States, 16-22 June 2024. Washington, DC, United States: IEEE Computer Society. doi: 10.1109/CVPR52733.2024.02143 |
|
2024 Conference Publication Text-guided 3D face synthesis - from generation to editingWu, Yunjie, Meng, Yapeng, Hu, Zhipeng, Li, Lincheng, Wu, Haoqian, Zhou, Kun, Xu, Weiwei and Yu, Xin (2024). Text-guided 3D face synthesis - from generation to editing. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, WA, United States, 16-22 June 2024. Washington, DC, United States: IEEE Computer Society. doi: 10.1109/CVPR52733.2024.00126 |
|
2024 Conference Publication MM-WLAuslan: multi-view multi-modal word-level Australian Sign Language recognition datasetShen, Xin, Du, Heming, Sheng, Hongwei, Wang, Shuyun, Chen, Hui, Chen, Huiqiang, Wu, Zhuojie, Du, Xiaobiao, Ying, Jiaying, Lu, Ruihan, Xu, Qingzheng and Yu, Xin (2024). MM-WLAuslan: multi-view multi-modal word-level Australian Sign Language recognition dataset. 38th Annual Conference on Neural Information Processing Systems (NeurIPS 2024), Vancouver, BC, Canada, 10-15 December 2024. San Mateo, CA, United States: Morgan Kaufmann Publishers. doi: 10.52202/079017-2227 |
|
2024 Journal Article StyleTalk++: A unified framework for controlling the speaking styles of talking headsWang, Suzhen, Ma, Yifeng, Ding, Yu, Hu, Zhipeng, Fan, Changjie, Lv, Tangjie, Deng, Zhidong and Yu, Xin (2024). StyleTalk++: A unified framework for controlling the speaking styles of talking heads. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46 (6), 4331-4347. doi: 10.1109/tpami.2024.3357808 |
|
2024 Conference Publication An empirical analysis on spatial reasoning capabilities of large multimodal modelsShiri, Fatemeh, Guo, Xiao-Yu, Far, Mona Golestan, Yu, Xin, Haffari, Gholamreza and Li, Yuan-Fang (2024). An empirical analysis on spatial reasoning capabilities of large multimodal models. 2024 Conference on Empirical Methods in Natural Language Processing, Miami, FL, United States, 12-16 November 2024. Kerrville, TX, United States: Association for Computational Linguistics (ACL). doi: 10.18653/v1/2024.emnlp-main.1195 |
|
2024 Journal Article CMGNet: Collaborative multi-modal graph network for video captioningRao, Qi, Yu, Xin, Li, Guang and Zhu, Linchao (2024). CMGNet: Collaborative multi-modal graph network for video captioning. Computer Vision and Image Understanding, 238 103864, 1-10. doi: 10.1016/j.cviu.2023.103864 |
|
2024 Journal Article MarkerNet: A divide-and-conquer solution to motion capture solving from raw markersHu, Zhipeng, Tang, Jilin, Li, Lincheng, Hou, Jie, Xin, Haoran, Yu, Xin and Bu, Jiajun (2024). MarkerNet: A divide-and-conquer solution to motion capture solving from raw markers. Computer Animation and Virtual Worlds, 35 (1) e2228, 1-19. doi: 10.1002/cav.2228 |
|
2024 Journal Article EmotionGesture: audio-driven diverse emotional co-speech 3D gesture generationQi, Xingqun, Liu, Chen, Li, Lincheng, Hou, Jie, Xin, Haoran and Yu, Xin (2024). EmotionGesture: audio-driven diverse emotional co-speech 3D gesture generation. IEEE Transactions on Multimedia, 26, 10420-10430. doi: 10.1109/tmm.2024.3407692 |
|
2024 Conference Publication EfficientDreamer: high-fidelity and stable 3D creation via orthogonal-view diffusion priorsHu, Zhipeng, Zhao, Minda, Zhao, Chaoyi, Liang, Xinyue, Li, Lincheng, Zhao, Zeng, Fan, Changjie, Zhou, Xiaowei and Yu, Xin (2024). EfficientDreamer: high-fidelity and stable 3D creation via orthogonal-view diffusion priors. 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, WA, United States, 16-22 June 2024. Washington, DC, United States: IEEE Computer Society. doi: 10.1109/CVPR52733.2024.00473 |
|
2023 Journal Article Calligraphy Font generation via explicitly modeling location-aware glyph component deformationsZhao, Minda, Qi, Xingqun, Hu, Zhipeng, Li, Lincheng, Zhang, Yongqiang, Huang, Zi and Yu, Xin (2023). Calligraphy Font generation via explicitly modeling location-aware glyph component deformations. IEEE Transactions on Multimedia, 26, 5939-5950. doi: 10.1109/tmm.2023.3342690 |
|
2023 Journal Article DMMG: Dual min-max games for self-supervised skeleton-based action recognitionGuan, Shannan, Yu, Xin, Huang, Wei, Fang, Gengfa and Lu, Haiyan (2023). DMMG: Dual min-max games for self-supervised skeleton-based action recognition. IEEE Transactions on Image Processing, 33, 395-407. doi: 10.1109/tip.2023.3338410 |
|
2023 Conference Publication Learning efficient unsupervised satellite image-based building damage detectionZhang, Yiyun, Wang, Zijian, Luo, Yadan, Yu, Xin and Huang, Zi (2023). Learning efficient unsupervised satellite image-based building damage detection. 2023 IEEE International Conference on Data Mining (ICDM), Shanghai, China, 1-4 December 2023. Piscataway, NJ, United States: IEEE. doi: 10.1109/icdm58522.2023.00206 |
|
2023 Conference Publication A new perspective of weakly supervised 3D instance segmentation via bounding boxesYu, Qingtao, Du, Heming and Yu, Xin (2023). A new perspective of weakly supervised 3D instance segmentation via bounding boxes. 36th Australasian Joint Conference on Artificial Intelligence, AJCAI 2023, Brisbane, QLD Australia, 28 November –1 December 2023. Singapore: Springer. doi: 10.1007/978-981-99-8388-9_9 |
|
2023 Conference Publication Toward a unified framework for RGB and RGB-D visual navigationDu, Heming, Huang, Zi, Chapman, Scott and Yu, Xin (2023). Toward a unified framework for RGB and RGB-D visual navigation. 36th Australasian Joint Conference on Artificial Intelligence, AJCAI 2023, Brisbane, QLD Australia, 28 November –1 December 2023. Singapore: Springer. doi: 10.1007/978-981-99-8391-9_29 |
|
2023 Conference Publication Context-based masking for spontaneous venous pulsations detectionSheng, Hongwei, Yu, Xin, Li, Xue and Golzan, Mojtaba (2023). Context-based masking for spontaneous venous pulsations detection. 36th Australasian Joint Conference on Artificial Intelligence, AJCAI 2023, Brisbane, QLD Australia, 28 November –1 December 2023. Singapore: Springer. doi: 10.1007/978-981-99-8388-9_42 |
|
2023 Conference Publication Towards reliable and efficient vegetation segmentation for Australian wheat data analysisYuan, Bowen, Wang, Zijian and Yu, Xin (2023). Towards reliable and efficient vegetation segmentation for Australian wheat data analysis. 34th Australasian Database Conference (ADC), Melbourne, NSW Australia, 1-3 November 2023. Cham, Switzerland: Springer Cham. doi: 10.1007/978-3-031-47843-7_9 |
|
2023 Conference Publication Audio-visual segmentation by exploring cross-modal mutual semanticsLiu, Chen, Li, Peike Patrick, Qi, Xingqun, Zhang, Hu, Li, Lincheng, Wang, Dadong and Yu, Xin (2023). Audio-visual segmentation by exploring cross-modal mutual semantics. MM '23: The 31st ACM International Conference on Multimedia, Ottawa, ON Canada, 29 October - 3 November 2023. New York, NY United States: Association for Computing Machinery. doi: 10.1145/3581783.3612373 |
|
2023 Conference Publication DyGait: exploiting dynamic representations for high-performance gait recognitionWang, Ming, Guo, Xianda, Lin, Beibei, Yang, Tian, Zhu, Zheng, Li, Lincheng, Zhang, Shunli and Yu, Xin (2023). DyGait: exploiting dynamic representations for high-performance gait recognition. IEEE/CVF International Conference on Computer Vision (ICCV), Paris, France, 2-6 October 2023. Piscataway, NJ, United States: Institute of Electrical and Electronics Engineers. doi: 10.1109/iccv51070.2023.01235 |
|
2023 Conference Publication Gait recognition with mask-based regularizationShen, Chuanfu, Lin, Beibei, Zhang, Shunli, Yu, Xin, Huang, George Q. and Yu, Shiqi (2023). Gait recognition with mask-based regularization. IEEE International Joint Conference on Biometrics (IJCB), Ljubljana, Slovenia, 25-28 September 2023. New York, NY, United States: IEEE. doi: 10.1109/ijcb57857.2023.10449112 |
|
2023 Journal Article Deep idempotent network for efficient single image blind deblurringMao, Yuxin, Wan, Zhexiong, Dai, Yuchao and Yu, Xin (2023). Deep idempotent network for efficient single image blind deblurring. IEEE Transactions on Circuits and Systems for Video Technology, 33 (1), 172-185. doi: 10.1109/tcsvt.2022.3202361 |