vix.ing · top · new · best · stats · spec

Chenliang Xu

  1. Deep Cross-Modal Audio-Visual Generation
    2017/04/26 by Lele Chen, Chen, Lele, Sudhanshu Srivastava +5 · 1 voice · 4 citations
    Computer Science · #Music and Audio Processing #Music Technology and Sound Studies #Generative Adversarial Networks and Image Synthesis
  2. Learning to Answer Questions in Dynamic Audio-Visual Scenarios
    2022/03/26 by Guangyao Li, Li, Guangyao, Yake Wei +9 · 33 citations
    Computer Science · #Multimodal Machine Learning Applications #Speech and dialogue systems #Video Analysis and Summarization
  3. Video Understanding with Large Language Models: A Survey
    2023/12/29 by Tang, Yolo Y., Jing Bi, Bi, Jing +34 · 40 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  4. TDAN: Temporally Deformable Alignment Network for Video Super-Resolution
    2018/12/07 by Yapeng Tian, Yulun Zhang, Tian, Yapeng +5 · 12 citations
    Computer Science · #Advanced Image Processing Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Enhancement Techniques
  5. Lip Movements Generation at a Glance
    2018/03/28 by Lele Chen, Chen, Lele, Zhiheng Li +7 · 11 citations
    Computer Science · #Speech and Audio Processing #Face recognition and analysis #Music and Audio Processing
  6. AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene Synthesis
    2023/02/04 by Susan Liang, Chao Huang, Liang, Susan +7 · 12 citations
    Computer Science · #Advanced Vision and Imaging #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Generative Adversarial Networks and Image Synthesis #Graphics (cs.GR) #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  7. Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing
    2020/07/21 by Yapeng Tian, Dingzeyu Li, Tian, Yapeng +3 · 8 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #Video Analysis and Summarization #electronic engineering #information engineering
  8. What comprises a good talking-head video generation?: A Survey and Benchmark
    2020/05/07 by Lele Chen, Chen, Lele, Guofeng Cui +7 · 7 citations
    Computer Science · #Face recognition and analysis #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization
  9. Egocentric Audio-Visual Object Localization
    2023/03/23 by Chao Huang, Huang, Chao, Yapeng Tian +5 · 7 citations
    Computer Science · Neuroscience · Psychology · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Hearing Loss and Rehabilitation #Multimedia (cs.MM) #Multisensory perception and integration #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  10. Transformer-empowered Multi-scale Contextual Matching and Aggregation for Multi-contrast MRI Super-resolution
    2022/03/26 by Guangyuan Li, Li, Guangyuan, Jun Lv +11 · 5 citations
    Computer Science · Engineering · Medicine · #Advanced Image Processing Techniques #Medical Imaging and Analysis #Medical Imaging Techniques and Applications
  11. Neural Acoustic Context Field: Rendering Realistic Room Impulse Response With Neural Fields
    2023/09/27 by Susan Liang, Liang, Susan, Chao Huang +7 · 6 citations
    Computer Science · Neuroscience · #Speech and Audio Processing #Music and Audio Processing #Hearing Loss and Rehabilitation
  12. Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
    2024/12/24 by Jing Bi, Bi, Jing, Guo, Junjia +7 · 10 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  13. Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See
    2024/10/08 by Phu Pham, Zhang, Zeliang, Wentian Zhao +13 · 8 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech and dialogue systems #Topic Modeling
  14. Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)
    2025/04/04 by Jing Bi, Susan Liang, Bi, Jing +31 · 14 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Speech and dialogue systems #Topic Modeling
  15. StyleT2I: Toward Compositional and High-Fidelity Text-to-Image Synthesis
    2022/03/29 by Zhiheng Li, Li, Zhiheng, Martin Renqiang Min +5 · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face recognition and analysis #Generative Adversarial Networks and Image Synthesis
  16. Learning to Transform Dynamically for Better Adversarial Transferability
    2024/05/23 by Rongyi Zhu, Zhu, Rongyi, Zeliang Zhang +7 · 5 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  17. MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
    2024/10/13 by Hang Hua, Yunlong Tang, Hua, Hang +13 · 7 citations
    Arts and Humanities · #Media, Religion, Digital Communication
  18. Tri2-plane: Thinking Head Avatar via Feature Pyramid
    2024/01/17 by Luchuan Song, Song, Luchuan, Pinxin Liu +6 · 4 citations
    Computer Science · Medicine · #Face recognition and analysis #Facial Nerve Paralysis Treatment and Research #Facial Rejuvenation and Surgery Techniques
  19. Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
    2024/07/12 by Zeliang Zhang, Zhang, Zeliang, Xiaodong Liu +7 · 5 citations
    Computer Science · #Data Stream Mining Techniques #Mobile Crowdsensing and Crowdsourcing
  20. Adaptive Super Resolution For One-Shot Talking-Head Generation
    2024/03/23 by Luchuan Song, Song, Luchuan, Pinxin Liu +5 · 4 citations
    Computer Science · Engineering · #Advanced Optical Imaging Technologies #Advanced Vision and Imaging #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image Processing Techniques and Applications #Image and Video Processing (eess.IV) #electronic engineering #information engineering
  21. Learning to Generate Scene Graph from Natural Language Supervision
    2021/09/06 by Yiwu Zhong, Zhong, Yiwu, Jing Shi +7 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Multimodal Machine Learning Applications
  22. Generative AI for Cel-Animation: A Survey
    2025/01/08 by Junjia Guo, Tang, Yolo Y., Guo, Junjia +29 · 6 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation #Human-Computer Interaction (cs.HC)
  23. OSCaR: Object State Captioning and State Change Representation
    2024/02/27 by Nguyen Nguyen, Nguyen, Nguyen, Jing Bi +9 · 3 citations
    Computer Science · Business, Management and Accounting · #Model-Driven Software Engineering Techniques #Advanced Software Engineering Methodologies #Business Process Modeling and Analysis
  24. Procedure Planning in Instructional Videos via Contextual Modeling and Model-based Policy Learning
    2021/10/05 by Jing Bi, Jiebo Luo, Bi, Jing +3 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  25. VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
    2024/11/17 by Yunlong Tang, Tang, Yolo Y., Junjia Guo +21 · 5 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Multimodal Machine Learning Applications
  26. Watch What You Just Said: Image Captioning with Text-Conditional Attention
    2016/06/15 by Luowei Zhou, Chenliang Xu, Zhou, Luowei +5 · 4 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Video Analysis and Summarization
  27. CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
    2024/08/21 by Yunlong Tang, Tang, Yolo Yunlong, Gen Zhan +7 · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Visual Attention and Saliency Detection
  28. Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation
    2024/10/09 by Susan Liang, Chao Huang, Liang, Susan +7 · 4 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Video Analysis and Summarization
  29. CalibQuant: 1-Bit KV Cache Quantization for Multimodal LLMs
    2025/02/15 by Insu Han, Han, Insu, Zeliang Zhang +19 · 3 voices · 2 citations
    #cs.CV
  30. One Forward is Enough for Neural Network Training via Likelihood Ratio Method
    2023/05/15 by Jinyang Jiang, Jiang, Jinyang, Zeliang Zhang +7 · 1 voice
    Computer Science · #Advanced Neural Network Applications #Machine Learning and ELM #Neural Networks and Applications #cs.LG #cs.NE #math.OC
  31. Learning by Planning: Language-Guided Global Image Editing
    2021/06/24 by Jing Shi, Shi, Jing, Ning Xu +9 · 1 citation
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
  32. TricorNet: A Hybrid Temporal Convolutional and Recurrent Network for Video Action Segmentation
    2017/05/22 by Li Ding, Chenliang Xu, Ding, Li +1 · 1 citation
    Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  33. Modeling and Driving Human Body Soundfields through Acoustic Primitives
    2024/07/18 by Dejan Marković, Huang, Chao, Chenliang Xu +4 · 2 citations
    Engineering · Health Professions · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Noise Effects and Management #Sound (cs.SD) #Vehicle Noise and Vibration Control #electronic engineering #information engineering
  34. Separating Invisible Sounds Toward Universal Audiovisual Scene-Aware Sound Separation
    2023/10/18 by Yiyang Su, Ali Vosoughi, Su, Yiyang +7 · 1 citation
    Computer Science · Engineering · Neuroscience · #Advanced Adaptive Filtering Techniques #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Hearing Loss and Rehabilitation #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  35. Intentional Gesture: Deliver Your Intentions with Gestures for Speech
    2025/05/21 by Pinxin Liu, Haiyang Liu, Liu, Pinxin +7 · 3 citations
    Arts and Humanities · Psychology · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Hearing Impairment and Communication #Language, Discourse, Communication Strategies #Language, Metaphor, and Cognition
  36. Scaling Concept With Text-Guided Diffusion Models
    2024/10/31 by Chao Huang, Susan Liang, Huang, Chao +8 · 2 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications #Music Technology and Sound Studies
  37. Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
    2024/09/23 by Zeliang Zhang, Zhuo Liu, Zhang, Zeliang +5 · 1 citation
    Engineering · Physics and Astronomy · #Astronomical Observations and Instrumentation #Astronomy and Astrophysical Research #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #History and Developments in Astronomy
  38. PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
    2025/10/25 by Ali Vosoughi, Yongyi Zang, Vosoughi, Ali +9 · 1 voice · 1 citation
    #cs.SD #cs.AI
  39. AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents
    2026/07/16 by Susan Liang, Chao Huang, Filippos Bellos +3
    #cs.CV