vix.ing · top · new · best · stats · spec

Mike Zheng Shou

  1. Ego4D: Around the World in 3,000 Hours of Egocentric Video
    2021/10/13 by Kristen Grauman, Grauman, Kristen, Andrew Westbury +166 · 207 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Participatory Visual Research Methods #Video Surveillance and Tracking Methods
  2. Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
    2024/08/22 by Jinheng Xie, Xie, Jinheng, Weijia Mao +17 · 168 citations
    Computer Science · #Speech and dialogue systems
  3. MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model
    2023/11/27 by Zhongcong Xu, Jianfeng Zhang, Xu, Zhongcong +14 · 1 voice · 50 citations
    Computer Science · #Advanced Vision and Imaging #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition #cs.CV #cs.GR
  4. Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives
    2023/11/30 by Kristen Grauman, Andrew Westbury, Grauman, Kristen +197 · 91 citations
    Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Anomaly Detection Techniques and Applications
  5. The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
    2024/11/15 by Siyuan Hu, Mingyu Ouyang, Hu, Siyuan +5 · 6 voices · 13 citations
    Mathematics · #Modeling, Simulation, and Optimization
  6. Paper2Video: Automatic Video Generation from Scientific Papers
    2025/10/06 by Zeyu Zhu, Kevin Qinghong Lin, Zhu, Zeyu +3 · 8 voices · 6 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Biomedical Text Mining and Ontologies #Mathematics, Computing, and Information Processing #Video Analysis and Summarization #cs.AI #cs.CL #cs.CV #cs.MA #cs.MM
  7. Hallucination of Multimodal Large Language Models: A Survey
    2024/04/29 by Zechen Bai, Bai, Zechen, Pichao Wang +11 · 68 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  8. MotionDirector: Motion Customization of Text-to-Video Diffusion Models
    2023/10/12 by Rui Zhao, Yuchao Gu, Zhao, Rui +13 · 1 voice · 22 citations
    Computer Science · #cs.CV
  9. Mix-of-Show: Decentralized Low-Rank Adaptation for Multi-Concept Customization of Diffusion Models
    2023/05/29 by Yuchao Gu, Xintao Wang, Gu, Yuchao +23 · 34 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #Image Retrieval and Classification Techniques
  10. BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion
    2023/07/20 by Jinheng Xie, Xie, Jinheng, Yuexiang Li +11 · 33 citations
    Computer Science · #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Image Processing and 3D Reconstruction
  11. ShowUI: One Vision-Language-Action Model for GUI Visual Agent
    2024/11/26 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Linjie Li +15 · 53 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Multimodal Machine Learning Applications
  12. Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
    2023/09/27 by David Junhao Zhang, Zhang, David Junhao, Jay Zhangjie Wu +13 · 29 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  13. VideoLLM-online: Online Video Large Language Model for Streaming Video
    2024/06/17 by Joya Chen, Chen, Joya, Zhaoyang Lv +17 · 36 citations
    Computer Science · Social Sciences · #Video Analysis and Summarization #Multimedia Communication and Technology
  14. Egocentric Video-Language Pretraining
    2022/06/03 by Kevin Qinghong Lin, Alex Jinpeng Wang, Lin, Kevin Qinghong +29 · 19 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Artificial Intelligence (cs.AI) #Cancer-related molecular mechanisms research #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  15. Show-o2: Improved Native Unified Multimodal Models
    2025/06/18 by Jinheng Xie, Xie, Jinheng, Zhenheng Yang +3 · 77 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech and dialogue systems
  16. VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence
    2023/12/04 by Yuchao Gu, Yipin Zhou, Gu, Yuchao +18 · 1 voice · 11 citations
    Computer Science · #Advanced Vision and Imaging #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization #cs.CV
  17. One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
    2024/09/29 by Zechen Bai, Bai, Zechen, Tong He +15 · 30 citations
    Arts and Humanities · Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Speech and dialogue systems #Subtitles and Audiovisual Media
  18. Long-Context Autoregressive Video Modeling with Next-Frame Prediction
    2025/03/25 by Yuchao Gu, Weijia Mao, Gu, Yuchao +3 · 41 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition
  19. Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models
    2025/03/03 by Jay Zhangjie Wu, Yuxuan Zhang, Wu, Jay Zhangjie +15 · 38 citations
    Medicine · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Imaging Techniques and Applications
  20. EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone
    2023/07/11 by Shraman Pramanick, Pramanick, Shraman, Yale Song +13 · 16 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  21. AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn
    2023/06/14 by Difei Gao, Gao, Difei, Lei Ji +10 · 14 citations
    Computer Science · #Natural Language Processing Techniques #Multimodal Machine Learning Applications #Topic Modeling
  22. All in One: Exploring Unified Video-Language Pre-training
    2022/03/14 by Alex Jinpeng Wang, Yixiao Ge, Wang, Alex Jinpeng +17 · 9 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Topic Modeling
  23. Generic Event Boundary Detection: A Benchmark for Event Segmentation
    2021/01/26 by Mike Zheng Shou, Stan Weixian Lei, Shou, Mike Zheng +7 · 7 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  24. DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation
    2023/11/30 by Bardienus P. Duisterhof, Zhao Mandi, Duisterhof, Bardienus P. +15 · 10 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Robotics (cs.RO)
  25. MIST: Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering
    2022/12/19 by Difei Gao, Gao, Difei, Luowei Zhou +9 · 8 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
  26. On Pursuit of Designing Multi-modal Transformer for Video Grounding
    2021/09/13 by Meng Cao, Long Chen, Cao, Meng +7 · 6 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Video Analysis and Summarization
  27. ViT-Lens: Towards Omni-modal Representations
    2023/11/27 by Weixian Lei, Yixiao Ge, Lei, Weixian +15 · 8 citations
    Computer Science · Neuroscience · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Hand Gesture Recognition Systems #Multimodal Machine Learning Applications #Tactile and Sensory Interactions
  28. Image Watermarks are Removable Using Controllable Regeneration from Clean Noise
    2024/10/07 by Yepeng Liu, Liu, Yepeng, Yiren Song +11 · 13 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Image and Object Detection Techniques #Image and Signal Denoising Methods #Medical Image Segmentation Techniques
  29. Faster Diffusion via Temporal Attention Decomposition
    2024/04/03 by Haozhe Liu, Liu, Haozhe, Wentian Zhang +12 · 9 citations
    Computer Science · Medicine · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Radiomics and Machine Learning in Medical Imaging #Topic Modeling
  30. ProcessPainter: Learn Painting Process from Sequence Data
    2024/06/10 by Yiren Song, Song, Yiren, Shijie Huang +13 · 11 citations
    Computer Science · #Image Processing and 3D Reconstruction #Handwritten Text Recognition Techniques
  31. A Large Cross-Modal Video Retrieval Dataset with Reading Comprehension
    2023/05/05 by Weijia Wu, Yuzhong Zhao, Wu, Weijia +11 · 6 citations
    Computer Science · #Multimodal Machine Learning Applications #Video Analysis and Summarization #Advanced Image and Video Retrieval Techniques
  32. X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion Model
    2023/12/04 by Lingmin Ran, Xiaodong Cun, Ran, Lingmin +13 · 1 voice · 2 citations
    #cs.CV #cs.AI #cs.MM
  33. PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
    2025/02/17 by Xinyu Zhang, Yuxuan Dong, Zhang, Xinyu +15 · 14 citations
    Computer Science · #AI-based Problem Solving and Planning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Intelligent Tutoring Systems and Adaptive Learning #Semantic Web and Ontologies
  34. ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation
    2023/12/20 by Difei Gao, Lei Ji, Gao, Difei +23 · 6 citations
    Computer Science · #AI in Service Interactions #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Topic Modeling
  35. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
    2025/02/03 by Yiren Song, Song, Yiren, Cheng Liu +3 · 13 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Speech Recognition and Synthesis
  36. Visual Perception by Large Language Model's Weights
    2024/05/30 by Feipeng Ma, Ma, Feipeng, Hongwei Xue +17 · 6 citations
    Computer Science · #Image Retrieval and Classification Techniques
  37. Unified Transformer Tracker for Object Tracking
    2022/03/29 by Fan Ma, Ma, Fan, Mike Zheng Shou +11 · 3 citations
    Computer Science · Engineering · #Video Surveillance and Tracking Methods #Gaze Tracking and Assistive Technology #Infrared Target Detection Methodologies
  38. Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval
    2022/06/05 by Xudong Lin, Lin, Xudong, Simran Tiwari +11 · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  39. DeVRF: Fast Deformable Voxel Radiance Fields for Dynamic Scenes
    2022/05/31 by Jiawei Liu, Liu, Jia-Wei, Yan‐Pei Cao +15 · 3 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  40. VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
    2025/07/23 by Jianxin Bi, Bi, Jianxin, Kevin Ma +7 · 12 citations
    Engineering · Neuroscience · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Robotics (cs.RO) #Tactile and Sensory Interactions #Teleoperation and Haptic Systems
  41. Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions
    2024/01/03 by David Junhao Zhang, Dongxu Li, Zhang, David Junhao +9 · 4 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  42. Making Vision Transformers Efficient from A Token Sparsification View
    2023/03/15 by Shuning Chang, Pichao Wang, Chang, Shuning +11 · 3 citations
    Computer Science · Engineering · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Image Processing Techniques and Applications #Machine Learning (cs.LG)
  43. WMAdapter: Adding WaterMark Control to Latent Diffusion Models
    2024/06/12 by Hai Ci, Ci, Hai, Yiren Song +7 · 5 citations
    Earth and Planetary Sciences · Environmental Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Hydrological Forecasting Using AI #Image and Video Processing (eess.IV) #Meteorological Phenomena and Simulations #Soil Moisture and Remote Sensing #electronic engineering #information engineering
  44. DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing
    2023/10/16 by Jiawei Liu, Liu, Jia-Wei, Yan‐Pei Cao +15 · 3 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Vision and Imaging #Video Analysis and Summarization
  45. COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
    2024/01/01 by Alex Jinpeng Wang, Linjie Li, Wang, Alex Jinpeng +13 · 3 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
  46. MAG-Edit: Localized Image Editing in Complex Scenarios via Mask-Based Attention-Adjusted Guidance
    2023/12/18 by Qi Mao, Mao, Qi, Lan Chen +7 · 3 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  47. MLLMs-Augmented Visual-Language Representation Learning
    2023/11/30 by Yanqing Liu, Kai Wang, Liu, Yanqing +13 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  48. VideoGUI: A Benchmark for GUI Automation from Instructional Videos
    2024/06/14 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Linjie Li +13 · 5 citations
    Computer Science · #Video Analysis and Summarization
  49. PV3D: A 3D Generative Model for Portrait Video Generation
    2022/12/13 by Zhongcong Xu, Xu, Zhongcong, Jianfeng Zhang +11 · 2 citations
    Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  50. Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
    2024/06/04 by Alex Jinpeng Wang, Linjie Li, Wang, Alex Jinpeng +9 · 4 citations
    Computer Science · #Multimodal Machine Learning Applications #Open Education and E-Learning #Speech and dialogue systems
  51. Position-guided Text Prompt for Vision-Language Pre-training
    2022/12/19 by Alex Jinpeng Wang, Pan Zhou, Wang, Alex Jinpeng +5 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  52. Label-Efficient Online Continual Object Detection in Streaming Video
    2022/06/01 by Jay Zhangjie Wu, Wu, Jay Zhangjie, David Junhao Zhang +7 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Image Enhancement Techniques #Multimodal Machine Learning Applications
  53. UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
    2025/05/29 by Weijia Mao, Zhenheng Yang, Mao, Weijia +3 · 8 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Topic Modeling
  54. Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis
    2022/12/06 by Yuchao Gu, Xintao Wang, Gu, Yuchao +9 · 2 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Image and Video Retrieval Techniques #Image Retrieval and Classification Techniques
  55. Unsupervised Open-Vocabulary Object Localization in Videos
    2023/09/18 by Ke Fan, Zechen Bai, Fan, Ke +25 · 2 citations
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  56. OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
    2025/05/24 by Yiren Song, Song, Yiren, Cheng Liu +3 · 7 citations
    Computer Science · Psychology · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Second Language Acquisition and Learning #Text Readability and Simplification
  57. Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
    2023/12/11 by Henry Hengyuan Zhao, Pan Zhou, Zhao, Henry Hengyuan +3 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
  58. DOTA: Distributional Test-Time Adaptation of Vision-Language Models
    2024/09/28 by Zongbo Han, Jialong Yang, Han, Zongbo +10 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Machine Learning (cs.LG) #Multimodal Machine Learning Applications
  59. Parrot Captions Teach CLIP to Spot Text
    2023/12/21 by Yiqi Lin, Conghui He, Lin, Yiqi +9 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  60. MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning
    2021/11/24 by David Junhao Zhang, Kunchang Li, Zhang, David Junhao +13 · 1 citation
    Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning
  61. AssistQ: Affordance-centric Question-driven Task Completion for Egocentric Assistant
    2022/03/08 by Benita Wong, Wong, Benita, Joya Chen +11 · 1 citation
    Computer Science · Medicine · #AI in Service Interactions #Artificial Intelligence in Healthcare and Education #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  62. GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval
    2022/04/01 by Yuxuan Wang, Difei Gao, Wang, Yuxuan +9 · 1 citation
    Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Machine Learning in Healthcare
  63. Multi-Modal Generative Embedding Model
    2024/05/29 by Feipeng Ma, Ma, Feipeng, Hongwei Xue +17 · 2 citations
    Computer Science · #Advanced Statistical Modeling Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  64. macOSWorld: A Multilingual Interactive Benchmark for GUI Agents
    2025/06/04 by Pei Yang, Hai Ci, Yang, Pei +3 · 5 citations
    Computer Science · #Security and Verification in Computing #Advanced Malware Detection Techniques #Web Application Security Vulnerabilities
  65. Egocentric Video-Language Pretraining @ Ego4D Challenge 2022
    2022/07/04 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Alex Jinpeng Wang +29 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  66. Skinned Motion Retargeting with Dense Geometric Interaction Perception
    2024/10/28 by Zijie Ye, Jiawei Liu, Ye, Zijie +7 · 2 citations
    Computer Science · Engineering · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human Motion and Animation #Human Pose and Action Recognition
  67. Apprenticeship-Inspired Elegance: Synergistic Knowledge Distillation Empowers Spiking Neural Networks for Efficient Single-Eye Emotion Recognition
    2024/06/20 by Yang Wang, Wang, Yang, Haiyang Mei +13 · 2 citations
    Engineering · Neuroscience · #Advanced Memory and Neural Computing #Computer Vision and Pattern Recognition (cs.CV) #EEG and Brain-Computer Interfaces #FOS: Computer and information sciences #Neural and Evolutionary Computing (cs.NE) #Neural dynamics and brain function
  68. Factorized Visual Tokenization and Generation
    2024/11/25 by Zechen Bai, Bai, Zechen, Jianxiong Gao +11 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques
  69. SparseFormer: Sparse Visual Recognition via Limited Latent Tokens
    2023/04/07 by Ziteng Gao, Tong Zhan, Gao, Ziteng +5 · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Visual Attention and Saliency Detection
  70. Revisiting Vision Transformer from the View of Path Ensemble
    2023/08/12 by Shuning Chang, Pichao Wang, Chang, Shuning +7 · 1 citation
    Computer Science · Engineering · #CCD and CMOS Imaging Sensors #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Industrial Vision Systems and Defect Detection #Visual Attention and Saliency Detection
  71. XAGen: 3D Expressive Human Avatars Generation
    2023/11/22 by Zhongcong Xu, Xu, Zhongcong, Jianfeng Zhang +7 · 1 citation
    Computer Science · #Face recognition and analysis #Human Pose and Action Recognition #Generative Adversarial Networks and Image Synthesis
  72. ShowRoom3D: Text to High-Quality 3D Room Generation Using 3D Priors
    2023/12/20 by Weijia Mao, Yan‐Pei Cao, Mao, Weijia +7 · 1 citation
    Computer Science · Earth and Planetary Sciences · #Advanced Vision and Imaging #3D Surveying and Cultural Heritage #Advanced Image and Video Retrieval Techniques
  73. Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
    2024/02/02 by Zongbo Han, Zechen Bai, Han, Zongbo +9 · 1 citation
    Medicine · Neuroscience · #Epilepsy research and treatment #Hallucinations in medical conditions #Schizophrenia research and treatment
  74. VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
    2025/03/12 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Mike Zheng Shou +1 · 2 citations
    Computer Science · #Video Analysis and Summarization #Topic Modeling #Multimodal Machine Learning Applications
  75. Object-centric Learning with Cyclic Walks between Parts and Whole
    2023/02/16 by Ziyu Wang, Wang, Ziyu, Mike Zheng Shou +3 · 1 citation
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  76. TPDiff: Temporal Pyramid Video Diffusion Model
    2025/03/12 by Lingmin Ran, Mike Zheng Shou, Ran, Lingmin +1 · 1 citation
    Computer Science · #Image and Video Quality Assessment #Image and Signal Denoising Methods #Advanced Data Compression Techniques
  77. Steganalysis on Digital Watermarking: Is Your Defense Truly Impervious?
    2024/06/13 by Pei Yang, Yang, Pei, Hai Ci +5 · 1 citation
    Computer Science · #Advanced Steganography and Watermarking Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Internet Traffic Analysis and Secure E-voting
  78. In-Context Defense in Computer Agents: An Empirical Study
    2025/03/12 by Pei Yang, Hai Ci, Yang, Pei +3 · 1 citation
    Computer Science · #Advanced Malware Detection Techniques #Network Security and Intrusion Detection
  79. GUI Action Narrator: Where and When Did That Action Take Place?
    2024/06/19 by Qinchen Wu, Difei Gao, Wu, Qinchen +15 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Persona Design and Applications
  80. Personalized Vision via Visual In-Context Learning
    2025/09/29 by Yuxin Jiang, Yuchao Gu, Jiang, Yuxin +7 · 7 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Image Retrieval and Classification Techniques
  81. H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
    2025/12/10 by Hai Ci, Ci, Hai, Xiaokang Liu +6 · 2 citations
    Engineering · Computer Science · Psychology · #Robot Manipulation and Learning #Human Pose and Action Recognition #Social Robot Interaction and HRI
  82. OmniPSD: Layered PSD Generation with Diffusion Transformer
    2025/12/10 by Cheng Liu, Liu, Cheng, Yiren Song +5 · 1 citation
    Computer Science · Arts and Humanities · #Generative Adversarial Networks and Image Synthesis #Computer Graphics and Visualization Techniques #Digital Humanities and Scholarship
  83. LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
    2025/04/22 by Joya Chen, Chen, Joya, Ziyun Zeng +9 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Speech Recognition and Synthesis #Video Analysis and Summarization
  84. VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
    2024/12/16 by Muhammet Furkan Ilaslan, Ilaslan, Muhammet Furkan, Ali Köksal +9 · 1 citation
    Computer Science · #Natural Language Processing Techniques #Speech and dialogue systems #AI-based Problem Solving and Planning