Mike Zheng Shou
- Ego4D: Around the World in 3,000 Hours of Egocentric Video
2021/10/13 by Kristen Grauman, Grauman, Kristen, Andrew Westbury +166 · 207 citations
Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Participatory Visual Research Methods #Video Surveillance and Tracking Methods
- Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
2024/08/22 by Jinheng Xie, Xie, Jinheng, Weijia Mao +17 · 168 citations
Computer Science · #Speech and dialogue systems
- MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model
2023/11/27 by Zhongcong Xu, Jianfeng Zhang, Xu, Zhongcong +14 · 1 voice · 50 citations
Computer Science · #Advanced Vision and Imaging #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition #cs.CV #cs.GR
- Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives
2023/11/30 by Kristen Grauman, Andrew Westbury, Grauman, Kristen +197 · 91 citations
Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Anomaly Detection Techniques and Applications
- The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
2024/11/15 by Siyuan Hu, Mingyu Ouyang, Hu, Siyuan +5 · 6 voices · 13 citations
Mathematics · #Modeling, Simulation, and Optimization
- Paper2Video: Automatic Video Generation from Scientific Papers
2025/10/06 by Zeyu Zhu, Kevin Qinghong Lin, Zhu, Zeyu +3 · 8 voices · 6 citations
Biochemistry, Genetics and Molecular Biology · Computer Science · #Biomedical Text Mining and Ontologies #Mathematics, Computing, and Information Processing #Video Analysis and Summarization #cs.AI #cs.CL #cs.CV #cs.MA #cs.MM
- Hallucination of Multimodal Large Language Models: A Survey
2024/04/29 by Zechen Bai, Bai, Zechen, Pichao Wang +11 · 68 citations
Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- MotionDirector: Motion Customization of Text-to-Video Diffusion Models
2023/10/12 by Rui Zhao, Yuchao Gu, Zhao, Rui +13 · 1 voice · 22 citations
Computer Science · #cs.CV
- Mix-of-Show: Decentralized Low-Rank Adaptation for Multi-Concept Customization of Diffusion Models
2023/05/29 by Yuchao Gu, Xintao Wang, Gu, Yuchao +23 · 34 citations
Computer Science · #Domain Adaptation and Few-Shot Learning #Image Retrieval and Classification Techniques
- BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion
2023/07/20 by Jinheng Xie, Xie, Jinheng, Yuexiang Li +11 · 33 citations
Computer Science · #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Image Processing and 3D Reconstruction
- ShowUI: One Vision-Language-Action Model for GUI Visual Agent
2024/11/26 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Linjie Li +15 · 53 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Multimodal Machine Learning Applications
- Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
2023/09/27 by David Junhao Zhang, Zhang, David Junhao, Jay Zhangjie Wu +13 · 29 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
- VideoLLM-online: Online Video Large Language Model for Streaming Video
2024/06/17 by Joya Chen, Chen, Joya, Zhaoyang Lv +17 · 36 citations
Computer Science · Social Sciences · #Video Analysis and Summarization #Multimedia Communication and Technology
- Egocentric Video-Language Pretraining
2022/06/03 by Kevin Qinghong Lin, Alex Jinpeng Wang, Lin, Kevin Qinghong +29 · 19 citations
Biochemistry, Genetics and Molecular Biology · Computer Science · #Artificial Intelligence (cs.AI) #Cancer-related molecular mechanisms research #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
- Show-o2: Improved Native Unified Multimodal Models
2025/06/18 by Jinheng Xie, Xie, Jinheng, Zhenheng Yang +3 · 77 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech and dialogue systems
- VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence
2023/12/04 by Yuchao Gu, Yipin Zhou, Gu, Yuchao +18 · 1 voice · 11 citations
Computer Science · #Advanced Vision and Imaging #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization #cs.CV
- One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
2024/09/29 by Zechen Bai, Bai, Zechen, Tong He +15 · 30 citations
Arts and Humanities · Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Speech and dialogue systems #Subtitles and Audiovisual Media
- Long-Context Autoregressive Video Modeling with Next-Frame Prediction
2025/03/25 by Yuchao Gu, Weijia Mao, Gu, Yuchao +3 · 41 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition
- Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models
2025/03/03 by Jay Zhangjie Wu, Yuxuan Zhang, Wu, Jay Zhangjie +15 · 38 citations
Medicine · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Imaging Techniques and Applications
- EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone
2023/07/11 by Shraman Pramanick, Pramanick, Shraman, Yale Song +13 · 16 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
- AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn
2023/06/14 by Difei Gao, Gao, Difei, Lei Ji +10 · 14 citations
Computer Science · #Natural Language Processing Techniques #Multimodal Machine Learning Applications #Topic Modeling
- All in One: Exploring Unified Video-Language Pre-training
2022/03/14 by Alex Jinpeng Wang, Yixiao Ge, Wang, Alex Jinpeng +17 · 9 citations
Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Topic Modeling
- Generic Event Boundary Detection: A Benchmark for Event Segmentation
2021/01/26 by Mike Zheng Shou, Stan Weixian Lei, Shou, Mike Zheng +7 · 7 citations
Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
- DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation
2023/11/30 by Bardienus P. Duisterhof, Zhao Mandi, Duisterhof, Bardienus P. +15 · 10 citations
Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Robotics (cs.RO)
- MIST: Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering
2022/12/19 by Difei Gao, Gao, Difei, Luowei Zhou +9 · 8 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
- On Pursuit of Designing Multi-modal Transformer for Video Grounding
2021/09/13 by Meng Cao, Long Chen, Cao, Meng +7 · 6 citations
Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Video Analysis and Summarization
- ViT-Lens: Towards Omni-modal Representations
2023/11/27 by Weixian Lei, Yixiao Ge, Lei, Weixian +15 · 8 citations
Computer Science · Neuroscience · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Hand Gesture Recognition Systems #Multimodal Machine Learning Applications #Tactile and Sensory Interactions
- Image Watermarks are Removable Using Controllable Regeneration from Clean Noise
2024/10/07 by Yepeng Liu, Liu, Yepeng, Yiren Song +11 · 13 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Image and Object Detection Techniques #Image and Signal Denoising Methods #Medical Image Segmentation Techniques
- Faster Diffusion via Temporal Attention Decomposition
2024/04/03 by Haozhe Liu, Liu, Haozhe, Wentian Zhang +12 · 9 citations
Computer Science · Medicine · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Radiomics and Machine Learning in Medical Imaging #Topic Modeling
- ProcessPainter: Learn Painting Process from Sequence Data
2024/06/10 by Yiren Song, Song, Yiren, Shijie Huang +13 · 11 citations
Computer Science · #Image Processing and 3D Reconstruction #Handwritten Text Recognition Techniques
- A Large Cross-Modal Video Retrieval Dataset with Reading Comprehension
2023/05/05 by Weijia Wu, Yuzhong Zhao, Wu, Weijia +11 · 6 citations
Computer Science · #Multimodal Machine Learning Applications #Video Analysis and Summarization #Advanced Image and Video Retrieval Techniques
- X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion Model
2023/12/04 by Lingmin Ran, Xiaodong Cun, Ran, Lingmin +13 · 1 voice · 2 citations
#cs.CV #cs.AI #cs.MM
- PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
2025/02/17 by Xinyu Zhang, Yuxuan Dong, Zhang, Xinyu +15 · 14 citations
Computer Science · #AI-based Problem Solving and Planning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Intelligent Tutoring Systems and Adaptive Learning #Semantic Web and Ontologies
- ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation
2023/12/20 by Difei Gao, Lei Ji, Gao, Difei +23 · 6 citations
Computer Science · #AI in Service Interactions #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Topic Modeling
- MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
2025/02/03 by Yiren Song, Song, Yiren, Cheng Liu +3 · 13 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Speech Recognition and Synthesis
- Visual Perception by Large Language Model's Weights
2024/05/30 by Feipeng Ma, Ma, Feipeng, Hongwei Xue +17 · 6 citations
Computer Science · #Image Retrieval and Classification Techniques
- Unified Transformer Tracker for Object Tracking
2022/03/29 by Fan Ma, Ma, Fan, Mike Zheng Shou +11 · 3 citations
Computer Science · Engineering · #Video Surveillance and Tracking Methods #Gaze Tracking and Assistive Technology #Infrared Target Detection Methodologies
- Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval
2022/06/05 by Xudong Lin, Lin, Xudong, Simran Tiwari +11 · 3 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- DeVRF: Fast Deformable Voxel Radiance Fields for Dynamic Scenes
2022/05/31 by Jiawei Liu, Liu, Jia-Wei, Yan‐Pei Cao +15 · 3 citations
Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
2025/07/23 by Jianxin Bi, Bi, Jianxin, Kevin Ma +7 · 12 citations
Engineering · Neuroscience · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Robotics (cs.RO) #Tactile and Sensory Interactions #Teleoperation and Haptic Systems
- Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions
2024/01/03 by David Junhao Zhang, Dongxu Li, Zhang, David Junhao +9 · 4 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
- Making Vision Transformers Efficient from A Token Sparsification View
2023/03/15 by Shuning Chang, Pichao Wang, Chang, Shuning +11 · 3 citations
Computer Science · Engineering · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Image Processing Techniques and Applications #Machine Learning (cs.LG)
- WMAdapter: Adding WaterMark Control to Latent Diffusion Models
2024/06/12 by Hai Ci, Ci, Hai, Yiren Song +7 · 5 citations
Earth and Planetary Sciences · Environmental Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Hydrological Forecasting Using AI #Image and Video Processing (eess.IV) #Meteorological Phenomena and Simulations #Soil Moisture and Remote Sensing #electronic engineering #information engineering
- DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing
2023/10/16 by Jiawei Liu, Liu, Jia-Wei, Yan‐Pei Cao +15 · 3 citations
Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Vision and Imaging #Video Analysis and Summarization
- COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
2024/01/01 by Alex Jinpeng Wang, Linjie Li, Wang, Alex Jinpeng +13 · 3 citations
Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
- MAG-Edit: Localized Image Editing in Complex Scenarios via Mask-Based Attention-Adjusted Guidance
2023/12/18 by Qi Mao, Mao, Qi, Lan Chen +7 · 3 citations
Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
- MLLMs-Augmented Visual-Language Representation Learning
2023/11/30 by Yanqing Liu, Kai Wang, Liu, Yanqing +13 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques
- VideoGUI: A Benchmark for GUI Automation from Instructional Videos
2024/06/14 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Linjie Li +13 · 5 citations
Computer Science · #Video Analysis and Summarization
- PV3D: A 3D Generative Model for Portrait Video Generation
2022/12/13 by Zhongcong Xu, Xu, Zhongcong, Jianfeng Zhang +11 · 2 citations
Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
- Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
2024/06/04 by Alex Jinpeng Wang, Linjie Li, Wang, Alex Jinpeng +9 · 4 citations
Computer Science · #Multimodal Machine Learning Applications #Open Education and E-Learning #Speech and dialogue systems
- Position-guided Text Prompt for Vision-Language Pre-training
2022/12/19 by Alex Jinpeng Wang, Pan Zhou, Wang, Alex Jinpeng +5 · 2 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- Label-Efficient Online Continual Object Detection in Streaming Video
2022/06/01 by Jay Zhangjie Wu, Wu, Jay Zhangjie, David Junhao Zhang +7 · 2 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Image Enhancement Techniques #Multimodal Machine Learning Applications
- UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
2025/05/29 by Weijia Mao, Zhenheng Yang, Mao, Weijia +3 · 8 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Topic Modeling
- Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis
2022/12/06 by Yuchao Gu, Xintao Wang, Gu, Yuchao +9 · 2 citations
Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Image and Video Retrieval Techniques #Image Retrieval and Classification Techniques
- Unsupervised Open-Vocabulary Object Localization in Videos
2023/09/18 by Ke Fan, Zechen Bai, Fan, Ke +25 · 2 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
2025/05/24 by Yiren Song, Song, Yiren, Cheng Liu +3 · 7 citations
Computer Science · Psychology · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Second Language Acquisition and Learning #Text Readability and Simplification
- Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
2023/12/11 by Henry Hengyuan Zhao, Pan Zhou, Zhao, Henry Hengyuan +3 · 2 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
- DOTA: Distributional Test-Time Adaptation of Vision-Language Models
2024/09/28 by Zongbo Han, Jialong Yang, Han, Zongbo +10 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Machine Learning (cs.LG) #Multimodal Machine Learning Applications
- Parrot Captions Teach CLIP to Spot Text
2023/12/21 by Yiqi Lin, Conghui He, Lin, Yiqi +9 · 2 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques
- MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning
2021/11/24 by David Junhao Zhang, Kunchang Li, Zhang, David Junhao +13 · 1 citation
Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning
- AssistQ: Affordance-centric Question-driven Task Completion for Egocentric Assistant
2022/03/08 by Benita Wong, Wong, Benita, Joya Chen +11 · 1 citation
Computer Science · Medicine · #AI in Service Interactions #Artificial Intelligence in Healthcare and Education #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval
2022/04/01 by Yuxuan Wang, Difei Gao, Wang, Yuxuan +9 · 1 citation
Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Machine Learning in Healthcare
- Multi-Modal Generative Embedding Model
2024/05/29 by Feipeng Ma, Ma, Feipeng, Hongwei Xue +17 · 2 citations
Computer Science · #Advanced Statistical Modeling Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- macOSWorld: A Multilingual Interactive Benchmark for GUI Agents
2025/06/04 by Pei Yang, Hai Ci, Yang, Pei +3 · 5 citations
Computer Science · #Security and Verification in Computing #Advanced Malware Detection Techniques #Web Application Security Vulnerabilities
- Egocentric Video-Language Pretraining @ Ego4D Challenge 2022
2022/07/04 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Alex Jinpeng Wang +29 · 1 citation
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- Skinned Motion Retargeting with Dense Geometric Interaction Perception
2024/10/28 by Zijie Ye, Jiawei Liu, Ye, Zijie +7 · 2 citations
Computer Science · Engineering · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human Motion and Animation #Human Pose and Action Recognition
- Apprenticeship-Inspired Elegance: Synergistic Knowledge Distillation Empowers Spiking Neural Networks for Efficient Single-Eye Emotion Recognition
2024/06/20 by Yang Wang, Wang, Yang, Haiyang Mei +13 · 2 citations
Engineering · Neuroscience · #Advanced Memory and Neural Computing #Computer Vision and Pattern Recognition (cs.CV) #EEG and Brain-Computer Interfaces #FOS: Computer and information sciences #Neural and Evolutionary Computing (cs.NE) #Neural dynamics and brain function
- Factorized Visual Tokenization and Generation
2024/11/25 by Zechen Bai, Bai, Zechen, Jianxiong Gao +11 · 2 citations
Computer Science · #Advanced Image and Video Retrieval Techniques
- SparseFormer: Sparse Visual Recognition via Limited Latent Tokens
2023/04/07 by Ziteng Gao, Tong Zhan, Gao, Ziteng +5 · 1 citation
Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Visual Attention and Saliency Detection
- Revisiting Vision Transformer from the View of Path Ensemble
2023/08/12 by Shuning Chang, Pichao Wang, Chang, Shuning +7 · 1 citation
Computer Science · Engineering · #CCD and CMOS Imaging Sensors #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Industrial Vision Systems and Defect Detection #Visual Attention and Saliency Detection
- XAGen: 3D Expressive Human Avatars Generation
2023/11/22 by Zhongcong Xu, Xu, Zhongcong, Jianfeng Zhang +7 · 1 citation
Computer Science · #Face recognition and analysis #Human Pose and Action Recognition #Generative Adversarial Networks and Image Synthesis
- ShowRoom3D: Text to High-Quality 3D Room Generation Using 3D Priors
2023/12/20 by Weijia Mao, Yan‐Pei Cao, Mao, Weijia +7 · 1 citation
Computer Science · Earth and Planetary Sciences · #Advanced Vision and Imaging #3D Surveying and Cultural Heritage #Advanced Image and Video Retrieval Techniques
- Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
2024/02/02 by Zongbo Han, Zechen Bai, Han, Zongbo +9 · 1 citation
Medicine · Neuroscience · #Epilepsy research and treatment #Hallucinations in medical conditions #Schizophrenia research and treatment
- VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
2025/03/12 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Mike Zheng Shou +1 · 2 citations
Computer Science · #Video Analysis and Summarization #Topic Modeling #Multimodal Machine Learning Applications
- Object-centric Learning with Cyclic Walks between Parts and Whole
2023/02/16 by Ziyu Wang, Wang, Ziyu, Mike Zheng Shou +3 · 1 citation
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- TPDiff: Temporal Pyramid Video Diffusion Model
2025/03/12 by Lingmin Ran, Mike Zheng Shou, Ran, Lingmin +1 · 1 citation
Computer Science · #Image and Video Quality Assessment #Image and Signal Denoising Methods #Advanced Data Compression Techniques
- Steganalysis on Digital Watermarking: Is Your Defense Truly Impervious?
2024/06/13 by Pei Yang, Yang, Pei, Hai Ci +5 · 1 citation
Computer Science · #Advanced Steganography and Watermarking Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Internet Traffic Analysis and Secure E-voting
- In-Context Defense in Computer Agents: An Empirical Study
2025/03/12 by Pei Yang, Hai Ci, Yang, Pei +3 · 1 citation
Computer Science · #Advanced Malware Detection Techniques #Network Security and Intrusion Detection
- GUI Action Narrator: Where and When Did That Action Take Place?
2024/06/19 by Qinchen Wu, Difei Gao, Wu, Qinchen +15 · 2 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Persona Design and Applications
- Personalized Vision via Visual In-Context Learning
2025/09/29 by Yuxin Jiang, Yuchao Gu, Jiang, Yuxin +7 · 7 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Image Retrieval and Classification Techniques
- H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
2025/12/10 by Hai Ci, Ci, Hai, Xiaokang Liu +6 · 2 citations
Engineering · Computer Science · Psychology · #Robot Manipulation and Learning #Human Pose and Action Recognition #Social Robot Interaction and HRI
- OmniPSD: Layered PSD Generation with Diffusion Transformer
2025/12/10 by Cheng Liu, Liu, Cheng, Yiren Song +5 · 1 citation
Computer Science · Arts and Humanities · #Generative Adversarial Networks and Image Synthesis #Computer Graphics and Visualization Techniques #Digital Humanities and Scholarship
- LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
2025/04/22 by Joya Chen, Chen, Joya, Ziyun Zeng +9 · 1 citation
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Speech Recognition and Synthesis #Video Analysis and Summarization
- VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
2024/12/16 by Muhammet Furkan Ilaslan, Ilaslan, Muhammet Furkan, Ali Köksal +9 · 1 citation
Computer Science · #Natural Language Processing Techniques #Speech and dialogue systems #AI-based Problem Solving and Planning