vix.ing · top · new · best · stats · spec

Xihui Liu

  1. WorldSimBench: Towards Video Generation Models as World Simulators
    2024/10/23 by Yiran Qin, Zhelun Shi, Qin, Yiran +23 · 188 citations
    Decision Sciences · Engineering · #3D Modeling in Geospatial Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Motion and Animation #Simulation Techniques and Applications
  2. T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation
    2023/07/12 by Kaiyi Huang, Huang, Kaiyi, Kaiyue Sun +8 · 106 citations
    Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization
  3. Point Transformer V3: Simpler, Faster, Stronger
    2023/12/15 by Xiaoyang Wu, Li Jiang, Wu, Xiaoyang +15 · 118 citations
    Computer Science · Earth and Planetary Sciences · Environmental Science · #3D Surveying and Cultural Heritage #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Optical measurement and interference techniques #Remote Sensing and LiDAR Applications
  4. FiT: Flexible Vision Transformer for Diffusion Model
    2024/02/19 by Zeyu Lu, Zidong Wang, Lu, Zeyu +11 · 2 voices · 15 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CV
  5. Point Transformer V2: Grouped Vector Attention and Partition-based Pooling
    2022/10/11 by Xiaoyang Wu, Yixing Lao, Wu, Xiaoyang +7 · 64 citations
    Environmental Science · Earth and Planetary Sciences · Engineering · #Remote Sensing and LiDAR Applications #3D Surveying and Cultural Heritage #3D Shape Modeling and Analysis
  6. FilMaster: Bridging Cinematic Principles and Generative AI for Automated Film Generation
    2025/06/23 by Kaiyi Huang, Huang, Kaiyi, Yukun Huang +15 · 5 voices · 11 citations
    #cs.CV
  7. LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
    2024/09/26 by Chenming Zhu, Zhu, Chenming, Tai Wang +7 · 61 citations
    Business, Management and Accounting · Engineering · #BIM and Construction Integration #Collaboration in agile enterprises #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  8. SAM3D: Segment Anything in 3D Scenes
    2023/06/06 by Yunhan Yang, Xiaoyang Wu, Yang, Yunhan +7 · 34 citations
    Engineering · Computer Science · #Industrial Vision Systems and Defect Detection #3D Shape Modeling and Analysis #Advanced Neural Network Applications
  9. 4Diffusion: Multi-view Video Diffusion Model for 4D Generation
    2024/05/31 by Haiyu Zhang, Zhang, Haiyu, Xinyuan Chen +9 · 32 citations
    Social Sciences · #Multimedia Communication and Technology
  10. EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI
    2023/12/26 by Tai Wang, Wang, Tai, Xiaohan Mao +25 · 27 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Hand Gesture Recognition Systems #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Robotics (cs.RO)
  11. GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
    2024/07/08 by Zhenyu Wang, Aoxue Li, Wang, Zhenyu +5 · 31 citations
    Computer Science · #Semantic Web and Ontologies #Natural Language Processing Techniques
  12. EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
    2023/12/11 by Yi Chen, Yuying Ge, Chen, Yi +15 · 24 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
  13. DDP: Diffusion Model for Dense Visual Prediction
    2023/03/30 by Yuanfeng Ji, Zhe Chen, Ji, Yuanfeng +15 · 18 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Video Surveillance and Tracking Methods #Image Retrieval and Classification Techniques
  14. SAMPart3D: Segment Any Part in 3D Objects
    2024/11/11 by Yunhan Yang, Yang, Yunhan, Yukun Huang +13 · 32 citations
    Computer Science · Earth and Planetary Sciences · #3D Surveying and Cultural Heritage #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction
  15. T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation
    2024/07/19 by Kaiyue Sun, Sun, Kaiyue, Kaiyi Huang +11 · 25 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Video Analysis and Summarization
  16. HydraPlus-Net: Attentive Deep Features for Pedestrian Analysis
    2017/09/28 by Xihui Liu, Haiyu Zhao, Liu, Xihui +13 · 12 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Video Surveillance and Tracking Methods
  17. GameFactory: Creating New Games with Generative Interactive Videos
    2025/01/14 by Jiwen Yu, Yu, Jiwen, Yiran Qin +9 · 34 citations
    Psychology · #Educational Games and Gamification
  18. Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training
    2023/08/18 by Xiaoyang Wu, Zhuotao Tian, Wu, Xiaoyang +11 · 16 citations
    Computer Science · Earth and Planetary Sciences · Engineering · #3D Shape Modeling and Analysis #3D Surveying and Cultural Heritage #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition
  19. Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
    2024/12/05 by Yi‐Ping Phoebe Chen, Yuying Ge, Chen, Yi +12 · 25 citations
    Computer Science · Engineering · #Human Pose and Action Recognition #Human Motion and Animation #Robotics and Automated Systems
  20. Seeing is not always believing: Benchmarking Human and Model Perception of AI-Generated Images
    2023/04/25 by Zeyu Lu, Di Huang, Lu, Zeyu +10 · 13 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Digital Media Forensic Detection #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Misinformation and Its Impacts
  21. Loong: Generating Minute-level Long Videos with Autoregressive Language Models
    2024/10/03 by Yuqing Wang, Wang, Yuqing, Tianqin Xiong +13 · 20 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Video Analysis and Summarization
  22. More Control for Free! Image Synthesis with Semantic Diffusion Guidance
    2021/12/10 by Xihui Liu, Dong Huk Park, Liu, Xihui +15 · 10 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Image Retrieval and Classification Techniques #Advanced Image and Video Retrieval Techniques
  23. Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding
    2024/10/02 by Yao Teng, Teng, Yao, Han Shi +13 · 17 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Image Retrieval and Classification Techniques #Video Analysis and Summarization
  24. Learning to Predict Layout-to-image Conditional Convolutions for\n Semantic Image Synthesis
    2019/10/15 by Xihui Liu, Liu, Xihui, Guojun Yin +7 · 11 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Image and Video Retrieval Techniques #Image Retrieval and Classification Techniques
  25. TC4D: Trajectory-Conditioned Text-to-4D Generation
    2024/03/26 by Sherwin Bahmani, Bahmani, Sherwin, Xian Liu +21 · 11 citations
    Computer Science · #Natural Language Processing Techniques #Model-Driven Software Engineering Techniques #Speech and dialogue systems
  26. Tailor3D: Customized 3D Assets Editing and Generation with Dual-Side Images
    2024/07/08 by Zhangyang Qi, Qi, Zhangyang, Yunhan Yang +17 · 10 citations
    Engineering · Computer Science · #3D Modeling in Geospatial Applications #Advanced Data Storage Technologies #Distributed and Parallel Computing Systems
  27. DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis
    2024/05/23 by Yao Teng, Yue Wu, Teng, Yao +13 · 9 citations
    Computer Science · #Medical Image Segmentation Techniques #Generative Adversarial Networks and Image Synthesis #Image Retrieval and Classification Techniques
  28. A Survey of Reasoning with Foundation Models: Concepts, Methodologies, and Outlook
    2025/04/11 by Jiankai Sun, Chuanyang Zheng, Enze Xie +34 · 18 citations
    Computer Science · #Logic, Reasoning, and Knowledge #Multi-Agent Systems and Negotiation #Semantic Web and Ontologies
  29. EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
    2024/12/05 by Lu Qiu, Yi Chen, Qiu, Lu +9 · 1 voice · 8 citations
    #cs.AI #cs.CV
  30. Bridging Video-text Retrieval with Multiple Choice Questions
    2022/01/13 by Yuying Ge, Yixiao Ge, Ge, Yuying +11 · 4 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Cancer-related molecular mechanisms research #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  31. GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
    2025/05/22 by Chengqi Duan, Rongyao Fang, Duan, Chengqi +13 · 21 citations
    Computer Science · Neuroscience · #Aesthetic Perception and Analysis #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG) #Multimedia (cs.MM) #Multimodal Machine Learning Applications
  32. OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion
    2025/07/08 by Yunhan Yang, Yufan Zhou, Yang, Yunhan +17 · 20 citations
    Engineering · Computer Science · #3D Shape Modeling and Analysis #Interactive and Immersive Displays #Human Motion and Animation
  33. Parallelized Autoregressive Visual Generation
    2024/12/19 by Yuqing Wang, Wang, Yuqing, Shuhuai Ren +15 · 10 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques
  34. HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
    2023/10/12 by Xian Liu, Jian Ren, Liu, Xian +15 · 4 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  35. Drag-A-Video: Non-rigid Video Editing with Point-based Interaction
    2023/12/05 by Teng, Yao, Enze Xie, Yue Wu +8 · 4 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  36. MBQ: Modality-Balanced Quantization for Large Vision-Language Models
    2024/12/27 by Shiyao Li, Yingchun Hu, Li, Shiyao +22 · 7 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  37. Hierarchical Diffusion Autoencoders and Disentangled Image Manipulation
    2023/04/24 by Zeyu Lu, Chengyue Wu, Lu, Zeyu +11 · 3 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Image Processing Techniques #Digital Media Forensic Detection
  38. AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
    2025/03/25 by Haiyu Zhang, Xinyuan Chen, Zhang, Haiyu +9 · 1 voice · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CV
  39. GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
    2024/12/05 by Huang, Kaiyi, Huang, Yukun, Ning, Xuefei +6 · 4 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling #Video Analysis and Summarization
  40. Shape-Guided Diffusion with Inside-Outside Attention
    2022/12/01 by Dong Huk Park, Park, Dong Huk, Grace Luo +13 · 2 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Computer Graphics and Visualization Techniques #Handwritten Text Recognition Techniques
  41. Understanding Masked Autoencoders From a Local Contrastive Perspective
    2023/10/03 by Xiaoyu Yue, Lei Bai, Yue, Xiaoyu +11 · 3 citations
    Engineering · Computer Science · #Image Processing Techniques and Applications #Image and Signal Denoising Methods #Advanced Image Processing Techniques
  42. Editing Massive Concepts in Text-to-Image Diffusion Models
    2024/03/20 by Tianwei Xiong, Xiong, Tianwei, Enze Xie +7 · 2 citations
    Arts and Humanities · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Digital Humanities and Scholarship #FOS: Computer and information sciences #Machine Learning (cs.LG)
  43. HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation
    2025/06/04 by Hermann Kumbong, Xian Liu, Kumbong, Hermann +14 · 6 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Artificial Intelligence (cs.AI) #Cell Image Analysis Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG)
  44. Open-Edit: Open-Domain Image Manipulation with Open-Vocabulary Instructions
    2020/08/04 by Xihui Liu, Zhe Lin, Liu, Xihui +11 · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications
  45. Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP
    2024/07/12 by Wei Meng, Wei, Meng, Wang, Tai +10 · 2 citations
    Computer Science · #FOS: Computer and information sciences #Natural Language Processing Techniques #Robotics (cs.RO) #Semantic Web and Ontologies #Speech and dialogue systems
  46. OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
    2025/07/10 by Jingli Lin, Chenming Zhu, Lin, Jingli +11 · 7 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Constraint Satisfaction and Optimization #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
  47. Localization Guided Learning for Pedestrian Attribute Recognition
    2018/08/28 by Pengze Liu, Xihui Liu, Liu, Pengze +5 · 2 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Video Surveillance and Tracking Methods
  48. Personalized Text-to-Image Generation with Auto-Regressive Models
    2025/04/17 by Kaiyue Sun, Sun, Kaiyue, Xian Liu +5 · 4 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Computer Graphics and Visualization Techniques #Multimodal Machine Learning Applications
  49. RIFormer: Keep Your Vision Backbone Effective While Removing Token Mixer
    2023/04/12 by Jiahao Wang, Wang, Jiahao, Songyang Zhang +15 · 1 citation
    Computer Science · Neuroscience · #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Visual Attention and Saliency Detection
  50. CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
    2025/10/13 by Chengqi Duan, Duan, Chengqi, Kaiyue Sun +23 · 6 citations
    Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Handwritten Text Recognition Techniques
  51. Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
    2026/07/14 by Guoxuan Chen, Chufeng Xiao, Haoran Yang +30 · 1 voice
    #cs.CV #cs.AI