vix.ing · top · new · best · stats · spec

Zhengzhong Tu

  1. Can Large Vision Language Models Read Maps Like a Human?
    2025/03/18 by Shuo Xing, Xing, Shuo, Zezhou Sun +15 · 2 voices · 8 citations
    #cs.CV
  2. V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision Transformer
    2022/03/20 by Runsheng Xu, Xiang Hao, Xu, Runsheng +9 · 47 citations
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Privacy-Preserving Technologies in Data #Visual Attention and Saliency Detection
  3. MaxViT: Multi-Axis Vision Transformer
    2022/04/04 by Zhengzhong Tu, Tu, Zhengzhong, Hossein Talebi +11 · 33 citations
    Computer Science · #Visual Attention and Saliency Detection #Advanced Neural Network Applications #Advanced Image and Video Retrieval Techniques
  4. CoBEVT: Cooperative Bird's Eye View Semantic Segmentation with Sparse Transformers
    2022/07/05 by Runsheng Xu, Xu, Runsheng, Zhengzhong Tu +9 · 30 citations
    Computer Science · Engineering · #Advanced Neural Network Applications #Visual Attention and Saliency Detection #Robotics and Sensor-Based Localization
  5. MAXIM: Multi-Axis MLP for Image Processing
    2022/01/09 by Zhengzhong Tu, Tu, Zhengzhong, Hossein Talebi +11 · 23 citations
    Computer Science · Engineering · #Advanced Memory and Neural Computing #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image Enhancement Techniques #Image and Video Processing (eess.IV) #Visual Attention and Saliency Detection #electronic engineering #information engineering
  6. UGC-VQA: Benchmarking Blind Video Quality Assessment for User Generated Content
    2021/01/01 by Zhengzhong Tu, Yilin Wang, Neil Birkbeck +2 · 12 citations
    Computer Science · #Image and Video Quality Assessment #Video Coding and Compression Technologies #Visual Attention and Saliency Detection
  7. OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
    2024/12/19 by Chengyuan Qian, Xing, Shuo, Yu‐Ping Wang +10 · 23 citations
    Engineering · #Transportation and Mobility Innovations
  8. LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X
    2025/10/15 by Shuo Xing, Xing, Shuo, Junyuan Hong +13 · 18 voices
    #cs.CL #cs.AI
  9. SPIRE: Semantic Prompt-Driven Image Restoration
    2023/12/18 by Chenyang Qi, Qi, Chenyang, Zhengzhong Tu +11 · 1 voice · 3 citations
    Computer Science · #Advanced Image Processing Techniques #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #cs.CV
  10. CoDi: Conditional Diffusion Distillation for Higher-Fidelity and Faster Image Generation
    2023/10/02 by Kangfu Mei, Mei, Kangfu, Mauricio Delbracio +9 · 6 citations
    Engineering · #Process Optimization and Integration #Advanced Control Systems Optimization
  11. NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
    2025/04/04 by Kexin Tian, Tian, Kexin, Yunlong Zhang +8 · 11 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Neural Network Applications #Advanced Image and Video Retrieval Techniques
  12. STAMP: Scalable Task And Model-agnostic Collaborative Perception
    2025/01/24 by Xiangbo Gao, Runsheng Xu, Gao, Xiangbo +9 · 10 citations
    Business, Management and Accounting · Computer Science · #Artificial Intelligence (cs.AI) #Business Process Modeling and Analysis #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotics (cs.RO) #Semantic Web and Ontologies
  13. MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning
    2025/05/30 by Yiqing Liang, Jielin Qiu, Liang, Yiqing +17 · 13 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Reinforcement Learning in Robotics
  14. SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion Models
    2024/12/06 by Zilan Wang, Junfeng Guo, Wang, Zilan +11 · 7 citations
    Computer Science · Engineering · #Advanced Steganography and Watermarking Techniques #Chaos-based Image/Signal Encryption #Vehicle License Plate Recognition
  15. Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
    2025/02/18 by Shuo Xing, Xing, Shuo, Peiran Li +13 · 9 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques
  16. DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution Detection
    2024/11/12 by Shawn Li, Li, Shawn, He Gong +9 · 6 citations
    Computer Science · #Anomaly Detection Techniques and Applications
  17. Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
    2024/10/04 by Tinghui Zhu, Qin Liu, Zhu, Tinghui +7 · 5 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Semantic Web and Ontologies
  18. AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
    2024/12/19 by Shuo Xing, Xing, Shuo, Hong Hua +22 · 5 citations
    Computer Science · #Adversarial Robustness in Machine Learning
  19. Video Quality Assessment: A Comprehensive Survey
    2024/12/04 by Qi Zheng, Zheng, Qi, Yibo Fan +19 · 5 citations
    Computer Science · #Image and Video Quality Assessment
  20. Generative AI for Autonomous Driving: Frontiers and Opportunities
    2025/05/13 by Yuping Wang, Shuo Xing, Wang, Yuping +89 · 10 citations
    Engineering · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotics (cs.RO) #Transportation and Mobility Innovations
  21. SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems
    2025/06/09 by Peiran Li, Li, Peiran, Zou, Xinkai +18 · 6 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Security and Verification in Computing
  22. DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
    2025/05/18 by Gang Li, Li, Gang, Ming Lin +7 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  23. The Tenth NTIRE 2025 Efficient Super-Resolution Challenge Report
    2025/04/14 by Bin Ren, Ren, Bin, Hang Guo +235 · 5 citations
    Computer Science · Engineering · #Advanced Image Processing Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image and Video Processing (eess.IV) #Image and Video Quality Assessment #Sparse and Compressive Sensing Techniques #electronic engineering #information engineering
  24. V2X-DGW: Domain Generalization for Multi-agent Perception under Adverse Weather Conditions
    2024/03/17 by Baolu Li, Jinlong Li, Li, Baolu +13 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Neural Networks and Applications #Reinforcement Learning in Robotics
  25. The Role of Open-Source LLMs in Shaping the Future of GeoAI
    2025/04/24 by Xiao Huang, Zhengzhong Tu, Huang, Xiao +5 · 1 citation
    Medicine · Social Sciences · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #Data-Driven Disease Surveillance #FOS: Computer and information sciences #Geographic Information Systems Studies #Human Mobility and Location-Based Analysis
  26. NTIRE 2025 Challenge on Short-form UGC Video Quality Assessment and Enhancement: Methods and Results
    2025/04/17 by Xin Li, Li, Xin, Kun Yuan +207 · 2 citations
    Computer Science · #Advanced Image Processing Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image and Video Processing (eess.IV) #Image and Video Quality Assessment #Video Coding and Compression Technologies #electronic engineering #information engineering
  27. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
    2026/07/30 by Shawn Li, Wei Yang, Jike Zhong +11
    Computer Science · #cs.CV #cs.AI
  28. FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving
    2026/07/13 by Yaqi Qiao, Ping He, Songrun Xie +4
    #cs.DC #cs.LG
  29. Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
    2026/07/29 by Xiangbo Gao, Siyuan Yang, Ping He +12
    Computer Science · #cs.CV