Zhengzhong Tu
- Can Large Vision Language Models Read Maps Like a Human?
2025/03/18 by Shuo Xing, Xing, Shuo, Zezhou Sun +15 · 2 voices · 8 citations
#cs.CV
- V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision Transformer
2022/03/20 by Runsheng Xu, Xiang Hao, Xu, Runsheng +9 · 47 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Privacy-Preserving Technologies in Data #Visual Attention and Saliency Detection
- MaxViT: Multi-Axis Vision Transformer
2022/04/04 by Zhengzhong Tu, Tu, Zhengzhong, Hossein Talebi +11 · 33 citations
Computer Science · #Visual Attention and Saliency Detection #Advanced Neural Network Applications #Advanced Image and Video Retrieval Techniques
- CoBEVT: Cooperative Bird's Eye View Semantic Segmentation with Sparse Transformers
2022/07/05 by Runsheng Xu, Xu, Runsheng, Zhengzhong Tu +9 · 30 citations
Computer Science · Engineering · #Advanced Neural Network Applications #Visual Attention and Saliency Detection #Robotics and Sensor-Based Localization
- MAXIM: Multi-Axis MLP for Image Processing
2022/01/09 by Zhengzhong Tu, Tu, Zhengzhong, Hossein Talebi +11 · 23 citations
Computer Science · Engineering · #Advanced Memory and Neural Computing #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image Enhancement Techniques #Image and Video Processing (eess.IV) #Visual Attention and Saliency Detection #electronic engineering #information engineering
- UGC-VQA: Benchmarking Blind Video Quality Assessment for User Generated Content
2021/01/01 by Zhengzhong Tu, Yilin Wang, Neil Birkbeck +2 · 12 citations
Computer Science · #Image and Video Quality Assessment #Video Coding and Compression Technologies #Visual Attention and Saliency Detection
- OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
2024/12/19 by Chengyuan Qian, Xing, Shuo, Yu‐Ping Wang +10 · 23 citations
Engineering · #Transportation and Mobility Innovations
- LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X
2025/10/15 by Shuo Xing, Xing, Shuo, Junyuan Hong +13 · 18 voices
#cs.CL #cs.AI
- SPIRE: Semantic Prompt-Driven Image Restoration
2023/12/18 by Chenyang Qi, Qi, Chenyang, Zhengzhong Tu +11 · 1 voice · 3 citations
Computer Science · #Advanced Image Processing Techniques #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #cs.CV
- CoDi: Conditional Diffusion Distillation for Higher-Fidelity and Faster Image Generation
2023/10/02 by Kangfu Mei, Mei, Kangfu, Mauricio Delbracio +9 · 6 citations
Engineering · #Process Optimization and Integration #Advanced Control Systems Optimization
- NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
2025/04/04 by Kexin Tian, Tian, Kexin, Yunlong Zhang +8 · 11 citations
Computer Science · #Multimodal Machine Learning Applications #Advanced Neural Network Applications #Advanced Image and Video Retrieval Techniques
- STAMP: Scalable Task And Model-agnostic Collaborative Perception
2025/01/24 by Xiangbo Gao, Runsheng Xu, Gao, Xiangbo +9 · 10 citations
Business, Management and Accounting · Computer Science · #Artificial Intelligence (cs.AI) #Business Process Modeling and Analysis #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotics (cs.RO) #Semantic Web and Ontologies
- MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning
2025/05/30 by Yiqing Liang, Jielin Qiu, Liang, Yiqing +17 · 13 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Reinforcement Learning in Robotics
- SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion Models
2024/12/06 by Zilan Wang, Junfeng Guo, Wang, Zilan +11 · 7 citations
Computer Science · Engineering · #Advanced Steganography and Watermarking Techniques #Chaos-based Image/Signal Encryption #Vehicle License Plate Recognition
- Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
2025/02/18 by Shuo Xing, Xing, Shuo, Peiran Li +13 · 9 citations
Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques
- DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution Detection
2024/11/12 by Shawn Li, Li, Shawn, He Gong +9 · 6 citations
Computer Science · #Anomaly Detection Techniques and Applications
- Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
2024/10/04 by Tinghui Zhu, Qin Liu, Zhu, Tinghui +7 · 5 citations
Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Semantic Web and Ontologies
- AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
2024/12/19 by Shuo Xing, Xing, Shuo, Hong Hua +22 · 5 citations
Computer Science · #Adversarial Robustness in Machine Learning
- Video Quality Assessment: A Comprehensive Survey
2024/12/04 by Qi Zheng, Zheng, Qi, Yibo Fan +19 · 5 citations
Computer Science · #Image and Video Quality Assessment
- Generative AI for Autonomous Driving: Frontiers and Opportunities
2025/05/13 by Yuping Wang, Shuo Xing, Wang, Yuping +89 · 10 citations
Engineering · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotics (cs.RO) #Transportation and Mobility Innovations
- SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems
2025/06/09 by Peiran Li, Li, Peiran, Zou, Xinkai +18 · 6 citations
Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Security and Verification in Computing
- DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
2025/05/18 by Gang Li, Li, Gang, Ming Lin +7 · 5 citations
Computer Science · #Artificial Intelligence (cs.AI) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
- The Tenth NTIRE 2025 Efficient Super-Resolution Challenge Report
2025/04/14 by Bin Ren, Ren, Bin, Hang Guo +235 · 5 citations
Computer Science · Engineering · #Advanced Image Processing Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image and Video Processing (eess.IV) #Image and Video Quality Assessment #Sparse and Compressive Sensing Techniques #electronic engineering #information engineering
- V2X-DGW: Domain Generalization for Multi-agent Perception under Adverse Weather Conditions
2024/03/17 by Baolu Li, Jinlong Li, Li, Baolu +13 · 1 citation
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Neural Networks and Applications #Reinforcement Learning in Robotics
- The Role of Open-Source LLMs in Shaping the Future of GeoAI
2025/04/24 by Xiao Huang, Zhengzhong Tu, Huang, Xiao +5 · 1 citation
Medicine · Social Sciences · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #Data-Driven Disease Surveillance #FOS: Computer and information sciences #Geographic Information Systems Studies #Human Mobility and Location-Based Analysis
- NTIRE 2025 Challenge on Short-form UGC Video Quality Assessment and Enhancement: Methods and Results
2025/04/17 by Xin Li, Li, Xin, Kun Yuan +207 · 2 citations
Computer Science · #Advanced Image Processing Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image and Video Processing (eess.IV) #Image and Video Quality Assessment #Video Coding and Compression Technologies #electronic engineering #information engineering
- JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
2026/07/30 by Shawn Li, Wei Yang, Jike Zhong +11
Computer Science · #cs.CV #cs.AI
- FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving
2026/07/13 by Yaqi Qiao, Ping He, Songrun Xie +4
#cs.DC #cs.LG
- Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
2026/07/29 by Xiangbo Gao, Siyuan Yang, Ping He +12
Computer Science · #cs.CV