vix.ing · top · new · best · stats · spec

Hou, Lu

  1. TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
    2023/12/04 by Shuhuai Ren, Linli Yao, Ren, Shuhuai +7 · 92 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Domain Adaptation and Few-Shot Learning
  2. FILIP: Fine-grained Interactive Language-Image Pre-Training
    2021/11/09 by Lewei Yao, Runhui Huang, Yao, Lewei +17 · 41 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
  3. TempCompass: Do Video LLMs Really Understand Videos?
    2024/03/01 by Liu, Yuanxin, Li, Shicheng, Liu, Yi +6 · 58 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  4. Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark
    2022/02/14 by Gu, Jiaxi, Meng, Xiaojun, Lu, Guansong +9 · 21 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  5. DynaBERT: Dynamic BERT with Adaptive Width and Depth
    2020/04/08 by Lu Hou, Zhiqi Huang, Hou, Lu +8 · 15 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Multimodal Machine Learning Applications
  6. FlatQuant: Flatness Matters for LLM Quantization
    2024/10/12 by Yuxuan Sun, Ruikang Liu, Sun, Yuxuan +23 · 21 citations
    Engineering · Physics and Astronomy · Medicine · #Advancements in Photolithography Techniques #Magnetic confinement fusion research #Medical Imaging Techniques and Applications
  7. FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation
    2023/11/03 by Yuanxin Liu, Lei Li, Liu, Yuanxin +13 · 13 citations
    Computer Science · Social Sciences · #Video Analysis and Summarization #Multimedia Communication and Technology #Multimodal Machine Learning Applications
  8. DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
    2024/05/31 by Linli Yao, Yao, Linli, Lei Li +11 · 16 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
  9. BinaryBERT: Pushing the Limit of BERT Quantization
    2020/12/31 by Haoli Bai, Wei Zhang, Bai, Haoli +14 · 8 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  10. CTRL: Connect Collaborative and Language Model for CTR Prediction
    2023/06/05 by Xiang‐Yang Li, Bo Chen, Li, Xiangyang +5 · 10 citations
    Computer Science · #Recommender Systems and Techniques #Sentiment Analysis and Opinion Mining
  11. ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance
    2024/12/09 by Wang, Chunwei, Lu, Guansong, Yang, Junwei +5 · 17 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  12. ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
    2025/04/02 by Runhui Huang, Huang, Runhui, Chunwei Wang +19 · 22 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques
  13. TernaryBERT: Distillation-aware Ultra-low Bit BERT
    2020/09/27 by Wei Zhang, Lu Hou, Zhang, Wei +10 · 5 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Sound (cs.SD) #Topic Modeling #electronic engineering #information engineering
  14. Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation
    2022/03/12 by Wenliang Dai, Dai, Wenliang, Lu Hou +8 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  15. Extending Context Window of Large Language Models via Semantic Compression
    2023/12/15 by Weizhi Fei, Xueyan Niu, Fei, Weizhi +11 · 7 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Information Theory (cs.IT) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  16. VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
    2023/11/29 by Shicheng Li, Li, Shicheng, Lei Li +13 · 7 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Human Pose and Action Recognition
  17. Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
    2025/04/07 by Ruikang Liu, Yuxuan Sun, Liu, Ruikang +13 · 15 citations
    Computer Science · #Explainable Artificial Intelligence (XAI) #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  18. EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
    2024/09/26 by Kai Chen, Yunhao Gou, Chen, Kai +57 · 8 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Speech and dialogue systems
  19. Improved OOD Generalization via Adversarial Training and Pre-training
    2021/05/24 by Yi, Mingyang, Hou, Lu, Sun, Jiacheng +4 · 3 citations
    #FOS: Computer and information sciences #Machine Learning (cs.LG)
  20. Reliable and Efficient Autonomous Driving: the Need for Heterogeneous Vehicular Networks
    2015/10/22 by Zheng, Kan, Zheng, Qiang, Yang, Haojun +3 · 2 citations
    #FOS: Computer and information sciences #Networking and Internet Architecture (cs.NI)
  21. IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact
    2024/03/02 by Ruikang Liu, Liu, Ruikang, Haoli Bai +15 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
  22. TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding
    2023/10/29 by Ren, Shuhuai, Chen, Sishuo, Li, Shicheng +2 · 4 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  23. Compression of Generative Pre-trained Language Models via Quantization
    2022/03/21 by Tao, Chaofan, Hou, Lu, Zhang, Wei +5 · 3 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  24. DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning
    2025/05/30 by Wenxuan Shi, Haochen Tan, Shi, Wenxuan +15 · 12 citations
    Computer Science · #Data Stream Mining Techniques #Peer-to-Peer Network Technologies #Web Data Mining and Analysis
  25. Wukong-Reader: Multi-modal Pre-training for Fine-grained Visual Document Understanding
    2022/12/19 by Bai, Haoli, Liu, Zhiguang, Meng, Xiaojun +9 · 2 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  26. UNIT: Unifying Image and Text Recognition in One Vision Encoder
    2024/09/06 by Yi Zhu, Yanpeng Zhou, Zhu, Yi +11 · 4 citations
    Computer Science · Engineering · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image and Object Detection Techniques #Industrial Vision Systems and Defect Detection
  27. OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging
    2025/05/26 by Wei, Yongxian, Cheng, Runxi, Jin, Weike +7 · 9 citations
    #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences
  28. HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
    2024/07/11 by Runhui Huang, Huang, Runhui, Xinpeng Ding +17 · 3 citations
    Computer Science · Engineering · #Adversarial Robustness in Machine Learning #Medical Imaging and Analysis #Natural Language Processing Techniques
  29. DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
    2025/10/14 by Yingyan Li, Li, Yingyan, Shuyao Shang +21 · 10 citations
    Computer Science · Engineering · #Time Series Analysis and Forecasting #Autonomous Vehicle Technology and Safety #Traffic Prediction and Management Techniques
  30. KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
    2025/06/02 by Honglin Li, Qi Zhu, Xu, Hongling +14 · 5 citations
    Social Sciences · #Artificial Intelligence (cs.AI) #Artificial Intelligence in Law #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  31. Towards Efficient Post-training Quantization of Pre-trained Language Models
    2021/09/30 by Haoli Bai, Lu Hou, Bai, Haoli +9 · 1 citation
    Computer Science · #Advanced Neural Network Applications #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
  32. The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
    2025/07/10 by Jierun Chen, Chen, Jierun, Tiezheng Yu +24 · 4 citations
    Computer Science · #Computation and Language (cs.CL) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
  33. Faster and Better LLMs via Latency-Aware Test-Time Scaling
    2025/05/26 by Wang, Zili, Zhang, Tianyu, Bai, Haoli +5 · 3 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences
  34. Visually Guided Generative Text-Layout Pre-training for Document Intelligence
    2024/03/25 by Mao, Zhiming, Bai, Haoli, Hou, Lu +4 · 1 citation
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  35. Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
    2025/08/07 by Huang, Jiameng, Lin, Baijiong, Feng, Guhao +3 · 6 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  36. InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
    2025/12/21 by Li, Kaican, Yao, Lewei, Wu, Jiannan +7 · 2 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  37. A Simple Linear Patch Revives Layer-Pruned Large Language Models
    2025/05/30 by Chen, Xinrui, Bai, Haoli, Yuan, Tao +7 · 2 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences