vix.ing · top · new · best · stats · spec

Guo, Longteng

  1. VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
    2023/04/17 by Jing Liu, Liu, Jing, Sihan Chen +11 · 17 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling #electronic engineering #information engineering
  2. VL-Mamba: Exploring State Space Models for Multimodal Learning
    2024/03/20 by Yanyuan Qiao, Qiao, Yanyuan, Zheng Yu +13 · 14 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multi-Agent Systems and Negotiation #Speech and dialogue systems
  3. Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
    2024/06/13 by Zhao, Zijia, Lu, Haoyu, Huo, Yuqi +6 · 8 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  4. EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
    2023/08/23 by Chen, Junyi, Guo, Longteng, Sun, Jia +4 · 6 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM)
  5. Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
    2023/12/13 by Wang, Wenxuan, Yue, Tongtian, Zhang, Yisi +4 · 5 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  6. ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst
    2023/05/25 by Zijia Zhao, Zhao, Zijia, Longteng Guo +13 · 4 citations
    Computer Science · #Topic Modeling #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  7. CPTR: Full Transformer Network for Image Captioning
    2021/01/26 by Wei Liu, Sihan Chen, Liu, Wei +7 · 5 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Human Pose and Action Recognition
  8. Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning
    2020/05/10 by Guo, Longteng, Liu, Jing, Zhu, Xinxin +3 · 2 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  9. Ada-K Routing: Boosting the Efficiency of MoE-based LLMs
    2024/10/14 by Yue, Tongtian, Guo, Longteng, Cheng, Jie +2 · 5 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences
  10. Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
    2024/04/22 by Dongze Hao, Hao, Dongze, Qunbo Wang +7 · 4 citations
    Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Fault Detection and Control Systems
  11. FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
    2025/03/18 by Zhang, Siqi, Qiao, Yanyuan, Wang, Qunbo +3 · 6 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotics (cs.RO)
  12. VRoPE: Rotary Position Embedding for Video Large Language Models
    2025/02/17 by Lijian Guo, Liu, Zikang, Guo, Longteng +10 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Video Analysis and Summarization
  13. BrainGPT: Unleashing the Potential of EEG Generalist Foundation Model by Autoregressive Pre-training
    2024/10/14 by Tongtian Yue, Xuange Gao, Yue, Tongtian +11 · 3 citations
    Computer Science · Neuroscience · #EEG and Brain-Computer Interfaces #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Neural Networks and Applications #Signal Processing (eess.SP) #electronic engineering #information engineering
  14. MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
    2024/10/02 by Sun, Mingzhen, Wang, Weining, Qiao, Yanyuan +5 · 3 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  15. Enhancing Vision-Language Pre-Training with Jointly Learned Questioner and Dense Captioner
    2023/05/19 by Zikang Liu, Liu, Zikang, Sihan Chen +9 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  16. Efficient Motion-Aware Video MLLM
    2025/03/17 by Zhao, Zijia, Huo, Yuqi, Yue, Tongtian +5 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  17. SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
    2024/03/20 by Tongtian Yue, Yue, Tongtian, Jie Cheng +15 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  18. Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward
    2025/06/05 by Zikang Liu, Tongtian Yue, Liu, Zikang +13 · 3 citations
    Computer Science · Materials Science · #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning in Materials Science #Reinforcement Learning in Robotics
  19. Breaking the Encoder Barrier for Seamless Video-Language Understanding
    2025/03/24 by Li, Handong, Zhang, Yiyuan, Guo, Longteng +2 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  20. ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval
    2024/10/24 by Zhao, Zijia, Guo, Longteng, Yue, Tongtian +5 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences