vix.ing · top · new · best · stats · spec

Mao, Yuxin

  1. MiniMax-01: Scaling Foundation Models with Lightning Attention
    2025/01/14 by MiniMax, Aonian Li, Ao Li +191 · 3 voices · 35 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CL #cs.CV
  2. MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
    2025/06/16 by MiniMax, :, Ao Li +208 · 55 citations
    Computer Science · #Parallel Computing and Optimization Techniques #Advanced Neural Network Applications #Computer Graphics and Visualization Techniques
  3. Multimodal Variational Auto-encoder based Audio-Visual Segmentation
    2023/10/12 by Yuxin Mao, Mao, Yuxin, Jing Zhang +7 · 9 citations
    Computer Science · #Music and Audio Processing #Speech and Audio Processing #Digital Media Forensic Detection
  4. Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
    2023/07/31 by Yuxin Mao, Mao, Yuxin, Jing Zhang +10 · 6 citations
    Computer Science · Arts and Humanities · #Music and Audio Processing #Speech and Audio Processing #Diverse Musicological Studies
  5. Improving Audio-Visual Segmentation with Bidirectional Generation
    2023/08/16 by Dawei Hao, Yuxin Mao, Hao, Dawei +9 · 5 citations
    Computer Science · #Speech and Audio Processing #Music and Audio Processing #Image Enhancement Techniques
  6. Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
    2024/07/11 by Jinxing Zhou, Zhou, Jinxing, Dan Guo +9 · 8 citations
    Computer Science · #Music and Audio Processing #Anomaly Detection Techniques and Applications #Speech Recognition and Synthesis
  7. TAVGBench: Benchmarking Text to Audible-Video Generation
    2024/04/22 by Yuxin Mao, Xuyang Shen, Mao, Yuxin +13 · 6 citations
    Computer Science · Engineering · Social Sciences · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Motion and Animation #Multimedia (cs.MM) #Multimedia Communication and Technology #Video Analysis and Summarization
  8. Towards Open-Vocabulary Audio-Visual Event Localization
    2024/11/18 by Jinxing Zhou, Dan Guo, Zhou, Jinxing +13 · 8 citations
    Computer Science · #Video Analysis and Summarization #Music and Audio Processing #Image Retrieval and Classification Techniques
  9. Generative Transformer for Accurate and Reliable Salient Object Detection
    2021/04/20 by Mao, Yuxin, Zhang, Jing, Wan, Zhexiong +6 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  10. RPEFlow: Multimodal Fusion of RGB-PointCloud-Event for Joint Optical Flow and Scene Flow Estimation
    2023/09/26 by Zhexiong Wan, Yuxin Mao, Wan, Zhexiong +5 · 2 citations
    Computer Science · Physics and Astronomy · #Advanced Optical Sensing Technologies #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Enhancement Techniques
  11. MUNet: Motion Uncertainty-aware Semi-supervised Video Object Segmentation
    2021/11/29 by Sun, Jiadai, Mao, Yuxin, Dai, Yuchao +2 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  12. You Only Scan Once: Efficient Multi-dimension Sequential Modeling with LightNet
    2024/05/31 by Zhen Qin, Qin, Zhen, Yuxin Mao +11 · 3 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Neural Networks and Applications
  13. Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
    2024/12/29 by Li, Bingliang, Yang, Fengyu, Mao, Yuxin +3 · 2 citations
    #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
  14. Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation
    2025/06/29 by Jinxing Zhou, Zhou, Jinxing, Zhihui Li +17 · 5 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Domain Adaptation and Few-Shot Learning #Multimodal Machine Learning Applications
  15. Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
    2025/07/02 by Yuxin Mao, Mao, Yuxin, Zhentao Qin +15 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimedia (cs.MM) #Multimodal Machine Learning Applications