vix.ing · top · new · best · stats · spec

Rha, Hyeongseop

  1. Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
    2024/06/12 by Se Jin Park, Park, Se Jin, Chae Won Kim +11 · 9 citations
    Computer Science · #Speech and dialogue systems #Multi-Agent Systems and Negotiation
  2. MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
    2025/03/14 by Jeong Hun Yeo, Hyeongseop Rha, Yeo, Jeong Hun +5 · 10 citations
    Computer Science · #Speech and Audio Processing #Speech Recognition and Synthesis #Music and Audio Processing
  3. Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
    2024/01/18 by Minsu Kim, Jeong Hun Yeo, Kim, Minsu +6 · 1 citation
    Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech and Audio Processing #Subtitles and Audiovisual Media #Video Surveillance and Tracking Methods #electronic engineering #information engineering
  4. TMT: Tri-Modal Translation between Speech, Image, and Text by Processing Different Modalities as Different Languages
    2024/02/25 by Kim, Minsu, Jung, Jee-weon, Rha, Hyeongseop +5 · 1 citation
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #electronic engineering #information engineering
  5. AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues
    2024/12/23 by Se Jin Park, Park, Se Jin, Yeonju Kim +7 · 1 citation
    Arts and Humanities · #Media Influence and Health