vix.ing · top · new · best · stats · spec

Haoyang Huang

  1. Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
    2025/02/14 by Guoqing Ma, Haoyang Huang, Ma, Guoqing +235 · 4 voices · 43 citations
    Computer Science · #Video Coding and Compression Technologies #cs.CL #cs.CV
  2. Not All Languages Are Created Equal in LLMs: Improving Multilingual Capability by Cross-Lingual-Thought Prompting
    2023/05/11 by Haoyang Huang, Tianyi Tang, Huang, Haoyang +11 · 18 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Multimodal Machine Learning Applications
  3. Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
    2024/02/20 by Haoran Li, Li, Haoran, Qingxiu Dong +36 · 15 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling
  4. BlonDe: An Automatic Evaluation Metric for Document-level Machine Translation
    2021/03/22 by Yuchen Eleanor Jiang, Jiang, Yuchen Eleanor, Tianyu Liu +17 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
  5. LVP-M3: Language-aware Visual Prompt for Multilingual Multimodal Machine Translation
    2022/10/19 by Hongcheng Guo, Guo, Hongcheng, Jiaheng Liu +11 · 1 citation
    Arts and Humanities · Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Subtitles and Audiovisual Media
  6. GanLM: Encoder-Decoder Pre-training with an Auxiliary Discriminator
    2022/12/20 by Jian Yang, Yang, Jian, Shuming Ma +17 · 1 citation
    Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling
  7. OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs
    2026/07/28 by Haoyang Huang, Wenjie Huang, Tianqi Xu +14
    #cs.AI
  8. Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models
    2026/07/23 by Mingyu Wang, Weilin Jin, Wenbo Li +3
    #cs.CV
  9. HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models
    2026/07/23 by Weilin Jin, Mingyu Wang, Wenbo Li +5
    #cs.CV
  10. Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
    2026/07/23 by Yong Liu, Xiaolong Fu, Zihang Xu +10
    #cs.CV
  11. Self Gradient Forcing: Native Long Video Extrapolation
    2026/07/22 by Junhao Zhuang, Shiyi Zhang, Yuxuan Bian +11
    #cs.CV