Jianhua Wu
- DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
2024/12/10 by Jianhua Wu, Jianzong Wu, Wu, Jianzong +10 · 1 voice · 8 citations
Arts and Humanities · Computer Science · #Digital Humanities and Scholarship #Handwritten Text Recognition Techniques #cs.CV
- VMoBA: Mixture-of-Block Attention for Video Diffusion Models
2025/06/30 by Jianhua Wu, Liang Hou, Wu, Jianzong +12 · 9 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Visual Attention and Saliency Detection
- MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
2024/12/27 by Jiaqi Fan, Fan, Jiaqi, Jianhua Wu +11 · 2 citations
Computer Science · Engineering · #Topic Modeling #Advanced Text Analysis Techniques #Traffic Prediction and Management Techniques
- MiMo-Embodied: X-Embodied Foundation Model Technical Report
2025/11/20 by Xiaoshuai Hao, Hao, Xiaoshuai, Lei Zhou +76 · 3 citations
Engineering · Computer Science · Psychology · #Autonomous Vehicle Technology and Safety #Multimodal Machine Learning Applications #Social Robot Interaction and HRI
- Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios
2024/12/10 by Jiaqi Fan, Jianhua Wu, Fan, Jiaqi +7 · 1 citation
Computer Science · #Data Visualization and Analytics