Xingyu Wan
- StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
2024/05/31 by Pengyuan Lyu, Yulin Li, Lyu, Pengyuan +19 · 4 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Multimodal Machine Learning Applications
- Towards Unified Multi-granularity Text Detection with Interactive Attention
2024/05/30 by Xingyu Wan, Wan, Xingyu, Chengquan Zhang +13 · 1 citation
Computer Science · #Handwritten Text Recognition Techniques #Natural Language Processing Techniques #Topic Modeling