vix.ing · top · new · best · stats · spec

Lijuan Wang

  1. The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)
    2023/09/29 by Zhengyuan Yang, Linjie Li, Yang, Zhengyuan +11 · 11 voices · 83 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
  2. Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
    2024/04/22 by Marah Abdin, Abdin, Marah, Jyoti Aneja +262 · 8 voices · 360 citations
    Computer Science · #Computational Physics and Python Applications
  3. GIT: A Generative Image-to-text Transformer for Vision and Language
    2022/05/27 by Jianfeng Wang, Zhengyuan Yang, Wang, Jianfeng +15 · 2 voices · 57 citations
    Computer Science · #Handwritten Text Recognition Techniques #Multimodal Machine Learning Applications #Natural Language Processing Techniques #cs.CV
  4. Segment Everything Everywhere All at Once
    2023/04/13 by Xueyan Zou, Zou, Xueyan, Jianwei Yang +15 · 1 voice · 90 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling #cs.CV
  5. MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
    2023/08/04 by Weihao Yu, Zhengyuan Yang, Yu, Weihao +13 · 213 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Multimodal Machine Learning Applications
  6. ShowUI: One Vision-Language-Action Model for GUI Visual Agent
    2024/11/26 by Kevin Qinghong Lin, Linjie Li, Lin, Kevin Qinghong +15 · 2 voices · 64 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Multimodal Machine Learning Applications #cs.AI #cs.CL #cs.CV #cs.HC
  7. Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
    2023/06/26 by Fuxiao Liu, Kevin Lin, Liu, Fuxiao +9 · 82 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computational Engineering #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Finance #Multimedia (cs.MM) #Multimodal Machine Learning Applications #and Science (cs.CE)
  8. Large Scale Incremental Learning
    2019/05/30 by Yue Wu, Wu, Yue, Yinpeng Chen +11 · 44 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #Machine Learning and ELM #Multimodal Machine Learning Applications
  9. MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
    2023/03/20 by Zhengyuan Yang, Linjie Li, Yang, Zhengyuan +16 · 68 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
  10. Florence: A New Foundation Model for Computer Vision
    2021/11/22 by Lu Yuan, Dongdong Chen, Yuan, Lu +43 · 53 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition #Machine Learning (cs.LG) #Multimodal Machine Learning Applications
  11. GenXD: Generating Any 3D and 4D Scenes
    2024/11/04 by Yuyang Zhao, Zhao, Yuyang, Chung-Ching Lin +15 · 1 voice · 18 citations
    Earth and Planetary Sciences · Engineering · #3D Modeling in Geospatial Applications #3D Surveying and Cultural Heritage #cs.AI #cs.CV
  12. Generalized Decoding for Pixel, Image, and Language
    2022/12/21 by Xueyan Zou, Zi-Yi Dou, Zou, Xueyan +25 · 42 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  13. ReCo: Region-Controlled Text-to-Image Generation
    2022/11/23 by Zhengyuan Yang, Jianfeng Wang, Yang, Zhengyuan +19 · 29 citations
    Computer Science · #Multimodal Machine Learning Applications #Image Retrieval and Classification Techniques #Generative Adversarial Networks and Image Synthesis
  14. End-to-End Semi-Supervised Object Detection with Soft Teacher
    2021/06/16 by Mengde Xu, Zheng Zhang, Xu, Mengde +13 · 21 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  15. Multimodal Foundation Models: From Specialists to General-Purpose Assistants
    2023/09/18 by Chunyuan Li, Zhe Gan, Li, Chunyuan +11 · 31 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  16. GLIPv2: Unifying Localization and Vision-Language Understanding
    2022/06/12 by Haotian Zhang, Pengchuan Zhang, Zhang, Haotian +17 · 24 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Topic Modeling
  17. End-to-End Human Pose and Mesh Reconstruction with Transformers
    2020/12/17 by Kevin Lin, Lijuan Wang, Lin, Kevin +3 · 22 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition
  18. RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
    2025/04/24 by Zihan Wang, Wang, Zihan, Kangrui Wang +33 · 83 citations
    Computer Science · #Reinforcement Learning in Robotics #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning
  19. NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation
    2023/03/22 by Shengming Yin, Chenfei Wu, Yin, Shengming +28 · 25 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization #Video Coding and Compression Technologies
  20. DisCo: Disentangled Control for Realistic Human Dance Generation
    2023/06/30 by Tan Wang, Linjie Li, Wang, Tan +14 · 25 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation #Human Pose and Action Recognition
  21. ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
    2025/02/25 by Yifan Pu, Yunfei Pu, Pu, Yifan +35 · 2 voices · 11 citations
    Computer Science · #Advanced Steganography and Watermarking Techniques #Chaos-based Image/Signal Encryption #Computer Vision and Pattern Recognition (cs.CV) #Digital Media Forensic Detection #FOS: Computer and information sciences #cs.CV
  22. Mesh Graphormer
    2021/04/01 by Kevin Lin, Lin, Kevin, Lijuan Wang +3 · 17 citations
    Computer Science · Engineering · #Human Pose and Action Recognition #3D Shape Modeling and Analysis #Video Surveillance and Tracking Methods
  23. An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA
    2021/09/10 by Zhengyuan Yang, Zhe Gan, Yang, Zhengyuan +11 · 17 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
  24. Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
    2025/01/09 by Yi Hao, Jiawei Gu, Hao, Yunzhuo +11 · 41 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Semantic Web and Ontologies #Speech and dialogue systems
  25. Scaling Up Vision-Language Pre-training for Image Captioning
    2021/11/24 by Xiaowei Hu, Zhe Gan, Hu, Xiaowei +11 · 14 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  26. GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation
    2023/11/13 by An Yan, Yan, An, Zhengyuan Yang +21 · 18 citations
    Computer Science · Psychology · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Social Robot Interaction and HRI
  27. SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
    2025/04/10 by Xiyao Wang, Wang, Xiyao, Zhengyuan Yang +15 · 45 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning and Data Classification #Multimodal Machine Learning Applications
  28. An Empirical Study of Training End-to-End Vision-and-Language Transformers
    2021/11/03 by Zi-Yi Dou, Yichong Xu, Dou, Zi-Yi +21 · 12 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Neural Network Applications
  29. Segment and Caption Anything
    2023/12/01 by Xiaoke Huang, Huang, Xiaoke, Jianfeng Wang +13 · 1 voice · 5 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CV
  30. MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
    2024/08/01 by Weihao Yu, Zhengyuan Yang, Yu, Weihao +17 · 17 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Speech and dialogue systems
  31. SEED: Self-supervised Distillation For Visual Representation
    2021/01/12 by Zhiyuan Fang, Fang, Zhiyuan, Jianfeng Wang +9 · 8 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  32. UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling
    2021/11/23 by Zhengyuan Yang, Yang, Zhengyuan, Zhe Gan +12 · 8 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
  33. VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation
    2021/06/08 by Linjie Li, Li, Linjie, Jie Lei +27 · 8 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Domain Adaptation and Few-Shot Learning
  34. NUWA-Infinity: Autoregressive over Autoregressive Generation for Infinite Visual Synthesis
    2022/07/20 by Chenfei Wu, Jian Liang, Wu, Chenfei +15 · 8 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  35. GRiT: A Generative Region-to-text Transformer for Object Understanding
    2022/12/01 by Jialian Wu, Jianfeng Wang, Wu, Jialian +11 · 8 citations
    Computer Science · #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  36. An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling
    2022/09/04 by Tsu-Jui Fu, Fu, Tsu-Jui, Linjie Li +11 · 7 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Neural Network Applications #Domain Adaptation and Few-Shot Learning
  37. Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
    2024/06/11 by Yuanhao Zhai, Kevin Lin, Zhai, Yuanhao +15 · 11 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image and Video Quality Assessment
  38. MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning
    2023/11/29 by Chaoyi Zhang, Kevin Lin, Zhang, Chaoyi +13 · 9 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Natural Language Processing Techniques #Video Analysis and Summarization
  39. Global trends in incidence, death, burden and risk factors of early-onset cancer from 1990 to 2019
    2023/07/01 by Jianhui Zhao, Liying Xu, Jing Sun +14 · 1 voice · 6 citations
    Medicine · #Multiple and Secondary Primary Cancers #Global Cancer Incidence and Screening #Cancer Risks and Factors
  40. Investigating Ceiling Effects in Longitudinal Data Analysis
    2008/09/10 by Lijuan Wang, Zhiyong Zhang, John J. McArdle +1 · 3 citations
    Economics, Econometrics and Finance · Decision Sciences · Mathematics · #Spatial and Panel Data Analysis #Decision-Making and Behavioral Economics #Statistical Methods and Bayesian Inference
  41. MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
    2024/06/12 by Xuehai He, Weixi Feng, He, Xuehai +25 · 10 citations
    Computer Science · #Advanced Vision and Imaging #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Video Surveillance and Tracking Methods
  42. Rethinking Classification and Localization for Object Detection
    2019/04/13 by Yue Wu, Wu, Yue, Yinpeng Chen +11 · 5 citations
    Computer Science · Engineering · #Advanced Neural Network Applications #Domain Adaptation and Few-Shot Learning #Medical Imaging and Analysis
  43. TAP: Text-Aware Pre-training for Text-VQA and Text-Caption
    2020/12/08 by Zhengyuan Yang, Yijuan Lu, Yang, Zhengyuan +15 · 5 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  44. List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
    2024/04/25 by Yan An, Zhengyuan Yang, Yan, An +19 · 9 citations
    Arts and Humanities · Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Lexicography and Language Studies #Natural Language Processing Techniques #Semantic Web and Ontologies
  45. An Empirical Study of Multimodal Model Merging
    2023/04/28 by Yi-Lin Sung, Sung, Yi-Lin, Linjie Li +9 · 6 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Domain Adaptation and Few-Shot Learning
  46. VinVL: Revisiting Visual Representations in Vision-Language Models
    2021/01/02 by Pengchuan Zhang, Xiujun Li, Xiaowei Hu +5 · 1 voice · 1 citation
    Computer Science · #cs.CV #cs.AI #cs.CL #cs.LG
  47. Vision-Language Pre-training: Basics, Recent Advances, and Future Trends
    2022/10/17 by Zhe Gan, Gan, Zhe, Linjie Li +9 · 5 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  48. SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
    2024/10/30 by Yining Hong, Baiyu Liu, Hong, Yining +21 · 8 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Advanced Vision and Imaging #Artificial Intelligence (cs.AI) #Cell Image Analysis Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Machine Learning (cs.LG) #Robotics (cs.RO)
  49. Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
    2023/10/12 by Zhengyuan Yang, Jianfeng Wang, Yang, Zhengyuan +11 · 5 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  50. EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
    2024/10/03 by Zheng, Kaizhi, Xiaotong Chen, Xuehai He +16 · 7 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graph Theory and Algorithms #Graphics (cs.GR) #Human-Computer Interaction (cs.HC)
  51. Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
    2024/10/04 by Zichen Miao, Miao, Zichen, Zhengyuan Yang +11 · 7 citations
    Computer Science · #Neural Networks and Applications
  52. Different frequency repetitive transcranial magnetic stimulation (rTMS) for posttraumatic stress disorder (PTSD): A systematic review and meta-analysis
    2017/02/27 by Tingting Yan, Qinglian Xie, Zhong Zheng +2 · 2 citations
    Neuroscience · Medicine · #Transcranial Magnetic Stimulation Studies #Traumatic Brain Injury Research #Functional Brain Connectivity Studies
  53. StrokeNUWA: Tokenizing Strokes for Vector Graphic Synthesis
    2024/01/30 by Zecheng Tang, Chenfei Wu, Tang, Zecheng +19 · 4 citations
    Engineering · #Additive Manufacturing and 3D Printing Technologies #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Manufacturing Process and Optimization
  54. MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos
    2023/06/07 by Jielin Qiu, Jiacheng Zhu, Qiu, Jielin +21 · 3 citations
    Computer Science · #Video Analysis and Summarization #Natural Language Processing Techniques #Music and Audio Processing
  55. VideoGUI: A Benchmark for GUI Automation from Instructional Videos
    2024/06/14 by Kevin Qinghong Lin, Lin, Kevin Qinghong, Linjie Li +13 · 6 citations
    Computer Science · #Video Analysis and Summarization
  56. Audio-Aware Large Language Models as Judges for Speaking Styles
    2025/06/06 by Cheng-Han Chiang, Chiang, Cheng-Han, Xiaofei Wang +18 · 10 citations
    Computer Science · Psychology · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Speech Recognition and Synthesis #electronic engineering #information engineering
  57. ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
    2025/06/11 by Xiyao Wang, Wang, Xiyao, Zhengyuan Yang +22 · 11 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG) #Multimodal Machine Learning Applications
  58. MiniVLM: A Smaller and Faster Vision-Language Model
    2020/12/13 by Jianfeng Wang, Wang, Jianfeng, Xiaowei Hu +13 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  59. Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
    2025/05/26 by Minheng Ni, Zhengyuan Yang, Ni, Minheng +11 · 11 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Semantic Web and Ontologies #Speech and dialogue systems
  60. COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
    2024/01/01 by Alex Jinpeng Wang, Linjie Li, Wang, Alex Jinpeng +13 · 3 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
  61. Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
    2024/06/04 by Alex Jinpeng Wang, Linjie Li, Wang, Alex Jinpeng +9 · 4 citations
    Computer Science · #Multimodal Machine Learning Applications #Open Education and E-Learning #Speech and dialogue systems
  62. VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
    2025/10/19 by Kangrui Wang, Wang, Kangrui, Pingyue Zhang +27 · 10 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Topic Modeling
  63. Adaptive Human Matting for Dynamic Videos
    2023/04/12 by Chung-Ching Lin, Jiang Wang, Lin, Chung-Ching +11 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Image Enhancement Techniques #Visual Attention and Saliency Detection
  64. Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
    2023/04/13 by Jaemin Cho, Cho, Jaemin, Linjie Li +9 · 2 citations
    Computer Science · #Advanced Vision and Imaging #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Visual Attention and Saliency Detection
  65. Impulse and sampled-data optimal control of heat equations, and error estimates
    2015/09/19 by Emmanuel Trélat, Lijuan Wang, Trélat, Emmanuel +3 · 1 citation
    Computer Science · Engineering · Mathematics · #Advanced Mathematical Modeling in Engineering #FOS: Mathematics #Numerical methods in inverse problems #Optimization and Control (math.OC) #Stability and Controllability of Differential Equations
  66. Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
    2024/12/04 by Xiyao Wang, Wang, Xiyao, Zhengyuan Yang +13 · 4 citations
    Computer Science · Psychology · #Color perception and design #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Machine Learning (cs.LG) #Visual Attention and Saliency Detection
  67. Cross-border Commodity Pricing Strategy Optimization via Mixed Neural Network for Time Series Analysis
    2024/08/22 by Lijuan Wang, Wang, Lijuan, Yucai Hu +3 · 3 citations
    Decision Sciences · #Computational Engineering #FOS: Computer and information sciences #FOS: Economics and business #Finance #General Economics (econ.GN) #Machine Learning (cs.LG) #Stock Market Forecasting Methods #and Science (cs.CE)
  68. Exploring Discrete Diffusion Models for Image Captioning
    2022/11/21 by Zixin Zhu, Yixuan Wei, Zhu, Zixin +17 · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization
  69. MPT: Mesh Pre-Training with Transformers for Human Pose and Mesh Reconstruction
    2022/11/24 by Kevin Lin, Lin, Kevin, Chung-Ching Lin +6 · 1 citation
    Computer Science · Medicine · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Diabetic Foot Ulcer Assessment and Management #FOS: Computer and information sciences #Human Pose and Action Recognition
  70. Mechanical properties and energy absorption of 3D printed double-layered helix honeycomb under in-plane compression
    2023/07/01 by Ping Xia, Qiancheng Liu, Hua Fu +5 · 1 citation
  71. Learning 3D Photography Videos via Self-supervised Diffusion on Single Images
    2023/02/21 by Xiaodong Wang, Chenfei Wu, Wang, Xiaodong +21 · 1 citation
    Computer Science · #Advanced Image Processing Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  72. What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding
    2025/06/08 by Ming Li, Zhengyuan Yang, Li, Ming +11 · 5 citations
    Computer Science · #Topic Modeling #Multimodal Machine Learning Applications #Constraint Satisfaction and Optimization
  73. Constrained approximate null controllability of coupled heat equation with periodic impulse controls
    2020/05/15 by Lijuan Wang, Wang, Lijuan, Qishu Yan +3 · 1 citation
    Computer Science · Engineering · Mathematics · #35K40 #93B05 #93C20 #Advanced Mathematical Modeling in Engineering #FOS: Mathematics #Nonlinear Differential Equations Analysis #Optimization and Control (math.OC) #Stability and Controllability of Differential Equations
  74. Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
    2024/03/19 by Jielin Qiu, Qiu, Jielin, William Han +15 · 1 citation
    Computer Science · Decision Sciences · #Computer Vision and Pattern Recognition (cs.CV) #Data Quality and Management #FOS: Computer and information sciences #Topic Modeling #Web Data Mining and Analysis
  75. GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
    2025/07/13 by Yiyang Zhou, Linjie Li, Zhou, Yiyang +21 · 6 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications