InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
2025/04/14 by Jinguo Zhu, Weiyun Wang, Zhu, Jinguo +95 · 1,656 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
paper · pdf · doi:10.48550/arxiv.2504.10479
openalex publication_date 2025/04/14 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
We introduce InternVL3, a significant advancement in the InternVL series featuring a native multimodal pre-training paradigm. Rather than adapting a text-only large language model (LLM) into a multimodal large language model (MLLM) that supports visual inputs, InternVL3 jointly acquires multimodal and linguistic capabilities from both diverse multimodal data and pure-text corpora during a single pre-training stage. This unified training paradigm effectively addresses the complexities and alignment challenges commonly encountered in conventional post-hoc training pipelines for MLLMs. To further improve performance and scalability, InternVL3 incorporates variable visual position encoding (V2PE) to support extended multimodal contexts, employs advanced post-training techniques such as supervised fine-tuning (SFT) and mixed preference optimization (MPO), and adopts test-time scaling strategies alongside an optimized training infrastructure. Extensive empirical evaluations demonstrate that InternVL3 delivers superior performance across a wide range of multi-modal tasks. In particular, InternVL3-78B achieves a score of 72.2 on the MMMU benchmark, setting a new state-of-the-art among open-source MLLMs. Its capabilities remain highly competitive with leading proprietary models, including ChatGPT-4o, Claude 3.5 Sonnet, and Gemini 2.5 Pro, while also maintaining strong pure-language proficiency. In pursuit of open-science principles, we will publicly release both the training data and model weights to foster further research and development in next-generation MLLMs.
Citations
- SmolVLM: Redefining small and efficient multimodal models
- VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
- Qwen2.5-VL Technical Report
- SCP-116K: A High-Quality Problem-Solution Dataset and a Generalized Pipeline for Automated Extraction in the Higher Education Science Domain
- UI-TARS: Pioneering Automated GUI Interaction with Native Agents
- Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
- The Lessons of Developing Process Reward Models in Mathematical Reasoning
- AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
- Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
- CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
- V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
- BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices
- Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
- OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
- DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
- GPT-4o System Card
- Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data
- Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
- R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
- TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
- MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
- Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- NVLM: Open Frontier-Class Multimodal LLMs
- Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
- MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
- LLaVA-OneVision: Easy Visual Task Transfer
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
- MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
- MiniCPM-V: A GPT-4V Level MLLM on Your Phone
- MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
- The Llama 3 Herd of Models
- LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
- VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
- LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
- We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?
- LLM Critics Help Catch LLM Bugs
- CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
- Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
- Long Context Transfer from Language to Vision
- Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
- MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
- Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
- WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
- MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
- VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
- Improve Mathematical Reasoning in Language Models by Automated Process Supervision
- Parrot: Multilingual Visual Instruction Tuning
- Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
- Ovis: Structural Embedding Alignment for Multimodal Large Language Model
- M3CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
- MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
- How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
- SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
- MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
- BLINK: Multimodal Large Language Models Can See but Not Perceive
- Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
- InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
- Binary Classifier Optimization for Large Language Model Alignment
- Are We on the Right Way for Evaluating Large Vision-Language Models?
- MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
- Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
- The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
- Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
- InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding
- SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
- InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning
- G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
- Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations
- VILA: On Pre-training for Visual Language Models
- MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
- Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
- mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration
- CogVLM: Visual Expert for Pretrained Language Models
- HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
- MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
- Aligning Large Multimodal Models with Factually Augmented RLHF
- MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
- The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World
- MMBench: Is Your Multi-modal Model an All-around Player?
- Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- CMMLU: Measuring massive multitask language understanding in Chinese
- Let's Verify Step by Step
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Evaluating the Performance of Large Language Models on GAOKAO Benchmark
- TheoremQA: A Theorem-driven Question Answering dataset
- ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
- Evaluating Object Hallucination in Large Vision-Language Models
- C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models
- VideoChat: Chat-Centric Video Understanding
- Visual Instruction Tuning
- GPT-4 Technical Report
- Universal Instance Perception as Object Discovery and Retrieval
- Annotated Point Clouds and Images from a Spatial-Semantic Perception Pipeline: Robotized Deconstruction at the Reference Construction Site, Aachen
- MapQA: A Dataset for Question Answering on Choropleth Maps
- Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them
- Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering
- CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning
- ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
- MViTv2: Improved Multiscale Vision Transformers for Classification and Detection
- Training Verifiers to Solve Math Word Problems
- IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning
- Program Synthesis with Large Language Models
- Evaluating Large Language Models Trained on Code
- Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning
- InfographicVQA
- Measuring Mathematical Problem Solving With the MATH Dataset
- Measuring Massive Multitask Language Understanding
- DocVQA: A Dataset for VQA on Document Images
- ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction
- Scene Text Visual Question Answering
- OK-VQA: A Visual Question Answering Benchmark Requiring External\n Knowledge
- HellaSwag: Can a Machine Really Finish Your Sentence?
- Investigating Prior Knowledge for Challenging Chinese Machine Reading Comprehension
- Towards VQA Models That Can Read
- DVQA: Understanding Data Visualizations via Question Answering
- Simple and Effective Multi-Paragraph Reading Comprehension
- TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for\n Reading Comprehension
- RACE: Large-scale ReAding Comprehension Dataset From Examinations
- Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering
- A Diagram Is Worth A Dozen Images
- Generation and Comprehension of Unambiguous Object Descriptions
- Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
- VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text
- MLVU: Benchmarking Multi-task Long Video Understanding
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
Cited by
- MIRA: Multimodal Iterative Reasoning Agent for Image Editing
- From Generated Human Videos to Physically Plausible Robot Trajectories
- ReasonX: MLLM-Guided Intrinsic Image Decomposition
- CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
- MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
- Video-BrowseComp: Benchmarking Agentic Video Research on Open Web
- MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments
- Modality Inflation: Energy Characterization and Optimization Opportunities for MLLM Inference
- Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
- Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
- FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound
- LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science
- Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
- VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
- SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
- MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
- ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness
- Offline-Online Curriculum RL for Multimodal Reasoning
- UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
- ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning
- Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
- What You See Is What You Get: Observation-Aligned Supervision for Chart-to-Code Generation
- See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
- An LMM for Precisely Grounding Elements in Documents
- RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation
- VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
- Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
- EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
- UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
- Streaming Video Instruction Tuning
- MarineEval: Assessing the Marine Intelligence of Vision-Language Models
- UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
- MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model
- Benchmarking and Enhancing VLM for Compressed Image Understanding
- VL4Gaze: Unleashing Vision-Language Models for Gaze Following
- Beyond Motion Pattern: An Empirical Study of Physical Forces for Human Motion Understanding
- Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs
- Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing
- IPCV: Information-Preserving Compression for MLLM Visual Encoders
- Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
- FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis
- Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
- Xiaomi MiMo-VL-Miloco Technical Report
- Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
- AdaTooler-V: Adaptive Tool-Use for Images and Videos
- A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos
- AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding
- Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- Seeing Beyond the Scene: Analyzing and Mitigating Background Bias in Action Recognition
- Uni-Parser Technical Report
- V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
- JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
- WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
- Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs
- Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning
- Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving
- HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
- KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding
- MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
- A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning
- SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning
- Adapting MLLMs for Nuanced Video Retrieval
- Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
- CogDoc: Towards Unified thinking in Documents
- More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
- Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
- Exploring MLLM-Diffusion Information Transfer with MetaCanvas
- SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
- HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
- VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
- MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
- Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
- Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules
- Grounding Everything in Tokens for Multimodal Large Language Models
- DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
- Rethinking Chain-of-Thought Reasoning for Videos
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
- ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
- Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
- From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models
- SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
- Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
- ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors
- ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems
- The Role of Entropy in Visual Grounding: Analysis and Optimization
- RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos
- MemLoRA: Distilling Expert Adapters for On-Device Memory Systems
- StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
- Jina-VLM: Small Multilingual Vision Language Model
- Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning
- ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
- Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
- Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
- LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization
- MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
- MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm
- Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols
- VACoT: Rethinking Visual Data Augmentation with VLMs
- Beyond N-grams: A Hierarchical Reward Learning Framework for Clinically-Aware Medical Report Generation
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models
- ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
- CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions
- ChartAnchor: Chart Grounding with Structural-Semantic Fidelity
- PhotoFramer: Multi-modal Image Composition Instruction
- Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
- Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Video-CoM: Interactive Video Reasoning via Chain of Manipulations
- Visual Generation Tuning
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
- AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
- UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
- World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
- Agentic Learner with Grow-and-Refine Multimodal Semantic Memory
- Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following
- Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
- Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
- Co-Training Vision Language Models for Remote Sensing Multi-task Learning
- LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules
- CaptionQA: Is Your Caption as Useful as the Image Itself?
- Text-Guided Semantic Image Encoder
- SPHINX: A Synthetic Environment for Visual Perception and Reasoning
- NVIDIA Nemotron Parse 1.1
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
- Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
- Boosting Reasoning in Large Multimodal Models via Activation Replay
- Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
- MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
- Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks
- Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
- Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
- LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
- VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
- Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning
- DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
- VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
- Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
- MedVision: Benchmarking Quantitative Medical Image Analysis
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
- Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring
- Mixture of Horizons in Action Chunking
- DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
- ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
- MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
- ConsistCompose: Unified Multimodal Layout Control for Image Composition
- Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection
- Multi-speaker Attention Alignment for Multimodal Social Interaction
- ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry
- VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
- When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
- The Potential and Limitations of Vision-Language Models for Human Motion Understanding: A Case Study in Data-Driven Stroke Rehabilitation
- Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content
- Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables
- EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
- Learning to Think Fast and Slow for Visual Language Models
- TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots
- POMA-3D: The Point Map Way to 3D Scene Understanding
- Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
- OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
- CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
- SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning
- MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
- Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
- FarSLIP: Discovering Effective CLIP Adaptation for Fine-Grained Remote Sensing Understanding
- ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
- P1: Mastering Physics Olympiads with Reinforcement Learning
- GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
- DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents
- Seeing isn't Hearing: Benchmarking Vision Language Models at Interpreting Spectrograms
- MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding
- Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models
- CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
- KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
- EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment
- Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
- Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
- MACEval: A Multi-Agent Continual Evaluation Network for Large Models
- mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
- UI2CodeN: A Visual Language Model for Test-Time Scalable Interactive UI-to-Code Generation
- Federated Learning for Video Violence Detection: Complementary Roles of Lightweight CNNs and Vision-Language Models for Energy-Efficient Use
- Improving Region Representation Learning from Urban Imagery with Noisy Long-Caption Supervision
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- Culture in Action: Evaluating Text-to-Image Models through Social Activities
- DeepEyesV2: Toward Agentic Multimodal Model
- Visual Spatial Tuning
- Cambrian-S: Towards Spatial Supersensing in Video
- ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai
- V-Thinker: Interactive Thinking with Images
- Surprisal reveals diversity gaps in image captioning and different scorers change the story
- Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
- SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
- VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
- Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
- When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
- TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
- Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
- OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
- CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
- Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
- VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
- Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
- Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges
- PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting
- FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding
- ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
- LoCoT2V-Bench: A Benchmark for Long-Form and Complex Text-to-Video Generation
- PairUni: Pairwise Training for Unified Multimodal Language Models
- RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
- TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning
- InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions
- Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning
- Unlimited OCR Works
- PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
- OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
- Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
- Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
- VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
- DynaSolidGeo: A Dynamic Benchmark for Genuine Spatial Mathematical Reasoning of VLMs in Solid Geometry
- OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
- Towards Physically Executable 3D Gaussian for Embodied Navigation
- SafetyPairs: Isolating Safety Critical Image Features with Counterfactual Image Generation
- Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
- GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models
- BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models
- Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
- Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
- Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
- MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom
- Detecting Latin in Historical Books with Large Language Models: A Multimodal Benchmark
- [De|Re]constructing VLMs' Reasoning in Counting
- DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
- VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
- Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
- Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
- DeepSeek-OCR: Contexts Optical Compression
- World-in-World: World Models in a Closed-Loop World
- Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
- VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
- iDETEX: Empowering MLLMs for Intelligent DETailed EXplainable IQA
- SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving
- See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models
- GACO-CAD: Geometry-Augmented and Conciseness-Optimized CAD Model Generation from Single Image
- Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
- Training-free Online Video Step Grounding
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
- Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
- From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
- You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
- Benchmarking Multimodal Large Language Models for Face Recognition
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- Scope: Selective Cross-modal Orchestration of Visual Perception Experts
- Detect Anything via Next Point Prediction
- UniFusion: Vision-Language Model as Unified Encoder in Image Generation
- VideoLucy: Deep Memory Backtracking for Long Video Understanding
- SafeMT: Multi-turn Safety for Multimodal Language Models
- MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
- Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation
- ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
- HoneyBee: Data Recipes for Vision-Language Reasoners
- ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
- ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?
- InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
- BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models
- Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- A Survey on Agentic Multimodal Large Language Models
- Catch-Only-One: Non-Transferable Examples for Model-Specific Authorization
- Judge Before Answer: Can MLLM Discern the False Premise in Question?
- FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
- RefineShot: Rethinking Cinematography Understanding with Foundational Skill Evaluation
- Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
- OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment
- ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
- Stacked Regression using Off-the-shelf, Stimulus-tuned and Fine-tuned Neural Networks for Predicting fMRI Brain Responses to Movies (Algonauts 2025 Report)
- OpusAnimation: Code-Based Dynamic Chart Generation
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
- Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
- AutoPR: Let's Automate Your Academic Promotion!
- Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
- Towards Efficient Multimodal Unified Reasoning Model via Model Merging
- Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
- Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
- Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
- To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
- Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception
- Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection
- MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
- GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
- VideoNorms: Benchmarking Cultural Awareness of Video Language Models
- CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
- RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
- SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- TTRV: Test-Time Reinforcement Learning for Vision Language Models
- StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
- Fine-grained Defocus Blur Control for Generative Image Models
- HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
- D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI
- A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
- AgriGPT-VL: Agricultural Vision-Language Understanding Suite
- What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models
- Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
- Exploring Instruction Data Quality for Explainable Image Quality Assessment
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- Automated Structured Radiology Report Generation with Rich Clinical Context
- PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
- TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding
- Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
- Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces
- TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- Towards Continual Expansion of Data Coverage: Automatic Text-guided Edge-case Synthesis
- DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
- MuSLR: Multimodal Symbolic Logical Reasoning
- Interpret, prune and distill Donut : towards lightweight VLMs for VQA on document
- VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
- LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
- Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding
- ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
- AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy
- When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
- FreeRet: MLLMs as Training-Free Retrievers
- Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
- VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
- HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
- RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation
- Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning
- GUI-PRA: Process Reward Agent for GUI Tasks
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
- MMPB: It's Time for Multi-Modal Personalization
- Color Names in Vision-Language Models
- Explaining multimodal LLMs via intra-modal token interactions
- InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning
- UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective
- WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
- From Bias to Balance: Exploring and Mitigating Spatial Bias in LVLMs
- RISK: A Framework for GUI Agents in E-commerce Risk Management
- Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- Training-Free Multimodal Deepfake Detection via Graph Reasoning
- MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
- ArchGPT: Understanding the World's Architectures with Large Multimodal Models
- CaTS-Bench: Can Language Models Describe Numeric Time Series?
- OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
- FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
- Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs
- One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting
- VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding
- PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology
- QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding
- S-GRPO: Unified Post-Training for Large Vision-Language Models
- Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor
- ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging
- UniECG: Understanding and Generating ECG in One Unified Model
- VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
- The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
- Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
- Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
- Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
- BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
- BaseReward: A Strong Baseline for Multimodal Reward Model
- ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
- SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models
- RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
- Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
- Frame Sampling Strategies Matter: A Benchmark for small vision language models
- Can Current AI Models Count What We Mean, Not What They See? A Benchmark and Systematic Evaluation
- AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
- SAIL-VL2 Technical Report
- Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
- LLM-I: LLMs are Naturally Interleaved Multimodal Creators
- MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
- The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations
- The Art of Saying "Maybe": A Conformal Lens for Uncertainty Benchmarking in VLMs
- MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
- Igniting VLMs toward the Embodied Space
- MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
- Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
- Adapting and Evaluating Multimodal Large Language Models for Adolescent Idiopathic Scoliosis Self-Management: A Divide and Conquer Framework
- Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
- MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
- InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning
- Measuring Epistemic Humility in Multimodal Large Language Models
- TextlessRAG: End-to-End Visual Document RAG by Speech Without Text
- Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation
- GLEAM: Learning to Match and Explain in Cross-View Geo-Localization
- Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
- Reconstruction Alignment Improves Unified Multimodal Models
- Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
- PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone Characters
- DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
- FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality
- Omnidirectional Spatial Modeling from Correlated Panoramas
- RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events
- PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?
- Kwai Keye-VL 1.5 Technical Report
- Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation
- Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants
- Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
- CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving
- VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
- Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
- Is this chart lying to me? Automating the detection of misleading visualizations
- ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding
- R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
- Intern-S1: A Scientific Multimodal Foundation Model
- Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning
- SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
- GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity
- Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models
- Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents
- CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods
- PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- SpotEdit: Evaluating Visually-Guided Image Editing Methods
- MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
- Mobile-Agent-v3: Fundamental Agents for GUI Automation
- MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
- HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
- AdaDocVQA: Adaptive Framework for Long Document Visual Question Answering in Low-Resource Settings
- STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models
- DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
- Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
- Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
- ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images
- MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding
- Thyme: Think Beyond Images
- Ovis2.5 Technical Report
- EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
- HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
- A Study of Commonsense Reasoning over Visual Object Properties
- We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning
- Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
- CARES: Collaborative Agentic Reasoning for Error Detection in Surgery
- Scaling Learned Image Compression Models up to 1 Billion
- Bridging Formal Language with Chain-of-Thought Reasoning to Geometry Problem Solving
- Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity
- MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
- RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering
- Find Them All: Unveiling MLLMs for Versatile Person Re-identification
- InfoCausalQA:Can Models Perform Non-explicit Causal Reasoning Based on Infographic?
- Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models
- VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
- Can Large Models Fool the Eye? A New Turing Test for Biological Animation
- Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
- Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
- Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
- mKG-RAG: Multimodal Knowledge Graph-Enhanced RAG for Visual Question Answering
- InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
- VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
- ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges
- Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding
- PET2Rep: Towards Vision-Language Model-Drived Automated Radiology Report Generation for Positron Emission Tomography
- Static and Plugged: Make Embodied Evaluation Simple
- Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models
- SAM2-UNeXT: An Improved High-Resolution Baseline for Adapting Foundation Models to Downstream Segmentation Tasks
- VLMQ: Efficient Post-Training Quantization for Large Vision-Language Models via Hessian Augmentation
- Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
- AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
- Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
- Engagement Prediction of Short Videos with Large Multimodal Models
- Mapillary Vistas Validation for Fine-Grained Traffic Signs: A Benchmark Revealing Vision-Language Model Limitations
- A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
- MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
- What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
- MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
- RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems
- SpectrumWorld: Artificial Intelligence Foundation for Spectroscopy
- CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
- Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
- UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
- Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
- VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
- FairReason: Balancing Reasoning and Social Bias in MLLMs
- Adapting Vehicle Detectors for Aerial Imagery to Unseen Domains with Weak Supervision
- Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
- A Survey of Token Compression for Efficient Multimodal Large Language Models
- Predicting Brain Responses To Natural Movies With Multimodal LLMs
- Position: Reasoning After Perception Means Reasoning Without Vision
- MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
- OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?
- IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
- Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
- EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
- Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference
- U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs
- PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation
- BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM
- ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- Edge-case Synthesis for Fisheye Object Detection: A Data-centric Perspective
- AD2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
- Describe Anything Model for Visual Question Answering on Text-rich Images
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
- FaceLLM: A Multimodal Large Language Model for Face Understanding
- EmbRACE-3K: Embodied Reasoning and Action in Complex Environments
- VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
- RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking
- Multilingual Multimodal Software Developer for Code Generation
- M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
- Scaling RL to Long Videos
- Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
- Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
- Perception-Aware Policy Optimization for Multimodal Reasoning
- Skywork-R1V3 Technical Report
- BlueLM-2.5-3B Technical Report
- Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
- VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs
- ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
- Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
- Foundation versus Domain-specific Models: Performance Comparison, Fusion, and Explainability in Face Recognition
- ConceptMix++: Leveling the Playing Field in Text-to-Image Benchmarking via Iterative Prompt Optimization
- BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs
- Kwai Keye-VL Technical Report
- SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement
- GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
- Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
- M3MAD-Bench: Multi-Dimensional Evaluation of Multi-Agent Debate Across Domains and Modalities
- Just Noticeable Difference for Large Multimodal Models
- DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World
- ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
- CyberV: Cybernetics for Test-time Scaling in Video Understanding
- IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
- Ovis-U1 Technical Report
- Towards Explainable Bilingual Multimodal Misinformation Detection and Localization
- MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
- HAIBU-ReMUD: Reasoning Multimodal Ultrasound Dataset and Model Bridging to General Specific Domains
- Test-Time Consistency in Vision Language Models
- Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment
- Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
- Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
- R1-Track: Direct Application of MLLMs to Visual Object Tracking via Reinforcement Learning
- ImplicitQA: Going beyond frames towards Implicit Video Reasoning
- Task-Aware KV Compression For Cost-Effective Long Video Understanding
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
- LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning
- World-aware Planning Narratives Enhance Large Vision-Language Model Planner
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
- Vision Transformers Don't Need Trained Registers
- Fine-grained Token Allocation Via Operation Pruning for Efficient MLLMs
- GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
- MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis
- CLGRPO: Reasoning Ability Enhancement for Small VLMs
- PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
- CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
- UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
- GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
- Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights
- SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- StreetLens: Enabling Human-Centered AI Agents for Neighborhood Assessment from Street View Imagery
- HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
- AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
- Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
- Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
- Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
- Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models
- Unsupervised Document and Template Clustering using Multimodal Embeddings
- Dynamic Mixture of Curriculum LoRA Experts for Continual Multimodal Instruction Tuning
- Aligning MLLM Benchmark With Human Preferences via Structural Equation Modeling
- VGR: Visual Grounded Reasoning
- Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables
- VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
- Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning
- PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
- VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
- Movie Facts and Fibs (MF2): A Benchmark for Long Movie Understanding
- VideoMolmo: Spatio-Temporal Grounding Meets Pointing
- Unleashing Hour-Scale Video Training for Long Video-Language Understanding
- AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
- SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
- Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
- VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
- Degradation-Aware Image Enhancement via Vision-Language Classification
- From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes
- LUT: Latent Utility Training for Visual Reasoning
- GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs
- VLMs Can Aggregate Scattered Training Patches
- Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
- Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
- SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
- SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
- MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs
- Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement
- FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment
- ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
- Affordance Benchmark for MLLMs
- GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
- Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
- MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book
- Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
- The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
- Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation
- Benchmarking Foundation Models for Zero-Shot Biometric Tasks
- CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
- Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
- Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
- ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
- OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data
- VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
- InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
- Generalizable Video Quality Assessment via Weak-to-Strong Learning
- SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services
- VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
- SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
- MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
- mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation
- DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes
- OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
- Training Free Stylized Abstraction
- Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying
- MSEarth: A Multimodal Scientific Dataset and Benchmark for Phenomena Uncovering in Earth Science
- ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
- MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
- Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
- DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
- DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
- DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
- UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
- GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
- Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
- Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
- MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
- Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
- R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
- Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
- Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models
- Shifting AI Efficiency From Model-Centric to Data-Centric Compression
- SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
- InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
- ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- So-Fake: Benchmarking and Explaining Social Media Image Forgery Detection
- MLLMs are Deeply Affected by Modality Bias
- Generative RLHF-V: Learning Principles from Multi-modal Human Preference
- ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
- DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
- Illuminating Visual Identity in Universal Multimodal Embeddings
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR
- FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow
- VC-Tooler: Learning Compositional and Adaptive Visual Tool Use
- Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework
- DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
- OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning
- RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs
- Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
- Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
- IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection
- QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
- STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
- Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition
- InstructSAM: A Training-Free Framework for Instruction-Oriented Remote Sensing Object Recognition
- LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
- CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
- GRIT: Teaching MLLMs to Think with Images
- MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing
- FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering
- Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models
- VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval
- VoQA: Visual-only Question Answering
- UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations
- VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation
- PlanGPT-VL: Enhancing Urban Planning with Domain-Specific Vision-Language Models
- UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering
- ViPlan: A Benchmark for Visual Planning with Symbolic Predicates and Vision-Language Models
- LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
- CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction
- MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
- Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models
- Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
- Decoding Children's Gait Behavior
- VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
- MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
- SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining
- Linguistic Context Recodes Visual Representations in Vision-Language Models
- CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts
- EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next
- DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models
- EmoScene: A Dual-space Dataset for Controllable Affective Image Generation
- NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding
- Steerable Visual Representations
- UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- Kwai Keye-VL-2.0 Technical Report
- SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs
- Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
- FireRed-OCR Technical Report
- Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs
- Beyond Language Modeling: An Exploration of Multimodal Pretraining
- Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
- GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
- Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
- Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
- Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
- Reinforced Attention Learning
- Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models
- Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
- DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
- A Review of 3D Object Detection with Vision-Language Models
- REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding
- Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling
- DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models
- When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning
- Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding
- MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding
- Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
- Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
- TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
- SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
- V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
Related