LLaVA-OneVision: Easy Visual Task Transfer
2024/08/06 by Bo Li, Yuanhan Zhang, Li, Bo +18 · 588 citations
Computer Science · Engineering · #Gaze Tracking and Assistive Technology #Teleoperation and Haptic Systems
paper · pdf · doi:10.48550/arxiv.2408.03326
Abstract
We present LLaVA-OneVision, a family of open large multimodal models (LMMs) developed by consolidating our insights into data, models, and visual representations in the LLaVA-NeXT blog series. Our experimental results demonstrate that LLaVA-OneVision is the first single model that can simultaneously push the performance boundaries of open LMMs in three important computer vision scenarios: single-image, multi-image, and video scenarios. Importantly, the design of LLaVA-OneVision allows strong transfer learning across different modalities/scenarios, yielding new emerging capabilities. In particular, strong video understanding and cross-scenario capabilities are demonstrated through task transfer from images to videos.
Cited by
- TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
- From Generated Human Videos to Physically Plausible Robot Trajectories
- Video Understanding: From Geometry and Semantics to Unified Models
- SpatialMosaic: A Multiview VLM Dataset for Partial Visibility
- MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
- VPTracker: Global Vision-Language Tracking via Visual Prompt and MLLM
- Modality Inflation: Energy Characterization and Optimization Opportunities for MLLM Inference
- Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
- Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
- VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
- TimePLE: Rethinking Temporal Representation for Video Temporal Grounding
- MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation
- Offline-Online Curriculum RL for Multimodal Reasoning
- UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
- CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding
- MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning
- WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation
- Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
- FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
- LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos
- Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
- PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models
- Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
- Reason Before You Retrieve: Agentic Planning for Multi-modal RAG
- VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing
- Group Preference Collapse in Personalized Multimodal Large Language Models
- RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection
- CHaystack: Benchmarking Chinese Document Retrieval and VQA
- When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
- MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence
- CLIP Is Shortsighted: Paying Attention Beyond the First Sentence
- Streaming Video Instruction Tuning
- Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
- Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
- M3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images
- SpatialTree: How Spatial Abilities Branch Out in MLLMs
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
- FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning
- LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
- SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse
- FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis
- Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
- RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
- Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
- Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
- AdaTooler-V: Adaptive Tool-Use for Images and Videos
- LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
- Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence
- V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
- Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models
- JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
- Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
- Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
- HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering
- SignIT: A Comprehensive Dataset and Multimodal Analysis for Italian Sign Language Recognition
- Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection
- StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
- WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
- VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
- Using GUI Agent for Electronic Design Automation
- HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
- UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
- From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models
- TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection
- Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding
- Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
- VisualActBench: Can VLMs See and Act like a Human?
- Rethinking Chain-of-Thought Reasoning for Videos
- Towards Lossless Ultimate Vision Token Compression for VLMs
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
- CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
- SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
- FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models
- Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding
- All You Need Are Random Visual Tokens? Demystifying Token Pruning in VLLMs
- ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
- Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
- Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
- START: Spatial and Textual Learning for Chart Understanding
- ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior
- MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
- Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
- Training Multi-Image Vision Agents via End2End Reinforcement Learning
- Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
- What Happens When: Learning Temporal Orders of Events in Videos
- ShaRP: SHAllow-LayeR Pruning for Video Large Language Models Acceleration
- EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
- VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
- dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
- SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
- Jina-VLM: Small Multilingual Vision Language Model
- TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning
- UniComp: Rethinking Video Compression Through Informational Uniqueness
- CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
- Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching
- Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
- Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
- OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
- S2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
- ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
- ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images
- CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions
- Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
- OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
- Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
- SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents
- Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
- From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images
- Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- Geometrically-Constrained Agent for Spatial Reasoning
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
- Unexplored flaws in multiple-choice VQA evaluations
- Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following
- Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
- SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
- REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
- Co-Training Vision Language Models for Remote Sensing Multi-task Learning
- CaptionQA: Is Your Caption as Useful as the Image Itself?
- FANoise: Singular Value-Adaptive Noise Modulation for Robust Multimodal Representation Learning
- G2VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
- EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
- Vision-Language Memory for Spatial Reasoning
- Look Where It Matters: Training-Free Ultra-HR Remote Sensing VQA via Adaptive Zoom Search
- Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
- WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
- Boosting Reasoning in Large Multimodal Models via Activation Replay
- Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
- MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
- CLASH: A Benchmark for Cross-Modal Contradiction Detection
- INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
- VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
- LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
- VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
- EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
- DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
- VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
- VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
- MedVision: Benchmarking Quantitative Medical Image Analysis
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
- VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
- SO-Bench: A Structural Output Evaluation of Multimodal LLMs
- Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
- MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
- AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
- MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
- SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
- Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection
- ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
- MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
- VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
- The Potential and Limitations of Vision-Language Models for Human Motion Understanding: A Case Study in Data-Driven Stroke Rehabilitation
- RynnVLA-002: A Unified Vision-Language-Action and World Model
- Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
- Counterfactual World Models via Digital Twin-conditioned Video Diffusion
- Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding
- VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
- Personalized Reward Modeling for Text-to-Image Generation
- SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
- Solving Spatial Supersensing Without Spatial Supersensing
- TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
- POMA-3D: The Point Map Way to 3D Scene Understanding
- Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning
- LLaVA3: Representing 3D Scenes like a Cubist Painter to Boost 3D Scene Understanding of VLMs
- A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
- Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
- MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
- Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
- OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
- Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges
- GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
- Video Spatial Reasoning with Object-Centric 3D Rollout
- ViSS-R1: Self-Supervised Reinforcement Video Reasoning
- Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
- CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
- Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets
- MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
- Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning
- CountSteer: Steering Attention for Object Counting in Diffusion Models
- VIDEOP2R: Video Understanding from Perception to Reasoning
- ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking
- Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
- Compression then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
- Text-based Aerial-Ground Person Retrieval
- Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
- StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
- NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models
- DeepEyesV2: Toward Agentic Multimodal Model
- Visual Spatial Tuning
- Cambrian-S: Towards Spatial Supersensing in Video
- SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
- What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
- Seeing What You Say: Expressive Image Generation from Speech
- QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
- Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
- ChartM3: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
- SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
- VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
- TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
- UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
- Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
- Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
- RzenEmbed: Towards Comprehensive Multimodal Retrieval
- FOCUS: Efficient Keyframe Selection for Long Video Understanding
- GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
- MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models
- Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
- Emu3.5: Native Multimodal Models are World Learners
- RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration
- CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
- Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
- ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents
- PureKV: Plug-and-Play KV Cache Optimization with Spatial-Temporal Sparse Attention for Vision-Language Large Models
- Instruction-based image editing: a survey on data, models, evaluation, and applications
- OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
- MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
- Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
- Progressive Multimodal Alignment for Continual Instruction Tuning
- Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning
- Multimodal Language Models Cannot Spot Spatial Inconsistencies
- RL makes MLLMs see better than SFT
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
- BLM1: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning
- VC4VG: Optimizing Video Captions for Text-to-Video Generation
- TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
- Latent Chain-of-Thought for Visual Reasoning
- RoboOmni: Proactive Robot Manipulation in Omni-modal Context
- PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
- EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
- Positional Preservation Embedding for Multimodal Large Language Models
- STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
- Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval
- OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
- Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Models
- MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
- Towards Fine-Grained Human Motion Video Captioning
- NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
- Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
- GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
- Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
- SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
- [De|Re]constructing VLMs' Reasoning in Counting
- MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models
- KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- From Denoising to Refining: A Corrective Framework for Vision-Language Diffusion Model
- Gestura: A LVLM-Powered System Bridging Motion and Semantics for Real-Time Free-Form Gesture Understanding
- VAR: Visual Attention Reasoning via Structured Search and Backtracking
- StreamingTOM: Streaming Token Compression for Efficient Video Understanding
- Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
- UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
- MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning
- Online In-Context Distillation for Low-Resource Vision Language Models
- HouseTour: A Virtual Real Estate A(I)gent
- MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
- Recurrent Attention-based Token Selection for Efficient Streaming Video-LLMs
- FineVision: Open Data Is All You Need
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
- Video Reasoning without Training
- Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
- Training-free Online Video Step Grounding
- ReefNet: A Large scale, Taxonomically Enriched Dataset and Benchmark for Hard Coral Classification
- Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling
- Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
- VERITAS: Leveraging Vision Priors and Expert Fusion to Improve Multimodal Data
- Pursuing Minimal Sufficiency in Spatial Reasoning
- MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models
- Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
- Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
- Neuro-Symbolic Spatial Reasoning in Segmentation
- Directional Reasoning Injection for Fine-Tuning MLLMs
- From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
- Learning an Image Editing Model without Image Editing Pairs
- VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
- GOPLA: Generalizable Object Placement Learning via Synthetic Augmentation of Human Arrangement
- Spatial Preference Rewarding for MLLMs Spatial Understanding
- Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
- Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- Generative Universal Verifier as Multimodal Meta-Reasoner
- Reasoning in Space via Grounding in the World
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
- NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
- DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
- Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
- VideoLucy: Deep Memory Backtracking for Long Video Understanding
- MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
- VideoNSA: Native Sparse Attention Scales Video Understanding
- ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?
- mmWalk: Towards Multi-modal Multi-view Walking Assistance
- Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
- video-SALMONN S: Streaming Audio-Visual LLMs Beyond Length Limits via Memory
- A Survey on Agentic Multimodal Large Language Models
- Judge Before Answer: Can MLLM Discern the False Premise in Question?
- Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
- RefineShot: Rethinking Cinematography Understanding with Foundational Skill Evaluation
- ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Towards Self-Refinement of Vision-Language Models with Triangular Consistency
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
- SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
- Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
- How to Teach Large Multimodal Models New Skills
- SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
- The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
- MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
- Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
- MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration
- VideoNorms: Benchmarking Cultural Awareness of Video Language Models
- SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
- Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
- Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models
- TTRV: Test-Time Reinforcement Learning for Vision Language Models
- VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
- OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
- EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark
- Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
- HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
- When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
- Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
- Visual Representations inside the Language Model
- A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
- Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
- FrameOracle: Learning What to See and How Much to See in Videos
- Harnessing Synthetic Preference Data for Enhancing Temporal Understanding of Video-LLMs
- Efficient Test-Time Scaling for Small Vision-Language Models
- Brain-Language Model Alignment: Insights into the Platonic Hypothesis and Intermediate-Layer Advantage
- Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond
- An Experimental Study on Generating Plausible Textual Explanations for Video Summarization
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment
- VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
- LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
- IRIS: Intrinsic Reward Image Synthesis
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
- MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
- MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
- StreamForest: Efficient Online Video Understanding with Persistent Event Memory
- Vision Function Layer in Multimodal LLMs
- LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
- Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
- AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy
- Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy
- RServe: Overlapping Encoding and Prefill for Efficient LMM Inference
- When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
- Latent Visual Reasoning
- NeMo: Needle in a Montage for Video-Language Understanding
- DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning
- VIVA+: Human-Centered Situational Decision-Making
- Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
- Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
- FreeRet: MLLMs as Training-Free Retrievers
- VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
- PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
- UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
- Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning
- Video Panels for Long Video Understanding
- MASH: A Multiplatform and Multimodal Annotated Dataset for Societal Impact of Hurricane
- RIV: Recursive Introspection Mask Diffusion Vision Language Model
- DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
- MMPB: It's Time for Multi-Modal Personalization
- GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
- Group Critical-token Policy Optimization for Autoregressive Image Generation
- WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
- Resolving Ambiguity in Gaze-Facilitated Visual Assistant Interaction Paradigm
- Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning
- Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
- VC-Agent: An Interactive Agent for Customized Video Dataset Collection
- MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
- MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
- VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
- ArchGPT: Understanding the World's Architectures with Large Multimodal Models
- Poisoning Prompt-Guided Sampling in Video Large Language Models
- Confidence-guided Refinement Reasoning for Zero-shot Question Answering
- Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding
- FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
- VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding
- OPENXRD: a comprehensive benchmark framework for LLM/MLLM XRD question answering
- AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
- ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- Bi-VLM: Pushing Ultra-Low Precision Post-Training Quantization Boundaries in Vision-Language Models
- Does Audio Matter for Modern Video-LLMs and Their Benchmarks?
- UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
- Adaptive Fast-and-Slow Visual Program Reasoning for Long-Form VideoQA
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- Visual Instruction Pretraining for Domain-Specific Foundation Models
- RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
- Memory-QA: Answering Recall Questions Based on Multimodal Memories
- NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning
- AgriDoctor: A Multimodal Intelligent Assistant for Agriculture
- From Easy to Hard: The MIR Benchmark for Progressive Interleaved Multi-Image Reasoning
- Seeing Culture: A Benchmark for Visual Reasoning and Grounding
- Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization
- AHA -- Predicting What Matters Next: Online Highlight Detection Without Looking Ahead
- See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
- BaseReward: A Strong Baseline for Multimodal Reward Model
- EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence
- CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
- Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
- UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets
- Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
- Towards Human-like Multimodal Conversational Agent by Generating Engaging Speech
- V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models
- Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
- AToken: A Unified Tokenizer for Vision
- Dense Video Understanding with Gated Residual Tokenization
- AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity
- SAIL-VL2 Technical Report
- Cinéaste: A Fine-grained Contextual Movie Question Answering Benchmark
- MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
- CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
- Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
- 3D Aware Region Prompted Vision Language Model
- MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
- Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
- PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
- Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
- Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
- InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning
- Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
- VQualA 2025 Challenge on Visual Quality Comparison for Large Multimodal Models: Methods and Results
- BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
- AdsQA: Towards Advertisement Video Understanding
- Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
- MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
- Visual Representation Alignment for Multimodal Large Language Models
- Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
- TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
- Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
- WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation
- GLEAM: Learning to Match and Explain in Cross-View Geo-Localization
- LLaDA-VLA: Vision Language Diffusion Action Models
- Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM
- Murakkab: Resource-Efficient Agentic Workflow Orchestration in Cloud Platforms
- Promptception: How Sensitive Are Large Multimodal Models to Prompts?
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
- Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- Challenges in Understanding Modality Conflict in Vision-Language Models
- RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
- Reinforced Visual Perception with Tools
- Improving Large Vision and Language Models by Learning from a Panel of Peers
- POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion
- Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation
- Do Video Language Models Really Know Where to Look? Diagnosing Attention Failures in Video Language Models
- Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
- SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
- Prompt the Unseen: Evaluating Visual-Language Alignment Beyond Supervision
- LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
- Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors
- LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
- Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
- Evaluating Recabilities of Foundation Models: A Multi-Domain, Multi-Dataset Benchmark
- ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding
- MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning
- R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
- Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
- StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
- MedGR2: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
- Video-LLMs with Temporal Visual Screening
- Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models
- Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum
- OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
- DIO: Refining Mutual Information and Causal Chain to Enhance Machine Abstract Reasoning Ability
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- An Empirical Study on How Video-LLMs Answer Video Questions
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
- RynnEC: Bringing MLLMs into Embodied World
- MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
- MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
- Mitigating Cross-Image Information Leakage in LVLMs for Multi-Image Tasks
- HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
- Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
- Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
- RadarQA: Multi-modal Quality Analysis of Weather Radar Forecasts
- Simple o3: Towards Interleaved Vision-Language Reasoning
- UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
- Thyme: Think Beyond Images
- Causality Matters: How Temporal Information Emerges in Video Language Models
- MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
- HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
- We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning
- Failures to Surface Harmful Contents in Video Large Language Models
- LLMC+: Benchmarking Vision-Language Model Compression with a Plug-and-play Toolkit
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- BigCharts-R1: Enhanced Chart Reasoning with Visual Reinforcement Finetuning
- MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
- The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models
- Episodic Memory Representation for Long-form Video Understanding
- CARES: Collaborative Agentic Reasoning for Error Detection in Surgery
- OmniVTLA: Vision-Tactile-Language-Action Model with Semantic-Aligned Tactile Sensing
- Mining the Social Fabric: Unveiling Communities for Fake News Detection in Short Videos
- Pose-RFT: Enhancing MLLMs for 3D Pose Generation via Hybrid Action Reinforcement Fine-Tuning
- CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
- Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Large Language Model
- LET-US: Long Event-Text Understanding of Scenes
- AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
- Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges
- Multimodal learning with next-token prediction for large multimodal models
- InfoCausalQA:Can Models Perform Non-explicit Causal Reasoning Based on Infographic?
- VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
- Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
- MV-Debate: Multi-view Agent Debate with Dynamic Reflection Gating for Multimodal Harmful Content Detection in Social Media
- IAD-R1: Reinforcing Consistent Reasoning in Industrial Anomaly Detection
- Automated Bug Frame Retrieval from Gameplay Videos Using Vision-Language Models
- VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
- X-SAM: From Segment Anything to Any Segmentation
- RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case
- Training-Free Multimodal Large Language Model Orchestration
- Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding
- Analyzing and Mitigating Object Hallucination: A Training Bias Perspective
- Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
- TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding
- VLMQ: Efficient Post-Training Quantization for Large Vision-Language Models via Hessian Augmentation
- Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery
- ADSeeker: A Knowledge-Infused Framework for Anomaly Detection and Reasoning
- VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
- Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
- MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine
- Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
- Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
- VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
- Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting
- Engagement Prediction of Short Videos with Large Multimodal Models
- StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
- MGCR-Net:Multimodal Graph-Conditioned Vision-Language Reconstruction Network for Remote Sensing Change Detection
- MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
- E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
- MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning
- From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model
- Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
- UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
- MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models
- VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
- Trade-offs in Image Generation: How Do Different Dimensions Interact?
- X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
- The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM
- EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO
- SafeDriveRAG: Towards Safe Autonomous Driving with Knowledge Graph-based Retrieval-Augmented Generation
- ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
- Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
- Enhancing Spatial Reasoning through Visual and Textual Thinking
- Cognitive Chain-of-Thought: Structured Multimodal Reasoning about Social Situations
Related