MUSIQ: Multi-scale Image Quality Transformer
2021/08/12 by Junjie Ke, Qifei Wang, Ke, Junjie +7 · 301 citations
Computer Science · Engineering · #Advanced Image Fusion Techniques #Artificial intelligence #Computer science #Computer vision #Convolutional neural network #Data mining #Embedding #Engineering #Image (mathematics) #Image Enhancement Techniques #Image and Video Quality Assessment #Image quality #Pattern recognition (psychology) #Representation (politics) #Scale (ratio) #Transformer #cs.CV
paper · pdf · doi:10.48550/arxiv.2108.05997
published in arXiv (Cornell University) (Cornell University) · ICCV 2021
arxiv created 2021/08/12 · openalex publication_date 2021/08/12 · arxiv updated 2021/08/16 · openalex created_date 2025/10/10 · openalex updated_date 2026/08/05
Abstract
Image quality assessment (IQA) is an important research topic for understanding and improving visual experience. The current state-of-the-art IQA methods are based on convolutional neural networks (CNNs). The performance of CNN-based models is often compromised by the fixed shape constraint in batch training. To accommodate this, the input images are usually resized and cropped to a fixed shape, causing image quality degradation. To address this, we design a multi-scale image quality Transformer (MUSIQ) to process native resolution images with varying sizes and aspect ratios. With a multi-scale image representation, our proposed method can capture image quality at different granularities. Furthermore, a novel hash-based 2D spatial embedding and a scale embedding is proposed to support the positional embedding in the multi-scale representation. Experimental results verify that our method can achieve state-of-the-art performance on multiple large scale IQA datasets such as PaQ-2-PiQ, SPAQ and KonIQ-10k.
Citations
Cited by
- Iterative Inference-time Scaling with Adaptive Frequency Steering for Image Super-Resolution
- Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
- Plug In, Grade Right: Psychology-Inspired AGIQA
- GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion
- FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution
- A Reference-Free Framework for Evaluating Single-Frame ISP Pipelines
- ScaleResfusion: Residual Rectified Flow based on Residual Vector Field
- Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
- SplatBright: Generalizable Low-Light Scene Reconstruction from Sparse Views via Physically-Guided Gaussian Enhancement
- Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
- Generative Refocusing: Flexible Defocus Control from a Single Image
- Guiding Perception-Reasoning Closer to Human in Blind Image Quality Assessment
- Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
- SPDMark: Selective Parameter Displacement for Robust Video Watermarking
- Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior
- Zero-shot Adaptation of Stable Diffusion via Plug-in Hierarchical Degradation Representation for Real-World Super-Resolution
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment
- FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model
- Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
- Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement
- TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search
- UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- DEAR: Dataset for Evaluating the Aesthetics of Rendering
- Splannequin: Freezing Monocular Mannequin-Challenge Footage with Dual-Detection Splatting
- SA-IQA: Redefining Image Quality Assessment for Spatial Aesthetics with Multi-Dimensional Rewards
- ICM-SR: Image-Conditioned Manifold Regularization for Image Super-Resolution
- EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
- OmniScaleSR: Unleashing Scale-Controlled Diffusion Prior for Faithful and Realistic Arbitrary-Scale Image Super-Resolution
- Auto3R: Automated 3D Reconstruction and Scanning via Data-driven Uncertainty Quantification
- FMA-Net++: Motion- and Exposure-Aware Real-World Joint Video Super-Resolution and Deblurring
- Beyond the Ground Truth: Enhanced Supervision for Image Restoration
- Rethinking Surgical Smoke: A Smoke-Type-Aware Laparoscopic Video Desmoking Method and Dataset
- PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution
- PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
- SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting
- PAI-Bench: A Comprehensive Benchmark For Physical AI
- TPCNet: Triple physical constraints for Low-light Image Enhancement
- IRPO: Boosting Image Restoration via Post-training GRPO
- DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline
- Vision Bridge Transformer at Scale
- DesignPref: Capturing Personal Preferences in Visual Design Generation
- Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decoupling
- STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
- Test-Time Preference Optimization for Image Restoration
- Sphinx: Efficiently Serving Novel View Synthesis using Regression-Guided Selective Refinement
- Zero-Shot Video Deraining with Video Diffusion Models
- Nested Unfolding Network for Real-World Concealed Object Segmentation
- UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- Hybrid Event Frame Sensors: Modeling, Calibration, and Simulation
- VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
- One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
- HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
- Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
- Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
- PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization
- Real-World Adverse Weather Image Restoration via Dual-Level Reinforcement Learning with High-Quality Cold Start
- THEval. Evaluation Framework for Talking Head Video Generation
- Diffusion Transformer meets Multi-level Wavelet Spectrum for Single Image Super-Resolution
- Evaluating Video Quality Metrics for Neural and Traditional Codecs using 4K/UHD-1 Videos
- Emu3.5: Native Multimodal Models are World Learners
- SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM
- Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
- SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning
- FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
- SCEESR: Semantic-Control Edge Enhancement for Diffusion-Based Super-Resolution
- Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning
- DP2O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution
- World-in-World: World Models in a Closed-Loop World
- Boosting Fidelity for Pre-Trained-Diffusion-Based Low-Light Image Enhancement via Condition Refinement
- Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- Counting Hallucinations in Diffusion Models
- FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution
- Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
- OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment
- Local-Global Context-Aware and Structure-Preserving Image Super-Resolution
- BurstDeflicker: A Benchmark Dataset for Flicker Removal in Dynamic Scenes
- MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
- Enhancing Infrared Vision: Progressive Prompt Fusion Network and Benchmark
- HandEval: Taking the First Step Towards Hand Quality Evaluation in Generated Images
- HeadsUp! High-Fidelity Portrait Image Super-Resolution
- LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring
- MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration
- SkipSR: Faster Super Resolution with Token Skipping
- VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
- PickStyle: Video-to-Video Style Transfer with Context-Style Adapters
- DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
- MATRIX: Mask Track Alignment for Interaction-aware Video Generation
- SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
- Character Mixing for Video Generation
- Pack and Force Your Memory: Long-form and Consistent Video Generation
- TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling
- DHQA-4D: Perceptual Quality Assessment of Dynamic 4D Digital Human
- PocketSR: The Super-Resolution Expert in Your Pocket Mobiles
- Extreme Blind Image Restoration via Prompt-Conditioned Information Bottleneck
- InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment
- Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- Asymmetric VAE for One-Step Video Super-Resolution Acceleration
- Reinforcement Learning with Inverse Rewards for World Model Post-training
- Texture Vector-Quantization and Reconstruction Aware Prediction for Generative Super-Resolution
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- Seeing the Unseen in Low-light Spike Streams
- Enhancing Blind Face Restoration through Online Reinforcement Learning
- Rethinking Inter-LoRA Orthogonality in Adapter Merging: Insights from Orthogonal Monte Carlo Dropout
- LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer
- Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
- BlindPSNR: A No-Reference Fidelity Predictor for Low-Light Image Enhancement
- 4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans
- RFMSR: Residual Flow Matching for Image Super-Resolution
- Split and Drive: Dual-Axis Disentanglement for Real-Time Gaussian Head Avatars
- SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
- TuningIQA: Fine-Grained Blind Image Quality Assessment for Livestreaming Camera Tuning
- SEGA: A Transferable Signed Ensemble Gaussian Black-Box Attack against No-Reference Image Quality Assessment Models
- VideoFrom3D: 3D Scene Video Generation via Complementary Image and Video Diffusion Models
- Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
- DocIQ: A Benchmark Dataset and Feature Fusion Network for Document Image Quality Assessment
- OS-DiffVSR: Towards One-step Latent Diffusion Model for High-detailed Real-world Video Super-Resolution
- Layout Stroke Imitation: A Layout Guided Handwriting Stroke Generation for Style Imitation with Diffusion Model
- TinySR: Pruning Diffusion for Real-World Image Super-Resolution
- Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation
- VQualA 2025 Challenge on Visual Quality Comparison for Large Multimodal Models: Methods and Results
- MDIQA: Unified Image Quality Assessment for Multi-dimensional Evaluation and Restoration
- BIR-Adapter: A Low-Complexity Diffusion Model Adapter for Blind Image Restoration
- Perception-oriented Bidirectional Attention Network for Image Super-resolution Quality Assessment
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- A Synthetic-to-Real Dehazing Method based on Domain Unification
- Aesthetic Image Captioning with Saliency Enhanced MLLMs
- Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
- Palette Aligned Image Diffusion
- RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- MILO: A Lightweight Perceptual Quality Metric for Image and Latent-Space Optimization
- Style4D-Bench: A Benchmark Suite for 4D Stylization
- RDDM: Practicing RAW Domain Diffusion Model for Real-world Image Restoration
- HiRQA: Hierarchical Ranking and Quality Alignment for Opinion-Unaware Image Quality Assessment
- Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration
- Fine-grained Image Quality Assessment for Perceptual Image Restoration
- MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
- DiffIER: Optimizing Diffusion Models with Iterative Error Reduction
- ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images
- NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
- RASR: Retrieval-Augmented Super Resolution for Practical Reference-based Image Restoration
- Personalized Face Super-Resolution with Identity Decoupling and Fitting
- Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos
- SelfHVD: Self-Supervised Handheld Video Deblurring
- Cut2Next: Generating Next Shot via In-Context Tuning
- Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models
- Sea-Undistort: A Dataset for Through-Water Image Restoration in High Resolution Airborne Bathymetric Mapping
- TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
- OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution
- AU-IQA: A Benchmark Dataset for Perceptual Quality Assessment of AI-Enhanced User-Generated Content
- QuantVSR: Low-Bit Post-Training Quantization for Real-World Video Super-Resolution
- Diffusion Once and Done: Degradation-Aware LoRA for Efficient All-in-One Image Restoration
- Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
- Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
- UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
- Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation
- Visual-Language Model Knowledge Distillation Method for Image Quality Assessment
- Robust Adverse Weather Removal via Spectral-based Spatial Grouping
- Text-Aware Image Restoration with Diffusion Models
- APT: Improving Diffusion Models for High Resolution Image Generation with Adaptive Path Tracing
- Harnessing Diffusion-Yielded Score Priors for Image Restoration
- JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1
- EndoControlMag: Robust Endoscopic Vascular Motion Magnification with Periodic Reference Resetting and Hierarchical Tissue-aware Dual-Mask Control
- Fine-structure Preserved Real-world Image Super-resolution via Transfer VAE Training
- GT-Mean Loss: A Simple Yet Effective Solution for Brightness Mismatch in Low-Light Image Enhancement
- DEFNet: Multitasks-based Deep Evidential Fusion Network for Blind Image Quality Assessment
- Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement
- Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
- ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
- Perceptual Classifiers: Detecting Generative Images using Perceptual Features
- DFDNet: Dynamic Frequency-Guided De-Flare Network
- Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution
- DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment
- TRIQA: Image Quality Assessment by Contrastive Pretraining on Ordered Distortion Triplets
- Elevating 3D Models: High-Quality Texture and Geometry Refinement from a Low-Quality Model
- Product of Experts for Visual Generation
- LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4×RTX 4090s
- Robust ID-Specific Face Restoration via Alignment Learning
- RefSTAR: Blind Facial Image Restoration with Reference Selection, Transfer, and Reconstruction
- Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
- When Schrödinger Bridge Meets Real-World Image Dehazing with Unpaired Training
- DreamArt: Generating Interactable Articulated Objects from a Single Image
- Semantic Frame Interpolation
- PixIE: Prompted Pixel-Space Low-Light Image Enhancement
- Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers
- DAM-VSR: Disentanglement of Appearance and Motion for Video Super-Resolution
- TRACE: Temporally Reliable Anatomically-Conditioned 3D CT Generation with Enhanced Efficiency
- Latent Posterior-Mean Rectified Flow for Higher-Fidelity Perceptual Face Restoration
- DiGA3D: Coarse-to-Fine Diffusional Propagation of Geometry and Appearance for Versatile 3D Inpainting
- A Systematic Investigation on Deep Learning-Based Omnidirectional Image and Video Super-Resolution
- Controllable Reference Guided Diffusion with Local Global Fusion for Real World Remote Sensing Image Super Resolution
- FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
- SCORP: Scene-Consistent Object Refinement via Proxy Generation and Tuning
- TurboVSR: Fantastic Video Upscalers and Where to Find Them
- Concept-based Adversarial Attack: a Probabilistic Perspective
- Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers
- PixelBoost: Leveraging Brownian Motion for Realistic-Image Super-Resolution
- Degradation-Modeled Multipath Diffusion for Tunable Metalens Photography
- FreeDNA: Endowing Domain Adaptation of Diffusion-Based Dense Prediction with Training-Free Domain Noise Alignment
- MS-IQA: A Multi-Scale Feature Fusion Network for PET/CT Image Quality Assessment
- SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution
- A Multi-Scale Spatial Attention-Based Zero-Shot Learning Framework for Low-Light Image Enhancement
- BPCLIP: A Bottom-up Image Quality Assessment from Distortion to Semantics Based on CLIP
- Emergent Temporal Correspondences from Video Diffusion Transformers
- RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought
- Private Training & Data Generation by Clustering Embeddings
- One-Step Diffusion for Detail-Rich and Temporally Consistent Video Super-Resolution
- 3DGS-IEval-15K: A Large-scale Image Quality Evaluation Database for 3D Gaussian-Splatting
- Vid-CamEdit: Video Camera Trajectory Editing with Generative Rendering from Estimated Geometry
- Stroke-based Cyclic Amplifier: Image Super-Resolution at Arbitrary Ultra-Large Scales
- AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation
- Optimization-Free Universal Watermark Forgery with Regenerative Diffusion Models
- SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training
- One-Step Diffusion-based Real-World Image Super-Resolution with Visual Perception Distillation
- The Devil is in the Darkness: Diffusion-Based Nighttime Dehazing Anchored in Brightness Perception
- Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
- Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
- Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation
- QuantFace: Efficient Quantization for Face Restoration
- Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution
- Video Signature: Implicit Watermarking for Video Diffusion Models
- Latent Guidance in Diffusion Models for Perceptual Evaluations
- IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models
- LAFR: Efficient Diffusion-based Blind Face Restoration via Latent Codebook Alignment Adapter
- DGIQA: Depth-guided Feature Attention and Refinement for Generalizable Image Quality Assessment
- Semantics-Guided Generative Image Compression
- Reference-Guided Identity Preserving Face Restoration
- Generative Image Compression by Estimating Gradients of the Rate-variable Feature Distribution
- Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality
- Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
- HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model
- RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration
- MoCRA: Mixture of Compositional Rank-1 Atoms for 4K All-in-One Video Restoration
- DiffusionReward: Enhancing Blind Face Restoration through Reward Feedback Learning
- MODEM: A Morton-Order Degradation Estimation Mechanism for Adverse Weather Image Recovery
- Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency
- Creatively Upscaling Images with Global-Regional Priors
- Deep Learning-Driven Ultra-High-Definition Image Restoration: A Survey
- Leveraging the Powerful Attention of a Pre-trained Diffusion Model for Exemplar-based Image Colorization
- GS2E: Gaussian Splatting is an Effective Data Generator for Event Stream Generation
- VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
- Context-Aware Autoregressive Models for Multi-Conditional Image Generation
- CompBench: Benchmarking Complex Instruction-guided Image Editing
- Accelerating Diffusion-based Super-Resolution with Dynamic Time-Spatial Sampling
- LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
- Instance-aware Image Colorization with Controllable Textual Descriptions and Segmentation Masks
- Semantic-Guided Diffusion Model for Single-Step Image Super-Resolution
- How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?
- EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution
- HiLLIE: Human-in-the-Loop Training for Low-Light Image Enhancement
- VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models
- SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
- Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields
- AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
- PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
- Augmenting Perceptual Super-Resolution via Image Quality Predictors
- FaithIR: Rethinking Infrared Image Super-Resolution from Perceptual Sharpness to Task Relevant Fidelity
- Dual Prompting Image Restoration with Diffusion Transformers
- UBLLIE: Unified Backlight and Low-Light Image Enhancement
- VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis
- Content-Distortion High-Order Interaction for Blind Image Quality Assessment
- Video-Bench: Human-Aligned Video Generation Benchmark
- IConFace: Fine-Grained Identity Conditioning for Reference-Aware Face Restoration
- WorldMark: A Unified Benchmark Suite for Interactive Video World Models
- MVQA: Mamba with Unified Sampling for Efficient Video Quality Assessment
- DSPO: Direct Semantic Preference Optimization for Real-World Image Super-Resolution
- Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration
- MoBGS: Motion Deblurring Dynamic 3D Gaussian Splatting for Blurry Monocular Video
- NTIRE 2025 Challenge on Short-form UGC Video Quality Assessment and Enhancement: KwaiSR Dataset and Study
- NTIRE 2025 Challenge on Real-World Face Restoration: Methods and Results
- Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis
- Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
- JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration
- Towards Realistic Low-Light Image Enhancement via ISP Driven Data Modeling
- Coding-Prior Guided Diffusion Network for Video Deblurring
- LiteKD-Net: Lightweight Knowledge-Distilled Network for Mobile Image Denoising
- Media Meets Communication in 6G: Fundamentals, Key Technologies, and Applications
- Enhanced Semantic Extraction and Guidance for UGC Image Super Resolution
- On Equivariance and Fast Sampling in Video Diffusion Models Trained with Warped Noise
- CleanMAP: Distilling Multimodal LLMs for Confidence-Driven Crowdsourced HD Map Updates
- Towards Explainable Partial-AIGC Image Quality Assessment
- LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
- ZipIR: Latent Pyramid Diffusion Transformer for High-Resolution Image Restoration
- VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
- S2R-HDR: A Large-Scale Rendered Dataset for HDR Fusion
- RASMD: RGB And SWIR Multispectral Driving Dataset for Robust Perception in Adverse Conditions
- Deep-learning–based assessment of postoperative nasolabial morphology in unilateral cleft lip repair
- Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
- Charm: The Missing Piece in ViT fine-tuning for Image Aesthetic Assessment
Related