A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
2025/08/13 by He, Shuting, Ji, Peilin, Yang, Yitong +4 · 6 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
paper · doi:10.48550/arxiv.2508.09977
Abstract
3D Gaussian Splatting (3DGS) has recently emerged as a powerful alternative to Neural Radiance Fields (NeRF) for 3D scene representation, offering high-fidelity photorealistic rendering with real-time performance. Beyond novel view synthesis, the explicit and compact nature of 3DGS enables a wide range of downstream applications that require geometric and semantic understanding. This survey provides a comprehensive overview of recent progress in 3DGS applications. It first introduces 2D foundation models that support semantic understanding and control in 3DGS applications, followed by a review of NeRF-based methods that inform their 3DGS counterparts. We then categorize 3DGS applications into segmentation, editing, generation, and other functional tasks. For each, we summarize representative methods, supervision strategies, and learning paradigms, highlighting shared design principles and emerging trends. Commonly used datasets and evaluation protocols are also summarized, along with comparative analyses of recent methods across public benchmarks. To support ongoing research and development, a continually updated repository of papers, code, and resources is maintained at https://github.com/heshuting555/Awesome-3DGS-Applications.
Citations
- TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming
- SAM 3D: 3Dfy Anything in Images
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
- COS3D: Collaborative Open-Vocabulary 3D Segmentation
- REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting
- FlashWorld: High-quality 3D Scene Generation within Seconds
- Perspective-aware 3D Gaussian Inpainting with Multi-view Consistency
- Stylos: Multi-View 3D Stylization with Single-Forward Gaussian Splatting
- Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
- MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
- FantasyStyle: Controllable Stylized Distillation for 3D Gaussian Splatting
- ReferSplat: Referring Segmentation in 3D Gaussian Splatting
- MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes
- Multimodal Referring Segmentation: A Survey
- ObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian Splatting
- Robust 3D-Masked Part-level Editing in 3D Gaussian Splatting with Regularized Score Distillation Sampling
- A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
- LangSplatV2: High-dimensional 3D Language Gaussian Splatting with 450+ FPS
- InterGSEdit: Interactive 3D Gaussian Splatting Editing with 3D Geometry-Consistent Attention Prior
- Outdoor Monocular SLAM with Global Scale-Consistent 3D Gaussian Pointmaps
- LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
- SIU3R: Simultaneous Scene Understanding and 3D Reconstruction Beyond Feature Alignment
- SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields
- SceneSplat++: A Large Dataset and Comprehensive Benchmark for Language Gaussian Splatting
- OpenSplat3D: Open-Vocabulary 3D Instance Segmentation using Gaussian Splatting
- Pro3D-Editor : A Progressive-Views Perspective for Consistent and Precise 3D Editing
- SpatialSplat: Efficient Semantic 3D from Sparse Unposed Images
- AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views
- CLIPGaussian: Universal and Multimodal Style Transfer Based on Gaussian Splatting
- Styl3R: Instant 3D Stylized Reconstruction for Arbitrary Scenes and Styles
- CCL-LGS: Contrastive Codebook Learning for 3D Language Gaussian Splatting
- GT2-GS: Geometry-aware Texture Transfer for Gaussian Splatting
- iSegMan: Interactive Segment-and-Manipulate 3D Gaussians
- QuickSplat: Fast 3D Surface Reconstruction via Learned Gaussian Initialization
- Apply Hierarchical-Chain-of-Generation to Complex Attributes Text-to-3D Generation
- Training-Free Hierarchical Scene Understanding for Gaussian Splatting with Superpoint Graphs
- CAGS: Open-Vocabulary 3D Scene Understanding with Context-Aware Gaussian Splatting
- TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting
- FMLGS: Fast Multilevel Language Embedded Gaussians for Part-level Interactive Agents
- Multi-StyleGS: Stylizing Gaussian Splatting with Multiple Styles
- econSG: Efficient and Multi-view Consistent Open-Vocabulary 3D Semantic Gaussians
- WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic Environments
- Scene Splatter: Momentum 3D Scene Generation from Single Image with Video Diffusion Model
- VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
- Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration
- ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
- ABC-GS: Alignment-Based Controllable Style Transfer for 3D Gaussian Splatting
- Semantic Consistent Language Gaussian Splatting for Point-Level Open-vocabulary Querying
- COB-GS: Clear Object Boundaries in 3DGS Segmentation Based on Boundary-Adaptive Gaussian Splitting
- MATT-GS: Masked Attention-based 3DGS for Robot Perception and Object Detection
- SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining
- PanoGS: Gaussian-based Panoptic Segmentation for 3D Open Vocabulary Scene Understanding
- TaoAvatar: Real-Time Lifelike Full-Body Talking Avatars for Augmented Reality via 3D Gaussian Splatting
- VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling
- Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting
- Generative Gaussian Splatting: Generating 3D Scenes with Video Diffusion Priors
- DynaGSLAM: Real-Time Gaussian-Splatting SLAM for Online Rendering, Tracking, Motion Predictions of Moving Objects in Dynamic Scenes
- VGGT: Visual Geometry Grounded Transformer
- HRAvatar: High-Quality and Relightable Gaussian Head Avatar
- GSV3D: Gaussian Splatting-based Geometric Distillation with Stable Video Diffusion for Single-Image 3D Object Generation
- Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs
- Morpheus: Text-Driven 3D Gaussian Splat Shape and Color Stylization
- OpenGS-SLAM: Open-Set Dense Semantic SLAM with 3D Gaussian Splatting for Object-Level Scene Understanding
- Compression in 3D Gaussian Splatting: A Survey of Methods, Trends, and Future Directions
- Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
- Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
- FLARE: Feed-forward Geometry, Appearance and Camera Estimation from Uncalibrated Sparse Views
- GaussianMotion: End-to-End Learning of Animatable Gaussian Avatars with Pose Guidance from Text
- AuraFusion360: Augmented Unseen Region Alignment for Reference-based 360° Unbounded Scene Inpainting
- LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation
- Lifting by Gaussians: A Simple, Fast and Flexible Method for 3D Instance Segmentation
- Drag Your Gaussian: Effective Drag-Based Editing with Score Distillation for 3D Gaussian Splatting
- SEGS-SLAM: Structure-enhanced 3D Gaussian Splatting SLAM with Appearance Embedding
- Taming Feed-forward Reconstruction Models as Latent Encoders for 3D Generative Models
- Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation
- PERSE: Personalized 3D Generative Avatars from A Single Portrait
- ArtNVG: Content-Style Separated Artistic Neighboring-View Gaussian Stylization
- LangSurf: Language-Embedded Surface Gaussians for 3D Scene Understanding
- GSemSplat: Generalizable Semantic 3D Gaussian Splatting from Uncalibrated Image Pairs
- OmniSplat: Taming Feed-Forward 3D Gaussian Splatting for Omnidirectional Images with Editable Capabilities
- CATSplat: Context-Aware Transformer with Spatial Guidance for Generalizable 3D Gaussian Splatting from A Single-View Image
- Wonderland: Navigating 3D Scenes from a Single Image
- EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian Splatting
- StrandHead: Text to Hair-Disentangled 3D Head Avatars Using Human-Centric Priors
- SuperGSeg: Open-Vocabulary 3D Segmentation with Structured Super-Gaussians
- FreeSplatter: Pose-free Gaussian Splatting for Sparse-view 3D Reconstruction
- SLGaussian: Fast Language Gaussian Splatting in Sparse Views
- ProGDF: Progressive Gaussian Differential Field for Controllable and Flexible 3D Editing
- Diffusion-Based Attention Warping for Consistent 3D Scene Editing
- Splatter-360: Generalizable 360∘ Gaussian Splatting for Wide-baseline Panoramic Images
- Text-to-3D Gaussian Splatting with Physics-Grounded Motion Generation
- Turbo3D: Ultra-fast Text-to-3D Generation
- SGSST: Scaling Gaussian Splatting StyleTransfer
- 3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting
- CTRL-D: Controllable Dynamic 3D Scene Editing with Personalized 2D Diffusion
- GradiSeg: Gradient-Guided Gaussian Segmentation with Enhanced 3D Boundary Precision
- Bootstraping Clustering of Gaussians for View-consistent 3D Scene Understanding
- InstanceGaussian: Appearance-Semantic Joint Gaussian Representation for 3D Instance-Level Perception
- Neural Surface Priors for Editable Gaussian Splatting
- SelfSplat: Pose-Free and 3D Prior-Free Generalizable 3D Gaussian Splatting
- GLS: Geometry-aware 3D Language Gaussian Splatting
- SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting Synthesis
- NovelGS: Consistent Novel-view Denoising via Large Gaussian Reconstruction Model
- Baking Gaussian Splatting into Diffusion Denoiser for Fast and Scalable Single-stage Image-to-3D Generation and Reconstruction
- GaussianCut: Interactive segmentation via graph cut for 3D Gaussian Splatting
- MVSplat360: Feed-Forward 360 Scene Synthesis from Sparse Views
- No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images
- Epipolar-Free 3D Gaussian Splatting for Generalizable Novel View Synthesis
- CompGS: Unleashing 2D Compositionality for Compositional Text-to-3D via Dynamically Optimizing 3D Gaussians
- Large Spatial Model: End-to-end Unposed Images to Semantic 3D
- VistaDream: Sampling multiview consistent images for single-view scene reconstruction
- MvDrag3D: Drag-based Creative 3D Editing via Multi-view Generation-Reconstruction Priors
- LUDVIG: Learning-Free Uplifting of 2D Visual Features to Gaussian Splatting Scenes
- UniGS: Modeling Unitary 3D Gaussians for Novel View Synthesis from Sparse-view Images
- DepthSplat: Connecting Gaussian Splatting and Depth
- Long-LRM: Long-sequence Large Reconstruction Model for Wide-coverage Gaussian Splats
- 3D Gaussian Splatting in Robotics: A Survey
- Enhancing Single Image to 3D Generation using Gaussian Splatting and Hybrid Diffusion Priors
- 3D Vision-Language Gaussian Splatting
- GS-VTON: Controllable 3D Virtual Try-on with Gaussian Splatting
- Gaussian-Det: Learning Closed-Surface Gaussians for 3D Object Detection
- 3DGS-DET: Empower 3D Gaussian Splatting with Boundary Guidance and Box-Focused Sampling for 3D Object Detection
- Flex3D: Feed-Forward 3D Generation with Flexible Reconstruction Model and Input View Curation
- WaSt-3D: Wasserstein-2 Distance for Scene-to-Scene Stylization on 3D Gaussians
- Language-Embedded Gaussian Splats (LEGS): Incrementally Building Room-Scale Representations with a Mobile Robot
- Portrait Video Editing Empowered by Multimodal Generative Priors
- FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
- Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
- MVGaussian: High-Fidelity text-to-3D Content Generation with Multi-View Guidance and Surface Densification
- GASP: Gaussian Splatting for Physic-Based Simulations
- DreamMapping: High-Fidelity Text-to-3D Generation via Variational Distribution Mapping
- ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis
- TranSplat: Generalizable 3D Gaussian Splatting from Sparse Multi-View Images with Transformers
- Splatt3R: Zero-shot Gaussian Splatting from Uncalibrated Image Pairs
- Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing
- Atlas Gaussians Diffusion for 3D Generation
- Large Point-to-Gaussian Model for Image-to-3D Generation
- 3D Gaussian Editing with A Single Image
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
- SAM 2: Segment Anything in Images and Videos
- Localized Gaussian Splatting Editing with Contextual Awareness
- Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction Cycle
- ScalingGaussian: Enhancing 3D Content Creation with Generative Gaussian Splatting
- 3D Gaussian Splatting: Survey, Technologies, Challenges, and Opportunities
- 3D Gaussian Splatting: Survey, Technologies, Challenges, and Opportunities
- HoloDreamer: Holistic 3D Panoramic World Generation from Text Descriptions
- Connecting Consistency Distillation to Score Distillation for Text-to-3D Generation
- DreamCatalyst: Fast and High-Quality 3D Editing via Controlling Editability and Identity Preservation
- Click-Gaussian: Interactive Segmentation to Any 3D Gaussians
- 3DEgo: 3D Editing on the Go!
- StyleSplat: 3D Object Style Transfer with Gaussian Splatting
- Reference-based Controllable Scene Stylization with Gaussian Splatting
- LaRa: Efficient Large-Baseline Radiance Fields
- TrAME: Trajectory-Anchored Multi-View Editing for Text-Guided 3D Gaussian Splatting Manipulation
- Fast and Efficient: Mask Neural Fields for 3D Scene Segmentation
- VDG: Vision-Only Dynamic Gaussian for Driving Simulation
- GaussianDreamerPro: Text to Manipulable 3D Gaussians with Highly Enhanced Quality
- HumanSplat: Generalizable Single-Image Human Gaussian Splatting with Structure Priors
- 3DGS.zip: A survey on 3D Gaussian Splatting Compression Methods
- GradeADreamer: Enhanced Text-to-3D Generation Using Gaussian Splatting and Multi-View Diffusion
- WonderWorld: Interactive 3D Scene Generation from a Single Image
- Generative Gaussian Splatting for Unbounded 3D City Generation
- Flash3D: Feed-Forward Generalisable 3D Scene Reconstruction from a Single Image
- Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion
- Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion
- Dynamic 3D Gaussian Fields for Urban Areas
- FastLGS: Speeding up Language Embedded Gaussians with Feature Grid Mapping
- OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
- GECO: Generative Image-to-3D within a SECOnd
- 3DitScene: Editing Any Scene via Language-guided Disentangled Gaussian Splatting
- RT-GS2: Real-Time Generalizable Semantic Segmentation for 3D Gaussian Representations of Radiance Fields
- GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane
- TIGER: Text-Instructed 3D Gaussian Retrieval and Coherent Editing
- D-MiSo: Editing Dynamic 3D Scenes using Multi-Gaussians Soup
- CoR-GS: Sparse-View 3D Gaussian Splatting via Co-Regularization
- Dreamer XL: Towards High-Resolution Text-to-3D Generation via Trajectory Score Matching
- GaussianVTON: 3D Human Virtual Try-ON via Multi-Stage Gaussian Splatting Editing with Image Prompting
- FastScene: Text-Driven Fast 3D Indoor Scene Generation via Panoramic Gaussian Splatting
- GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting
- DGE: Direct Gaussian 3D Editing by Consistent Multi-view Editing
- GScream: Learning 3D Geometry and Feature Consistent Gaussian Splatting for Object Removal
- Contrastive Gaussian Clustering: Weakly Supervised 3D Scene Segmentation
- PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation
- InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior
- RefFusion: Reference Adapted Diffusion Models for 3D Scene Inpainting
- Gaga: Group Any Gaussians via 3D-aware Memory Bank
- RealmDreamer: Text-Driven 3D Scene Generation with Inpainting and Depth Diffusion
- DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian Splatting
- Hash3D: Training-free Acceleration for 3D Generation
- 3D Geometry-aware Deformable Gaussian Splatting for Dynamic View Synthesis
- DreamScene: 3D Gaussian-based Text-to-3D Scene Generation via Formation Pattern Sampling
- Mirror-3DGS: Incorporating Mirror Reflections into 3D Gaussian Splatting
- Octree-GS: Towards Consistent Real-time Rendering with LOD-Structured 3D Gaussians
- latentSplat: Autoencoding Variational Gaussians for Fast Generalizable 3D Reconstruction
- Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting
- GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation
- Mini-Splatting: Representing Scenes with a Constrained Number of Gaussians
- GVGEN: Text-to-3D Generation with Volumetric Representation
- VFusion3D: Learning Scalable 3D Generative Models from Video Diffusion Models
- View-Consistent 3D Editing with Gaussian Splatting
- BAD-Gaussians: Bundle Adjusted Deblur Gaussian Splatting
- BrightDreamer: Generic 3D Gaussian Generative Framework for Fast Text-to-3D Synthesis
- Recent Advances in 3D Gaussian Splatting
- Analytic-Splatting: Anti-Aliased 3D Gaussian Splatting via Analytic Integration
- N2F2: Hierarchical Scene Understanding with Nested Neural Feature Fields
- Controllable Text-to-3D Generation via Surface-Aligned Gaussian Splatting
- GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting
- Texture-GS: Disentangling the Geometry and Texture for 3D Gaussian Splatting Editing
- Hyper-3DG: Text-to-3D Gaussian Generation via Hypergraph
- Reconstruction and Simulation of Elastic Objects with Spring-Mass 3D Gaussians
- Gaussian Splatting in Style
- GaussCtrl: Multi-View Consistent Text-Driven 3D Gaussian Splatting Editing
- StyleGaussian: Instant 3D Style Transfer with Gaussian Splatting
- FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
- DNGaussian: Optimizing Sparse-View 3D Gaussian Radiance Fields with Global-Local Depth Normalization
- GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting
- BAGS: Blur Agnostic Gaussian Splatting through Multi-Scale Kernel Modeling
- Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
- 3DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint Videos
- VastGaussian: Vast 3D Gaussians for Large Scene Reconstruction
- Spec-Gaussian: Anisotropic View-Dependent Appearance for 3D Gaussian Splatting
- GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting
- LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation
- 4D-Rotor Gaussian Splatting: Towards Efficient Novel View Synthesis for Dynamic Scenes
- SAGD: Boundary-Enhanced Segment Anything in 3D Gaussian via Gaussian Decomposition
- VR-GS: A Physical Dynamics-Aware Interactive Gaussian Splatting System in Virtual Reality
- TIP-Editor: An Accurate 3D Editor Following Both Text-Prompts And Image-Prompts
- GARField: Group Anything with Radiance Fields
- A Survey on 3D Gaussian Splatting
- AGG: Amortized Generative 3D Gaussians for Single Image to 3D
- FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
- Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels
- Spacetime Gaussian Feature Splatting for Real-Time Dynamic View Synthesis
- LangSplat: 3D Language Gaussian Splatting
- DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision
- DUSt3R: Geometric 3D Vision Made Easy
- SpecNeRF: Gaussian Directional Encoding for Specular Reflections
- Splatter Image: Ultra-Fast Single-View 3D Reconstruction
- pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction
- Triplane Meets Gaussian Splatting: Fast and Generalizable Single-View 3D Reconstruction with Transformers
- Aleth-NeRF: Illumination Adaptive NeRF with Concealing Field Assumption
- Text2Immersion: Generative Immersive Scene with 3D Gaussians
- DrivingGaussian: Composite Gaussian Splatting for Surrounding Dynamic Autonomous Driving Scenes
- Gaussian Splatting SLAM
- EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingS
- Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature Fields
- HiFi4G: High-Fidelity Human Performance Rendering via Compact Gaussian Splatting
- WonderJourney: Going from Anywhere to Everywhere
- Gaussian-Flow: 4D Reconstruction with Dynamic 3D Gaussian Particle
- GauHuman: Articulated Gaussian Splatting from Monocular Human Videos
- SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM
- GaussianAvatars: Photorealistic Head Avatars with Rigged 3D Gaussians
- Aligning and Prompting Everything All at Once for Universal Visual Perception
- SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic Scenes
- StableDreamer: Taming Noisy Score Distillation Sampling for Text-to-3D
- Segment Any 3D Gaussians
- Gaussian Grouping: Segment and Edit Anything in 3D Scenes
- FSGS: Real-Time Few-shot View Synthesis using Gaussian Splatting
- NeuSG: Neural Implicit Surface Reconstruction with 3D Gaussian Splatting Guidance
- Periodic Vibration Gaussian: Dynamic Urban Scene Reconstruction and Real-time Rendering
- SparseGS: Sparse View Synthesis using 3D Gaussian Splatting
- Rethinking FID: Towards a Better Evaluation Metric for Image Generation
- Language Embedded 3D Gaussians for Open-Vocabulary Scene Understanding
- Scaffold-GS: Structured 3D Gaussians for View-Adaptive Rendering
- DynMF: Neural Motion Factorization for Real-time Dynamic View Synthesis with 3D Gaussian Splatting
- HUGS: Human Gaussian Splats
- Gaussian Shell Maps for Efficient 3D Human Generation
- CG3D: Compositional Generation for Text-to-3D via Gaussian Splatting
- GaussianShader: 3D Gaussian Splatting with Shading Functions for Reflective Surfaces
- Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular, Stereo, and RGB-D Cameras
- HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting
- RichDreamer: A Generalizable Normal-Depth Diffusion Model for Detail Richness in Text-to-3D
- LightGaussian: Unbounded 3D Gaussian Compression with 15x Reduction and 200+ FPS
- Multi-Scale 3D Gaussian Splatting for Anti-Aliased Rendering
- Point'n Move: Interactive Scene Object Manipulation on Gaussian Splatting Radiance Fields
- GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
- Mip-Splatting: Alias-free 3D Gaussian Splatting
- GS-IR: 3D Gaussian Splatting for Inverse Rendering
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- GaussianEditor: Swift and Controllable 3D Editing with Gaussian Splatting
- LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes
- Depth-Regularized Optimization for 3D Gaussian Splatting in Few-Shot Images
- Compact 3D Gaussian Representation for Radiance Field
- SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction and High-Quality Mesh Rendering
- OmniSeg3D: Omniversal 3D Segmentation via Hierarchical Contrastive Learning
- GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
- PhysGaussian: Physics-Integrated 3D Gaussians for Generative Dynamics
- LucidDreamer: Towards High-Fidelity Text-to-3D Generation via Interval Score Matching
- Compressed 3D Gaussian Splatting for Accelerated Novel View Synthesis
- Drivable 3D Gaussian Avatars
- Text-to-3D with Classifier Score Distillation
- ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single Image
- Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model
- Real-time Photorealistic Dynamic Scene Representation and Rendering with 4D Gaussian Splatting
- GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models
- 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering
- Text-to-3D using Gaussian Splatting
- DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation
- Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack
- Deformable 3D Gaussians for High-Fidelity Monocular Dynamic Scene Reconstruction
- MVDream: Multi-view Diffusion for 3D Generation
- ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes
- Dynamic 3D Gaussians: Tracking by Persistent Dynamic View Synthesis
- MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions
- 3D Gaussian Splatting for Real-Time Radiance Field Rendering
- 3D Gaussian Splatting for Real-Time Radiance Field Rendering
- Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis
- Contrastive Lift: 3D Object Instance Segmentation by Slow-Fast Contrastive Fusion
- GRES: Generalized Referring Expression Segmentation
- ProlificDreamer: High-Fidelity and Diverse Text-to-3D Generation with Variational Score Distillation
- Weakly Supervised 3D Open-vocabulary Segmentation
- Text2NeRF: Text-Driven 3D Scene Generation with Neural Radiance Fields
- Segment Anything in 3D with Radiance Fields
- Long-Term Photometric Consistent Novel View Synthesis with Diffusion Models
- Visual Instruction Tuning
- DINOv2: Learning Robust Visual Features without Supervision
- Micrograph segmentations for DDEVD
- Segment Anything
- Instruct-NeRF2NeRF: Editing 3D Scenes with Instructions
- Text2Room: Extracting Textured 3D Meshes from 2D Text-to-Image Models
- Zero-1-to-3: Zero-shot One Image to 3D Object
- LERF: Language Embedded Radiance Fields
- OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and Generation
- Interactive Segmentation of Radiance Fields
- Panoptic Lifting for 3D Scene Understanding with Neural Fields
- Scalable Diffusion Models with Transformers
- Objaverse: A Universe of Annotated 3D Objects
- Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D Generation
- Magic3D: High-Resolution Text-to-3D Content Creation
- InstructPix2Pix: Learning to Follow Image Editing Instructions
- Latent-NeRF for Shape-Guided Generation of 3D Shapes and Textures
- LAION-5B: An open large-scale dataset for training next generation image-text models
- DreamFusion: Text-to-3D using 2D Diffusion
- Neural Feature Fusion Fields: 3D Distillation of Self-Supervised 2D Image Representations
- DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
- DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
- DM-NeRF: 3D Scene Geometry Decomposition and Manipulation from 2D Images
- Exploring CLIP for Assessing the Look and Feel of Images
- Object-Compositional Neural Implicit Surfaces
- Decomposing NeRF for Editing via Feature Field Distillation
- Neural Volumetric Object Selection
- Google Scanned Objects: A High-Quality Dataset of 3D Scanned Household Items
- DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection
- Language-driven Semantic Segmentation
- High-Resolution Image Synthesis with Latent Diffusion Models
- High-Resolution Image Synthesis with Latent Diffusion Models
- GRAM: Generative Radiance Manifolds for 3D-Aware Image Generation
- Efficient Geometry-aware 3D Generative Adversarial Networks
- CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance Fields
- CoNeRF: Controllable Neural Radiance Fields
- Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields
- Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields
- Learning Object-Compositional Neural Radiance Field for Editable Scene Rendering
- LoRA: Low-Rank Adaptation of Large Language Models
- Editing Conditional Radiance Fields
- Emerging Properties in Self-Supervised Vision Transformers
- In-Place Scene Labelling and Understanding with Implicit Scene Representation
- NeX: Real-time View Synthesis with Neural Basis Expansion
- Learning Transferable Visual Models From Natural Language Supervision
- Infinite Nature: Perpetual View Generation of Natural Scenes from a Single Image
- Denoising Diffusion Implicit Models
- Denoising Diffusion Probabilistic Models
- BlendedMVS: A Large-scale Dataset for Generalized Multi-view Stereo Networks
- The Replica Dataset: A Digital Replica of Indoor Spaces
- Expressive Body Capture: 3D Hands, Face, and Body from a Single Image
- Matchable Image Retrieval by Learning from Surface Reconstruction
- The Unreasonable Effectiveness of Deep Features as a Perceptual Metric
- Panoptic Segmentation
- ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes
- Improved Techniques for Training GANs
- ShapeNet: An Information-Rich 3D Model Repository
- Rethinking the Inception Architecture for Computer Vision
- Making a “Completely Blind” Image Quality Analyzer
- Image quality assessment: from error visibility to structural similarity
- Segment then Splat: Unified 3D Open-Vocabulary Segmentation via Gaussian Splatting
- DreamPhysics: Learning Physics-Based 3D Dynamics with Video Diffusion Priors
- Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and Rendering
- GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
- Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian Splatting
- T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation
- Relightable 3D Gaussians: Realistic Point Cloud Relighting with BRDF Decomposition and Ray Tracing
- CompGS: Smaller and Faster Gaussian Splatting with Vector Quantization
Cited by
Related