Playing Atari with Deep Reinforcement Learning
2013/12/19 by Volodymyr Mnih, Koray Kavukcuoglu, Mnih, Volodymyr +11 · 5 voices · 5,122 citations
Computer Science · Decision Sciences · Engineering · Mathematics · #Advanced Bandit Algorithms Research #Architecture #Artificial Intelligence in Games #Artificial intelligence #Bellman equation #Computer science #Control (management) #Convolutional neural network #Deep learning #Engineering #Function (biology) #Machine learning #Mathematical optimization #Mathematics #Pixel #Q-learning #Reinforcement #Reinforcement Learning in Robotics #Reinforcement learning #Value (mathematics) #cs.LG
paper · pdf · doi:10.48550/arxiv.1312.5602
published in arXiv (Cornell University) (Cornell University) · NIPS Deep Learning Workshop 2013
arxiv created 2013/12/19 · openalex publication_date 2013/12/19 · arxiv updated 2013/12/20 · openalex created_date 2025/10/10 · openalex updated_date 2026/08/05
Abstract
We present the first deep learning model to successfully learn control policies directly from high-dimensional sensory input using reinforcement learning. The model is a convolutional neural network, trained with a variant of Q-learning, whose input is raw pixels and whose output is a value function estimating future rewards. We apply our method to seven Atari 2600 games from the Arcade Learning Environment, with no adjustment of the architecture or learning algorithm. We find that it outperforms all previous approaches on six of the games and surpasses a human expert on three of them.
Citations
Cited by
- Error Amplification Limits ANN-to-SNN Conversion in Continuous Control
- What Matters for Simulation to Online Reinforcement Learning on Real Robots
- From Trajectories to Instructions: Language-Conditioned Meta-Reinforcement Learning
- Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning
- HypEMBER: Hypernetwork-based Ensemble for Robust Policy Learning of Parametrized Dynamical Systems
- Physics-enhanced reinforcement learning for real-time optimal control of dynamical systems
- Co-Design of Aeroelastic Systems with Deep Reinforcement Learning
- Memory Merge DQN: Sensitivity Weighted Target Updates for Stable Value Learning
- Molecular quantum control algorithm design by reinforcement learning
- From Particles to Perils: SVGD-Based Hazardous Scenario Generation for Autonomous Driving Systems Testing
- Partial recurrence enables robust and efficient computation
- Hierarchical Reasoning Model
- Reinforcement Learning Teachers of Test Time Scaling
- Can machines learn density functionals? Past, present, and future of ML in DFT
- Evolution and The Knightian Blindspot of Machine Learning
- The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models
- Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning
- Nash Equilibrium Between Consumer Electronic Devices and DoS Attacker for Distributed IoT-enabled RSE Systems
- VulnGym: Evaluating Vulnerability Management Strategies against Advanced Persistent Threats
- CAST: Game Solvers as Turn-Level Teachers for LLM Agents
- Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning
- Endpoint Replay: Compressing the Recency Buffer in Deep Reinforcement Learning
- A Survey of Freshness-Aware Wireless Networking with Reinforcement Learning
- Recurrent Off-Policy Deep Reinforcement Learning Doesn't Have to be Slow
- LacaDM: A Latent Causal Diffusion Model for Multiobjective Reinforcement Learning
- Beyond Sliding Windows: Learning to Manage Memory in Non-Markovian Environments
- CoDrone: Autonomous Drone Navigation Assisted by Edge and Cloud Foundation Models
- Online Robust Reinforcement Learning with General Function Approximation
- Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
- Demonstration-Guided Continual Reinforcement Learning in Dynamic Environments
- StarCraft+: Benchmarking Multi-agent Algorithms in Adversary Paradigm
- VET Your Agent: Towards Host-Independent Autonomy via Verifiable Execution Traces
- Spectral Representation-based Reinforcement Learning
- Tiny, On-Device Decision Makers with the MiniConv Library
- FM-EAC: Feature Model-based Enhanced Actor-Critic for Multi-Task Control in Dynamic Environments
- Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning
- Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
- Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation
- Advancing LLM-Based Security Automation with Customized Group Relative Policy Optimization for Zero-Touch Networks
- TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
- Scalable Offline Model-Based RL with Action Chunks
- Deep Reinforcement Learning for Phishing Detection with Transformer-Based Semantic Features
- A Fast Anti-Jamming Cognitive Radar Deployment Algorithm Based on Reinforcement Learning
- Marti-5: A Mathematical Model of "Self in the World" as a First Step Toward Self-Awareness
- AI & Human Co-Improvement for Safer Co-Superintelligence
- Using Machine Learning to Take Stay-or-Go Decisions in Data-driven Drone Missions
- Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
- Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism
- Deep Reinforcement Learning for Dynamic Algorithm Configuration: A Case Study on Optimizing OneMax with the (1+(λ,λ))-GA
- Tutorial on Large Language Model-Enhanced Reinforcement Learning for Wireless Networks
- TECM*: A Data-Driven Assessment to Reinforcement Learning Methods and Application to Heparin Treatment Strategy for Surgical Sepsis
- Dynamic Configuration of On-Street Parking Spaces using Multi Agent Reinforcement Learning
- Differentiable Weightless Controllers: Learning Logic Circuits for Continuous Control
- Extending NGU to Multi-Agent RL: A Preliminary Study
- Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments
- Hardware-Software Collaborative Computing of Photonic Spiking Reinforcement Learning for Robotic Continuous Control
- SmallWorlds: Assessing Dynamics Understanding of World Models in Isolated Environments
- Heterogeneous Multi-Agent Reinforcement Learning with Attention for Cooperative and Scalable Feature Transformation
- Distributed quantum architecture search using multi-agent reinforcement learning
- Adaptive Dueling Double Deep Q-networks in Uniswap V3 Replication and Extension with Mamba
- Attention Trajectories as a Diagnostic Axis for Deep Reinforcement Learning
- InF-ATPG: Intelligent FFR-Driven ATPG with Advanced Circuit Representation Guided Reinforcement Learning
- Video Object Recognition in Mobile Edge Networks: Local Tracking or Edge Detection?
- SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning
- MOMA-AC: A preference-driven actor-critic framework for continuous multi-objective multi-agent reinforcement learning
- Physical Reinforcement Learning
- LAOF: Robust Latent Action Learning with Optical Flow Constraints
- Limitations of Scalarisation in MORL: A Comparative Study in Discrete Environments
- IPR-1: Interactive Physical Reasoner
- Simulated Human Learning in a Dynamic, Partially-Observed, Time-Series Environment
- Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning
- Object-Centric World Models for Causality-Aware Reinforcement Learning
- Boosting Reinforcement Learning in 3D Visuospatial Tasks Through Human-Informed Curriculum Design
- NFQ2.0: The CartPole Benchmark Revisited
- PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
- Graph Neural Networks, Deep Reinforcement Learning and Probabilistic Topic Modeling for Strategic Multiagent Settings
- Simulator and Experience Enhanced Diffusion Model for Comprehensive ECG Generation
- Representation Learning Enables Scalable Multitask Deep Reinforcement Learning
- Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning
- Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
- Source-Only Cross-Weather LiDAR via Geometry-Aware Point Drop
- Approximating Shapley Explanations in Reinforcement Learning
- Deep Reinforcement Learning for Dynamic Origin-Destination Matrix Estimation in Microscopic Traffic Simulations Considering Credit Assignment
- Multi-agent Coordination via Flow Matching
- Environment Agnostic Goal-Conditioning, A Study of Reward-Free Autonomous Learning
- Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction
- DQN Performance with Epsilon Greedy Policies and Prioritized Experience Replay
- From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning
- None To Optima in Few Shots: Bayesian Optimization with MDP Priors
- Power Control Based on Multi-Agent Deep Q Network for D2D Communication
- Challenges in Credit Assignment for Multi-Agent Reinforcement Learning in Open Agent Systems
- Towards Reinforcement Learning Based Log Loading Automation
- Conformal Prediction Beyond the Horizon: Distribution-Free Inference for Policy Evaluation
- To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning
- Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning
- A Benchmark Study of Deep Reinforcement Learning Algorithms for the Container Stowage Planning Problem
- Expanding LLM Agent Boundaries with Strategy-Guided Exploration
- Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO
- NavQ: Learning a Q-Model for Foresighted Vision-and-Language Navigation
- Dense and Diverse Goal Coverage in Multi Goal Reinforcement Learning
- Learning-Based vs Human-Derived Congestion Control: An In-Depth Experimental Study
- Adaptive Surrogate Gradients for Sequential Reinforcement Learning in Spiking Neural Networks
- Survey and Tutorial of Reinforcement Learning Methods in Process Systems Engineering
- Hybrid Modeling, Sim-to-Real Reinforcement Learning, and Large Language Model Driven Control for Digital Twins
- Transitive RL: Value Learning via Divide and Conquer
- Reinforcement learning-guided optimization of critical current in high-temperature superconductors
- Is Temporal Difference Learning the Gold Standard for Stitching in RL?
- Narrowing Action Choices with AI Improves Human Sequential Decisions
- Software Engineering Agents for Embodied Controller Generation : A Study in Minigrid Environments
- PARL: Prompt-based Agents for Reinforcement Learning
- ProSh: Probabilistic Shielding for Model-free Reinforcement Learning
- Balancing Specialization and Centralization: A Multi-Agent Reinforcement Learning Benchmark for Sequential Industrial Control
- COLA: Continual Learning via Autoencoder Retrieval of Adapters
- StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
- Actor-Free Continuous Control via Structurally Maximizable Q-Functions
- REPAIR Approach for Social-based City Reconstruction Planning in case of natural disasters
- Heterogeneous Adversarial Play in Interactive Environments
- Learning to Design Soft Hands using Reward Models
- Continuous Q-Score Matching: Diffusion Guided Reinforcement Learning for Continuous-Time Control
- Learning to play: A Multimodal Agent for 3D Game-Play
- Human-Allied Relational Reinforcement Learning
- Zero-shot World Models via Search in Memory
- The Pursuit of Diversity: Multi-Objective Testing of Deep Reinforcement Learning Agents
- Stop-RAG: Value-Based Retrieval Control for Iterative RAG
- ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- Simplicial Embeddings Improve Sample Efficiency in Actor-Critic Agents
- AOAD-MAT: Transformer-based multi-agent deep reinforcement learning model considering agents' order of action decisions
- Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
- MATH-Beyond: A Benchmark for RL to Expand Beyond the Base Model
- Neutral Agent-based Adversarial Policy Learning against Deep Reinforcement Learning in Multi-party Open Systems
- ExGRPO: Learning to Reason from Experience
- Efficient Restarts in Non-Stationary Model-Free Reinforcement Learning
- High-Dimensional Learning Dynamics of Quantized Models with Straight-Through Estimator
- PAC-Bayesian Reinforcement Learning Trains Generalizable Policies
- Experience-Efficient Model-Free Deep Reinforcement Learning Using Pre-Training
- Agent Learning via Early Experience
- Energy-Guided Diffusion Sampling for Long-Term User Behavior Prediction in Reinforcement Learning-based Recommendation
- Rethinking Provenance Completeness with a Learning-Based Linux Scheduler
- Dual Goal Representations
- Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions
- Medical Vision Language Models as Policies for Robotic Surgery
- AutoPentester: An LLM Agent-based Framework for Automated Pentesting
- BuilderBench: The Building Blocks of Intelligent Agents
- Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading
- Wavelet Predictive Representations for Non-Stationary Reinforcement Learning
- Q-Learning with Shift-Aware Upper Confidence Bound in Non-Stationary Reinforcement Learning
- Deep Reinforcement Learning for Multi-Agent Coordination
- Memory-Driven Self-Improvement for Decision Making with Large Language Models
- RL-Guided Data Selection for Language Model Finetuning
- Learning Distinguishable Representations in Deep Q-Networks for Linear Transfer
- Quantifying Generalisation in Imitation Learning
- Beyond Softmax: A Natural Parameterization for Categorical Random Variables
- Optimisation of Resource Allocation in Heterogeneous Wireless Networks Using Deep Reinforcement Learning
- STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
- CaRe-BN: Precise Moving Statistics for Stabilizing Spiking Neural Networks in Reinforcement Learning
- Bridging Discrete and Continuous RL: Stable Deterministic Policy Gradient with Martingale Characterization
- Learning Market Making with Closing Auctions
- Reinforcement Learning-Based Prompt Template Stealing for Text-to-Image Models
- Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
- Activation Function Design Sustains Plasticity in Continual Learning
- Impact of Collective Behaviors of Autonomous Vehicles on Urban Traffic Dynamics: A Multi-Agent Reinforcement Learning Approach
- ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation
- Physics of Learning: A Lagrangian perspective to different learning paradigms
- Adaptive Federated Learning Defences via Trust-Aware Deep Q-Networks
- Sig2Model: A Boosting-Driven Model for Updatable Learned Indexes
- Inverse Reinforcement Learning with Just Classification and a Few Regressions
- Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration
- Leveraging Temporally Extended Behavior Sharing for Multi-task Reinforcement Learning
- Embodied AI: From LLMs to World Models
- Understanding Adversarial Attacks on Observations in Deep Reinforcement Learning
- PrintAnything: Learning an Intermediate Representation for 3D printing G-code Generation
- AutoSoC: Automating Algorithm-SOC Co-design for Aerial Robots
- SOE: Sample-Efficient Robot Policy Self-Improvement via On-Manifold Exploration
- Moving by Looking: Towards Vision-Driven Avatar Motion Generation
- SlicePilot: Demystifying Network Slice Placement in Heterogeneous Cloud Infrastructures
- Efficient Reinforcement Learning by Reducing Forgetting with Elephant Activation Functions
- CayleyPy Growth: Efficient growth computations and hundreds of new conjectures on Cayley graphs (Brief version)
- Learning View and Target Invariant Visual Servoing for Navigation
- Towards General Computer Control with Hierarchical Agents and Multi-Level Action Spaces
- On the Limits of Tabular Hardness Metrics for Deep RL: A Study with the Pharos Benchmark
- Learning from Observation: A Survey of Recent Advances
- The Distribution Shift Problem in Transportation Networks using Reinforcement Learning and AI
- Online reinforcement learning via sparse Gaussian mixture model Q-functions
- TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
- Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
- Zero-sum turn games using Q-learning: finite computation with security guarantees
- PuzzleJAX: A Benchmark for Reasoning and Learning
- Linear Dynamics meets Linear MDPs: Closed-Form Optimal Policies via Reinforcement Learning
- Compositional shield synthesis for safe reinforcement learning in partial observability
- A Practical Adversarial Attack against Sequence-based Deep Learning Malware Classifiers
- ICR-RL: Deep Reinforcement Learning via In-Context Regression
- A neural drift-plus-penalty algorithm for network power allocation and routing
- How well can LLMs provide planning feedback in grounded environments?
- Reinforcement Learning based Dynamic Model Selection for Short-Term Load Forecasting
- One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
- Language Self-Play For Data-Free Training
- Timing the Message: Language-Based Notifications for Time-Critical Assistive Settings
- Physics-informed Value Learner for Offline Goal-Conditioned Reinforcement Learning
- TrajAware: Graph Cross-Attention and Trajectory-Aware for Generalisable VANETs under Partial Observations
- FinXplore: An Adaptive Deep Reinforcement Learning Framework for Balancing and Discovering Investment Opportunities
- An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning
- Improving Robustness of AlphaZero Algorithms to Test-Time Environment Changes
- Reinforced Data-Driven Estimation for Spectral Properties of Koopman Semigroup in Stochastic Dynamical Systems
- Off-Policy Actor-Critic with Shared Experience Replay
- Deep Reinforcement Learning for Sponsored Search Real-time Bidding
- Multi-Agent Reinforcement Learning for Task Offloading in Wireless Edge Networks
- Machine Intelligence on the Edge: Interpretable Cardiac Pattern Localisation Using Reinforcement Learning
- Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning
- Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
- ReLATE: Learning Efficient Sparse Encoding for High-Performance Tensor Decomposition
- Breaking the Cold-Start Barrier: Reinforcement Learning with Double and Dueling DQNs
- Improving Aviation Safety Analysis: Automated HFACS Classification Using Reinforcement Learning with Group Relative Policy Optimization
- Off-Policy Self-Critical Training for Transformer in Visual Paragraph Generation
- Out-of-Distribution Dynamics Detection: RL-Relevant Benchmarks and Results
- Machine-Learning-Assisted Pulse Design for State Preparation in a Noisy Environment
- The Effectiveness of Memory Replay in Large Scale Continual Learning
- Demystifying Reward Design in Reinforcement Learning for Upper Extremity Interaction: Practical Guidelines for Biomechanical Simulations in HCI
- SPACE: Unsupervised Object-Oriented Scene Representation via Spatial Attention and Decomposition
- Online Hyper-parameter Tuning in Off-policy Learning via Evolutionary Strategies
- Optimistic Distributionally Robust Policy Optimization
- Financial Decision Making using Reinforcement Learning with Dirichlet Priors and Quantum-Inspired Genetic Optimization
- Real-time visual tracking by deep reinforced decision making
- Learning Game-Playing Agents with Generative Code Optimization
- PoolFlip: A Multi-Agent Reinforcement Learning Security Environment for Cyber Defense
- Deep Reinforcement Learning for Complex Manipulation Tasks with Sparse Feedback
- Real-Time Model Checking for Closed-Loop Robot Reactive Planning
- Skill-Aligned Fairness in Multi-Agent Learning for Collaboration in Healthcare
- Language Models For Generalised PDDL Planning: Synthesising Sound and Programmatic Policies
- Uncertainty-Aware Reinforcement Learning for Collision Avoidance
- Adversarial Agent Behavior Learning in Autonomous Driving Using Deep Reinforcement Learning
- A Dynamical Systems Framework for Reinforcement Learning Safety and Robustness Verification
- A Reinforcement Learning Approach to the View Planning Problem
- Overcoming Digital Gravity when using AI in Public Health Decisions
- Slipping to the Extreme: A Mixed Method to Explain How Extreme Opinions Infiltrate Online Discussions
- Stability-certified reinforcement learning: A control-theoretic perspective
- SDN Flow Entry Management Using Reinforcement Learning
- Beyond ReLU: Chebyshev-DQN for Enhanced Deep Q-Networks
- Deep Reinforcement Learning for Imbalanced Classification
- Large Batch Training Does Not Need Warmup
- Pixels to Play: A Foundation Model for 3D Gameplay
- Competitive Experience Replay
- A Short Survey On Memory Based Reinforcement Learning
- Soft Actor-Critic Algorithms and Applications
- Adversarial recovery of agent rewards from latent spaces of the limit order book
- PAPPL: Personalized AI-Powered Progressive Learning Platform
- MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
- Boosting Image Recognition with Non-differentiable Constraints
- Discovering hierarchies using Imitation Learning from hierarchy aware policies
- Predictor-Corrector Policy Optimization
- Stochastic Recursive Momentum for Policy Gradient Methods
- Towards Content Provider Aware Recommender Systems: A Simulation Study on the Interplay between User and Provider Utilities
- Data-Efficient Reinforcement Learning for Malaria Control
- Task-Agnostic Morphology Evolution
- MAPEL: Multi-Agent Pursuer-Evader Learning using Situation Report
- Meta-Learning Bandit Policies by Gradient Ascent
- A Comprehensive Review of AI Agents: Transforming Possibilities in Technology and Beyond
- Approximate Inference with Amortised MCMC
- D2Q Synchronizer: Distributed SDN Synchronization for Time Sensitive Applications
- Learn to Memorize: Optimizing LLM-based Agents with Adaptive Memory Framework
- Developing a Simple Model for Sand-Tool Interaction and Autonomously Shaping Sand
- Designing Interpretable Approximations to Deep Reinforcement Learning
- Understanding in Artificial Intelligence
- Optimizing Large-Scale Fleet Management on a Road Network using Multi-Agent Deep Reinforcement Learning with Graph Neural Network
- Hierarchically Integrated Models: Learning to Navigate from Heterogeneous Robots
- RUDDER: Return Decomposition for Delayed Rewards
- Reinforced Language Models for Sequential Decision Making
- Reinforcement-Learning-Designed Field-Free Sub-Nanosecond Spin-Orbit-Torque Switching
- Offline Reinforcement Learning with Soft Behavior Regularization
- Improve Agents without Retraining: Parallel Tree Search with Off-Policy Correction
- Dirichlet Pruning for Neural Network Compression
- Playing Catan with Cross-dimensional Neural Network
- Multi-Agent Path Planning based on MPC and DDPG
- Distributional Reinforcement Learning for Multi-Dimensional Reward Functions
- A Review On Safe Reinforcement Learning Using Lyapunov and Barrier Functions
- Continual Learning in Neural Networks
- SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens
- LPaintB: Learning to Paint from Self-Supervision
- Toward Lifelong Learning in Equilibrium Propagation: Sleep-like and Awake Rehearsal for Enhanced Stability
- Playing Atari Space Invaders with Sparse Cosine Optimized Policy Evolution
- An Intelligent Control Strategy for buck DC-DC Converter via Deep Reinforcement Learning
- Meta Reinforcement Learning with Distribution of Exploration Parameters Learned by Evolution Strategies
- ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction
- From proprioception to long-horizon planning in novel environments: A hierarchical RL model
- Reinforcement learning for batch bioprocess optimization
- Evolutionary Optimization of Deep Learning Agents for Sparrow Mahjong
- A State Aggregation Approach for Solving Knapsack Problem with Deep Reinforcement Learning
- Efficient Ridesharing Dispatch Using Multi-Agent Reinforcement Learning
- Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges
- PANAMA: A Network-Aware MARL Framework for Multi-Agent Path Finding in Digital Twin Ecosystems
- Progressive Relation Learning for Group Activity Recognition
- Multimedia Edge Computing
- Maximum Entropy Model Rollouts: Fast Model Based Policy Optimization without Compounding Errors
- Robusta: Robust AutoML for Feature Selection via Reinforcement Learning
- Tail-Risk-Safe Monte Carlo Tree Search under PAC-Level Guarantees
- CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL
- Smaller Models, Better Generalization
- Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies
- HCRide: Harmonizing Passenger Fairness and Driver Preference for Human-Centered Ride-Hailing
- Deep reinforcement learning to detect brain lesions on MRI: a proof-of-concept application of reinforcement learning to medical images
- Model-based Adversarial Meta-Reinforcement Learning
- Robust Deep Reinforcement Learning through Adversarial Loss
- DiWA: Diffusion Policy Adaptation with World Models
- Fast reinforcement learning for decentralized MAC optimization
- Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies
- A Non-Technical Survey on Deep Convolutional Neural Network Architectures
- Replay in Deep Learning: Current Approaches and Missing Biological Elements
- Reinforcement Learning with General Value Function Approximation: Provably Efficient Approach via Bounded Eluder Dimension
- Transfer Learning Across Patient Variations with Hidden Parameter Markov Decision Processes
- CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
- Recurrent Value Functions
- ACTRCE: Augmenting Experience via Teacher's Advice For Multi-Goal Reinforcement Learning
- A Machine Learning Approach to Routing
- MRPB 1.0: A Unified Benchmark for the Evaluation of Mobile Robot Local Planning Approaches
- Learning Network Dismantling Without Handcrafted Inputs
- Task-Relevant Object Discovery and Categorization for Playing First-person Shooter Games
- Hierarchical Message-Passing Policies for Multi-Agent Reinforcement Learning
- Collaborative creativity with Monte-Carlo Tree Search and Convolutional Neural Networks
- Safe Reinforcement Learning Using Robust Action Governor
- Cooperative multi-agent reinforcement learning for high-dimensional nonequilibrium control
- Making Sense of Reinforcement Learning and Probabilistic Inference
- Variance Reduction for Deep Q-Learning using Stochastic Recursive Gradient
- Personalized Education with Ranking Alignment Recommendation
- Dynamics-Aware Unsupervised Discovery of Skills
- Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks
- Deep Implicit Coordination Graphs for Multi-agent Reinforcement Learning
- Enhancing Multi-Agent Collaboration with Attention-Based Actor-Critic Policies
- Boosting Soft Actor-Critic: Emphasizing Recent Experience without Forgetting the Past
- Striving for Simplicity and Performance in Off-Policy DRL: Output Normalization and Non-Uniform Sampling
- Precision medicine as a control problem: Using simulation and deep\n reinforcement learning to discover adaptive, personalized multi-cytokine\n therapy for sepsis
- CausalWorld: A Robotic Manipulation Benchmark for Causal Structure and\n Transfer Learning
- PreCo: A Large-scale Dataset in Preschool Vocabulary for Coreference Resolution
- DeepGo: Predictive Directed Greybox Fuzzing
- What Does it Mean for a Neural Network to Learn a "World Model"?
- Top-K Off-Policy Correction for a REINFORCE Recommender System
- Giraffe: Using Deep Reinforcement Learning to Play Chess
- Learning Robotic Manipulation through Visual Planning and Acting
- Why Pay More When You Can Pay Less: A Joint Learning Framework for Active Feature Acquisition and Classification
- Tracking the Race Between Deep Reinforcement Learning and Imitation Learning -- Extended Version
- FAST: Similarity-based Knowledge Transfer for Efficient Policy Learning
- Evolutionary Population Curriculum for Scaling Multi-Agent Reinforcement Learning
- Machine Learning With Neuromorphic Photonics
- Influencing Towards Stable Multi-Agent Interactions
- Deep Reinforcement Learning for Producing Furniture Layout in Indoor Scenes
- Region Growing Curriculum Generation for Reinforcement Learning
- Deep Variation-structured Reinforcement Learning for Visual Relationship and Attribute Detection
- Implicit Generation and Generalization in Energy-Based Models
- Causal Confusion in Imitation Learning
- Minding Motivation: The Effect of Intrinsic Motivation on Agent Behaviors
- Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning
- Quantum Reinforcement Learning by Adaptive Non-local Observables
- Hierarchical Deep Reinforcement Learning Framework for Multi-Year Asset Management Under Budget Constraints
- Virne: A Comprehensive Benchmark for RL-based Network Resource Allocation in NFV
- Deep Reinforcement Learning for Backup Strategies against Adversaries
- Recurrent Predictive State Policy Networks
- Multi-Year Maintenance Planning for Large-Scale Infrastructure Systems: A Novel Network Deep Q-Learning Approach
- Reinforcement Learning via Conservative Agent for Environments with Random Delays
- From Roots to Rewards: Dynamic Tree Reasoning with Reinforcement Learning
- The Dynamics of Handwriting Improves the Automated Diagnosis of Dysgraphia
- SHAQ: Incorporating Shapley Value Theory into Multi-Agent Q-Learning
- Learning Visual Predictive Models of Physics for Playing Billiards
- OPAC: Opportunistic Actor-Critic
- Deep Reinforcement Learning-based Task Offloading in Satellite-Terrestrial Edge Computing Networks
- ADARES: Adaptive Resource Management for Virtual Machines
- Uniform State Abstraction For Reinforcement Learning
- AutoPilot: Automating SoC Design Space Exploration for SWaP Constrained Autonomous UAVs
- A Dual-Hormone Closed-Loop Delivery System for Type 1 Diabetes Using Deep Reinforcement Learning
- Vizarel: A System to Help Better Understand RL Agents
- Adaptive perturbation adversarial training: based on reinforcement learning
- Self-Tuning Sectorization: Deep Reinforcement Learning Meets Broadcast Beam Optimization
- GASL: Guided Attention for Sparsity Learning in Deep Neural Networks
- Deep Reinforcement Learning for Tactile Robotics: Learning to Type on a Braille Keyboard
- Learning Nonlinear Causal Reductions to Explain Reinforcement Learning Policies
- Mapping Instructions to Actions in 3D Environments with Visual Goal Prediction
- Randomized Policy Learning for Continuous State and Action MDPs
- Auto-MAP: A DQN Framework for Exploring Distributed Execution Plans for DNN Workloads
- RL-NCS: Reinforcement learning based data-driven approach for nonuniform compressed sensing
- Interactive Machine Comprehension with Dynamic Knowledge Graphs
- All-In-One: Artificial Association Neural Networks
- ResearchDoom and CocoDoom: Learning Computer Vision with Games
- Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning
- Leveraging Extrinsic Dexterity for Occluded Grasping on Grasp Constraining Walls
- Learning to Control in Metric Space with Optimal Regret
- Learning dynamic polynomial proofs
- Revocable Deep Reinforcement Learning with Affinity Regularization for Outlier-Robust Graph Matching
- NeoNav: Improving the Generalization of Visual Navigation via Generating Next Expected Observations
- Towards Brain-inspired System: Deep Recurrent Reinforcement Learning for Simulated Self-driving Agent
- Deep Reinforcement Learning for Multi-Domain Dialogue Systems
- Training an Interactive Humanoid Robot Using Multimodal Deep Reinforcement Learning
- Towards A Rigorous Science of Interpretable Machine Learning
- Hippocampal representations emerge when training recurrent neural networks on a memory dependent maze navigation task
- LeRobot: An Open-Source Library for End-to-End Robot Learning
- Federated Reinforcement Learning in Heterogeneous Environments
- Detecting Adversarial Samples Using Density Ratio Estimates
- AutoEG: Automated Experience Grafting for Off-Policy Deep Reinforcement Learning
- PixelRL: Fully Convolutional Network with Reinforcement Learning for Image Processing
- Learning Socially Appropriate Robot Approaching Behavior Toward Groups using Deep Reinforcement Learning
- Divide-and-Conquer Reinforcement Learning
- Intelligent Trainer for Model-Based Reinforcement Learning
- Joint Policy Search for Multi-agent Collaboration with Imperfect Information
- Combining Reinforcement Learning with Model Predictive Control for On-Ramp Merging
- Grounding Hierarchical Reinforcement Learning Models for Knowledge Transfer
- Preference-based Multi-Objective Reinforcement Learning
- Amortized Variational Deep Q Network
- A View on Deep Reinforcement Learning in System Optimization
- The Accidental Pump and Dump: When Agentic AI Meets Autonomous Trading
- Knowledge accumulating: The general pattern of learning
- Reinforcement Learning on Variable Impedance Controller for High-Precision Robotic Assembly
- Fever Basketball: A Complex, Flexible, and Asynchronized Sports Game Environment for Multi-agent Reinforcement Learning
- Offline RL With Resource Constrained Online Deployment
- Polygonal Building Segmentation by Frame Field Learning
- Solve Traveling Salesman Problem by Monte Carlo Tree Search and Deep Neural Network
- Exponentially Increasing the Capacity-to-Computation Ratio for Conditional Computation in Deep Learning
- Modern Deep Reinforcement Learning Algorithms
- Chrome Dino Run using Reinforcement Learning
- Soft-Robust Actor-Critic Policy-Gradient
- Maximum Mutation Reinforcement Learning for Scalable Control
- MELD: Meta-Reinforcement Learning from Images via Latent State Models
- Novel Multi-Agent Action Masked Deep Reinforcement Learning for General Industrial Assembly Lines Balancing Problems
- Playing Atari with Hybrid Quantum-Classical Reinforcement Learning
- SMiRL: Surprise Minimizing Reinforcement Learning in Unstable Environments
- A Neural Networks Committee for the Contextual Bandit Problem
- Emergent Real-World Robotic Skills via Unsupervised Off-Policy Reinforcement Learning
- Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
- Explanation in Human-AI Systems: A Literature Meta-Review, Synopsis of Key Ideas and Publications, and Bibliography for Explainable AI
- Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents
- Learning predictive representations in autonomous driving to improve deep reinforcement learning
- Theory-informed neural networks for particle physics
- Spectral Bellman Method: Unifying Representation and Exploration in RL
- A Reinforcement Learning Environment For Job-Shop Scheduling
- The Benchmark Lottery
- Self-Imitation Advantage Learning
- The Adversarial Resilience Learning Architecture for AI-based Modelling, Exploration, and Operation of Complex Cyber-Physical Systems
- Corner Case Generation and Analysis for Safety Assessment of Autonomous Vehicles
- Neural Network Based Nonlinear Weighted Finite Automata
- Online Training and Pruning of Deep Reinforcement Learning Networks
- A Survey of Deep Learning for Geometry Problem Solving
- BenchRL-QAS: Benchmarking reinforcement learning algorithms for quantum architecture search
- Differentiable Robust LQR Layers
- Reinforcement Learning for Industrial Control Network Cyber Security Orchestration
- QAS-QTNs: Curriculum Reinforcement Learning-Driven Quantum Architecture Search for Quantum Tensor Networks
- Deep Reinforcement and InfoMax Learning
- Q-Networks for Binary Vector Actions
- Conservative Q-Learning for Offline Reinforcement Learning
- Learning to Sample the Most Useful Training Patches from Images
- Deep Learning: Our Miraculous Year 1990-1991
- Online Deep Reinforcement Learning for Autonomous UAV Navigation and Exploration of Outdoor Environments
- ANT: Learning Accurate Network Throughput for Better Adaptive Video Streaming
- Zero-Shot Learning of Text Adventure Games with Sentence-Level Semantics
- Optimal Operating Strategy for PV-BESS Households: Balancing Self-Consumption and Self-Sufficiency
- Learning Efficient and Effective Exploration Policies with Counterfactual Meta Policy
- Group Fairness in Bandit Arm Selection
- Implicit Generative Modeling for Efficient Exploration
- On the Ethics of Building AI in a Responsible Manner
- Learning What Data to Learn
- A study of first-passage time minimization via Q-learning in heated gridworlds
- PlanGAN: Model-based Planning With Sparse Rewards and Multiple Goals
- Reinforced active learning for image segmentation
- Self-driving scale car trained by Deep reinforcement learning
- Learning to Reason in Large Theories without Imitation
- A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark
- End-to-End Training of Deep Visuomotor Policies
- Virtual-Taobao: Virtualizing Real-world Online Retail Environment for Reinforcement Learning
- Robotic Grasp Manipulation Using Evolutionary Computing and Deep Reinforcement Learning
- Deep Reinforcement Learning for Dynamic Treatment Regimes on Medical Registry Data
- GPS Spoofing Attacks on AI-based Navigation Systems with Obstacle Avoidance in UAV
- TauRieL: Targeting Traveling Salesman Problem with a deep reinforcement learning inspired architecture
- Implementing Inductive bias for different navigation tasks through diverse RNN attractors
- A Study of State Aliasing in Structured Prediction with RNNs
- Mapping State Space using Landmarks for Universal Goal Reaching
- Weakly Supervised Video Summarization by Hierarchical Reinforcement Learning
- NVCell: Standard Cell Layout in Advanced Technology Nodes with Reinforcement Learning
- PsiPhi-Learning: Reinforcement Learning with Demonstrations using Successor Features and Inverse Temporal Difference Learning
- Multi-Task Reward Learning from Human Ratings
- Financial Crime & Fraud Detection Using Graph Computing: Application Considerations & Outlook
- Loss is its own Reward: Self-Supervision for Reinforcement Learning
- A Genetic Programming Approach to Designing Convolutional Neural Network Architectures
- Soft Actor-Critic With Integer Actions
- Quantum Machine Learning For Classical Data
- AMBER: Adaptive Multi-Batch Experience Replay for Continuous Action Control
- FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making
- A Deep Reinforcement Learning Approach for Ramp Metering Based on Traffic Video Data
- Learning Complex Multi-Agent Policies in Presence of an Adversary
- Partially Observable Markov Decision Process for Recommender Systems
- Architecting and Visualizing Deep Reinforcement Learning Models
- Generative Actor-Critic: An Off-policy Algorithm Using the Push-forward Model
- A Policy Efficient Reduction Approach to Convex Constrained Deep Reinforcement Learning
- Adaptive Policy Synchronization for Scalable Reinforcement Learning
- Universal Memory Architectures for Autonomous Machines
- What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study
- Variational Empowerment as Representation Learning for Goal-Based Reinforcement Learning
- A Survey of Reinforcement Learning for Software Engineering
- Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing
- Transfer Reinforcement Learning across Homotopy Classes
- GenAI-based Multi-Agent Reinforcement Learning towards Distributed Agent Intelligence: A Generative-RL Agent Perspective
- Regret Bounds and Reinforcement Learning Exploration of EXP-based Algorithms
- CubeTR: Learning to Solve The Rubiks Cube Using Transformers
- elsciRL: Integrating Language Solutions into Reinforcement Learning Problem Settings
- Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- Soft Expert Reward Learning for Vision-and-Language Navigation
- Ultrasound-Guided Robotic Navigation with Deep Reinforcement Learning
- Player-AI Interaction: What Neural Network Games Reveal About AI as Play
- Deep Reinforcement Learning in Applied Control: Challenges, Analysis, and Insights
- Explore Beyond the Boundary Using Entropic Information
- Multi-agent Reinforcement Learning-based In-place Scaling Engine for Edge-cloud Systems
- Task-Focused Consolidation with Spaced Recall: Making Neural Networks Learn like College Students
- Zero-Shot Context Generalization in Reinforcement Learning from Few Training Contexts
- OMiSO: Adaptive optimization of state-dependent brain stimulation to shape neural population states
- Combining Pre-Trained Models for Enhanced Feature Representation in Reinforcement Learning
- Off-Policy Evaluation Under Nonignorable Missing Data
- Artificial Generals Intelligence: Mastering Generals.io with Reinforcement Learning
- Improved Hard Example Mining by Discovering Attribute-based Hard Person Identity
- An Interaction-aware Evaluation Method for Highly Automated Vehicles
- Learning to Expand: Reinforced Pseudo-relevance Feedback Selection for Information-seeking Conversations
- Learning Lookahead Lemmas for Neural Network Verification
- Generalization in Reinforcement Learning for Radio Access Networks
- Non-decreasing Quantile Function Network with Efficient Exploration for Distributional Reinforcement Learning
- SimpleDS: A Simple Deep Reinforcement Learning Dialogue System
- Trust Region Policy Optimization
- Fast constraint satisfaction problem and learning-based algorithm for solving Minesweeper
- Evaluating the Safety of Deep Reinforcement Learning Models using Semi-Formal Verification
- Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods
- Beyond Training-time Poisoning: Component-level and Post-training Backdoors in Deep Reinforcement Learning
- Double Deep Q-Learning for Optimal Execution
- DISCO: Influence Maximization Meets Network Embedding and Deep Learning
- Recurrent Sum-Product-Max Networks for Decision Making in Perfectly-Observed Environments
- Natural Environment Benchmarks for Reinforcement Learning
- Mission-Aligned Learning-Informed Control of Autonomous Systems: Formulation and Foundations
- Improving Deep Learning Framework Testing with Model-Level Metamorphic Testing
- Data-Efficient Methods for Dialogue Systems
- Where to Intervene: Action Selection in Deep Reinforcement Learning
- Deep Reinforcement Learning Models Predict Visual Responses in the Brain: A Preliminary Result
- Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization
- Affordance as general value function: A computational model
- Active Screening for Recurrent Diseases: A Reinforcement Learning Approach
- MoTiAC: Multi-Objective Actor-Critics for Real-Time Bidding
- Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog
- CleanRL: High-quality Single-file Implementations of Deep Reinforcement Learning Algorithms
- A General Approach for Using Deep Neural Network for Digital Watermarking
- Next Best View Planning via Reinforcement Learning for Scanning of Arbitrary 3D Shapes
- On Hyper-parameter Tuning for Stochastic Optimization Algorithms
- On Characterizing the Capacity of Neural Networks using Algebraic Topology
- Gym-μRTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning
- TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents
- Multiagent Reinforcement Learning based Energy Beamforming Control
- Training Neural Networks Using Features Replay
- Reinforcement Learning with Perturbed Rewards
- Input Convex Neural Networks
- Deep Reinforcement Learning for Optimal Control of Space Heating
- Online Meta-Critic Learning for Off-Policy Actor-Critic Methods
- Quantum Circuit Structure Optimization for Quantum Reinforcement Learning
- Learning for routing: A guided review of recent developments and future directions
- Reinforcement Learning for Automated Cybersecurity Penetration Testing
- Scalable Voltage Control using Structure-Driven Hierarchical Deep Reinforcement Learning
- Brain Inspired Cognitive Model with Attention for Self-Driving Cars
- Control-Optimized Deep Reinforcement Learning for Artificially Intelligent Autonomous Systems
- Provably Efficient and Agile Randomized Q-Learning
- A Reinforcement Learning Approach for Optimal Control in Microgrids
- Cell Selection with Deep Reinforcement Learning in Sparse Mobile Crowdsensing
- Learning Causal State Representations of Partially Observable Environments
- Lyapunov-based Safe Policy Optimization for Continuous Control
- Is Q-learning Provably Efficient?
- Reinforcement Learning with Efficient Active Feature Acquisition
- Weakly-supervised Disentangling with Recurrent Transformations for 3D View Synthesis
- Beyond Exponentially Discounted Sum: Automatic Learning of Return Function
- Integrating Motion into Vision Models for Better Visual Prediction
- M3PO: Massively Multi-Task Model-Based Policy Optimization
- Using Deep Q-learning To Prolong the Lifetime of Correlated Internet of Things Devices
- Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning
- Reinforcement Learning Increases Wind Farm Power Production by Enabling Closed-Loop Collaborative Control
- Memoryless Exact Solutions for Deterministic MDPs with Sparse Rewards
- Communication Efficient Parallel Reinforcement Learning
- Self-Imitation Learning via Generalized Lower Bound Q-learning
- Machine-Learning-Assisted Photonic Device Development: A Multiscale Approach from Theory to Characterization
- Kalman meets Bellman: Improving Policy Evaluation through Value Tracking
- Learning Heuristic Search via Imitation
- Neural Optimization Kernel: Towards Robust Deep Learning
- Solving Atari Games Using Fractals And Entropy
- The Effects of Memory Replay in Reinforcement Learning
- FIXAR: A Fixed-Point Deep Reinforcement Learning Platform with Quantization-Aware Training and Adaptive Parallelism
- Improved Learning in Evolution Strategies via Sparser Inter-Agent Network Topologies
- Reliability-Adjusted Prioritized Experience Replay
- Learning Value Functions in Deep Policy Gradients using Residual Variance
- DISPATCH: Design Space Exploration of Cyber-Physical Systems
- Reward learning from human preferences and demonstrations in Atari
- Bipedal Walking Robot using Deep Deterministic Policy Gradient
- Hierarchical Reinforcement Learning Framework towards Multi-agent Navigation
- Interactive Language Acquisition with One-shot Visual Concept Learning through a Conversational Game
- A Survey of State Representation Learning for Deep Reinforcement Learning
- EASE: Embodied Active Event Perception via Self-Supervised Energy Minimization
- Gradient-based Training of Slow Feature Analysis by Differentiable Approximate Whitening
- Bridging Cognitive Programs and Machine Learning
- Deep Reinforcement Learning for Autonomous Driving
- PowerNet: Multi-agent Deep Reinforcement Learning for Scalable Powergrid Control
- Reliable Transmission of LTP Using Reinforcement Learning-Based Adaptive FEC
- An Efficient Graph Convolutional Network Technique for the Travelling Salesman Problem
- A Deep Reinforcement Learning Chatbot (Short Version)
- VRAIL: Vectorized Reward-based Attribution for Interpretable Learning
- Deception in Social Learning: A Multi-Agent Reinforcement Learning Perspective
- Unsupervised Learning from Continuous Video in a Scalable Predictive Recurrent Network
- Goal-conditioned Hierarchical Reinforcement Learning for Sample-efficient and Safe Autonomous Driving at Intersections
- Data-Driven Policy Mapping for Safe RL-based Energy Management Systems
- Optimal Navigation in Microfluidics via the Optimization of a Discrete Loss
- Flow Shape Design for Microfluidic Devices Using Deep Reinforcement Learning
- Nonparametric Stochastic Compositional Gradient Descent for Q-Learning\n in Continuous Markov Decision Problems
- A Survey of Deep Network Solutions for Learning Control in Robotics: From Reinforcement to Imitation
- Deep Reinforcement Learning for Dynamic Multichannel Access in Wireless Networks
- SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning
- Online Data Poisoning Attack
- Online Sub-Sampling for Reinforcement Learning with General Function Approximation
- Modeling Earth-Scale Human-Like Societies with One Billion Agents
- Offline Reinforcement Learning for Autonomous Driving with Safety and Exploration Enhancement
- Distributed Deep Q-Learning
- Batch-Constrained Distributional Reinforcement Learning for Session-based Recommendation
- Learning to Explore in Diverse Reward Settings via Temporal-Difference-Error Maximization
- Inverse design of the transmission matrix in a random system using Reinforcement Learning
- Overcoming Overfitting in Reinforcement Learning via Gaussian Process Diffusion Policy
- Scalable, Decentralized Multi-Agent Reinforcement Learning Methods Inspired by Stigmergy and Ant Colonies
- Lifelong Object Detection
- MLGO: a Machine Learning Guided Compiler Optimizations Framework
- Safety-Aware Reinforcement Learning for Control via Risk-Sensitive Action-Value Iteration and Quantile Regression
- Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response
- Ghost Policies: A New Paradigm for Understanding and Learning from Failure in Deep Reinforcement Learning
- Topology-Assisted Spatio-Temporal Pattern Disentangling for Scalable MARL in Large-scale Autonomous Traffic Control
- Momentum Q-learning with Finite-Sample Convergence Guarantee
- Unsupervised Video Object Segmentation for Deep Reinforcement Learning
- Correcting Momentum in Temporal Difference Learning
- ReLMoGen: Leveraging Motion Generation in Reinforcement Learning for Mobile Manipulation
- Behavior Planning at Urban Intersections through Hierarchical Reinforcement Learning
- Visual Pre-Training on Unlabeled Images using Reinforcement Learning
- Automatic Data Augmentation for Generalization in Deep Reinforcement Learning
- Bilinear Classes: A Structural Framework for Provable Generalization in RL
- Neuro-Symbolic Reinforcement Learning with First-Order Logic
- Multi-dimensional Autoscaling of Processing Services: A Comparison of Agent-based Methods
- Task Adaptation from Skills: Information Geometry, Disentanglement, and New Objectives for Unsupervised Reinforcement Learning
- AI-Based Autonomous Line Flow Control via Topology Adjustment for Maximizing Time-Series ATCs
- Run Away From your Teacher: Understanding BYOL by a Novel Self-Supervised Approach
- A Dynamic Penalty Function Approach for Constraints-Handling in Reinforcement Learning
- Statistical Guarantees for Offline Domain Randomization
- IOS: Inter-Operator Scheduler for CNN Acceleration
- A Free Lunch from the Noise: Provable and Practical Exploration for Representation Learning
- Learning to Evade Static PE Machine Learning Malware Models via Reinforcement Learning
- A Threshold-based Scheme for Reinforcement Learning in Neural Networks
- Aligning an optical interferometer with beam divergence control and continuous action space
- Benchmarking Quantum Architecture Search with Surrogate Assistance
- Why Build an Assistant in Minecraft?
- Reusing Trajectories in Policy Gradients Enables Fast Convergence
- Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning
- SCC: an efficient deep reinforcement learning agent mastering the game of StarCraft II
- Deep Reinforcement Learning for Unmanned Aerial Vehicle-Assisted Vehicular Networks
- Delphos: A reinforcement learning framework for assisting discrete choice model specification
- Improving Experience Replay through Modeling of Similar Transitions' Sets
- Learning Self-Correctable Policies and Value Functions from Demonstrations with Negative Sampling
- Generalization to Novel Objects using Prior Relational Knowledge
- Policy Learning Using Weak Supervision
- Massively Parallel Methods for Deep Reinforcement Learning
- Dream to Generalize: Zero-Shot Model-Based Reinforcement Learning for Unseen Visual Distractions
- CLUSE: Cross-Lingual Unsupervised Sense Embeddings
- Deep Learning Reforms Image Matching: A Survey and Outlook
- Policy Search, Retrieval, and Composition via Task Similarity in Collaborative Agentic Systems
- Deep reinforcement learning approach to MIMO precoding problem: Optimality and Robustness
- Cautious Reinforcement Learning via Distributional Risk in the Dual Domain
- Learning from Learning Machines: Optimisation, Rules, and Social Norms
- Unsupervised Meta-Testing with Conditional Neural Processes for Hybrid Meta-Reinforcement Learning
- An overall view of key problems in algorithmic trading and recent progress
- Accelerating Safe Reinforcement Learning with Constraint-mismatched Policies
- Self-Composing Policies for Scalable Continual Reinforcement Learning
- Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach
- Lane Change Decision-making through Deep Reinforcement Learning with Rule-based Constraints
- Merging and Disentangling Views in Visual Reinforcement Learning for Robotic Manipulation
- Autonomous Vehicle Lateral Control Using Deep Reinforcement Learning with MPC-PID Demonstration
- Efficient Communication in Multi-Agent Reinforcement Learning via Variance Based Control
- Combining Neural Networks and Tree Search for Task and Motion Planning in Challenging Environments
- How Crucial Is It for 6G Networks to Be Autonomous?
- Attend, Adapt and Transfer: Attentive Deep Architecture for Adaptive Transfer from multiple sources in the same domain
- Learning Efficient Multi-Agent Cooperative Visual Exploration
- Off-policy Reinforcement Learning with Optimistic Exploration and Distribution Correction
- Coordinated Heterogeneous Distributed Perception based on Latent Space Representation
- Deep Reinforcement Learning Based Spectrum Allocation in Integrated Access and Backhaul Networks
- Optimal Attacks on Reinforcement Learning Policies
- Optimal Network Control in Partially-Controllable Networks
- DeepRobust: A PyTorch Library for Adversarial Attacks and Defenses
- First Order Constrained Optimization in Policy Space
- An Empirical Study of Representation Learning for Reinforcement Learning in Healthcare
- The History Began from AlexNet: A Comprehensive Survey on Deep Learning Approaches
- Elements of Effective Deep Reinforcement Learning towards Tactical Driving Decision Making
- Sequence Tutor: Conservative Fine-Tuning of Sequence Generation Models with KL-control
- Deep Multi-Agent Reinforcement Learning with Relevance Graphs
- Teaching Machines to Converse
- Learning to Prune Deep Neural Networks via Reinforcement Learning
- State of the Art Control of Atari Games Using Shallow Reinforcement Learning
- Incorporating Relational Background Knowledge into Reinforcement Learning via Differentiable Inductive Logic Programming
- Multi-Hop Knowledge Graph Reasoning with Reward Shaping
- GAPLE: Generalizable Approaching Policy LEarning for Robotic Object Searching in Indoor Environment
- TFPnP: Tuning-free Plug-and-Play Proximal Algorithm with Applications to Inverse Imaging Problems
- Improving Robustness of Reinforcement Learning for Power System Control with Adversarial Training
- Q-Learning for Continuous Actions with Cross-Entropy Guided Policies
- SuperSuit: Simple Microwrappers for Reinforcement Learning Environments
- Unsupervised Visual Attention and Invariance for Reinforcement Learning
- Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial
- The Transformer Network for the Traveling Salesman Problem
- CyGIL: A Cyber Gym for Training Autonomous Agents over Emulated Network Systems
- Frog Soup: Zero-Shot, In-Context, and Sample-Efficient Frogger Agents
- Learning Light Transport the Reinforced Way
- Decorrelated Double Q-learning
- Deep Reinforcement Learning with Robust and Smooth Policy
- Leveraging Reward Models for Guiding Code Review Comment Generation
- A Comparative Analysis of Deep Reinforcement Learning-enabled Freeway Decision-making for Automated Vehicles
- Iconary: A Pictionary-Based Game for Testing Multimodal Communication with Drawings and Text
- Deep Reinforcement Learning for Dialogue Generation
- Learning robust driving policies without online exploration
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Delayed Observation
- Horizon Reduction Makes RL Scalable
- Measuring the Algorithmic Efficiency of Neural Networks
- Graph Computing for Financial Crime and Fraud Detection: Trends, Challenges and Outlook
- Improving Exploration in Evolution Strategies for Deep Reinforcement Learning via a Population of Novelty-Seeking Agents
- Improving Performance of Spike-based Deep Q-Learning using Ternary Neurons
- Optimal k-Coverage Charging Problem
- Nearly Horizon-Free Offline Reinforcement Learning
- Reinforcement Learning with Combinatorial Actions: An Application to Vehicle Routing
- VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
- Can Complex Collective Behaviour Be Generated Through Randomness, Memory and a Pinch of Luck?
- Temporal-Difference Value Estimation via Uncertainty-Guided Soft Updates
- Soft Hindsight Experience Replay
- GRAC: Self-Guided and Self-Regularized Actor-Critic
- Policy Gradient for Continuing Tasks in Non-stationary Markov Decision Processes
- Are Gradient-based Saliency Maps Useful in Deep Reinforcement Learning?
- Where Do Human Heuristics Come From?
- A General Framework for Charger Scheduling Optimization Problems
- Metis: Multi-Agent Based Crisis Simulation System
- Reinforcement Learning with Random Time Horizons
- DYSTIL: Dynamic Strategy Induction with Large Language Models for Reinforcement Learning
- State-Covering Trajectory Stitching for Diffusion Planners
- Breaker: Removing Shortcut Cues with User Clustering for Single-slot Recommendation System
- Multiplayer Support for the Arcade Learning Environment
- Map-based Multi-Policy Reinforcement Learning: Enhancing Adaptability of Robots by Deep Reinforcement Learning
- Q-learning with Posterior Sampling
- Deep reinforcement learning for time series: playing idealized trading games
- Gradient based sample selection for online continual learning
- Single Deep Counterfactual Regret Minimization
- Learning Representations in Reinforcement Learning:An Information Bottleneck Approach
- Lineage Evolution Reinforcement Learning
- Is Plug-in Solver Sample-Efficient for Feature-based Reinforcement Learning?
- STMARL: A Spatio-Temporal Multi-Agent Reinforcement Learning Approach for Cooperative Traffic Light Control
- Causal-aware Large Language Models: Enhancing Decision-Making Through Learning, Adapting and Acting
- A Model-free Learning Algorithm for Infinite-horizon Average-reward MDPs with Near-optimal Regret
- GrapheonRL: A Graph Neural Network and Reinforcement Learning Framework for Constraint and Data-Aware Workflow Mapping and Scheduling in Heterogeneous HPC Systems
- AXIOM: Learning to Play Games in Minutes with Expanding Object-Centric Models
- ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
- Don't Forget Your Teacher: A Corrective Reinforcement Learning Framework
- A Comprehensive Survey on the Ambulance Routing and Location Problems
- Decentralized Distributed Proximal Policy Optimization (DD-PPO) for High Performance Computing Scheduling on Multi-User Systems
- Proxy Target: Bridging the Gap Between Discrete Spiking Neural Networks and Continuous Control
- Relational Neural Expectation Maximization: Unsupervised Discovery of Objects and their Interactions
- Reinforcement Learning of Beam Codebooks in Millimeter Wave and Terahertz MIMO Systems
- Unbiased Deep Reinforcement Learning: A General Training Framework for Existing and Future Algorithms
- To be a fast adaptive learner: using game history to defeat opponents
- Fast Neural Network Verification via Shadow Prices
- Learning Recommender Mechanisms for Bayesian Stochastic Games
- Autonomy 2.0: Why is self-driving always 5 years away?
- Information theoretic analysis of computational models as a tool to understand the neural basis of behaviors
- Normalizing Flows are Capable Models for Continuous Control
- Meta Dialogue Policy Learning
- X-ToM: Explaining with Theory-of-Mind for Gaining Justified Human Trust
- Content-Aware Personalised Rate Adaptation for Adaptive Streaming via Deep Video Analysis
- Regret Minimization for Partially Observable Deep Reinforcement Learning
- Convex Q-Learning, Part 1: Deterministic Optimal Control
- Learn Zero-Constraint-Violation Policy in Model-Free Constrained Reinforcement Learning
- A Decentralized Policy Gradient Approach to Multi-task Reinforcement Learning
- VIRAL: Vision-grounded Integration for Reward design And Learning
- Scalable Centralized Deep Multi-Agent Reinforcement Learning via Policy Gradients
- Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning
- Scaling Offline RL via Efficient and Expressive Shortcut Models
- FlapAI Bird: Training an Agent to Play Flappy Bird Using Reinforcement Learning Techniques
- When Autonomous Systems Meet Accuracy and Transferability through AI: A Survey
- BOFormer: Learning to Solve Multi-Objective Bayesian Optimization via Non-Markovian RL
- Calibrated Value-Aware Model Learning with Probabilistic Environment Models
- Discrete Action On-Policy Learning with Action-Value Critic
- Towards Cognitive Exploration through Deep Reinforcement Learning for Mobile Robots
- Reinforcement Learning with A* and a Deep Heuristic
- Exploring Fluent Query Reformulations with Text-to-Text Transformers and Reinforcement Learning
- D-ACC: Dynamic Adaptive Cruise Control for Highways with Ramps Based on Deep Q-Learning
- A Framework for Adversarial Analysis of Decision Support Systems Prior to Deployment
- A Critical Investigation of Deep Reinforcement Learning for Navigation
- CraftAssist: A Framework for Dialogue-enabled Interactive Agents
- Multi-level Certified Defense Against Poisoning Attacks in Offline Reinforcement Learning
- Distantly Supervised Question Parsing
- medDreamer: Model-Based Reinforcement Learning with Latent Imagination on Complex EHRs for Clinical Decision Support
- Learning to Perform Local Rewriting for Combinatorial Optimization
- Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring Statewise Safety
- Fox in the Henhouse: Supply-Chain Backdoor Attacks Against Reinforcement Learning
- Towards Cooperation in Sequential Prisoner's Dilemmas: a Deep Multiagent Reinforcement Learning Approach
- Brittle AI, Causal Confusion, and Bad Mental Models: Challenges and Successes in the XAI Program
- A Game-Theoretic Approach to Multi-Agent Trust Region Optimization
- An Internal Covariate Shift Bounding Algorithm for Deep Neural Networks by Unitizing Layers' Outputs
- Do Offline Metrics Predict Online Performance in Recommender Systems?
- Asynchronous Temporal Fields for Action Recognition
- Is Deep Reinforcement Learning Ready for Practical Applications in Healthcare? A Sensitivity Analysis of Duel-DDQN for Hemodynamic Management in Sepsis Patients
- DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
- Improving Classifier Confidence using Lossy Label-Invariant Transformations
- Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective
- Importance Weighted Score Matching for Diffusion Samplers with Enhanced Mode Coverage
- Learning Transition Models with Time-delayed Causal Relations
- A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning
- Planning with Expectation Models for Control
- Engineering problems in machine learning systems
- Multiagent Soft Q-Learning
- Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
- Pessimism Principle Can Be Effective: Towards a Framework for Zero-Shot Transfer Reinforcement Learning
- VideoGameBench: Can Vision-Language Models complete popular video games?
- Beyond Discreteness: Finite-Sample Analysis of Straight-Through Estimator for Quantization
- Learning to be Global Optimizer
- Cooperative Perception with Deep Reinforcement Learning for Connected Vehicles
- Biologically inspired architectures for sample-efficient deep reinforcement learning
- DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors
- IQ-Learn: Inverse soft-Q Learning for Imitation
- Neural Stochastic Dual Dynamic Programming
- Object Exchangeability in Reinforcement Learning: Extended Abstract
- Deep Reinforcement Learning for Inquiry Dialog Policies with Logical Formula Embeddings
- Smooth Q-learning: Accelerate Convergence of Q-learning Using Similarity
- Investigation on the generalization of the Sampled Policy Gradient algorithm
- Domain Knowledge Integration By Gradient Matching For Sample-Efficient Reinforcement Learning
- Chess on Ice: Curling Tactical Decision-Making via Backward Induction and Deep Reinforcement Learning
- NeoRL: A Near Real-World Benchmark for Offline Reinforcement Learning
- Incremental Sequence Classification with Temporal Consistency
- Learning Graph Structure With A Finite-State Automaton Layer
- Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
- Resilient LLM-Empowered Semantic MAC Protocols via Zero-Shot Adaptation and Knowledge Distillation
- KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
- Which Mutual-Information Representation Learning Objectives are Sufficient for Control?
- RAP: Runtime Adaptive Pruning for LLM Inference
- Discriminative Particle Filter Reinforcement Learning for Complex Partial Observations
- Hadamax Encoding: Elevating Performance in Model-Free Atari
- Filtering Learning Histories Enhances In-Context Reinforcement Learning
- Deep Learning for Continuous-Time Stochastic Control with Jumps
- Control-Aware Representations for Model-based Reinforcement Learning
- Solving General-Utility Markov Decision Processes in the Single-Trial Regime with Online Planning
- An advantage actor-critic algorithm for robotic motion planning in dense and dynamic scenarios
- Boosting Offline Reinforcement Learning with Residual Generative Modeling
- Convergence of Value Aggregation for Imitation Learning
- Inverse Policy Evaluation for Value-based Sequential Decision-making
- Automated Lane Change Strategy using Proximal Policy Optimization-based Deep Reinforcement Learning
- Continuous-action Reinforcement Learning for Playing Racing Games: Comparing SPG to PPO
- Amanuensis: The Programmer's Apprentice
- Learning Robotic Manipulation of Granular Media
- Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO
- Autonomous Driving using Safe Reinforcement Learning by Incorporating a Regret-based Human Lane-Changing Decision Model
- Multi-parameter Control for the (1+(λ,λ))-GA on OneMax via Deep Reinforcement Learning
- Tuning-free Plug-and-Play Proximal Algorithm for Inverse Imaging Problems
- Towards Learning to Speak and Hear Through Multi-Agent Communication\n over a Continuous Acoustic Channel
- From Grunts to Lexicons: Emergent Language from Cooperative Foraging
- Generating Socially Acceptable Perturbations for Efficient Evaluation of Autonomous Vehicles
- Dual-Agent Reinforcement Learning for Automated Feature Generation
- G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
- Language and Thought: The View from LLMs
- An Energy-Saving Snake Locomotion Gait Policy Obtained Using Deep Reinforcement Learning
- Deictic Image Maps: An Abstraction For Learning Pose Invariant Manipulation Policies
- Optimal patient allocation for echocardiographic assessments
- Playing Flappy Bird via Asynchronous Advantage Actor Critic Algorithm
- Trust Region Value Optimization using Kalman Filtering
- Adaptive Resolving Methods for Reinforcement Learning with Function Approximations
- RLAP: A Reinforcement Learning Enhanced Adaptive Planning Framework for Multi-step NLP Task Solving
- Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning
- Reinforcement Mechanism Design for e-commerce
- Follow the Attention: Combining Partial Pose and Object Motion for Fine-Grained Action Detection
- Zero-Shot Visual Generalization in Robot Manipulation
- Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes
- Scalability of Reinforcement Learning Methods for Dispatching in Semiconductor Frontend Fabs: A Comparison of Open-Source Models with Real Industry Datasets
- Fine-Grained AutoAugmentation for Multi-Label Classification
- Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models
- Developing and Integrating Trust Modeling into Multi-Objective Reinforcement Learning for Intelligent Agricultural Management
- Policy Evaluation and Seeking for Multi-Agent Reinforcement Learning via Best Response
- Generative Question Refinement with Deep Reinforcement Learning in Retrieval-based QA System
- Self-Supervised Policy Adaptation during Deployment
- Multi-Task Reinforcement Learning with Soft Modularization
- The Atari Data Scraper
- Implementation of Q Learning and Deep Q Network For Controlling a Self Balancing Robot Model
- Towards Runtime Verification of Programmable Switches
- Transforming Cooling Optimization for Green Data Center via Deep Reinforcement Learning
- Flight Controller Synthesis Via Deep Reinforcement Learning
- Decomposed Inductive Procedure Learning: Learning Academic Tasks with Human-Like Data Efficiency
- Continuous Homeostatic Reinforcement Learning for Self-Regulated Autonomous Agents
- Automated vehicle's behavior decision making using deep reinforcement learning and high-fidelity simulation environment
- NavigationNet: A Large-scale Interactive Indoor Navigation Dataset
- Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning
- TensorRL-QAS: Reinforcement learning with tensor networks for improved quantum architecture search
- Energy-based Surprise Minimization for Multi-Agent Value Factorization
- Act to Reason: A Dynamic Game Theoretical Model of Driving
- Deep Reinforcement Learning based Resource Allocation for V2V Communications
- Continual Reinforcement Learning via Autoencoder-Driven Task and New Environment Recognition
- Enhancing Aerial Combat Tactics through Hierarchical Multi-Agent Reinforcement Learning
- Deep reinforcement learning-based longitudinal control strategy for automated vehicles at signalised intersections
- Discovering General-Purpose Active Learning Strategies
- DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning
- Meta learning Framework for Automated Driving
- Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation
- DSADF: Thinking Fast and Slow for Decision Making
- Symphony from Synapses: Neocortex as a Universal Dynamical Systems Modeller using Hierarchical Temporal Memory
- Typed Graph Networks
- A Novel Update Mechanism for Q-Networks Based On Extreme Learning\n Machines
- Exposure: A White-Box Photo Post-Processing Framework
- Generalization in Monitored Markov Decision Processes (Mon-MDPs)
- Multi-source Plume Tracing via Multi-Agent Reinforcement Learning
- A comparative study of Bitcoin and Ripple cryptocurrencies trading using Deep Reinforcement Learning algorithms
- Combining Bayesian Inference and Reinforcement Learning for Agent Decision Making: A Review
- Unsupervised Emergence of Spatial Structure from Sensorimotor Prediction
- Genome Variant Calling with a Deep Averaging Network
- Prediction, Consistency, Curvature: Representation Learning for\n Locally-Linear Control
- Time-Varying Formation Controllers for Unmanned Aerial Vehicles Using Deep Reinforcement Learning
- Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning
- Learning to Design Games: Strategic Environments in Reinforcement Learning
- Constant-Memory Strategies in Stochastic Games: Best Responses and Equilibria
- On-Policy Trust Region Policy Optimisation with Replay Buffers
- Synthesizing Chemical Plant Operation Procedures using Knowledge, Dynamic Simulation and Deep Reinforcement Learning
- Towards Human-Centric Autonomous Driving: A Fast-Slow Architecture Integrating Large Language Model Guidance with Reinforcement Learning
- Balancing Progress and Safety: A Novel Risk-Aware Objective for RL in Autonomous Driving
- Multimodal Safety-Critical Scenarios Generation for Decision-Making Algorithms Evaluation
- AsyncQVI: Asynchronous-Parallel Q-Value Iteration for Discounted Markov Decision Processes with Near-Optimal Sample Complexity
- Deep Reinforcement Learning based Dynamic Optimization of Bus Timetable
- DeepHoyer: Learning Sparser Neural Network with Differentiable Scale-Invariant Sparsity Measures
- Deep Reinforcement Learning and Transportation Research: A Comprehensive Review
- Alleviating Privacy Attacks via Causal Learning
- Multi-agent Embodied AI: Advances and Future Directions
- Reinforcement Learning-Based Coverage Path Planning with Implicit Cellular Decomposition
- Learning to Communicate Using Counterfactual Reasoning
- Fast Policy Learning through Imitation and Reinforcement
- Hybrid deep reinforcement learning based eco-driving for low-level connected and automated vehicles along signalized corridors
- Sample-Efficient Imitation Learning via Generative Adversarial Nets
- ConvLab: Multi-Domain End-to-End Dialog System Platform
- A Generalised and Adaptable Reinforcement Learning Stopping Method
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- Decentralized Multi-Agent Actor-Critic with Generative Inference
- Deep Reinforcement Learning for Dynamic Urban Transportation Problems
- AI Enabling Technologies: A Survey
- A coevolutionary approach to deep multi-agent reinforcement learning
- Two-stage training algorithm for AI robot soccer
- Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution
- Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
- Efficient and Phase-aware Video Super-resolution for Cardiac MRI
- Active Perception in Adversarial Scenarios using Maximum Entropy Deep Reinforcement Learning
- Error Controlled Actor-Critic
- An End-to-End Robot Architecture to Manipulate Non-Physical State Changes of Objects
- Millimeter Wave Communications with an Intelligent Reflector: Performance Optimization and Distributional Reinforcement Learning
- Sample Efficient Feature Selection for Factored MDPs
- Intelligent Replication Management for HDFS Using Reinforcement Learning
- Parallel Actors and Learners: A Framework for Generating Scalable RL Implementations
- Towards Scalable Verification of Deep Reinforcement Learning
- Anomaly-resistant Graph Neural Networks via Neural Architecture Search
- Interactive Lungs Auscultation with Reinforcement Learning Agent
- Learning to Factor Policies and Action-Value Functions: Factored Action Space Representations for Deep Reinforcement learning
- Neural MMO v1.3: A Massively Multiagent Game Environment for Training and Evaluating Neural Networks
- Experience enrichment based task independent reward model
- The Case for Automatic Database Administration using Deep Reinforcement Learning
- Continual Learning of Control Primitives: Skill Discovery via Reset-Games
- Interactively shaping robot behaviour with unlabeled human instructions
- Off-Policy Adversarial Inverse Reinforcement Learning
- Angrier Birds: Bayesian reinforcement learning
- Combining Deep Reinforcement Learning and Safety Based Control for Autonomous Driving
- Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning
- Simulating Human Audiovisual Search Behavior
- Utilizing Skipped Frames in Action Repeats via Pseudo-Actions
- Playing Doom with SLAM-Augmented Deep Reinforcement Learning
- Chainer: A Deep Learning Framework for Accelerating the Research Cycle
- Deep Q learning for fooling neural networks
- Playing optical tweezers with deep reinforcement learning: in virtual, physical and augmented environments
- Fully Bayesian Recurrent Neural Networks for Safe Reinforcement Learning
- Learning Pregrasp Manipulation of Objects from Ungraspable Poses
- A Probabilistic Simulator of Spatial Demand for Product Allocation
- Reinforcement Learning with Convolutional Reservoir Computing
- A Smart Sliding Chinese Pinyin Input Method Editor on Touchscreen
- From Persistent Homology to Reinforcement Learning with Applications for Retail Banking
- Planning with a Receding Horizon for Manipulation in Clutter using a Learned Value Function
- A Deep Multi-Agent Reinforcement Learning Approach to Autonomous Separation Assurance
- HTMRL: Biologically Plausible Reinforcement Learning with Hierarchical Temporal Memory
- Simulating multi-exit evacuation using deep reinforcement learning
- Surrogate gradients for analog neuromorphic computing
- Predictive Coding for Locally-Linear Control
- Concept and the implementation of a tool to convert industry 4.0 environments modeled as FSM to an OpenAI Gym wrapper
- Understanding Domain Randomization for Sim-to-real Transfer
- Dragonfly: a modular deep reinforcement learning library
- Enhancing New-item Fairness in Dynamic Recommender Systems
- Yet Another Text Captcha Solver
- Unknowable Manipulators: Social Network Curator Algorithms
- Model-based controller assisted domain randomization in deep reinforcement learning: application to nonlinear powertrain control
- Interactive Double Deep Q-network: Integrating Human Interventions and Evaluative Predictions in Reinforcement Learning of Autonomous Driving
- Replay-buffer engineering for noise-robust quantum circuit optimization
- Improving Zero-Shot Offline RL via Behavioral Task Sampling
- A Review of Variational Quantum Algorithms: Insights into Fault-Tolerant Quantum Computing
- Evolution Strategies for Deep RL pretraining
- Deep Reinforcement Learning for Optimal Portfolio Allocation: A Comparative Study with Mean-Variance Optimization
- Maximum Likelihood Reinforcement Learning
- Mastering the Game of Go with Self-play Experience Replay
- Deep Reinforcement Learning for Automated Web GUI Testing
- Landscape and training regimes in deep learning
- BQSched: A Non-intrusive Scheduler for Batch Concurrent Queries via Reinforcement Learning
- Neuroevolution of Self-Attention Over Proto-Objects
- Transformer-Empowered Actor-Critic Reinforcement Learning for Sequence-Aware Service Function Chain Partitioning
- Vulnerability of Deep Reinforcement Learning to Policy Induction Attacks
- Transferring Autonomous Driving Knowledge on Simulated and Real\n Intersections
- Soft-Quantum Algorithms
- On the Role of Computation in Reinforcement Learning
- Locality-Sensitive Experience Replay for Online Recommendation
- Co-Adaptation of Algorithmic and Implementational Innovations in Inference-based Deep Reinforcement Learning
- Directed Exploration for Reinforcement Learning
- Ensemble deep learning: A review
- Learning Runtime Parameters in Computer Systems with Delayed Experience\n Injection
- Reinforcement Learning for Micro-Level Claims Reserving
- Deep Reinforcement Learning for Optimum Order Execution: Mitigating Risk and Maximizing Returns
- Correcting Experience Replay for Multi-Agent Communication
- Reinforcement Learning for Autonomous Driving with Latent State Inference and Spatial-Temporal Relationships
- Improved Regret Bound and Experience Replay in Regularized Policy Iteration
- Learn to Interpret Atari Agents
- Do We Need Transformers to Play FPS Video Games?
- Iterative Amortized Policy Optimization
- Obstacle Avoidance and Navigation Utilizing Reinforcement Learning with Reward Shaping
- SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling
- Efficient Tree Generation for Globally Optimal Decisions under Probabilistic Outcomes
- Cracking the Code of Action: a Generative Approach to Affordances for Reinforcement Learning
- PBCS : Efficient Exploration and Exploitation Using a Synergy between Reinforcement Learning and Motion Planning
- Zero-shot Sim-to-Real Transfer for Reinforcement Learning-based Visual Servoing of Soft Continuum Arms
- Neural network based reinforcement learning for audio–visual gaze control in human–robot interaction
- Reinforced Imitation Learning by Free Energy Principle
- Deep Deterministic Policy Gradient for Urban Traffic Light Control
- Task-oriented Design through Deep Reinforcement Learning
- Bayesian Optimization for Iterative Learning
- Optimising Stochastic Routing for Taxi Fleets with Model Enhanced Reinforcement Learning
- MMD-MIX: Value Function Factorisation with Maximum Mean Discrepancy for Cooperative Multi-Agent Reinforcement Learning
- Deep Reinforcement Learning for Visual Object Tracking in Videos
- Dynamic Control of a Fiber Manufacturing Process using Deep Reinforcement Learning
- Practical Convex Formulation of Robust One-hidden-layer Neural Network Training
- Bridging Econometrics and AI: VaR Estimation via Reinforcement Learning and GARCH Models
- A data-driven choice of misfit function for FWI using reinforcement learning
- POAR: Efficient Policy Optimization via Online Abstract State Representation Learning
- Coordination of PV Smart Inverters Using Deep Reinforcement Learning for Grid Voltage Regulation
- A Deep Reinforcement Learning Approach to Efficient Drone Mobility Support
- Adaptive Behavior Generation for Autonomous Driving using Deep Reinforcement Learning with Compact Semantic States
- Generalizing Decision Making for Automated Driving with an Invariant Environment Representation using Deep Reinforcement Learning
- MALib: A Parallel Framework for Population-based Multi-agent Reinforcement Learning
- Making Neural Networks More Suitable for Approximate Clifford+T Circuit Synthesis
- Grasping Deformable Objects via Reinforcement Learning with Cross-Modal Attention to Visuo-Tactile Inputs
- A non-cooperative meta-modeling game for automated third-party calibrating, validating and falsifying constitutive laws with parallelized adversarial attacks
- Learning to Reason under Off-Policy Guidance
- MARFT: Multi-Agent Reinforcement Fine-Tuning
- Reinforcement Learning from Multi-level and Episodic Human Feedback
- DRAMA: A Dynamic Packet Routing Algorithm using Multi-Agent Reinforcement Learning with Emergent Communication
- Cooperative Lane Changing via Deep Reinforcement Learning
- A Deep Reinforcement Learning Approach for Global Routing
- When Multiple Agents Learn to Schedule: A Distributed Radio Resource\n Management Framework
- A Gradient Estimator for Time-Varying Electrical Networks with\n Non-Linear Dissipation
- Measuring Human Adaptation to AI in Decision Making: Application to Evaluate Changes after AlphaGo
- Generative Auto-Bidding with Value-Guided Explorations
- Access Probability Optimization in RACH: A Multi-Armed Bandits Approach
- Discrete Sequential Prediction of Continuous Actions for Deep RL
- Neuro-evolutionary Frameworks for Generalized Learning Agents
- Deep Deterministic Path Following
- SwitchMT: An Adaptive Context Switching Methodology for Scalable Multi-Task Learning in Intelligent Autonomous Agents
- Predicting Game Difficulty and Churn Without Players
- Autonomous and Cooperative Design of the Monitor Positions for a Team of UAVs to Maximize the Quantity and Quality of Detected Objects
- Deep Reinforcement Learning with Stacked Hierarchical Attention for Text-based Games
- OnSlicing
- Drone swarm patrolling with uneven coverage requirements
- Towards continuous control of flippers for a multi-terrain robot using deep reinforcement learning
- PaintBot: A Reinforcement Learning Approach for Natural Media Painting
- Reinforcement learning for optimal error correction of toric codes
- Correspondence between neuroevolution and gradient descent
- Eden: A Unified Environment Framework for Booming Reinforcement Learning Algorithms
- Comparing heterogeneous entities using artificial neural networks of trainable weighted structural components and machine-learned activation functions
- Deep RL Agent for a Real-Time Action Strategy Game
- Planning Robot Motion using Deep Visual Prediction
- On the Definition of Robustness and Resilience of AI Agents for Real-time Congestion Management
- Evolutionary Policy Optimization
- Impact of Price Inflation on Algorithmic Collusion Through Reinforcement Learning Agents
- pix2pockets: Shot Suggestions in 8-Ball Pool from a Single Image in the Wild
- F2Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading
- Observation-Grounded Self-Predictive Reinforcement Learning for Visual Continuous Control
- A Rollout-Based Algorithm and Reward Function for Resource Allocation in Business Processes
- Moderate Actor-Critic Methods: Controlling Overestimation Bias via Expectile Loss
- Vision based driving agent for race car simulation environments
- Deep Reinforcement Learning-Based Product Recommender for Online Advertising
- InterQ: A DQN Framework for Optimal Intermittent Control
- Dynamic Residual Safe Reinforcement Learning for Multi-Agent Safety-Critical Scenarios Decision-Making
- Generative Framework for Personalized Persuasion: Inferring Causal, Counterfactual, and Latent Knowledge
- AEGIS: Human Attention-based Explainable Guidance for Intelligent Vehicle Systems
- Deep Reinforcement Learning Algorithms for Option Hedging
- Thinking While Moving: Deep Reinforcement Learning with Concurrent Control
- Computation on Sparse Neural Networks: an Inspiration for Future Hardware
- AlgaeDICE: Policy Gradient from Arbitrary Experience
Discussions
- Playing Atari with Deep Reinforcement Learning [pdf] [hn, 37 points, 9 comments]
- Playing Atari with Deep Reinforcement Learning (2013) [pdf] [hn, 21 points, 2 comments]
- Deep Mind's neural networks play 7 Atari 2600 games with more skill than a human [hn, 5 points, 0 comments]
- Playing Atari with Deep Reinforcement Learning [hn, 3 points, 1 comments]
- And the paper that started the trend (way back in 2013): arxiv.org/abs/1312.5602 [bsky, 1 points, 0 comments]
Related