RLC 2026 Paper Schedule
No papers match your search.
Natural Policy Gradient for Bayesian Network Policies in Markov Potential Games
StaQ: a Finite Memory Approach to Discrete Action Policy Mirror Descent
Near-Optimal Reinforcement Learning for Linear Distributionally Robust Markov Decision Processes
Intrinsic Closed-Loop Practical Asymptotic Stability in Standard Reinforcement Learning
Provable Distributional Value Iteration under Partial Observability
Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification
Strategically Robust Multi-Agent Reinforcement Learning with Linear Function Approximation
The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise
Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function
Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See
Reward Design Agent for Reinforcement Learning
Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning
Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration
Leveraging Reward Machines for Efficient Multi-Objective Reinforcement Learning
SR-Reward: Taking The Path More Traveled
From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning
Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning
Gradient Iterated Temporal-Difference Learning
Representation Regularization in Distributional Reinforcement Learning
From Pixels to Factors: Learning Independently Controllable State Variables for Reinforcement Learning
Learning World Value Functions with Successor Representation and Vision Models
Gated Q-learning: Add Off-Policy Bias to Taste
Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
The Yokai Learning Environment: Tracking Beliefs Over Space and Time
The Cell Must Go On: Agar.io for Continual Reinforcement Learning
SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens
Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Program
Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics
The Open Ant: A Robot Platform for Reinforcement Learning Research
ARLBench: Flexible and Efficient Benchmarking for Hyperparameter Optimization in Reinforcement Learning
Randomized Exploration for Linear Bandits via Absolute Perturbations
ContrastSpanner: Learning Low-Rank Causal Contrasts to Alleviate Power-Set and Eluder Barriers
Learning with Coupled Uncertainty
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
Offline-to-Online Learning in Linear Bandits
Annealed Softmax Greedy in Many-Armed Bayesian Bandits
Collaborative Learning under Strategic Behavior: Mechanisms for Eliciting Feedback in Principal-Agent Bandit Games
Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Context Drifts
Limits of reinforcement learning for decision trees in Markov decision processes
Planning for Signaling in Low-Trust Environments
Inference-Time Policy Alignment for Fair Reinforcement Learning
Improving Human Performance with Value-Aware Interventions: A Case Study in Chess
Toward Agents That Reason About Their Computation
Let it Cook: Learning to Wait in Sequential Decision Making
Trajectory First: A Curriculum for Discovering Diverse Policies
Hierarchical Behaviour Spaces
Overcoming Valid Action Suppression in Unmasked Policy Gradient Algorithms
PPO+: Enhancing proximal policy optimization
Repetition as Reinforcement: Enhancing Sample Efficiency via Instant Episode Repetition in Reinforcement Learning
Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments
Delightful Policy Gradient
Counterfactual Shapley Credit Assignment
Reinforcement Learning for Stochastic Shortest Paths with Dead-Ends
Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL
Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry
Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids
Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning
Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning
Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning
Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach
When Do We Need LLMs? A Diagnostic for Language-Driven Bandits
Discovering High Quality Chess Puzzles with Offline Reinforcement Learning
Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control
Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning
Architecture over Algorithms: Network Modernization Improves Multi-Objective Reinforcement Learning
Revisiting FTA: A Sparse One-to-Many Activation for Reinforcement Learning
Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability
Learning the Supports for Categorical Critic in Reinforcement Learning
Rethinking the Suitability of RL Algorithms Under Practical Transfer Constraints
V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
ICPL: Few-shot In-context Preference Learning via LLMs
Modification-Considering Value Learning for Reward Hacking Mitigation in RL
PB²: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
Discovering Reinforcement Learning Interfaces with Large Language Models
Generalization in Monitored Markov Decision Processes (Mon-MDPs)
Design Principles for Tabular Multi-Policy MORL in Infinite Horizons
Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization
Biased Dreams: Limitations to Epistemic Uncertainty Quantification in Latent Space Models
Risk-Aware General-Utility Markov Decision Processes
Stable Planning through Aligned Representations in Model-Based Reinforcement Learning
Bi-Level Reinforcement Learning Pathway for Sim-to-Real Optimality
Using Common Random Numbers for Simulation-based Planning with Rollouts
Gaussian Process Aggregation for Root-Parallel Monte Carlo Tree Search with Continuous Actions
Strategically-Linked Decisions in Long-Term Planning and Reinforcement Learning
When to Plan: Learning to Select Between Reactive Control and Deliberative Planning
Centralized Adaptive Sampling for Reliable Co-training of Independent Multi-Agent Policies
Beyond Local Views: Global State Inference with Diffusion Models for Cooperative MARL
Credit Assignment and Focused Exploration for Sparse-reward Multi-agent Deep Reinforcement Learning
Multi-Agent Reinforcement Learning with Reward Machines for Mixed Cooperative-Competitive Environments
Learning Multi-Agent Communication Protocol: Study on Information Entropy Efficiency in MARL
Coordination Graphs for Constrained Multi-Agent Reinforcement Learning
The challenge of hidden gifts in multi-agent reinforcement learning
Sociodynamics of Reinforcement Learning
On the Variance of Temporal Difference Learning and its Reduction Using Control Variates
Towards Formalizing Reinforcement Learning Theory: A Robbins-Siegmund Approach
Statistical Inference for Policy Evaluation with Temporal Difference Learning
Finite Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes
Solvable models of learning to pursue a moving target
Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies
Optimal Regret for Policy Optimization in Average Reward MDPs Without Mixing
When Can Pure Exploitation Succeed in Linear RL? Decoys and Self-Identifiability for Greedy LSVI
On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents
Conformal Preemption of Failures in Sequential Decision-Making Agents
Distributionally Robust Self Paced Curriculum Reinforcement Learning
Adaptive Critic Shaping for Reinforcement Learning with Temporal Logic Constraint
Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics
An Unreasonably Simple Approach to Safe Reinforcement Learning
Skill-based Safe Reinforcement Learning with Risk Planning
V-OCBF: Learning Safety Filters from Offline Data via Value-Guided Offline Control Barrier Functions
Yes, Q-learning Helps Offline In-Context RL
CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning
Fully Offline Reinforcement Learning
Dynamics Models for Offline Hyperparameter Selection in Real-World RL
Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies
Conservative Value Priors: A Bayesian Path to Offline Reinforcement Learning
Offline RL with Hierarchical Action Chunking
{MOORL}: A Framework for Integrating Offline-Online Reinforcement Learning
Confidence Intervals for the Interquartile Mean
Synthetic Monitoring Environments for Reinforcement Learning
Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning
PGTG: Procedurally Generated Grid-Based Traffic Gym
Ludax: A GPU-Accelerated Description Language for Board Games
Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning
NutriRL: A Benchmark for Nutritional Regulation under Delayed State Transitions
Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots
DART: Dual Adaptive Residual Tracking for Low-Bias Advantage Estimation and Credit Assignment in AI Agents
FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies
A Simple Baseline for Learning Approximate State Abstractions in Factored State Spaces
Endpoint Replay: Compressing the Recency Buffer in Deep Reinforcement Learning
Improving Reward-Based Hindsight Credit Assignment
Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching
Cohering Reinforcement Learning
A Survey of State Representation Learning for Deep Reinforcement Learning
Temporally Extended Mixture-of-Experts Models
Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning
A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation
Scalable Causal Imitation Learning
Supervised Reward Inference
Minimal Ingredients for Reward Assignment from Expert Demonstrations
Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning
Q-Based Variational Inverse Reinforcement Learning
Extending Differential Temporal Difference Methods for Episodic Problems
Revisiting Adam for Streaming Reinforcement Learning
Forager: a lightweight testbed for continual learning with partial observability in RL
Dense and Diverse Goal Coverage in Multi Goal Reinforcement Learning
Maximum-Entropy Exploration with Future State-Action Visitation Measures
Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs
Weight a moment: risk-aware exploration with Bayes
Maximum Entropy Exploration Without Rollouts
An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning
ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning
A Causality-Inspired Spatial-Temporal Return Decomposition Approach for Multi-Agent Reinforcement Learning
SCoUT: Scalable Communication via Utility-Guided Temporal Grouping in Multi-Agent Reinforcement Learning
Decentralized Asymmetric DQN: Decentralization without Factorization in Multi-Agent Reinforcement Learning
Fixing Incomplete Value Function Decomposition for Multi-Agent Reinforcement Learning
Learning Communication Skills in Multi-task Multi-agent Deep Reinforcement Learning
ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning