Company logo

RLC 2026 Paper Schedule

Sun, August 16

Natural Policy Gradient for Bayesian Network Policies in Markov Potential Games

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #1 · 1 PM – 2:30 PM
Sun, August 16

StaQ: a Finite Memory Approach to Discrete Action Policy Mirror Descent

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #2 · 1 PM – 2:30 PM
Sun, August 16

Near-Optimal Reinforcement Learning for Linear Distributionally Robust Markov Decision Processes

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #3 · 1 PM – 2:30 PM
Sun, August 16

Intrinsic Closed-Loop Practical Asymptotic Stability in Standard Reinforcement Learning

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #4 · 1 PM – 2:30 PM
Sun, August 16

Provable Distributional Value Iteration under Partial Observability

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #5 · 1 PM – 2:30 PM
Sun, August 16

Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #6 · 1 PM – 2:30 PM
Sun, August 16

Strategically Robust Multi-Agent Reinforcement Learning with Linear Function Approximation

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #7 · 1 PM – 2:30 PM
Sun, August 16

The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #8 · 1 PM – 2:30 PM
Sun, August 16

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #9 · 1 PM – 2:30 PM
Sun, August 16

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #10 · 1 PM – 2:30 PM
Sun, August 16

Reward Design Agent for Reinforcement Learning

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #11 · 1 PM – 2:30 PM
Sun, August 16

Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #12 · 1 PM – 2:30 PM
Sun, August 16

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #13 · 1 PM – 2:30 PM
Sun, August 16

Leveraging Reward Machines for Efficient Multi-Objective Reinforcement Learning

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #14 · 1 PM – 2:30 PM
Sun, August 16

SR-Reward: Taking The Path More Traveled

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #15 · 1 PM – 2:30 PM
Sun, August 16

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

  • Track 2 · Reward functions
  • Room B-0325
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #16 · 1 PM – 2:30 PM
Sun, August 16

Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #17 · 1 PM – 2:30 PM
Sun, August 16

Gradient Iterated Temporal-Difference Learning

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #18 · 1 PM – 2:30 PM
Sun, August 16

Representation Regularization in Distributional Reinforcement Learning

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #19 · 1 PM – 2:30 PM
Sun, August 16

From Pixels to Factors: Learning Independently Controllable State Variables for Reinforcement Learning

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #20 · 1 PM – 2:30 PM
Sun, August 16

Learning World Value Functions with Successor Representation and Vision Models

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #21 · 1 PM – 2:30 PM
Sun, August 16

Gated Q-learning: Add Off-Policy Bias to Taste

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #22 · 1 PM – 2:30 PM
Sun, August 16

Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #23 · 1 PM – 2:30 PM
Sun, August 16

On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #24 · 1 PM – 2:30 PM
Sun, August 16

The Yokai Learning Environment: Tracking Beliefs Over Space and Time

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #25 · 1 PM – 2:30 PM
Sun, August 16

The Cell Must Go On: Agar.io for Continual Reinforcement Learning

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #26 · 1 PM – 2:30 PM
Sun, August 16

SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #27 · 1 PM – 2:30 PM
Sun, August 16

Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Program

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #28 · 1 PM – 2:30 PM
Sun, August 16

Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #29 · 1 PM – 2:30 PM
Sun, August 16

The Open Ant: A Robot Platform for Reinforcement Learning Research

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #30 · 1 PM – 2:30 PM
Sun, August 16

ARLBench: Flexible and Efficient Benchmarking for Hyperparameter Optimization in Reinforcement Learning

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #31 · 1 PM – 2:30 PM
Mon, August 17

Randomized Exploration for Linear Bandits via Absolute Perturbations

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #1 · 3 PM – 6 PM
Mon, August 17

ContrastSpanner: Learning Low-Rank Causal Contrasts to Alleviate Power-Set and Eluder Barriers

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #2 · 3 PM – 6 PM
Mon, August 17

Learning with Coupled Uncertainty

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #3 · 3 PM – 6 PM
Mon, August 17

Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #4 · 3 PM – 6 PM
Mon, August 17

Offline-to-Online Learning in Linear Bandits

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #5 · 3 PM – 6 PM
Mon, August 17

Annealed Softmax Greedy in Many-Armed Bayesian Bandits

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #6 · 3 PM – 6 PM
Mon, August 17

Collaborative Learning under Strategic Behavior: Mechanisms for Eliciting Feedback in Principal-Agent Bandit Games

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #7 · 3 PM – 6 PM
Mon, August 17

Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Context Drifts

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #8 · 3 PM – 6 PM
Mon, August 17

Limits of reinforcement learning for decision trees in Markov decision processes

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #17 · 3 PM – 6 PM
Mon, August 17

Planning for Signaling in Low-Trust Environments

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #18 · 3 PM – 6 PM
Mon, August 17

Inference-Time Policy Alignment for Fair Reinforcement Learning

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #19 · 3 PM – 6 PM
Mon, August 17

Improving Human Performance with Value-Aware Interventions: A Case Study in Chess

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #20 · 3 PM – 6 PM
Mon, August 17

Toward Agents That Reason About Their Computation

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #21 · 3 PM – 6 PM
Mon, August 17

Let it Cook: Learning to Wait in Sequential Decision Making

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #22 · 3 PM – 6 PM
Mon, August 17

Trajectory First: A Curriculum for Discovering Diverse Policies

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #23 · 3 PM – 6 PM
Mon, August 17

Hierarchical Behaviour Spaces

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #24 · 3 PM – 6 PM
Mon, August 17

Overcoming Valid Action Suppression in Unmasked Policy Gradient Algorithms

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #33 · 3 PM – 6 PM
Mon, August 17

PPO+: Enhancing proximal policy optimization

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #34 · 3 PM – 6 PM
Mon, August 17

Repetition as Reinforcement: Enhancing Sample Efficiency via Instant Episode Repetition in Reinforcement Learning

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #35 · 3 PM – 6 PM
Mon, August 17

Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #36 · 3 PM – 6 PM
Mon, August 17

Delightful Policy Gradient

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #37 · 3 PM – 6 PM
Mon, August 17

Counterfactual Shapley Credit Assignment

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #38 · 3 PM – 6 PM
Mon, August 17

Reinforcement Learning for Stochastic Shortest Paths with Dead-Ends

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #39 · 3 PM – 6 PM
Mon, August 17

Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #40 · 3 PM – 6 PM
Mon, August 17

Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #49 · 3 PM – 6 PM
Mon, August 17

Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #50 · 3 PM – 6 PM
Mon, August 17

Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #51 · 3 PM – 6 PM
Mon, August 17

Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #52 · 3 PM – 6 PM
Mon, August 17

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #53 · 3 PM – 6 PM
Mon, August 17

Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #54 · 3 PM – 6 PM
Mon, August 17

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #55 · 3 PM – 6 PM
Mon, August 17

Discovering High Quality Chess Puzzles with Offline Reinforcement Learning

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #56 · 3 PM – 6 PM
Mon, August 17

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #9 · 3 PM – 6 PM
Mon, August 17

Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #10 · 3 PM – 6 PM
Mon, August 17

Architecture over Algorithms: Network Modernization Improves Multi-Objective Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #11 · 3 PM – 6 PM
Mon, August 17

Revisiting FTA: A Sparse One-to-Many Activation for Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #12 · 3 PM – 6 PM
Mon, August 17

Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #13 · 3 PM – 6 PM
Mon, August 17

Learning the Supports for Categorical Critic in Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #14 · 3 PM – 6 PM
Mon, August 17

Rethinking the Suitability of RL Algorithms Under Practical Transfer Constraints

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #15 · 3 PM – 6 PM
Mon, August 17

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #16 · 3 PM – 6 PM
Mon, August 17

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #25 · 3 PM – 6 PM
Mon, August 17

ICPL: Few-shot In-context Preference Learning via LLMs

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #26 · 3 PM – 6 PM
Mon, August 17

Modification-Considering Value Learning for Reward Hacking Mitigation in RL

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #27 · 3 PM – 6 PM
Mon, August 17

PB²: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #28 · 3 PM – 6 PM
Mon, August 17

Discovering Reinforcement Learning Interfaces with Large Language Models

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #29 · 3 PM – 6 PM
Mon, August 17

Generalization in Monitored Markov Decision Processes (Mon-MDPs)

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #30 · 3 PM – 6 PM
Mon, August 17

Design Principles for Tabular Multi-Policy MORL in Infinite Horizons

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #31 · 3 PM – 6 PM
Mon, August 17

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #32 · 3 PM – 6 PM
Mon, August 17

Biased Dreams: Limitations to Epistemic Uncertainty Quantification in Latent Space Models

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #41 · 3 PM – 6 PM
Mon, August 17

Risk-Aware General-Utility Markov Decision Processes

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #42 · 3 PM – 6 PM
Mon, August 17

Stable Planning through Aligned Representations in Model-Based Reinforcement Learning

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #43 · 3 PM – 6 PM
Mon, August 17

Bi-Level Reinforcement Learning Pathway for Sim-to-Real Optimality

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #44 · 3 PM – 6 PM
Mon, August 17

Using Common Random Numbers for Simulation-based Planning with Rollouts

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #45 · 3 PM – 6 PM
Mon, August 17

Gaussian Process Aggregation for Root-Parallel Monte Carlo Tree Search with Continuous Actions

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #46 · 3 PM – 6 PM
Mon, August 17

Strategically-Linked Decisions in Long-Term Planning and Reinforcement Learning

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #47 · 3 PM – 6 PM
Mon, August 17

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #48 · 3 PM – 6 PM
Mon, August 17

Centralized Adaptive Sampling for Reliable Co-training of Independent Multi-Agent Policies

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #57 · 3 PM – 6 PM
Mon, August 17

Beyond Local Views: Global State Inference with Diffusion Models for Cooperative MARL

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #58 · 3 PM – 6 PM
Mon, August 17

Credit Assignment and Focused Exploration for Sparse-reward Multi-agent Deep Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #59 · 3 PM – 6 PM
Mon, August 17

Multi-Agent Reinforcement Learning with Reward Machines for Mixed Cooperative-Competitive Environments

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #60 · 3 PM – 6 PM
Mon, August 17

Learning Multi-Agent Communication Protocol: Study on Information Entropy Efficiency in MARL

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #61 · 3 PM – 6 PM
Mon, August 17

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #62 · 3 PM – 6 PM
Mon, August 17

The challenge of hidden gifts in multi-agent reinforcement learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #63 · 3 PM – 6 PM
Mon, August 17

Sociodynamics of Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #64 · 3 PM – 6 PM
Tue, August 18

On the Variance of Temporal Difference Learning and its Reduction Using Control Variates

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #1 · 3 PM – 6 PM
Tue, August 18

Towards Formalizing Reinforcement Learning Theory: A Robbins-Siegmund Approach

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #2 · 3 PM – 6 PM
Tue, August 18

Statistical Inference for Policy Evaluation with Temporal Difference Learning

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #3 · 3 PM – 6 PM
Tue, August 18

Finite Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #4 · 3 PM – 6 PM
Tue, August 18

Solvable models of learning to pursue a moving target

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #5 · 3 PM – 6 PM
Tue, August 18

Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #6 · 3 PM – 6 PM
Tue, August 18

Optimal Regret for Policy Optimization in Average Reward MDPs Without Mixing

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #7 · 3 PM – 6 PM
Tue, August 18

When Can Pure Exploitation Succeed in Linear RL? Decoys and Self-Identifiability for Greedy LSVI

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #8 · 3 PM – 6 PM
Tue, August 18

On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #17 · 3 PM – 6 PM
Tue, August 18

Conformal Preemption of Failures in Sequential Decision-Making Agents

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #18 · 3 PM – 6 PM
Tue, August 18

Distributionally Robust Self Paced Curriculum Reinforcement Learning

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #19 · 3 PM – 6 PM
Tue, August 18

Adaptive Critic Shaping for Reinforcement Learning with Temporal Logic Constraint

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #20 · 3 PM – 6 PM
Tue, August 18

Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #21 · 3 PM – 6 PM
Tue, August 18

An Unreasonably Simple Approach to Safe Reinforcement Learning

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #22 · 3 PM – 6 PM
Tue, August 18

Skill-based Safe Reinforcement Learning with Risk Planning

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #23 · 3 PM – 6 PM
Tue, August 18

V-OCBF: Learning Safety Filters from Offline Data via Value-Guided Offline Control Barrier Functions

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #24 · 3 PM – 6 PM
Tue, August 18

Yes, Q-learning Helps Offline In-Context RL

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #33 · 3 PM – 6 PM
Tue, August 18

CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #34 · 3 PM – 6 PM
Tue, August 18

Fully Offline Reinforcement Learning

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #35 · 3 PM – 6 PM
Tue, August 18

Dynamics Models for Offline Hyperparameter Selection in Real-World RL

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #36 · 3 PM – 6 PM
Tue, August 18

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #37 · 3 PM – 6 PM
Tue, August 18

Conservative Value Priors: A Bayesian Path to Offline Reinforcement Learning

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #38 · 3 PM – 6 PM
Tue, August 18

Offline RL with Hierarchical Action Chunking

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #39 · 3 PM – 6 PM
Tue, August 18

{MOORL}: A Framework for Integrating Offline-Online Reinforcement Learning

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #40 · 3 PM – 6 PM
Tue, August 18

Confidence Intervals for the Interquartile Mean

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #49 · 3 PM – 6 PM
Tue, August 18

Synthetic Monitoring Environments for Reinforcement Learning

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #50 · 3 PM – 6 PM
Tue, August 18

Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #51 · 3 PM – 6 PM
Tue, August 18

PGTG: Procedurally Generated Grid-Based Traffic Gym

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #52 · 3 PM – 6 PM
Tue, August 18

Ludax: A GPU-Accelerated Description Language for Board Games

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #53 · 3 PM – 6 PM
Tue, August 18

Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #54 · 3 PM – 6 PM
Tue, August 18

NutriRL: A Benchmark for Nutritional Regulation under Delayed State Transitions

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #55 · 3 PM – 6 PM
Tue, August 18

Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #56 · 3 PM – 6 PM
Tue, August 18

DART: Dual Adaptive Residual Tracking for Low-Bias Advantage Estimation and Credit Assignment in AI Agents

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #9 · 3 PM – 6 PM
Tue, August 18

FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #10 · 3 PM – 6 PM
Tue, August 18

A Simple Baseline for Learning Approximate State Abstractions in Factored State Spaces

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #11 · 3 PM – 6 PM
Tue, August 18

Endpoint Replay: Compressing the Recency Buffer in Deep Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #12 · 3 PM – 6 PM
Tue, August 18

Improving Reward-Based Hindsight Credit Assignment

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #13 · 3 PM – 6 PM
Tue, August 18

Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #14 · 3 PM – 6 PM
Tue, August 18

Cohering Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #15 · 3 PM – 6 PM
Tue, August 18

A Survey of State Representation Learning for Deep Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #16 · 3 PM – 6 PM
Tue, August 18

Temporally Extended Mixture-of-Experts Models

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #25 · 3 PM – 6 PM
Tue, August 18

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #26 · 3 PM – 6 PM
Tue, August 18

A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #27 · 3 PM – 6 PM
Tue, August 18

Scalable Causal Imitation Learning

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #28 · 3 PM – 6 PM
Tue, August 18

Supervised Reward Inference

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #29 · 3 PM – 6 PM
Tue, August 18

Minimal Ingredients for Reward Assignment from Expert Demonstrations

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #30 · 3 PM – 6 PM
Tue, August 18

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #31 · 3 PM – 6 PM
Tue, August 18

Q-Based Variational Inverse Reinforcement Learning

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #32 · 3 PM – 6 PM
Tue, August 18

Extending Differential Temporal Difference Methods for Episodic Problems

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #41 · 3 PM – 6 PM
Tue, August 18

Revisiting Adam for Streaming Reinforcement Learning

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #42 · 3 PM – 6 PM
Tue, August 18

Forager: a lightweight testbed for continual learning with partial observability in RL

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #43 · 3 PM – 6 PM
Tue, August 18

Dense and Diverse Goal Coverage in Multi Goal Reinforcement Learning

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #44 · 3 PM – 6 PM
Tue, August 18

Maximum-Entropy Exploration with Future State-Action Visitation Measures

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #45 · 3 PM – 6 PM
Tue, August 18

Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #46 · 3 PM – 6 PM
Tue, August 18

Weight a moment: risk-aware exploration with Bayes

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #47 · 3 PM – 6 PM
Tue, August 18

Maximum Entropy Exploration Without Rollouts

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #48 · 3 PM – 6 PM
Tue, August 18

An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #57 · 3 PM – 6 PM
Tue, August 18

ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #58 · 3 PM – 6 PM
Tue, August 18

A Causality-Inspired Spatial-Temporal Return Decomposition Approach for Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #59 · 3 PM – 6 PM
Tue, August 18

SCoUT: Scalable Communication via Utility-Guided Temporal Grouping in Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #60 · 3 PM – 6 PM
Tue, August 18

Decentralized Asymmetric DQN: Decentralization without Factorization in Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #61 · 3 PM – 6 PM
Tue, August 18

Fixing Incomplete Value Function Decomposition for Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #62 · 3 PM – 6 PM
Tue, August 18

Learning Communication Skills in Multi-task Multi-agent Deep Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #63 · 3 PM – 6 PM
Tue, August 18

ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #64 · 3 PM – 6 PM
Company logo