Company logo

RLC 2026 Paper Schedule

PDF
Sun, August 16

Natural Policy Gradient for Bayesian Network Policies in Markov Potential Games

Dingyang Chen, Zhenyu Zhang, Yuan Ling, and Qi Zhang

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #1 · 1 PM – 2:30 PM
PDF
Sun, August 16

StaQ: a Finite Memory Approach to Discrete Action Policy Mirror Descent

Alex Davey, Alena Shilova, Brahim Driss, and Riad Akrour

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #2 · 1 PM – 2:30 PM
PDF
Sun, August 16

Towards Formalizing Reinforcement Learning Theory: A Robbins-Siegmund Approach

Shangtong Zhang

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #3 · 1 PM – 2:30 PM
PDF
Sun, August 16

Intrinsic Closed-Loop Practical Asymptotic Stability in Discrete-Time Reinforcement Learning

Jan de Priester and Ricardo Sanfelice

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #4 · 1 PM – 2:30 PM
PDF
Sun, August 16

Provable Distributional Value Iteration under Partial Observability

Larry Preuett, Qiuyi Zhang, and Muhammad Aurangzeb Ahmad

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #5 · 1 PM – 2:30 PM
PDF
Sun, August 16

Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

Haoyang Hong, Zichen Wang, Quanquan Gu, and Huazheng Wang

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #6 · 1 PM – 2:30 PM
PDF
Sun, August 16

Strategically Robust Multi-Agent Reinforcement Learning with Linear Function Approximation

Jake Gonzales, Max Horwitz, Eric Mazumdar, and Lillian J. Ratliff

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #7 · 1 PM – 2:30 PM
Sun, August 16
Journal-to-Conference

The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #8 · 1 PM – 2:30 PM
PDF
Sun, August 16

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function

Qining Zhang and Lei Ying

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #9 · 1 PM – 2:30 PM
PDF
Sun, August 16

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

Mohamed Benabdelouahad, AHMED DJALAL HACINI, Nadir Farhi, and Aissa Boulmerka

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #10 · 1 PM – 2:30 PM
PDF
Sun, August 16

Reward Design Agent for Reinforcement Learning

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, and Nitin Kamra

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #11 · 1 PM – 2:30 PM
PDF
Sun, August 16

Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning

Ali Larian, Qian Lin, Chang Zong Wu, and Daniel S. Brown

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #12 · 1 PM – 2:30 PM
PDF
Sun, August 16

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, and Ness Shroff

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #13 · 1 PM – 2:30 PM
PDF
Sun, August 16

Leveraging Reward Machines for Efficient Multi-Objective Reinforcement Learning

Panos Aronis, Mehdi Dastani, Roxana Rădulescu, and Giovanni Varricchione

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #14 · 1 PM – 2:30 PM
Sun, August 16
Journal-to-Conference

SR-Reward: Taking The Path More Traveled

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #15 · 1 PM – 2:30 PM
Sun, August 16
Journal-to-Conference

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #16 · 1 PM – 2:30 PM
PDF
Sun, August 16

Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning

Hsiao-Ru Pan and Bernhard Schölkopf

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #17 · 1 PM – 2:30 PM
PDF
Sun, August 16

Gradient Iterated Temporal-Difference Learning

Théo Vincent, Kevin Gerhardt, Yogesh Tripathi, Habib Maraqten, Adam White, Martha White, Jan Peters, and Carlo D'Eramo

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #18 · 1 PM – 2:30 PM
PDF
Sun, August 16

Representation Regularization in Distributional Reinforcement Learning

André Inge, Jonas Nordqvist, Björn Lindenberg, and Karl-Olof Lindahl

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #19 · 1 PM – 2:30 PM
PDF
Sun, August 16

From Pixels to Factors: Learning Independently Controllable State Variables for Reinforcement Learning

Rafael Rodriguez-Sanchez, Cameron Allen, and George Konidaris

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #20 · 1 PM – 2:30 PM
PDF
Sun, August 16

Learning World Value Functions with Successor Representation and Vision Models

Sergio Frasco, Devon Jarvis, and Geraud Nangue Tasse

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #21 · 1 PM – 2:30 PM
PDF
Sun, August 16

Gated Q-learning: Add Off-Policy Bias to Taste

Brett Daley

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #22 · 1 PM – 2:30 PM
PDF
Sun, August 16

Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL

Mingxuan Che, Tsung Yuan Tseng, Theresa Eimer, Marius Lindauer, and Alexander von Rohr

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #23 · 1 PM – 2:30 PM
Sun, August 16
Journal-to-Conference

On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #24 · 1 PM – 2:30 PM
PDF
Sun, August 16

The Yokai Learning Environment: Tracking Beliefs Over Space and Time

Constantin Ruhdorfer, Matteo Bortoletto, Johannes Forkel, Jakob Nicolaus Foerster, and Andreas Bulling

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 1 · 11:00 AM – 11:50 AM
  • Poster #25 · 1 PM – 2:30 PM
PDF
Sun, August 16

The Cell Must Go On: Agar.io for Continual Reinforcement Learning

Mohamed Ayman Mohamed, Kateryna Nekhomiazh, Vedant Vyas, Marcos Menon Jose, Andrew Patterson, and Marlos C. Machado

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 2 · 11:00 AM – 11:50 AM
  • Poster #26 · 1 PM – 2:30 PM
PDF
Sun, August 16

SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens

Alexandre Brown and Glen Berseth

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 3 · 11:00 AM – 11:50 AM
  • Poster #27 · 1 PM – 2:30 PM
PDF
Sun, August 16

Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Program

Jose Efraim Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu, and Huazheng Wang

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 4 · 11:00 AM – 11:50 AM
  • Poster #28 · 1 PM – 2:30 PM
PDF
Sun, August 16

Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics

Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius, Elle Miller, Trevor McInroe, Fan Zhang, Patricia Wollstadt, Stefano V. Albrecht, and Subramanian Ramamoorthy

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 5 · 11:00 AM – 11:50 AM
  • Poster #29 · 1 PM – 2:30 PM
PDF
Sun, August 16

The Open Ant: A Robot Platform for Reinforcement Learning Research

Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D Martin, Martha Steenstrup, and Joseph Varughese Modayil

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 6 · 11:00 AM – 11:50 AM
  • Poster #30 · 1 PM – 2:30 PM
Sun, August 16
Journal-to-Conference

ARLBench: Flexible and Efficient Benchmarking for Hyperparameter Optimization in Reinforcement Learning

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 7 · 11:00 AM – 11:50 AM
  • Poster #31 · 1 PM – 2:30 PM
PDF
Sun, August 16

Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

Vincent Taboga, Justin Veilleux, Doseok Jang, Anushree Rankawat, and Pierre-Luc Bacon

  • Track 4 · Evaluation, benchmarks, and envs
  • Room B-0305
  • Presentation Talk 8 · 11:00 AM – 11:50 AM
  • Poster #32 · 1 PM – 2:30 PM
PDF
Mon, August 17

Randomized Exploration for Linear Bandits via Absolute Perturbations

Toshinori Kitamura, Shuai Liu, and Csaba Szepesvari

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #1 · 3 PM – 6 PM
PDF
Mon, August 17

ContrastSpanner: Learning Low-Rank Causal Contrasts to Alleviate Power-Set and Eluder Barriers

Alec Koppel and Laixi Shi

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #2 · 3 PM – 6 PM
PDF
Mon, August 17

Learning with Coupled Uncertainty

Waqar Mirza, Aldo Pacchiano, and Eric Mazumdar

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #3 · 3 PM – 6 PM
PDF
Mon, August 17

Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives

S Akash, Pratik Gajane, and Jawar Singh

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #4 · 3 PM – 6 PM
PDF
Mon, August 17

Offline-to-Online Learning in Linear Bandits

Kushagra Chandak, Toshinori Kitamura, and Xiaoqi Tan

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #5 · 3 PM – 6 PM
PDF
Mon, August 17

Annealed Softmax Greedy in Many-Armed Bayesian Bandits

William Overman and Mohsen Bayati

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #6 · 3 PM – 6 PM
PDF
Mon, August 17

Collaborative Learning under Strategic Behavior: Mechanisms for Eliciting Feedback in Principal-Agent Bandit Games

Ramakrishnan Krishnamurthy, Arpit Agarwal, Lakshmi Subramanian, and Maximilian Nickel

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #7 · 3 PM – 6 PM
PDF
Mon, August 17

Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Context Drifts

Udvas Das, Waris Radji, Debabrota Basu, and Odalric-Ambrym Maillard

  • Track 1 · Bandits
  • Room B-2305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #8 · 3 PM – 6 PM
PDF
Mon, August 17

Limits of reinforcement learning for decision trees in Markov decision processes

Hector Kohler, Riad Akrour, and Philippe Preux

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #17 · 3 PM – 6 PM
PDF
Mon, August 17

Planning for Signaling in Low-Trust Environments

Septia Rani, Turgay Caglar, and Sarath Sreedharan

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #18 · 3 PM – 6 PM
PDF
Mon, August 17

Inference-Time Policy Alignment for Fair Reinforcement Learning

Umer Siddique, Peilang Li, Conor Wallace, and Yongcan Cao

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #19 · 3 PM – 6 PM
PDF
Mon, August 17

Improving Human Performance with Value-Aware Interventions: A Case Study in Chess

Saumik Narayanan, Raja Panjwani, Siddhartha Sen, and Chien-Ju Ho

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #20 · 3 PM – 6 PM
PDF
Mon, August 17

Toward Agents That Reason About Their Computation

Adrian Orenstein, Jessica Chen, Gwyneth Anne Delos Santos, Bayley Sapara, and Michael Bowling

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #21 · 3 PM – 6 PM
PDF
Mon, August 17

Let it Cook: Learning to Wait in Sequential Decision Making

Christopher Watson, Arjun Krishna, Dinesh Jayaraman, and Rajeev Alur

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #22 · 3 PM – 6 PM
PDF
Mon, August 17

Trajectory First: A Curriculum for Discovering Diverse Policies

Cornelius V. Braun, Sayantan Auddy, and Marc Toussaint

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #23 · 3 PM – 6 PM
PDF
Mon, August 17

Hierarchical Behaviour Spaces

Michael Matthews, Pierluca D'Oro, Anssi Kanervisto, Scott Fujimoto, Jakob Nicolaus Foerster, and Mikael Henaff

  • Track 2 · Fairness, interpretability, and human-AI interaction + Hierarchical RL and skills
  • Room B-0325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #24 · 3 PM – 6 PM
PDF
Mon, August 17

Overcoming Valid Action Suppression in Unmasked Policy Gradient Algorithms

Renos Zabounidis, Roy Siegelmann, Mohamad Qadri, Woojun Kim, Simon Stepputtis, and Katia P. Sycara

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #33 · 3 PM – 6 PM
PDF
Mon, August 17

PPO+: Enhancing proximal policy optimization

Mahdi Kallel, Jose-Luis Holgado-Alvarez, Samuele Tosatto, and Carlo D'Eramo

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #34 · 3 PM – 6 PM
PDF
Mon, August 17

Repetition as Reinforcement: Enhancing Sample Efficiency via Instant Episode Repetition in Reinforcement Learning

Hoda Yamani, Yuning Xing, Koen van Rijnsoever, Bruce A. MacDonald, and Henry Williams

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #35 · 3 PM – 6 PM
PDF
Mon, August 17

Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments

Michael Beukman, Khimya Khetarpal, Zeyu Zheng, Will Dabney, Jakob Nicolaus Foerster, Michael D Dennis, and Clare Lyle

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #36 · 3 PM – 6 PM
PDF
Mon, August 17

Delightful Policy Gradient

Ian Osband

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #37 · 3 PM – 6 PM
PDF
Mon, August 17

Counterfactual Shapley Credit Assignment

Mingxuan Li, Kai-Zhan Lee, and Elias Bareinboim

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #38 · 3 PM – 6 PM
PDF
Mon, August 17

Goal-Oriented Reinforcement Learning for Stochastic Shortest Paths with Dead-Ends

Gustavo De Mari Pereira and Leliane N. de Barros

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #39 · 3 PM – 6 PM
PDF
Mon, August 17

Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL

Dillon Sandhu and Ronald Parr

  • Track 3 · Core RL algorithms
  • Room B-2325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #40 · 3 PM – 6 PM
PDF
Mon, August 17

Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry

Alexander Fabisch, Melvin Laux, Mariela De Lucas Alvarez, Edoardo Caroselli, and Julian Theis

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #49 · 3 PM – 6 PM
PDF
Mon, August 17

Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids

Hadi Nekoei, Alexandre Blondin Massé, Rachid Hassani, Sarath Chandar, and Vincent Mai

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #50 · 3 PM – 6 PM
PDF
Mon, August 17

Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning

Jiajun Hu, Núria Armengol Urpí, Jin Cheng, and Stelian Coros

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #51 · 3 PM – 6 PM
PDF
Mon, August 17

Dynamics Models for Offline Hyperparameter Selection in Real-World RL

Jordan Coblin, Han Wang, Martha White, and Adam White

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #52 · 3 PM – 6 PM
PDF
Mon, August 17

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

Fahim Shahriar, Cheryl Wang, Seyed Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, and Colin Bellinger

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #53 · 3 PM – 6 PM
PDF
Mon, August 17

Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach

Alessandro Sestini, Joakim Bergdahl, Jean-Philippe Barrette-LaPierre, Florian Fuchs, Brady Chen, Fabio Zinno, Michael D Jones, and Linus Gisslén

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #54 · 3 PM – 6 PM
PDF
Mon, August 17

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

Uljad Berdica, Fernando Acero, Anton Ipsen, Parisa Zehtabi, Michael Cashmore, and Manuela Veloso

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #55 · 3 PM – 6 PM
PDF
Mon, August 17

Discovering High Quality Chess Puzzles with Offline Reinforcement Learning

Allen Nie, Anirudhan Badrinath, Nicholas Tomlin, Timothy Dai, Carissa Yip, Rose E Wang, Emma Brunskill, and Christopher J Piech

  • Track 4 · Applied RL
  • Room B-0305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #56 · 3 PM – 6 PM
PDF
Mon, August 17

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

Rohit Kumar Salla, Manoj Saravanan, and Simon Stepputtis

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #9 · 3 PM – 6 PM
PDF
Mon, August 17

Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning

Aleksandar Todorov and Matthia Sabatelli

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #10 · 3 PM – 6 PM
PDF
Mon, August 17

Momba: Network Modernization Improves Multi-Objective Reinforcement Learning

Adam Štafa, Santeri Heiskanen, Petr Novotný, and Joni Pajarinen

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #11 · 3 PM – 6 PM
PDF
Mon, August 17

Revisiting FTA: A Sparse One-to-Many Activation for Reinforcement Learning

Tyler Lazar, Matthew Vandergrift, Martha White, and Adam White

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #12 · 3 PM – 6 PM
PDF
Mon, August 17

Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability

Taewoon Kim, Vincent Francois-Lavet, and Michael Cochez

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #13 · 3 PM – 6 PM
PDF
Mon, August 17

Learning the Supports for Categorical Critic in Reinforcement Learning

Jen-Yen Chang, Takayuki Osa, and Tatsuya Harada

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #14 · 3 PM – 6 PM
PDF
Mon, August 17

Rethinking the Suitability of RL Algorithms Under Practical Transfer Constraints

Hany Hamed, Abhishek Naik, Colin Bellinger, and A. Rupam Mahmood

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #15 · 3 PM – 6 PM
PDF
Mon, August 17

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

Donghu Kim, Youngdo Lee, Hojoon Lee, Johan Obando-Ceron, Byungkun Lee, Aaron Courville, Pablo Samuel Castro, Jaegul Choo, and Clare Lyle

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #16 · 3 PM – 6 PM
PDF
Mon, August 17

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

Christian Gumbsch, Leonardo Barcellona, Lennard Schuenemann, Platon Karageorgis, Andrii Zadaianchuk, Zehao Wang, Sergey Zakharov, Fabien Despinoy, Rahaf Aljundi, and Stratis Gavves

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #25 · 3 PM – 6 PM
PDF
Mon, August 17

ICPL: Few-shot In-context Preference Learning via LLMs

Chao Yu, Qixin Tan, Hong Lu, Jiaxuan Gao, Xinting Yang, Yu Wang, Yi Wu, and Eugene Vinitsky

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #26 · 3 PM – 6 PM
PDF
Mon, August 17

Modification-Considering Value Learning for Reward Hacking Mitigation in RL

Evgenii Opryshko, Umangi Jain, and Igor Gilitschenski

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #27 · 3 PM – 6 PM
PDF
Mon, August 17

PB²: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning

Brahim Driss, Alex Davey, and Riad Akrour

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #28 · 3 PM – 6 PM
PDF
Mon, August 17

Discovering Reinforcement Learning Interfaces with Large Language Models

Akshat Singh Jaswal, Ashish Baghel, and Paras Chopra

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #29 · 3 PM – 6 PM
PDF
Mon, August 17

Generalization in Monitored Markov Decision Processes (Mon-MDPs)

Montaser Mohammedalamen and Michael Bowling

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #30 · 3 PM – 6 PM
PDF
Mon, August 17

Design Principles for Tabular Multi-Policy MORL in Infinite Horizons

Marcelo d'Almeida and Daniel Mosse

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #31 · 3 PM – 6 PM
PDF
Mon, August 17

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

Matteo Pannacci, Andrea Fanti, Elena Umili, and Roberto Capobianco

  • Track 2 · Task specification and reward functions
  • Room B-0325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #32 · 3 PM – 6 PM
PDF
Mon, August 17

Biased Dreams: Limitations to Epistemic Uncertainty Quantification in Latent Dynamics Models

Julia Berger, Bernd Frauenknecht, Sebastian Trimpe, and Bastian Leibe

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #41 · 3 PM – 6 PM
PDF
Mon, August 17

Risk-Aware General-Utility Markov Decision Processes

Pedro Pinto Santos, Fábio Vital, Alberto Sardinha, and Francisco S. Melo

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #42 · 3 PM – 6 PM
PDF
Mon, August 17

Stable Planning through Aligned Representations in Model-Based Reinforcement Learning

Misagh Soltani and Forest Agostinelli

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #43 · 3 PM – 6 PM
PDF
Mon, August 17

Bi-Level Reinforcement Learning Pathway for Sim-to-Real Optimality

Akhil S Anand, Shambhuraj Sawant, Paavo Parmas, Jasper Hoffmann, Dirk Reinhardt, and Sebastien Gros

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #44 · 3 PM – 6 PM
PDF
Mon, August 17

Using Common Random Numbers for Simulation-based Planning with Rollouts

Sandarbh Yadav, Frederic J Maliakkal, Harshad Khadilkar, and Shivaram Kalyanakrishnan

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #45 · 3 PM – 6 PM
PDF
Mon, August 17

Gaussian Process Aggregation for Root-Parallel Monte Carlo Tree Search with Continuous Actions

Junlin Xiao, Victor-Alexandru Darvariu, Bruno Lacerda, and Nick Hawes

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #46 · 3 PM – 6 PM
PDF
Mon, August 17

Strategically-Linked Decisions in Long-Term Planning and Reinforcement Learning

Alihan Hüyük, Jonas B Raedler, Leo Benac, and Finale Doshi-Velez

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #47 · 3 PM – 6 PM
PDF
Mon, August 17

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

Adam Labiosa and Josiah P. Hanna

  • Track 3 · Planning and model-based RL
  • Room B-2325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #48 · 3 PM – 6 PM
PDF
Mon, August 17

Centralized Adaptive Sampling for Reliable Co-training of Independent Multi-Agent Policies

Nicholas E. Corrado and Josiah P. Hanna

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #57 · 3 PM – 6 PM
PDF
Mon, August 17

Beyond Local Views: Global State Inference with Diffusion Models for Cooperative MARL

Zhiwei Xu, Hangyu Mao, ZHANG NIANMIN, Shengtao Zhang, Xin Xin, Pengjie Ren, Dapeng Li, Bin Zhang, Guoliang Fan, Zhumin Chen, Changwei Wang, and Jiangjin Yin

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #58 · 3 PM – 6 PM
PDF
Mon, August 17

Credit Assignment and Focused Exploration for Sparse-reward Multi-agent Deep Reinforcement Learning

Shuai Han, Mehdi Dastani, and Shihan Wang

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #59 · 3 PM – 6 PM
PDF
Mon, August 17

Multi-Agent Reinforcement Learning with Reward Machines for Mixed Cooperative-Competitive Environments

Sriram Ganapathi Subramanian, Toryn Q. Klassen, and Sheila A. McIlraith

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #60 · 3 PM – 6 PM
PDF
Mon, August 17

Learning Multi-Agent Communication Protocol: Study on Information Entropy Efficiency in MARL

Xinren Zhang, Zixin Zhong, and Jiadong Yu

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #61 · 3 PM – 6 PM
PDF
Mon, August 17

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

Santiago Amaya-Corredor, Miguel Calvo-Fullana, and Anders Jonsson

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #62 · 3 PM – 6 PM
PDF
Mon, August 17

The challenge of hidden gifts in multi-agent reinforcement learning

Dane Malenfant and Blake Aaron Richards

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #63 · 3 PM – 6 PM
Mon, August 17
Journal-to-Conference

Sociodynamics of Reinforcement Learning

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #64 · 3 PM – 6 PM
PDF
Tue, August 18

On the Variance of Temporal Difference Learning and its Reduction Using Control Variates

Hsiao-Ru Pan and Bernhard Schölkopf

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #1 · 3 PM – 6 PM
PDF
Tue, August 18

Near-Optimal Reinforcement Learning for Linear Distributionally Robust Markov Decision Processes

Zhishuai Liu, Weixin Wang, and Pan Xu

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #2 · 3 PM – 6 PM
PDF
Tue, August 18

Statistical Inference for Policy Evaluation with Temporal Difference Learning

Weichen Wu, Gen Li, Yuting Wei, and Alessandro Rinaldo

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #3 · 3 PM – 6 PM
PDF
Tue, August 18

Finite Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes

Asha Barua and Sajad Khodadadian

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #4 · 3 PM – 6 PM
PDF
Tue, August 18

Solvable models of learning to pursue a moving target

John J. Vastola and Kanaka Rajan

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #5 · 3 PM – 6 PM
PDF
Tue, August 18

Rationalizing Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies

Silviu Pitis

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #6 · 3 PM – 6 PM
PDF
Tue, August 18

Optimal Regret for Policy Optimization in Average Reward MDPs Without Mixing

William Powell, Jeongyeol Kwon, Qiaomin Xie, and Hanbaek Lyu

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #7 · 3 PM – 6 PM
PDF
Tue, August 18

When Can Pure Exploitation Succeed in Linear RL? Decoys and Self-Identifiability for Greedy LSVI

Manoj Saravanan and Rohit Kumar Salla

  • Track 1 · Theory of RL
  • Room B-2305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #8 · 3 PM – 6 PM
PDF
Tue, August 18

On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents

Oliver Mortensen and M. Sadegh Talebi

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #17 · 3 PM – 6 PM
PDF
Tue, August 18

Conformal Preemption of Failures in Sequential Decision-Making Agents

Garrett Ethan Katz, Adebayo Braimah, Qinru Qiu, and Simon Khan

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #18 · 3 PM – 6 PM
PDF
Tue, August 18

Distributionally Robust Self Paced Curriculum Reinforcement Learning

Anirudh Satheesh, Keenan Powell, and Vaneet Aggarwal

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #19 · 3 PM – 6 PM
PDF
Tue, August 18

Adaptive Critic Shaping for Reinforcement Learning with Temporal Logic Constraint

Duo XU

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #20 · 3 PM – 6 PM
PDF
Tue, August 18

Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics

Bernd Frauenknecht, Lukas Kesper, Daniel Mayfrank, Henrik Hose, and Sebastian Trimpe

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #21 · 3 PM – 6 PM
PDF
Tue, August 18

An Unreasonably Simple Approach to Safe RL

Geraud Nangue Tasse, Mark Nemecek, Tamlin Love, Steven James, and Benjamin Rosman

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #22 · 3 PM – 6 PM
PDF
Tue, August 18

Skill-based Safe Reinforcement Learning with Risk Planning

Hanping Zhang and Yuhong Guo

  • Track 2 · Safe, robust, and risk-sensitive RL
  • Room B-0325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #23 · 3 PM – 6 PM
PDF
Tue, August 18

Yes, Q-learning Helps Offline In-Context RL

Denis Tarasov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin, Igor Kiselev, and Vladislav Kurenkov

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #32 · 3 PM – 6 PM
PDF
Tue, August 18

CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning

Marcel Hedman, Kale-ab Tessera, Juan Claude Formanek, Anya Sims, Riccardo Zamboni, Trevor McInroe, John Torr, and Elliot Fosong

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #33 · 3 PM – 6 PM
PDF
Tue, August 18

Fully Offline Reinforcement Learning

Mattie Fellows, Clarisse Wibault, Uljad Berdica, Johannes Forkel, Michael A Osborne, and Jakob Nicolaus Foerster

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #34 · 3 PM – 6 PM
Tue, August 18
Journal-to-Conference

V-OCBF: Learning Safety Filters from Offline Data via Value-Guided Offline Control Barrier Functions

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #35 · 3 PM – 6 PM
PDF
Tue, August 18

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

Mumuksh Tayal, Manan Tayal, and Ravi Prakash

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #36 · 3 PM – 6 PM
PDF
Tue, August 18

Conservative Value Priors: A Bayesian Path to Offline Reinforcement Learning

Filippo Valdettaro, Yingzhen Li, and Aldo A. Faisal

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #37 · 3 PM – 6 PM
PDF
Tue, August 18

Offline RL with Hierarchical Action Chunking

Ahad Jawaid

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #38 · 3 PM – 6 PM
Tue, August 18
Journal-to-Conference

{MOORL}: A Framework for Integrating Offline-Online Reinforcement Learning

  • Track 3 · Offline RL
  • Room B-2325
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #39 · 3 PM – 6 PM
PDF
Tue, August 18

Confidence Intervals for the Interquartile Mean

Alexandra Burushkina and Philip S. Thomas

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 1 · 10:20 AM – 11:10 AM
  • Poster #48 · 3 PM – 6 PM
PDF
Tue, August 18

Synthetic Monitoring Environments for Reinforcement Learning

Leonard S. Pleiss, Carolin Schmidt, and Maximilian Schiffer

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 2 · 10:20 AM – 11:10 AM
  • Poster #49 · 3 PM – 6 PM
PDF
Tue, August 18

Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning

Oleg Shchendrigin, Egor Cherepanov, Alexey Kovalev, and Aleksandr Panov

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 3 · 10:20 AM – 11:10 AM
  • Poster #50 · 3 PM – 6 PM
PDF
Tue, August 18

PGTG: Procedurally Generated Grid-Based Traffic Gym

Joshua Meyer, Felix Maurice Kuntz, Verena Wolf, Jörg Hoffmann, and Timo P. Gros

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 4 · 10:20 AM – 11:10 AM
  • Poster #51 · 3 PM – 6 PM
PDF
Tue, August 18

Ludax: A GPU-Accelerated Description Language for Board Games

Graham Todd, Alexander George Padula, Dennis J. N. J. Soemers, Sam Earle, and Julian Togelius

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 5 · 10:20 AM – 11:10 AM
  • Poster #52 · 3 PM – 6 PM
PDF
Tue, August 18

Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning

Naveen Mysore

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 6 · 10:20 AM – 11:10 AM
  • Poster #53 · 3 PM – 6 PM
PDF
Tue, August 18

NutriRL: A Benchmark for Nutritional Regulation under Delayed State Transitions

Aniket Khan, Charitha Palika, and V.Srinivasa Chakravarthy

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 7 · 10:20 AM – 11:10 AM
  • Poster #54 · 3 PM – 6 PM
PDF
Tue, August 18

Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots

Khurram Javed, Joseph Varughese Modayil, Gloria Kennickell, Richard S Sutton, and John Carmack

  • Track 4 · Evaluation, benchmarks, and environments
  • Room B-0305
  • Presentation Talk 8 · 10:20 AM – 11:10 AM
  • Poster #55 · 3 PM – 6 PM
PDF
Tue, August 18

DART: Dual Adaptive Residual Tracking for Low-Bias Advantage Estimation and Credit Assignment in AI Agents

Shahrad Mohammadzadeh, Amir-massoud Farahmand, Reihaneh Rabbany, and Doina Precup

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #9 · 3 PM – 6 PM
PDF
Tue, August 18

FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies

Chenxiao Gao, Edward Chen, Tianyi Chen, and Bo Dai

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #10 · 3 PM – 6 PM
PDF
Tue, August 18

A Simple Baseline for Learning Approximate State Abstractions in Factored State Spaces

Anshuman Senapati and Josiah P. Hanna

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #11 · 3 PM – 6 PM
PDF
Tue, August 18

Endpoint Replay: Compressing the Recency Buffer in Deep Reinforcement Learning

Parham Mohammad Panahi, Armin Ashrafi, Haoyu Du, Andrew Patterson, Martha White, and Adam White

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #12 · 3 PM – 6 PM
PDF
Tue, August 18

Improving Reward-Based Hindsight Credit Assignment

Aditya A. Ramesh, Jiamin He, Jürgen Schmidhuber, and Martha White

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #13 · 3 PM – 6 PM
PDF
Tue, August 18

Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching

Andrea Fraschini, Davide Tenedini, Riccardo Zamboni, Mirco Mutti, and Marcello Restelli

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #14 · 3 PM – 6 PM
PDF
Tue, August 18

Cohering Reinforcement Learning

Anna Harutyunyan, Will Dabney, and Doina Precup

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #15 · 3 PM – 6 PM
Tue, August 18
Journal-to-Conference

A Survey of State Representation Learning for Deep Reinforcement Learning

  • Track 1 · Understanding deep RL
  • Room B-2305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #16 · 3 PM – 6 PM
PDF
Tue, August 18

Temporally Extended Mixture-of-Experts Models

Zeyu Shen and Peter Henderson

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #24 · 3 PM – 6 PM
PDF
Tue, August 18

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, and Roberto Martín-Martín

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #25 · 3 PM – 6 PM
PDF
Tue, August 18

A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation

Xiaocan Li, Shiliang Wu, and Zheng Shen

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #26 · 3 PM – 6 PM
PDF
Tue, August 18

Scalable Causal Imitation Learning

Eylam Tagor, Mingxuan Li, and Elias Bareinboim

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #27 · 3 PM – 6 PM
PDF
Tue, August 18

Supervised Reward Inference

Will Schwarzer, Jordan Jack Schneider, Philip S. Thomas, and Scott Niekum

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #28 · 3 PM – 6 PM
PDF
Tue, August 18

Minimal Ingredients for Reward Assignment from Expert Demonstrations

Zixuan Dong, Yumi Omori, and Keith W. Ross

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #29 · 3 PM – 6 PM
PDF
Tue, August 18

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

Ziyi Liu and Grace Zhang

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #30 · 3 PM – 6 PM
PDF
Tue, August 18

Q-Based Variational Inverse Reinforcement Learning

Ondrej Bajgar, Peter Tisnikar, Konstantinos Gatsis, Alessandro Abate, and Michael A Osborne

  • Track 2 · RL fine-tuning of LLMs/VLMs/VLAs + Imitation learning
  • Room B-0325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #31 · 3 PM – 6 PM
PDF
Tue, August 18

Extending Differential Temporal Difference Methods for Episodic Problems

Kris De Asis, Mohamed Elsayed, and Jiamin He

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #40 · 3 PM – 6 PM
PDF
Tue, August 18

Revisiting Adam for Streaming Reinforcement Learning

Florin Gogianu, Luțu Adrian-Cătălin, and Razvan Pascanu

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #41 · 3 PM – 6 PM
PDF
Tue, August 18

Forager: a lightweight testbed for continual learning with partial observability in RL

Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, and Adam White

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #42 · 3 PM – 6 PM
PDF
Tue, August 18

Dense and Diverse Goal Coverage in Multi Goal Reinforcement Learning

Sagalpreet Singh, Rishi Saket, and Aravindan Raghuveer

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #43 · 3 PM – 6 PM
PDF
Tue, August 18

Maximum-Entropy Exploration with Future State-Action Visitation Measures

Adrien Bolland, Gaspard Lambrechts, and Damien Ernst

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #44 · 3 PM – 6 PM
PDF
Tue, August 18

Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

Max Weltevrede, Caroline Horsch, Matthijs T. J. Spaan, and Wendelin Boehmer

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #45 · 3 PM – 6 PM
PDF
Tue, August 18

Weight a moment: risk-aware exploration with Bayes

Karim Zaghw, Peter Dayan, and Georgy Antonov

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #46 · 3 PM – 6 PM
PDF
Tue, August 18

A Value-Based Approach to Maximum Entropy Exploration

Jacob Adamczyk, Adam Kamoski, and Rahul V Kulkarni

  • Track 3 · Continual RL + Streaming RL + Exploration
  • Room B-2325
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #47 · 3 PM – 6 PM
PDF
Tue, August 18

An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning

James Rudd-Jones, Maria Perez-Ortiz, and Mirco Musolesi

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 1 · 11:40 AM – 12:30 PM
  • Poster #56 · 3 PM – 6 PM
PDF
Tue, August 18

ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning

Anurag Akula, Satheesh K Perepu, Abhishek Sarkar, and Kaushik Dey

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 2 · 11:40 AM – 12:30 PM
  • Poster #57 · 3 PM – 6 PM
PDF
Tue, August 18

A Causality-Inspired Spatial-Temporal Return Decomposition Approach for Multi-Agent Reinforcement Learning

Yudi Zhang, Yali Du, Biwei Huang, Mykola Pechenizkiy, and Meng Fang

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 3 · 11:40 AM – 12:30 PM
  • Poster #58 · 3 PM – 6 PM
PDF
Tue, August 18

SCoUT: Scalable Communication via Utility-Guided Temporal Grouping in Multi-Agent Reinforcement Learning

Manav Vora, Gokul Puthumanaillam, Hiroyasu Tsukamoto, and Melkior Ornik

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 4 · 11:40 AM – 12:30 PM
  • Poster #59 · 3 PM – 6 PM
PDF
Tue, August 18

Decentralized Asymmetric DQN: Decentralization without Factorization in Multi-Agent Reinforcement Learning

Rupali Bhati, Anurag Kadkol, Andrea Baisero, and Christopher Amato

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 5 · 11:40 AM – 12:30 PM
  • Poster #60 · 3 PM – 6 PM
PDF
Tue, August 18

Fixing Incomplete Value Function Decomposition for Multi-Agent Reinforcement Learning

Andrea Baisero, Rupali Bhati, Shuo Liu, Aathira Sunil Pillai, and Christopher Amato

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 6 · 11:40 AM – 12:30 PM
  • Poster #61 · 3 PM – 6 PM
PDF
Tue, August 18

Learning Communication Skills in Multi-task Multi-agent Deep Reinforcement Learning

Changxi Zhu, Mehdi Dastani, and Shihan Wang

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 7 · 11:40 AM – 12:30 PM
  • Poster #62 · 3 PM – 6 PM
PDF
Tue, August 18

ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning

Daiki E. Matsunaga, Junho Na, Tri Wahyu Guntara, Scott Sanner, Pascal Poupart, Jongmin Lee, and Kee-Eung Kim

  • Track 4 · Multi-agent RL
  • Room B-0305
  • Presentation Talk 8 · 11:40 AM – 12:30 PM
  • Poster #63 · 3 PM – 6 PM
Company logo