Nonparametrische Bayesian Inverse Reinforcement Learning met Data-Parallel Gibbs Sampling
Gepubliceerd 14 July 2026
Dit onderzoek introduceert Nonparametric Bayesian Inverse Reinforcement Learning, dat het mogelijk maakt om beloningsfuncties te herstellen uit demonstraties van meerdere experts met verschillende voorkeuren. Traditionele methoden leiden tot een gemiddelde beloning die niet goed aansluit bij individuele experts. De studie maakt gebruik van een Dirichlet Process prior en een geavanceerde Gibbs sampler om beloningen en het aantal latent beloningstypen gezamenlijk te infereren. Resultaten tonen aan dat de methode effectief is in het identificeren van clusters in expertgedrag, met significante verbeteringen ten opzichte van bestaande methoden. De implementatie is geoptimaliseerd voor parallelle verwerking, wat de snelheid aanzienlijk verhoogt.
Oorspronkelijke bronnen (1)
Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.
-
Primaire bron Nonparametric Bayesian Inverse Reinforcement Learning with Data-Parallel Gibbs SamplingLees origineelarXiv - cs.LG (Machine Learning) · 14-07-2026 · ResearchPublication