Metadata-vrije meta-herwogen directe voorkeuroptimalisatie onder ruisachtige voorkeurlabels
Gepubliceerd 14 July 2026
Direct Preference Optimization (DPO) is een belangrijke methode voor het afstemmen van grote taalmodellen op menselijke voorkeuren, maar de effectiviteit ervan is sterk afhankelijk van de kwaliteit van voorkeurdata. Ruis in deze data kan de prestaties verzwakken. Dit onderzoek stelt een bilevel optimalisatieframework voor dat, onder bepaalde aannames, het DPO-optimum kan herstellen bij schone data. Daarnaast wordt een meta-kennisgestuurde methode gepresenteerd die meta-learning mogelijk maakt zonder metadata. Experimentele resultaten tonen aan dat de voorgestelde methode de trainingsprestaties verbetert in vergelijking met meerdere DPO-baselines bij verschillende ruisniveaus.
Oorspronkelijke bronnen (1)
Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.
-
Primaire bron Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference LabelsLees origineelarXiv - cs.LG (Machine Learning) · 14-07-2026 · ResearchPublication