Format Sensitivity Index: Robuustheid van Token-Controlled Prompt Wrappers in LLM Benchmarking
Gepubliceerd 14 July 2026
In dit onderzoek wordt de impact van verschillende prompt wrappers op de prestaties van modellen bestudeerd. De auteurs introduceren twee nieuwe metrics: de Format Sensitivity Index (FSI) en de Parseability Sensitivity Index (PSI). Deze metrics meten de variabiliteit in nauwkeurigheid en parseerbaarheid van antwoorden bij gebruik van verschillende wrappers. Uit analyses van 140.000 generaties blijkt dat de FSI aanzienlijk varieert tussen modellen en dat deze variatie grotendeels te wijten is aan nalevingsfouten. De studie pleit voor een zorgvuldige rapportage van nauwkeurigheid, rekening houdend met wrapper-variabiliteit en compliance, en biedt praktische aanbevelingen voor benchmarking en gestructureerde output.
Oorspronkelijke bronnen (1)
Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.
-
Primaire bron Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM BenchmarkingLees origineelarXiv - cs.AI (testbron) · 14-07-2026 · ResearchPublication