Onderzoek Unconfirmed

Format Sensitivity Index: Robuustheid van Token-Controlled Prompt Wrappers in LLM Benchmarking

Gepubliceerd 14 July 2026

AI-samenvatting, gecontroleerd door de redactie.

In dit onderzoek wordt de impact van verschillende prompt wrappers op de prestaties van modellen bestudeerd. De auteurs introduceren twee nieuwe metrics: de Format Sensitivity Index (FSI) en de Parseability Sensitivity Index (PSI). Deze metrics meten de variabiliteit in nauwkeurigheid en parseerbaarheid van antwoorden bij gebruik van verschillende wrappers. Uit analyses van 140.000 generaties blijkt dat de FSI aanzienlijk varieert tussen modellen en dat deze variatie grotendeels te wijten is aan nalevingsfouten. De studie pleit voor een zorgvuldige rapportage van nauwkeurigheid, rekening houdend met wrapper-variabiliteit en compliance, en biedt praktische aanbevelingen voor benchmarking en gestructureerde output.

Betrouwbaarheid
70
Relevantie
80
Impact
75
Urgentie
50

Oorspronkelijke bronnen (1)

Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.

  • Primaire bron Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
    arXiv - cs.AI (testbron) · 14-07-2026 · ResearchPublication
    Lees origineel