Onderzoek Unconfirmed US

Veilige reacties zijn belangrijk: Output-bewuste veiligheidsmaatregelen verminderen overmatige weigering in MLLM's

Gepubliceerd 14 July 2026

AI-samenvatting, gecontroleerd door de redactie.

Bestaande veiligheidsmechanismen voor multimodale grote taalmodellen (MLLM's) kampen met een fundamentele afweging tussen veiligheid en bruikbaarheid. Input-gebaseerde veiligheidsmaatregelen kunnen leiden tot overmatige weigering van onschuldige vragen. Dit onderzoek stelt dat de oorzaak van deze overmatige weigering ligt in het input-georiënteerde paradigma, waarbij veiligheidsbeslissingen worden genomen zonder rekening te houden met de mogelijkheid van het model om veilige reacties te genereren. De auteurs stellen een verschuiving voor naar output-bewuste veiligheidsmaatregelen, die voorspellen of de gegenereerde output onveilig zal zijn, en zo de bruikbaarheid van het model behouden. Experimenten tonen aan dat deze nieuwe aanpak de veiligheidsprestaties van bestaande methoden evenaart, terwijl de overmatige weigering aanzienlijk wordt verminderd.

Betrouwbaarheid
70
Relevantie
80
Impact
75
Urgentie
60

Oorspronkelijke bronnen (1)

Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.

  • Primaire bron Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs
    arXiv - cs.LG (Machine Learning) · 14-07-2026 · ResearchPublication
    Lees origineel