SPARK: Gevoeligheidsgestuurde Profilering en Sturing van Latente Redeneringsstaten in Grote Taalmodellen
Gepubliceerd 14 July 2026
In dit onderzoek wordt SPARK geïntroduceerd, een methode die verborgen-staatrespons gebruikt om te diagnosticeren of een groot taalmodel effectief een redeneringsstaat binnengaat. De auteurs benadrukken dat bestaande evaluatiemethoden meestal op outputniveau werken en niet in staat zijn om de interne redeneringsprocessen van modellen adequaat te analyseren. SPARK maakt gebruik van lengte-gecontroleerde gevoeligheid om de effecten van invoerlengte te scheiden van de actieve redeneringscapaciteit. De resultaten tonen aan dat deze methode de nauwkeurigheid van Qwen3-modellen verbetert, wat suggereert dat gevoeligheid kan dienen als een diagnostisch signaal voor redeneringsfouten en als een praktische gids voor gerichte interventies tijdens het testen.
Oorspronkelijke bronnen (1)
Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.
-
Primaire bron SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language ModelsLees origineelarXiv - cs.AI (testbron) · 14-07-2026 · ResearchPublication