Who&When Pro: Kunnen LLM's echt falen toeschrijven aan AI-agenten?
Gepubliceerd 14 July 2026
Automatische fouttoeschrijving maakt gebruik van LLM's om te identificeren waar en waarom agentische systemen falen. Naarmate agenten capabeler worden, worden hun fouten subtieler, waardoor automatische toeschrijving steeds belangrijker wordt. Dit onderzoek introduceert Who&When Pro, een grootschalige benchmark voor automatische fouttoeschrijving in agentische systemen. Er zijn 12.326 mislukte trajecten gecreëerd met gouden labels, verdeeld over 3 modaliteiten en 26 benchmarks. De studie onthult systematische patronen in hoe modellen fouten toeschrijven en biedt empirische richtlijnen voor toekomstige systemen voor automatische fouttoeschrijving.
Oorspronkelijke bronnen (1)
Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.
-
Primaire bron Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?Lees origineelarXiv - cs.AI (testbron) · 14-07-2026 · ResearchPublication