Onderzoek Unconfirmed

Who&When Pro: Kunnen LLM's echt falen toeschrijven aan AI-agenten?

Gepubliceerd 14 July 2026

AI-samenvatting, gecontroleerd door de redactie.

Automatische fouttoeschrijving maakt gebruik van LLM's om te identificeren waar en waarom agentische systemen falen. Naarmate agenten capabeler worden, worden hun fouten subtieler, waardoor automatische toeschrijving steeds belangrijker wordt. Dit onderzoek introduceert Who&When Pro, een grootschalige benchmark voor automatische fouttoeschrijving in agentische systemen. Er zijn 12.326 mislukte trajecten gecreëerd met gouden labels, verdeeld over 3 modaliteiten en 26 benchmarks. De studie onthult systematische patronen in hoe modellen fouten toeschrijven en biedt empirische richtlijnen voor toekomstige systemen voor automatische fouttoeschrijving.

Betrouwbaarheid
60
Relevantie
70
Impact
65
Urgentie
50

Oorspronkelijke bronnen (1)

Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.

  • Primaire bron Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?
    arXiv - cs.AI (testbron) · 14-07-2026 · ResearchPublication
    Lees origineel