Onderzoek Unconfirmed

Informatiezoekfouten van grote taalmodellen in klinisch redeneren

Gepubliceerd 14 July 2026

AI-samenvatting, gecontroleerd door de redactie.

Grote taalmodellen behalen hoge scores op medische kennisbeoordelingen, maar klinisch redeneren vereist actieve besluitvorming over wat te onderzoeken onder onzekerheid. Een evaluatiekader werd ontwikkeld in de hematologische oncologie, waarbij modellen proactief klinische gegevens moesten opvragen in drie opeenvolgende rondes voordat ze zich aan een diagnose en behandelplan konden committeren. Van de 32 geëvalueerde modellen behaalde het beste model slechts 68% nauwkeurigheid. Het gebruik van informatie, oftewel het percentage beschikbare gegevens dat daadwerkelijk werd opgevraagd, bleek de sterkste voorspeller van diagnostische nauwkeurigheid te zijn.

Betrouwbaarheid
70
Relevantie
80
Impact
75
Urgentie
60

Oorspronkelijke bronnen (1)

Deze pagina toont geen volledige brontekst - lees het origineel voor de volledige context.

  • Primaire bron Information-seeking failures of large language models in agentic clinical reasoning
    arXiv - cs.AI (testbron) · 14-07-2026 · ResearchPublication
    Lees origineel