Wanneer AI oude fouten herhaalt… onderzoek toont belangrijke beperking van AI

Er verschijnt steeds meer onderzoek naar hoe AI-modellen zoals ChatGPT omgaan met wetenschap. Een nieuw artikel in Learned Publishing van Thelwall en collega’s zoomt in op een specifieke vraag: herkent ChatGPT of een wetenschappelijk artikel intussen is ingetrokken?

Het antwoord blijkt ontnuchterend: in dit onderzoek werden 217 beruchte, ingetrokken of problematische artikelen aan ChatGPT 4o-mini voorgelegd (ik vond dit onderzoek via Retraction Watch). Geen enkele keer meldde het model dat er een intrekking of correctie speelde. Integendeel, vaak kreeg het onderzoek zelfs een hoog kwaliteitslabel — soms zelfs “world leading.” En toen de onderzoekers losse claims uit die ingetrokken studies aan ChatGPT voorlegden, antwoordde het model in twee derde van de gevallen dat die waar of grotendeels waar waren. Inclusief een claim die al meer dan tien jaar geleden aantoonbaar vals bleek.

Op het eerste gezicht lijkt dit een serieuze alarmbel. Maar er zijn een paar belangrijke kanttekeningen. Ten eerste gaat het om één specifieke versie van ChatGPT (4o-mini, zomer 2024), met een kennisstop in oktober 2023. Nieuwe(re) versies kunnen inmiddels beter omgaan met retraction notices of live webdata. Het is dus gevaarlijk om dit resultaat zonder meer te veralgemenen naar “ChatGPT” in het algemeen.

Daarnaast blijft de methodologische keuze interessant maar ook beperkend. De onderzoekers vroegen het model om abstracts te beoordelen op onderzoekskwaliteit, en niet om expliciet te checken of een artikel was ingetrokken. Mensen zouden zelf ook niet altijd meteen uit een abstract afleiden dat een artikel later is teruggetrokken. Toch blijft de kern staan: zelfs bij zeer bekende retractions, die breed in de media en op Wikipedia zijn besproken, kwam ChatGPT er niet mee.

Wat dit onderzoek vooral duidelijk maakt, is dat we AI-samenvattingen van literatuur niet blind mogen vertrouwen. Als een LLM zegt dat een artikel “hoogstaand” is, betekent dat niet dat de wetenschappelijke gemeenschap dat nog steeds zelf zo vindt. En nog een eigen bedenking:  probleem beperkt zich niet tot AI, ook wetenschappers van vlees en bloed citeren nog regelmatig ingetrokken studies, vaak zonder te beseffen dat die status veranderd is.

De boodschap is dus tweeledig. Enerzijds: grote taalmodellen zijn handig voor eerste verkenningen, maar niet voor de laatste check. Anderzijds: we moeten zelf als onderzoekers, docenten en studenten alerter zijn op de status van bronnen. Tools zoals Retraction Watch bestaan, maar worden in de praktijk nog te weinig geraadpleegd.

Het zou mooi zijn mocht AI ons daar net bij helpen — automatisch waarschuwen wanneer een artikel intussen is ingetrokken, of wanneer een claim in de gevarenhoek zit. Maar voorlopig zijn we er nog niet. Tot die tijd geldt een oude les opnieuw: vertrouwen is goed, controleren blijft beter.

Abstract van het onderzoek:

Large language models (LLMs) like ChatGPT seem to be increasingly used for information seeking and analysis, including to support academic literature reviews. To test whether the results might sometimes include retracted research, we identified 217 retracted or otherwise concerning academic studies with high altmetric scores and asked ChatGPT 4o-mini to evaluate their quality 30 times each. Surprisingly, none of its 6510 reports mentioned that the articles were retracted or had relevant errors, and it gave 190 relatively high scores (world leading, internationally excellent, or close). The 27 articles with the lowest scores were mostly accused of being weak, although the topic (but not the article) was described as controversial in five cases (e.g., about hydroxychloroquine for COVID-19). In a follow-up investigation, 61 claims were extracted from retracted articles from the set, and ChatGPT 4o-mini was asked 10 times whether each was true. It gave a definitive yes or a positive response two-thirds of the time, including for at least one statement that had been shown to be false over a decade ago. The results therefore emphasise, from an academic knowledge perspective, the importance of verifying information from LLMs when using them for information seeking or analysis.

Geef een reactie