Mensch-Maschine-Interaktion: Einfluss künstlicher Intelligenz auf das diagnostische Vertrauen von Endoskopikern bei der Beurteilung des Barrett-Ösophagus
Bibliographic record
Abstract
Einleitung: Die Interaktion zwischen Mensch und Maschine kann die Effektivität künstlicher Intelligenz (KI) erheblich beeinflussen. Studien deuten darauf hin, dass Endoskopiker mithilfe der KI zwar erhebliche Verbesserungen bei der Beurteilung des Barrett-Ösophagus (BÖ) zeigen, ihre Leistung jedoch nicht das Niveau der KI alleine erreicht. Ein kritischer Aspekt der Interaktion ist die Auswirkung der KI auf die diagnostische Sicherheit der Untersucher, welche indirekt mit dem Vertrauen und der Akzeptanz von KI in Verbindung gebracht werden kann. Abb. 1 Quelle: Eigene Darstellung, David Roser Abb. 2 Quelle: Eigene Darstellung, David Roser Ziele: Das Ziel der Studie war es, den Einfluss von KI auf die diagnostische Sicherheit (Konfidenzniveau) von Endoskopikern anhand von BÖ-Videos zu untersuchen und mögliche Korrelationen mit der Untersuchungsqualität zu erforschen. Methodik: 22 Endoskopiker aus zwölf Zentren mit unterschiedlicher Barrett-Erfahrung untersuchten 96 standardisierte Endoskopievideos. Die Untersucher wurden in Experten und Nicht-Experten eingeteilt und nach dem Zufallsprinzip für die Bewertung der Videos mit oder ohne KI eingeteilt. Die Teilnehmer wurden in zwei Gruppen aufgeteilt: Arm A bewertete zunächst Videos ohne KI und dann mit KI, während Arm B die umgekehrte Reihenfolge einhielt. Die Untersucher hatten die Aufgabe, BÖ-assoziierte Neoplasien zu erkennen und ihr Konfidenzniveau sowohl mit als auch ohne KI auf einer Skala von 0 bis 9 anzugeben. Abb. 3 Ergebnis: In Arm A erhöhte der Einsatz von KI das Konfidenzniveau bei beiden signifikant (p<0.001). Bemerkenswert ist, dass jedoch nur Nicht-Experten durch die KI eine signifikante Verbesserung der Sensitivität und Spezifität (p<0.001 bzw. p<0.05) erfuhren. Während Experten ohne KI im Vergleich zu Nicht-Experten mit KI ein höheres Konfidenzniveau aufwiesen, gab es keinen signifikanten Unterschied in der Genauigkeit. In Arm B zeigten beide Gruppen eine signifikante Abnahme des Konfidenzniveaus (p<0.001) bei gleichbleibender Genauigkeit. Darüber hinaus wurden in 9% der Entscheidungen trotz korrekter KI eine falsche Wahl getroffen. Schlussfolgerung: Der Einsatz künstlicher Intelligenz steigerte das Konfidenzniveau sowohl bei Experten als auch bei Nicht-Experten signifikant – ein Effekt, der im Studienmodell reversibel war. Darüber hinaus wiesen Experten mit oder ohne KI durchweg höhere Konfidenzniveaus auf als Nicht-Experten mit KI, trotz vergleichbarer Ergebnisse. Zudem konnte beobachtet werden, dass die Untersucher in 9% der Fälle die KI zuungunsten des Patienten ignorierten. präsentiert in der Sitzung: Barrett-Ösophagus: Diagnostik und Management Freitag, 04. Oktober 2024, 17:00 – 18:30, Saal Theodor Billroth Publication History Article published online: 26 September 2024 © 2024. Thieme. All rights reserved. Georg Thieme Verlag KG Rüdigerstraße 14, 70469 Stuttgart, Germany
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.006 | 0.044 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.001 | 0.001 |
| Science and technology studies | 0.001 | 0.002 |
| Scholarly communication | 0.004 | 0.002 |
| Open science | 0.001 | 0.003 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.006 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".