Die Meisten lernen die Herz-Lungen-Wiederbelebung an einer Puppe. Diese Puppe hat in den meisten Fällen eine flache Brust. Eine Studie aus dem Jahr 2024, die 20 weltweit verkaufte HLW-Trainingsmodelle untersuchte, ergab, dass drei Viertel als männlich beschrieben wurden oder kein Geschlecht angegeben war. Nur eines bot einen Brustaufsatz an. Das ist kein unwichtiges Detail über die Trainingsausrüstung. Es ist ein sichtbares Symptom eines viel tieferen strukturellen Problems, das nun droht, dauerhaft in die KI im Gesundheitswesen eincodiert zu werden.
Die Lücke, die vor dem Algorithmus beginnt
Die Folgen einer mangelnden Repräsentation im medizinischen Training sind messbar. Eine US-Studie mit 19.331 Herz-Kreislauf-Stillständen außerhalb von Krankenhäusern ergab, dass 39% der Frauen, die in der Öffentlichkeit zusammenbrachen, eine HLW durch Ersthelfer erhielten, verglichen mit 45% der Männer. Diese Lücke von sechs Prozentpunkten spiegelt teilweise möglicherweise eine Zögerlichkeit wider, die auf Unvertrautheit beruht: Personen, die an männlich geformten Puppen trainiert wurden, fühlen sich womöglich unsicherer dabei, eine HLW an einem weiblichen Körper durchzuführen. Das Timing ist enorm wichtig. Eine separate US-Studie ergab, dass Personen, die vier bis fünf Minuten nach einem beobachteten Herz-Kreislauf-Stillstand eine HLW durch Ersthelfer erhielten, eine um 27% geringere Wahrscheinlichkeit hatten, lebend aus dem Krankenhaus entlassen zu werden, als diejenigen, die sie innerhalb einer Minute erhielten. In England überlebten laut im Jahr 2024 veröffentlichten Zahlen weniger als einer von 12 Patienten, bei denen der Rettungsdienst eine Wiederbelebung versuchte, 30 Tage.
Das Puppenproblem lässt sich mit besserer Ausrüstung lösen. Das tieferliegende Problem ist, was passiert, wenn dieselbe historische Voreingenommenheit in die Daten gelangt, die KI-Systeme trainieren.
Wie voreingenommene Aufzeichnungen zu voreingenommenen Algorithmen werden
Die Gesundheits-KI lernt, indem sie Muster in Krankenakten findet. Das Problem ist, dass Krankenakten nicht nur Biologie widerspiegeln. Sie spiegeln klinische Entscheidungen wider, und diese Entscheidungen wurden historisch von Annahmen über das Geschlecht geprägt.
Eine experimentelle Studie mit Medizinstudenten und Assistenzärzten veranschaulicht den Mechanismus deutlich. Wenn Symptome einer koronaren Herzkrankheit zusammen mit psychischem Stress präsentiert wurden, erhielten Frauen weniger Diagnosen einer koronaren Herzkrankheit und weniger Überweisungen an die Kardiologie als Männer. Ihre Symptome wurden eher als psychogen interpretiert. Ein KI-System, das auf Aufzeichnungen trainiert ist, die von diesen Entscheidungen geprägt sind, würde nicht wissen, dass eine Voreingenommenheit vorliegt. Es würde einfach das Muster lernen und es reproduzieren.
Das ist kein hypothetisches Risiko. Berichte über KI in der Medizin haben darauf hingewiesen, dass unausgewogene Datensätze eine ungleichmäßige Leistung erbringen. Die Bewertung dieser Ungleichmäßigkeit ist selbst schwierig: Eine Überprüfung von 692 KI-gestützten Medizinprodukten, die von der US-amerikanischen Lebensmittel- und Arzneimittelbehörde zugelassen wurden, ergab im Jahr 2024, dass demografische Informationen und Details zu Leistungsstudien in öffentlichen Dokumenten oft fehlten.
Das Datenproblem sitzt tief. Weibliche Personen waren in der medizinischen Forschung jahrzehntelang durchgehend unterrepräsentiert. Nach der Contergan-Tragödie der späten 1950er und frühen 1960er Jahre empfahl die US-amerikanische Lebensmittel- und Arzneimittelbehörde 1977, Frauen, die schwanger werden konnten, von frühen Medikamentenstudien auszuschließen. Diese Richtlinie wurde erst 1993 rückgängig gemacht. Männliche Tiere wurden in der Laborforschung ebenfalls bevorzugt, und viele Studien versäumten es, das Geschlecht von Zellen zu melden, die in Experimenten verwendet wurden.
Die Auswirkungen auf die Behandlung sind dokumentiert. Frauen bauen das Schlafmittel Zolpidem langsamer ab als Männer, und 2013 empfahlen Regulierungsbehörden, die Startdosis für Frauen zu halbieren. Eine Analyse aus dem Jahr 2020 ergab, dass Frauen fast doppelt so oft wie Männer unerwünschte Arzneimittelwirkungen erlebten, wobei Unterschiede in der Art und Weise, wie Medikamente den Körper passieren, viele davon erklären.
Alte Annahmen, neue Technologie
Die Repräsentation in der medizinischen Forschung hat sich verbessert. Die Richtlinien für geschlechtergerechte Forschung aus dem Jahr 2016 ermutigen Forscher dazu, das Geschlecht zu berücksichtigen und zu berichten. Eine Überprüfung von 574 Arbeiten aus dem Jahr 2026 ergab, dass 61% beide Geschlechter umfassten. Dennoch analysierten nur 44% dieser Arbeiten die Ergebnisse nach Geschlecht. Einschluss ohne Analyse lässt die zugrundeliegende Wissenslücke intakt.
Die Unterscheidung zwischen biologischem und sozialem Geschlecht fügt eine weitere Ebene der Komplexität hinzu. Geschlechtsspezifische Biologie kann beeinflussen, wie Medikamente verstoffwechselt werden. Gesellschaftlich bedingte Erfahrungen können den Zugang zur Gesundheitsversorgung und die Interpretation von Symptomen beeinflussen. Viele Gesundheitsdatenbanken fassen beides in einer einzigen binären Kategorie zusammen, was einschränkt, was Forscher tatsächlich aus den Daten schlussfolgern können.
Die Präsentation von Symptomen veranschaulicht, warum Präzision wichtig ist. Eine Analyse von mehr als einer Million Menschen mit akuten Koronarsyndromen ergab, dass 74% der Frauen und 79% der Männer Brustschmerzen hatten, aber Frauen eine höhere Wahrscheinlichkeit hatten, zusätzliche Symptome wie Nacken oder Kieferschmerzen, Müdigkeit und Kurzatmigkeit zu melden. Eine australische Studie mit mehr als 202.000 Menschen, die mit einem Schlaganfall eingeliefert wurden, ergab, dass unter denjenigen unter 70 Jahren, die mit dem Krankenwagen eintrafen, Frauen von Rettungssanitätern seltener als Männer als Schlaganfallpatienten eingeschätzt und seltener nach dem präklinischen Schlaganfallprotokoll behandelt wurden.
Das ist es, was die meiste Berichterstattung über Gesundheits-KI übersieht: Das Problem ist nicht, dass KI-Systeme schlecht entworfen sind. Das Problem ist, dass sie auf Aufzeichnungen trainiert werden, die unter Bedingungen einer systematischen Unterrepräsentation erstellt wurden. Ein technisch einwandfreier Algorithmus, der auf historisch verzerrte Daten angewendet wird, wird historisch verzerrte Ergebnisse produzieren. Die Voreingenommenheit verschwindet nicht, nur weil die Technologie neu ist.
Eine Studie mit 6,9 Millionen Menschen in Dänemark ergab, dass Frauen bei den meisten untersuchten Erkrankungen bei ihrer ersten Krankenhausdiagnose älter waren. Dieses Muster könnte einen späteren Krankheitsbeginn, ein anderes gesundheitsbezogenes Verhalten oder eine langsamere Diagnose widerspiegeln. Das Entwirren dieser Ursachen erfordert ein sorgfältiges Forschungsdesign. KI-Systeme, die auf dem rohen Muster ohne diesen Kontext trainiert sind, können die Unterscheidung nicht treffen.
Kurz gesagt
Jahrzehntelang hat die medizinische Forschung den männlichen Körper als Standard behandelt und damit Datensätze hervorgebracht, von denen KI-Systeme jetzt lernen. Wenn diese Systeme Muster in Gesundheitsdaten identifizieren, lernen sie möglicherweise nicht nur etwas über Krankheiten, sondern auch darüber, wie Patienten in der Vergangenheit aufgrund ihres Geschlechts unterschiedlich behandelt wurden. Die Verbesserung der Repräsentation in der zukünftigen Forschung ist notwendig, aber nicht hinreichend. Die dringendere Aufgabe besteht darin zu verstehen, welche Muster in bestehenden Daten die Biologie und welche alte Annahmen widerspiegeln, bevor diese Annahmen in die Diagnose- und Behandlungswerkzeuge der nächsten Generation eingebettet werden.
Basierend auf Berichten von The Conversation AI.