Die Verfügbarkeit großer, öffentlicher Datensätze in Kombination mit der Leistungsfähigkeit von KI-Textgeneratoren hat in den letzten Jahren zu einem besorgniserregenden Trend in der Forschung geführt. Immer mehr wissenschaftliche Artikel werden mit geringem Aufwand produziert und erreichen dennoch den Weg in Fachzeitschriften. Besonders betroffen davon ist die Gesundheitsforschung, wie ein aktueller Bericht in der Fachzeitschrift „PLOS Biology“ zeigt.

Jeden 2. Sonntag

Ein FUNKE Liebe

Alle zwei Wochen sonntags: Antworten auf Beziehungsfragen – ehrlich, nah und alltagstauglich.

Mit meiner Anmeldung zum Newsletter stimme ich der Werbevereinbarung zu.

Den Ausgangspunkt der Recherchen bildete ein Verdacht von Matt Spick, Statistiker an der University of Surrey und Mitherausgeber bei „Scientific Reports“. Im vergangenen Jahr fiel ihm auf, dass ungewöhnlich viele Studien zur Begutachtung eingereicht wurden. Die Basis der Beiträge waren frei zugängliche National Health and Nutrition Examination Survey (NHANES), ein US-amerikanischer Datensatz mit Informationen zu Gesundheitszustand, Ernährung und Lebensstil von über 130.000 Menschen.

„Ich bekam so viele fast identische Artikel – einen pro Tag, manchmal sogar zwei“, sagt Spick gegenüber „Science“. Die Struktur war laut der Fachzeitschrift stets dieselbe: ein Gesundheitszustand, ein Umwelt- oder Lebensstilfaktor, eine demografische Gruppe – etwa „Vitamin D und Depression bei Männern über 65“.

Lesen Sie auch

Massenhafte Studien mit NHANES-Daten: Forscher warnen vor Qualitätsverlust

Tatsächlich identifizierten Spick und sein Team in ihrer Analyse 341 solcher NHANES-Studien zwischen 2014 und 2024, die in 147 Zeitschriften veröffentlicht wurden, darunter „Scientific Reports“ , „BMC Public Health“ und „BMJ Open“. Allein im Jahr 2024 wurden bis Oktober 190 dieser Arbeiten gezählt. Zum Vergleich: Zwischen 2014 und 2021 waren es im Schnitt nur vier pro Jahr. Spicks Team stellte zudem fest, dass viele der NHANES-Studien auffällig selektiv mit dem Datensatz umgehen – etwa nur bestimmte Altersgruppen oder Jahre analysieren –, ohne dies wissenschaftlich zu begründen. Ziel scheint es zu sein, durch bloßes Ausprobieren auf ein „signifikantes“ Ergebnis zu stoßen. Nur 13 von 28 untersuchten Studien zu Depressionen überstanden eine Korrektur auf Mehrfachvergleiche – ein alarmierender Befund.

Auch interessant

„Die Industrialisierung minderwertiger Forschung überschwemmt die Literatur mit nutzlosen Ergebnissen“, so Spick weiter. „Ehrlich gesagt hat mich das richtig geärgert.“ Der Schaden für die Glaubwürdigkeit der Forschung sei erheblich – gerade in Bereichen wie Medizin und Gesundheit, in denen politische Entscheidungen oder ärztliche Leitlinien auf wissenschaftlichen Studien basieren.

Ausmaß des Problems wird unterschätzt: Weitere Datensätze anfällig für Ausnutzung

Auch Metawissenschaftler Reese Richardson von der Northwestern University sieht laut „Science“ ein systemisches Problem: „Alle im Artikel genannten Verlage haben Gebühren, wahrscheinlich in der Größenordnung von 1000 Dollar pro Person, für die Veröffentlichung dieses Schrotts akzeptiert.“ Der Anreiz, möglichst viele Artikel zu publizieren – nicht unbedingt qualitativ hochwertige –, befeuere die Entwicklung zusätzlich. Richardson warnt gegenüber des Journals: „Das Problem wird sich nur noch verschärfen, wenn wir die Anreize für wissenschaftliche Veröffentlichungen nicht radikal umstrukturieren.“

Spick und sein Team vermuten, dass ihre Analyse das Ausmaß des Problems deutlich unterschätzt. Ihre Untersuchung konzentrierte sich ausschließlich auf NHANES-Studien, die einem bestimmten Muster folgten. Eine breiter angelegte Auswertung zeigte jedoch, dass die Zahl der Veröffentlichungen auf Basis dieses Datensatzes von 4.926 im Jahr 2023 auf 7.876 im Jahr 2024 gestiegen ist. Laut Spick sind vermutlich auch andere umfangreiche Gesundheitsdatensätze wie die Global Burden of Disease-Studie anfällig für eine ähnliche Art der Ausnutzung.