Zum Hauptinhalt springen

Entwicklung und Bewertung eines auf künstlicher Intelligenz basierenden Tools zur Bewertung des Läsionsschweregrads in klinischen Bildern der generalisierten pustulösen Psoriasis

· 7 Minuten Lesezeit
JID Innovations
JID Innovations
Peer-reviewed open access journal of the Society for Investigative Dermatology
Boehringer Ingelheim
Boehringer Ingelheim
Pharmaceutical company

Diese in JID Innovations veröffentlichte, von Fachkollegen begutachtete Studie stellt das automatische Generalized Pustular Psoriasis Physician Global Assessment (AGPPGA) vor, ein KI-gestütztes Tool, das Pustulation, Erythem und Schuppung anhand klinischer Bilder der generalisierten pustulösen Psoriasis (GPP) bewertet, einer seltenen und potenziell lebensbedrohlichen Erkrankung, deren Schweregrad sich nur schwer einheitlich beurteilen lässt.

Sabater A, Medela A, Hernández Montilla I, Aguilar Robles SA, Mac Carthy T, Mollet Sanchez J, Baniandrés O, Izu-Belloso R, Mataix Díaz J, Rueda JM, Sanz-Motilva V, Chowdhry GSS, Semeco J, Martorell A. Development and assessment of an artificial intelligence–based tool for scoring lesion severity in generalized pustular psoriasis clinical images. JID Innovations. 2026;6:100521. https://doi.org/10.1016/j.xjidi.2026.100521

Zusammenfassung​

  • Studientyp: Entwicklung und retrospektive Validierung eines KI-basierten Tools zur Schweregradbewertung
  • Fachzeitschrift: JID Innovations (2026)
  • DOI: https://doi.org/10.1016/j.xjidi.2026.100521
  • Datensätze: 2 Datensätze mit GPP-Bildern, V1 (332 Bilder) und V2 (4296 Bilder von 46 Patienten), mit unterschiedlichen Geschlechtern, Altersgruppen und Hauttönen
  • Referenzstandard: Konsens von 2 Gremien europäisch zertifizierter Dermatologen mit Expertise in Psoriasis und GPP (3 Annotatoren für V1 und 4 für V2)
  • Ziel: Die 3 visuellen Zeichen des GPPGA (Pusteln, Erythem und Schuppung) automatisch bewerten und die Übereinstimmung des Tools mit dem Expertenkonsens mit der der Dermatologen selbst vergleichen

Hintergrund und Begründung​

Die generalisierte pustulöse Psoriasis ist eine seltene, chronische, systemische Entzündungserkrankung mit unvorhersehbarem und heterogenem klinischem Verlauf, die durch Pusteln, Erytheme und Krankheitsschübe gekennzeichnet ist. Eine genaue Beurteilung des Schweregrads hilft Ärzten, Therapieziele festzulegen und das Ansprechen auf die Behandlung zu bewerten.

Das GPPGA stuft Pusteln, Erythem und Schuppung auf einer 5-Punkte-Skala ein (0 = erscheinungsfrei, 1 = nahezu erscheinungsfrei, 2 = leicht, 3 = mittelschwer und 4 = schwer), und der Gesamtwert ist der Mittelwert der 3 Komponenten. Wie andere Bewertungssysteme ist es durch die Subjektivität der manuellen Beurteilung und den Zeitaufwand eingeschränkt, und diese Schwierigkeiten sind für nicht dermatologisch tätige Ärzte noch größer. AGPPGA wurde im Sinne der erweiterten Intelligenz (Augmented Intelligence) entwickelt: nicht um das klinische Urteil zu ersetzen, sondern um eine objektive und reproduzierbare Grundlage zu schaffen, die die Sicherheit und Einheitlichkeit der Ärzte stärkt, die diese seltene Erkrankung behandeln.

Studiendesign​

AGPPGA ist ein auf Deep Learning basierendes Computer-Vision-Modell, das einen Bildencoder (CAFormer-S), einen Multitask-Block mit Mixture of Experts und 3 aufgabenspezifische Köpfe kombiniert, einen für jedes visuelle Zeichen des GPPGA. Dieses Design bewertet alle 3 Zeichen anhand eines einzigen Bildes und vermeidet den Leistungsverlust, der entstehen kann, wenn sich Aufgaben gegenseitig stören.

Das Modell wurde mit 4-facher Kreuzvalidierung auf 2 Datensätzen trainiert und evaluiert:

  • V1: 332 auf die Läsion zentrierte Bilder, davon 101 aus der klinischen Studie EFFISAYIL 1 und die übrigen aus öffentlichen dermatologischen Atlanten, überwiegend mit hellen Hauttönen
  • V2: 4296 hochauflösende Bilder großer Körperareale von 46 Patienten aus der klinischen Studie EFFISAYIL 2, überwiegend mit mittleren bis dunklen Hauttönen und mit strikter Aufteilung auf Patientenebene

Ein dritter Datensatz mit 50 Bildern gesunder Haut oder unspezifischer Läsionen wurde hinzugefügt, um den erscheinungsfreien Ausgangswert (GPPGA = 0) zu verankern. Die Leistung wurde mit Genauigkeit, quadratisch gewichtetem Cohens Kappa und dem mittleren absoluten Fehler (MAE) des finalen GPPGA-Werts gemessen.

Abbildung 5: Saliency Maps, berechnet auf Bildern der Datensätze V1 und V2

Raster aus sechs klinischen Bildern generalisierter pustulöser Psoriasis, jeweils gefolgt von drei Heatmaps, die die Bildbereiche zeigen, auf die sich das Modell bei der Bewertung von Pustulation, Erythem und Schuppung stützt

Jede Zeile zeigt ein klinisches Originalbild, gefolgt von den Saliency Maps für Pustulation, Erythem und Schuppung, mit dem von AGPPGA bewerteten Schweregrad. Das Modell konzentriert sich durchgehend auf die GPP-Läsionen und ihre Ränder statt auf den Hintergrund oder andere kontextuelle Artefakte: Es berücksichtigt beispielsweise hellere Pixel zur Bewertung der Schuppung und den Übergang zwischen gesunder und erythematöser Haut zur Bewertung des Erythems.

Ergebnisse​

Übereinstimmung mit dem Expertenkonsens​

Tabelle 1: Leistung von AGPPGA und der annotierenden Dermatologen im Vergleich zum Expertenkonsens

DatensatzBewerterGenauigkeitCohens KappaGPPGA-MAE
V1AGPPGA0.62 ± 0.040.74 ± 0.040.30 ± 0.01
V1Dermatologen0.70 ± 0.010.79 ± 0.020.32 ± 0.02
V2AGPPGA0.64 ± 0.020.82 ± 0.020.31 ± 0.01
V2Dermatologen0.65 ± 0.020.80 ± 0.020.33 ± 0.02

Aggregierte Ergebnisse über die 3 visuellen Zeichen des GPPGA, angegeben als Mittelwert ± SD über die 4 Kreuzvalidierungs-Folds. Bei Genauigkeit und Cohens Kappa ist ein höherer Wert besser, beim MAE des finalen GPPGA-Werts ein niedrigerer. AGPPGA erreicht in beiden Datensätzen einen niedrigeren GPPGA-MAE als die Dermatologen und im stärker standardisierten Datensatz V2 ein höheres Cohens Kappa.

Tabelle 2: Cohens Kappa je visuellem Zeichen des GPPGA

DatensatzBewerterPustelnErythemSchuppung
V1AGPPGA0.760.750.72
V1Dermatologen0.780.800.79
V2AGPPGA0.710.860.88
V2Dermatologen0.680.860.86

Mittleres quadratisch gewichtetes Cohens Kappa über die 4 Kreuzvalidierungs-Folds. Im Datensatz V2 erreicht oder übertrifft AGPPGA die Dermatologen bei jedem visuellen Zeichen, mit signifikanten Verbesserungen bei Pustulation und Schuppung.

Statistisch war AGPPGA im heterogeneren Datensatz V1 nicht vom aggregierten Expertengremium zu unterscheiden und im stärker standardisierten Datensatz V2 signifikant besser, sowohl bei den aggregierten visuellen Zeichen als auch beim finalen GPPGA-Wert. Die große Mehrheit der Fehlklassifikationen betraf benachbarte Schweregradkategorien, sodass große, klinisch gefährliche Fehler, etwa die Einstufung eines schweren Falls als erscheinungsfrei, äußerst selten waren.

Leistung nach demografischen Merkmalen der Patienten​

Tabelle 3: Leistung im Datensatz V2, stratifiziert nach Geschlecht und Alter der Patienten

UntergruppePatientenProbenCohens Kappa AGPPGACohens Kappa DermatologenGPPGA-MAE AGPPGAGPPGA-MAE Dermatologen
Frauen327600.800.780.290.33
Männer143280.740.730.350.41
21 bis 34 Jahre113840.770.810.320.34
35 bis 49 Jahre225440.810.760.290.35
50 bis 66 Jahre131600.730.680.350.44

Werte für den ersten Kreuzvalidierungs-Fold. Die Leistung war zwischen Geschlechtern und Altersgruppen vergleichbar, und AGPPGA erreichte in jeder Untergruppe einen niedrigeren GPPGA-MAE als die Dermatologen.

Tabelle 4: Leistung in den Datensätzen V1 und V2, stratifiziert nach Fitzpatrick-Hauttyp

DatensatzFitzpatrick-HauttypCohens Kappa AGPPGACohens Kappa DermatologenGPPGA-MAE AGPPGAGPPGA-MAE Dermatologen
V1I-II0.740.780.300.31
V1III-IV0.780.820.350.35
V1V-VI--0.170.33
V2I-II0.680.740.310.34
V2III-IV0.770.760.300.35
V2V-VI0.810.770.320.37

Werte für den ersten Kreuzvalidierungs-Fold. Cohens Kappa kann nicht berechnet werden, wenn alle Proben zu einer einzigen Kategorie gehören, wie in der kleinen Untergruppe V-VI von V1. AGPPGA erzielte in beiden Datensätzen über alle Hauttypen hinweg einen niedrigeren oder gleichen GPPGA-MAE wie die Dermatologen.

Schlussfolgerungen​

AGPPGA erreichte eine substanzielle Übereinstimmung mit erfahrenen Dermatologen (Cohens Kappa von 0.74 oder höher) und eine präzise Berechnung des GPPGA-Werts (MAE von 0.31 oder niedriger) über alle visuellen Zeichen und eine große Vielfalt an Geschlechtern, Altersgruppen und Hauttönen hinweg. Seine Leistung war im Datensatz V1 statistisch nicht vom Expertengremium zu unterscheiden und im stärker standardisierten Datensatz V2 statistisch überlegen.

Das Tool ist für die Schweregradbewertung von GPP-Läsionen bestimmt, nicht für deren Diagnose, und seine Leistung hängt von der Qualität der Bilder ab: gute Beleuchtung, keine Bewegungsunschärfe und hochauflösende Bilder, die aus einem geeigneten Abstand aufgenommen wurden, damit auch kleine Pusteln sichtbar bleiben. Durch objektive und reproduzierbare Bewertungen kann AGPPGA Nicht-Fachärzte unterstützen, die Inter- und Intraobserver-Variabilität unter erfahrenen Dermatologen verringern und zur Standardisierung der Schweregradbewertung in der Forschung zu seltenen Erkrankungen und in multizentrischen klinischen Studien beitragen.

Das automatische GPPGA bietet eine reproduzierbare Methode, die der Subjektivität der manuellen Bewertung begegnen und die Standardisierung der Schweregradbewertung der GPP erleichtern kann.

—

Sabater A, Medela A, Hernández Montilla I, et al. Development and assessment of an artificial intelligence–based tool for scoring lesion severity in generalized pustular psoriasis clinical images. JID Innovations. 2026;6:100521. https://doi.org/10.1016/j.xjidi.2026.100521