Développement et évaluation d'un outil fondé sur l'intelligence artificielle pour évaluer la sévérité des lésions sur des images cliniques de psoriasis pustuleux généralisé
Publiée dans JID Innovations, cette étude évaluée par les pairs présente le Generalized Pustular Psoriasis Physician Global Assessment automatique (AGPPGA), un outil fondé sur l'intelligence artificielle qui évalue la pustulation, l'érythème et la desquamation à partir d'images cliniques de psoriasis pustuleux généralisé (PPG), une maladie rare et potentiellement mortelle dont la sévérité est difficile à évaluer de manière homogène.
Sabater A, Medela A, Hernández Montilla I, Aguilar Robles SA, Mac Carthy T, Mollet Sanchez J, Baniandrés O, Izu-Belloso R, Mataix Díaz J, Rueda JM, Sanz-Motilva V, Chowdhry GSS, Semeco J, Martorell A. Development and assessment of an artificial intelligence–based tool for scoring lesion severity in generalized pustular psoriasis clinical images. JID Innovations. 2026;6:100521. https://doi.org/10.1016/j.xjidi.2026.100521
Résumé
- Type d'étude : Développement et validation rétrospective d'un outil d'évaluation de la sévérité fondé sur l'IA
- Revue : JID Innovations (2026)
- DOI : https://doi.org/10.1016/j.xjidi.2026.100521
- Jeux de données : 2 jeux d'images de PPG, V1 (332 images) et V2 (4296 images de 46 patients), avec une diversité de sexes, d'âges et de teintes de peau
- Référence : consensus de 2 panels de dermatologues certifiés en Europe, experts du psoriasis et du PPG (3 annotateurs pour V1 et 4 pour V2)
- Objectif : Évaluer automatiquement les 3 signes visuels du GPPGA (pustules, érythème et desquamation) et comparer la concordance de l'outil avec le consensus d'experts à celle des dermatologues eux-mêmes
Contexte et justification
Le psoriasis pustuleux généralisé est une maladie inflammatoire systémique, chronique et rare, à l'évolution clinique imprévisible et hétérogène, caractérisée par des pustules, un érythème et des poussées. Une évaluation précise de la sévérité de la maladie aide les médecins à définir les objectifs thérapeutiques et à évaluer la réponse au traitement.
Le GPPGA cote les pustules, l'érythème et la desquamation sur une échelle de 5 points (0 = absent, 1 = presque absent, 2 = léger, 3 = modéré et 4 = sévère), et le score global correspond à la moyenne des 3 composantes. Comme d'autres échelles, il est limité par la subjectivité de l'évaluation manuelle et par le temps nécessaire pour la réaliser, et ces difficultés sont plus marquées pour les médecins non dermatologues. AGPPGA a été conçu dans le paradigme de l'intelligence augmentée : non pas pour remplacer le jugement clinique, mais pour fournir une référence objective et reproductible qui renforce la confiance et l'homogénéité des cliniciens qui prennent en charge cette maladie rare.
Méthodologie
AGPPGA est un modèle de vision par ordinateur fondé sur l'apprentissage profond qui associe un encodeur d'images (CAFormer-S), un bloc multitâche de mélange d'experts et 3 têtes spécifiques, une pour chaque signe visuel du GPPGA. Cette architecture évalue les 3 signes à partir d'une seule image tout en évitant la perte de performance qui peut survenir lorsqu'une tâche interfère avec une autre.
Le modèle a été entraîné et évalué par validation croisée à 4 partitions sur 2 jeux de données :
- V1 : 332 images centrées sur la lésion, dont 101 issues de l'essai clinique EFFISAYIL 1 et les autres d'atlas dermatologiques publics, avec une majorité de peaux claires
- V2 : 4296 images haute résolution de grandes zones corporelles de 46 patients de l'essai clinique EFFISAYIL 2, avec une majorité de peaux moyennes à foncées et des partitions strictes au niveau du patient
Un troisième jeu de 50 images de peau saine ou de lésions non spécifiques a été ajouté pour ancrer la référence d'absence de maladie (GPPGA = 0). La performance a été mesurée par l'exactitude, le kappa de Cohen à pondération quadratique et l'erreur absolue moyenne (MAE) du score final du GPPGA.
Figure 5 : Cartes de saillance calculées sur des images des jeux V1 et V2

Chaque ligne présente une image clinique originale suivie des cartes de saillance de la pustulation, de l'érythème et de la desquamation, avec le grade de sévérité évalué par AGPPGA. Le modèle se concentre systématiquement sur les lésions de PPG et leurs bords plutôt que sur l'arrière-plan ou d'autres artefacts contextuels : il s'appuie par exemple sur les pixels les plus clairs pour évaluer la desquamation et sur la transition entre peau saine et peau érythémateuse pour évaluer l'érythème.
Résultats
Concordance avec le consensus d'experts
Tableau 1 : Performance d'AGPPGA et des dermatologues annotateurs par rapport au consensus d'experts
| Jeu de données | Évaluateur | Exactitude | Kappa de Cohen | MAE du GPPGA |
|---|---|---|---|---|
| V1 | AGPPGA | 0.62 ± 0.04 | 0.74 ± 0.04 | 0.30 ± 0.01 |
| V1 | Dermatologues | 0.70 ± 0.01 | 0.79 ± 0.02 | 0.32 ± 0.02 |
| V2 | AGPPGA | 0.64 ± 0.02 | 0.82 ± 0.02 | 0.31 ± 0.01 |
| V2 | Dermatologues | 0.65 ± 0.02 | 0.80 ± 0.02 | 0.33 ± 0.02 |
Résultats agrégés des 3 signes visuels du GPPGA, exprimés en moyenne ± ET sur les 4 partitions de validation croisée. Pour l'exactitude et le kappa de Cohen, une valeur plus élevée est meilleure ; pour la MAE du score final du GPPGA, une valeur plus faible est meilleure. AGPPGA obtient une MAE du GPPGA inférieure à celle des dermatologues dans les deux jeux et un kappa de Cohen supérieur dans le jeu V2, plus standardisé.
Tableau 2 : Kappa de Cohen par signe visuel du GPPGA
| Jeu de données | Évaluateur | Pustules | Érythème | Desquamation |
|---|---|---|---|---|
| V1 | AGPPGA | 0.76 | 0.75 | 0.72 |
| V1 | Dermatologues | 0.78 | 0.80 | 0.79 |
| V2 | AGPPGA | 0.71 | 0.86 | 0.88 |
| V2 | Dermatologues | 0.68 | 0.86 | 0.86 |
Kappa de Cohen moyen à pondération quadratique sur les 4 partitions de validation croisée. Dans le jeu V2, AGPPGA égale ou dépasse les dermatologues pour chaque signe visuel, avec des améliorations significatives pour la pustulation et la desquamation.
Sur le plan statistique, AGPPGA n'a pas pu être distingué du panel d'experts agrégé dans le jeu V1, plus hétérogène, et s'est montré significativement supérieur dans le jeu V2, plus standardisé, tant pour les signes visuels agrégés que pour le score final du GPPGA. La grande majorité des erreurs de classification concernaient des catégories de sévérité adjacentes : les erreurs importantes et cliniquement dangereuses, comme classer un cas sévère comme absent, ont été exceptionnellement rares.
Performance selon les caractéristiques démographiques des patients
Tableau 3 : Performance dans le jeu V2 stratifiée par sexe et âge des patients
| Sous-groupe | Patients | Échantillons | Kappa de Cohen d'AGPPGA | Kappa de Cohen des dermatologues | MAE du GPPGA d'AGPPGA | MAE du GPPGA des dermatologues |
|---|---|---|---|---|---|---|
| Femmes | 32 | 760 | 0.80 | 0.78 | 0.29 | 0.33 |
| Hommes | 14 | 328 | 0.74 | 0.73 | 0.35 | 0.41 |
| De 21 à 34 ans | 11 | 384 | 0.77 | 0.81 | 0.32 | 0.34 |
| De 35 à 49 ans | 22 | 544 | 0.81 | 0.76 | 0.29 | 0.35 |
| De 50 à 66 ans | 13 | 160 | 0.73 | 0.68 | 0.35 | 0.44 |
Valeurs rapportées pour la première partition de validation croisée. La performance était comparable entre les sexes et les tranches d'âge, et AGPPGA a obtenu une MAE du GPPGA inférieure à celle des dermatologues dans chaque sous-groupe.
Tableau 4 : Performance dans les jeux V1 et V2 stratifiée par phototype de Fitzpatrick
| Jeu de données | Phototype de Fitzpatrick | Kappa de Cohen d'AGPPGA | Kappa de Cohen des dermatologues | MAE du GPPGA d'AGPPGA | MAE du GPPGA des dermatologues |
|---|---|---|---|---|---|
| V1 | I-II | 0.74 | 0.78 | 0.30 | 0.31 |
| V1 | III-IV | 0.78 | 0.82 | 0.35 | 0.35 |
| V1 | V-VI | - | - | 0.17 | 0.33 |
| V2 | I-II | 0.68 | 0.74 | 0.31 | 0.34 |
| V2 | III-IV | 0.77 | 0.76 | 0.30 | 0.35 |
| V2 | V-VI | 0.81 | 0.77 | 0.32 | 0.37 |
Valeurs rapportées pour la première partition de validation croisée. Le kappa de Cohen ne peut pas être calculé lorsque tous les échantillons appartiennent à une seule catégorie, comme dans le petit sous-groupe V-VI de V1. AGPPGA a obtenu une MAE du GPPGA inférieure ou égale à celle des dermatologues pour tous les phototypes dans les deux jeux.
Conclusions
AGPPGA a atteint une concordance substantielle avec les dermatologues experts (kappa de Cohen de 0.74 ou plus) et un calcul précis du score GPPGA (MAE de 0.31 ou moins) pour l'ensemble des signes visuels et sur une grande diversité de sexes, d'âges et de teintes de peau. Sa performance n'a pas pu être distinguée de celle du panel d'experts dans le jeu V1 et s'est révélée statistiquement supérieure dans le jeu V2, plus standardisé.
L'outil est destiné à coter la sévérité des lésions de PPG, et non à les diagnostiquer, et sa performance dépend de la qualité des images : un bon éclairage, l'absence de flou de mouvement et des images haute résolution prises à une distance adaptée pour que les petites pustules restent visibles. En fournissant des évaluations objectives et reproductibles, AGPPGA peut aider les non-spécialistes, réduire la variabilité inter- et intra-observateur entre dermatologues experts et contribuer à standardiser l'évaluation de la sévérité dans la recherche sur les maladies rares et les essais cliniques multicentriques.
Le GPPGA automatique offre une méthode reproductible qui peut remédier à la subjectivité de l'évaluation manuelle et faciliter la standardisation de l'évaluation de la sévérité du PPG.
