Desenvolvimento e avaliação de uma ferramenta baseada em inteligência artificial para pontuar a gravidade das lesões em imagens clínicas de psoríase pustulosa generalizada
Publicado na JID Innovations, este estudo revisado por pares apresenta o Generalized Pustular Psoriasis Physician Global Assessment automático (AGPPGA), uma ferramenta baseada em inteligência artificial que pontua a pustulação, o eritema e a descamação a partir de imagens clínicas de psoríase pustulosa generalizada (PPG), uma doença rara e potencialmente fatal cuja gravidade é difícil de avaliar de forma consistente.
Sabater A, Medela A, Hernández Montilla I, Aguilar Robles SA, Mac Carthy T, Mollet Sanchez J, Baniandrés O, Izu-Belloso R, Mataix Díaz J, Rueda JM, Sanz-Motilva V, Chowdhry GSS, Semeco J, Martorell A. Development and assessment of an artificial intelligence–based tool for scoring lesion severity in generalized pustular psoriasis clinical images. JID Innovations. 2026;6:100521. https://doi.org/10.1016/j.xjidi.2026.100521
Resumo
- Tipo de estudo: Desenvolvimento e validação retrospectiva de uma ferramenta de pontuação de gravidade baseada em IA
- Revista: JID Innovations (2026)
- DOI: https://doi.org/10.1016/j.xjidi.2026.100521
- Conjuntos de dados: 2 conjuntos de imagens de PPG, V1 (332 imagens) e V2 (4296 imagens de 46 pacientes), com diversidade de sexos, idades e tons de pele
- Padrão de referência: consenso de 2 painéis de dermatologistas com certificação europeia e experiência em psoríase e PPG (3 anotadores para V1 e 4 para V2)
- Objetivo: Avaliar automaticamente os 3 sinais visuais do GPPGA (pústulas, eritema e descamação) e comparar a concordância da ferramenta com o consenso de especialistas com a dos próprios dermatologistas
Contexto e justificativa
A psoríase pustulosa generalizada é uma doença inflamatória sistêmica, crônica e rara, com curso clínico imprevisível e heterogêneo, caracterizada por pústulas, eritema e períodos de crise. Uma avaliação precisa da gravidade da doença ajuda os médicos a definir os objetivos do tratamento e a avaliar a resposta terapêutica.
O GPPGA classifica as pústulas, o eritema e a descamação em uma escala de 5 pontos (0 = ausente, 1 = quase ausente, 2 = leve, 3 = moderado e 4 = grave), e a pontuação global é a média dos 3 componentes. Como outras escalas de pontuação, é limitado pela subjetividade da avaliação manual e pelo tempo necessário para preenchê-la, e essas dificuldades são maiores para médicos que não são dermatologistas. O AGPPGA foi projetado dentro do paradigma da inteligência aumentada: não para substituir o julgamento clínico, mas para oferecer uma referência objetiva e reprodutível que aumente a confiança e a consistência dos médicos que tratam essa doença rara.
Desenho do estudo
O AGPPGA é um modelo de visão computacional baseado em aprendizado profundo que combina um codificador de imagem (CAFormer-S), um bloco multitarefa de mistura de especialistas e 3 cabeças específicas, uma para cada sinal visual do GPPGA. Esse desenho avalia os 3 sinais a partir de uma única imagem e evita a perda de desempenho que pode ocorrer quando uma tarefa interfere em outra.
O modelo foi treinado e avaliado com validação cruzada de 4 partições em 2 conjuntos de dados:
- V1: 332 imagens centradas na lesão, 101 do ensaio clínico EFFISAYIL 1 e as demais de atlas dermatológicos públicos, com predomínio de tons de pele claros
- V2: 4296 imagens de alta resolução de grandes áreas do corpo de 46 pacientes do ensaio clínico EFFISAYIL 2, com predomínio de tons de pele médios a escuros e com partições estritas por paciente
Um terceiro conjunto de 50 imagens de pele saudável ou de lesões inespecíficas foi adicionado para ancorar a referência de ausência de doença (GPPGA = 0). O desempenho foi medido com a acurácia, o kappa de Cohen com ponderação quadrática e o erro absoluto médio (MAE) da pontuação final do GPPGA.
Figura 5: Mapas de saliência calculados sobre imagens dos conjuntos V1 e V2

Cada linha mostra uma imagem clínica original seguida dos mapas de saliência de pustulação, eritema e descamação, com o grau de gravidade avaliado pelo AGPPGA. O modelo se concentra de forma consistente nas lesões de PPG e em suas bordas, e não no fundo ou em outros artefatos do contexto: por exemplo, observa os pixels mais claros para avaliar a descamação e a transição entre pele saudável e pele eritematosa para avaliar o eritema.
Resultados
Concordância com o consenso de especialistas
Tabela 1: Desempenho do AGPPGA e dos dermatologistas anotadores em relação ao consenso de especialistas
| Conjunto | Avaliador | Acurácia | Kappa de Cohen | MAE do GPPGA |
|---|---|---|---|---|
| V1 | AGPPGA | 0.62 ± 0.04 | 0.74 ± 0.04 | 0.30 ± 0.01 |
| V1 | Dermatologistas | 0.70 ± 0.01 | 0.79 ± 0.02 | 0.32 ± 0.02 |
| V2 | AGPPGA | 0.64 ± 0.02 | 0.82 ± 0.02 | 0.31 ± 0.01 |
| V2 | Dermatologistas | 0.65 ± 0.02 | 0.80 ± 0.02 | 0.33 ± 0.02 |
Resultados agregados dos 3 sinais visuais do GPPGA, expressos como média ± DP das 4 partições de validação cruzada. Na acurácia e no kappa de Cohen, um valor mais alto é melhor; no MAE da pontuação final do GPPGA, um valor mais baixo é melhor. O AGPPGA obtém um MAE do GPPGA inferior ao dos dermatologistas nos dois conjuntos e um kappa de Cohen superior no conjunto V2, mais padronizado.
Tabela 2: Kappa de Cohen por sinal visual do GPPGA
| Conjunto | Avaliador | Pústulas | Eritema | Descamação |
|---|---|---|---|---|
| V1 | AGPPGA | 0.76 | 0.75 | 0.72 |
| V1 | Dermatologistas | 0.78 | 0.80 | 0.79 |
| V2 | AGPPGA | 0.71 | 0.86 | 0.88 |
| V2 | Dermatologistas | 0.68 | 0.86 | 0.86 |
Kappa de Cohen médio com ponderação quadrática nas 4 partições de validação cruzada. No conjunto V2, o AGPPGA iguala ou supera os dermatologistas em todos os sinais visuais, com melhorias significativas em pustulação e descamação.
Em termos de significância estatística, o AGPPGA foi estatisticamente indistinguível do painel de especialistas agregado no conjunto V1, mais heterogêneo, e estatisticamente superior no conjunto V2, mais padronizado, tanto nos sinais visuais agregados quanto na pontuação final do GPPGA. A grande maioria das classificações incorretas correspondeu a categorias de gravidade adjacentes, de modo que erros grandes e clinicamente perigosos, como classificar um caso grave como ausente, foram excepcionalmente raros.
Desempenho segundo as características demográficas dos pacientes
Tabela 3: Desempenho no conjunto V2 estratificado por sexo e idade do paciente
| Subgrupo | Pacientes | Amostras | Kappa de Cohen do AGPPGA | Kappa de Cohen dos dermatologistas | MAE do GPPGA do AGPPGA | MAE do GPPGA dos dermatologistas |
|---|---|---|---|---|---|---|
| Mulheres | 32 | 760 | 0.80 | 0.78 | 0.29 | 0.33 |
| Homens | 14 | 328 | 0.74 | 0.73 | 0.35 | 0.41 |
| De 21 a 34 anos | 11 | 384 | 0.77 | 0.81 | 0.32 | 0.34 |
| De 35 a 49 anos | 22 | 544 | 0.81 | 0.76 | 0.29 | 0.35 |
| De 50 a 66 anos | 13 | 160 | 0.73 | 0.68 | 0.35 | 0.44 |
Valores referentes à primeira partição de validação cruzada. O desempenho foi comparável entre sexos e faixas etárias, e o AGPPGA obteve um MAE do GPPGA inferior ao dos dermatologistas em todos os subgrupos.
Tabela 4: Desempenho nos conjuntos V1 e V2 estratificado por fototipo de Fitzpatrick
| Conjunto | Fototipo de Fitzpatrick | Kappa de Cohen do AGPPGA | Kappa de Cohen dos dermatologistas | MAE do GPPGA do AGPPGA | MAE do GPPGA dos dermatologistas |
|---|---|---|---|---|---|
| V1 | I-II | 0.74 | 0.78 | 0.30 | 0.31 |
| V1 | III-IV | 0.78 | 0.82 | 0.35 | 0.35 |
| V1 | V-VI | - | - | 0.17 | 0.33 |
| V2 | I-II | 0.68 | 0.74 | 0.31 | 0.34 |
| V2 | III-IV | 0.77 | 0.76 | 0.30 | 0.35 |
| V2 | V-VI | 0.81 | 0.77 | 0.32 | 0.37 |
Valores referentes à primeira partição de validação cruzada. O kappa de Cohen não pode ser calculado quando todas as amostras pertencem a uma única categoria, como no pequeno subgrupo V-VI de V1. O AGPPGA obteve um MAE do GPPGA inferior ou igual ao dos dermatologistas em todos os fototipos, nos dois conjuntos.
Conclusões
O AGPPGA alcançou uma concordância substancial com dermatologistas especialistas (kappa de Cohen de 0.74 ou superior) e um cálculo preciso da pontuação do GPPGA (MAE de 0.31 ou inferior) em todos os sinais visuais e em uma ampla diversidade de sexos, idades e tons de pele. Seu desempenho foi estatisticamente indistinguível do painel de especialistas no conjunto V1 e estatisticamente superior no conjunto V2, mais padronizado.
A ferramenta se destina a classificar a gravidade das lesões de PPG, não a diagnosticá-las, e seu desempenho depende da qualidade das imagens: boa iluminação, ausência de desfoque por movimento e imagens de alta resolução tiradas a uma distância adequada para que as pústulas pequenas continuem visíveis. Ao fornecer avaliações objetivas e reprodutíveis, o AGPPGA pode apoiar profissionais não especialistas, reduzir a variabilidade inter e intraobservador entre dermatologistas especialistas e ajudar a padronizar a pontuação da gravidade na pesquisa de doenças raras e em ensaios clínicos multicêntricos.
O GPPGA automático oferece um método reprodutível que pode enfrentar a subjetividade da avaliação manual e facilitar a padronização da avaliação da gravidade da PPG.
