PhenomicsJ的个人博客分享 http://blog.sciencenet.cn/u/PhenomicsJ

博文

Phenomics | 何仁亮/赵爽教授团队探索人工智能在瘢痕智能诊断与精准评分中的应用效果和案例

已有 366 次阅读 2026-8-11 18:55 |系统分类:论文交流

文章速递

    近日,《表型组学(英文)》(Phenomics)在线发表由南方医科大学皮肤病医院何仁亮教授联合中南大学湘雅学院赵爽教授团队完成的研究型文章“Deep learning models for automatic diagnosis and efficacy assessment of scars: A case study”。    该文章针对瘢痕疙瘩缺乏精准诊断和评估体系的问题,构建智能辅助诊断与自动化严重程度评分模型,实现瘢痕疙瘩的精准诊断,并基于温哥华瘢痕量表(Vancouver Scar Scale, VSS)对其进行快速、客观的严重程度量化评分,旨在验证人工智能瘢痕评估的精准性与客观性,为临床瘢痕精细化管理、个体化治疗方案的制定与动态监测提供新型技术支撑。

文末点击“阅读原文”可在线阅读文章。

扫描二维码 | 下载PDF原文

论文DOI链接:

https://doi.org/10.1007/s43657-025-00251-8

论文引用格式:

Li, Y., Zhang, L., Bu, W. et al.Deep Learning Models for Automatic Diagnosis and Efficacy Assessment of Scars: A Case Study. Phenomics(2026). https://doi.org/10.1007/s43657-025-00251-8

研究背景

    瘢痕是创伤后皮肤过度自我修复引发的常见皮肤病变,主要分为萎缩性瘢痕、增生性瘢痕、瘢痕疙瘩及瘢痕癌四类。其发病机制复杂,暂无统一、稳定的治疗方案,且复发率高,临床治疗难度极大。每年全球数百万患者因手术、外伤、烧伤形成瘢痕,不仅存在外观受损、红肿、痛痒等问题,特殊部位瘢痕还会限制躯体功能,给患者造成严重身心损害,同时也带来了沉重的医疗负担,仅美国每年瘢痕诊疗费用便超200亿美元。临床研究证实,结合瘢痕亚型与严重程度开展的个体化治疗、早期精准诊断及长期疗效评估,是优化瘢痕预后的核心关键。    目前瘢痕基础诊断难度较低,但精准分型与严重程度量化评估仍存在明显短板。临床极易混淆增生性瘢痕与瘢痕疙瘩,误诊率较高;同时主流评估工具均为各类人工量表,其中应用最广泛的温哥华瘢痕量表(VSS)高度依赖医师主观判断,存在主观性强、一致性差、操作繁琐耗时等问题,难以满足临床精准、高效的评估需求,且目前缺乏标准化、客观的瘢痕疗效监测手段。    人工智能已广泛应用于皮肤病智能诊断,依托深度学习、卷积神经网络等技术,可实现白癜风、银屑病等皮肤病的图像分级与量化评估,有效弥补了人工评估的主观性缺陷,为慢性皮肤病的客观监测和个体化治疗提供了技术支撑。但现阶段,人工智能应用于瘢痕自动诊断与严重程度评估的相关研究几乎处于空白状态。基于此,本研究创新性采用深度学习方法开展瘢痕亚型诊断与VSS智能评分,旨在验证人工智能瘢痕评估的精准性与客观性,为临床瘢痕精细化管理、个体化治疗方案的制定与动态监测提供新型技术支撑。图片

研究结果

一、研究方法与工作流程概述 

本研究所构建的智能模型在临床实际场景中的预期工作流程如图1所示,患者可以在首诊或线上就诊时提供皮损的临床照片,系统首先识别出该皮损是否为“瘢痕”,根据自动特征识别给出瘢痕亚型的分类诊断,并进一步依据VSS评分标准执行评分任务,给出该瘢痕严重程度的量化分数(范围从015)。

二、模型性能 

针对不同模型的瘢痕分类任务,本研究绘制了受试者工作特征(ROC)曲线与归一化混淆矩阵。所有模型在瘢痕分类任务中的平均曲线下面积(AUC)均高于 0.9100,平均精确率、平均召回率分别为 0.8631、0.8634。其中 Swin Transformer 模型综合性能最优,平均 AUC 达 0.9696,精确率 0.9027,召回率 0.8876(表1)。

1 每个网络的超参数设置

    针对临床最常见的增生性瘢痕与瘢痕疙瘩,Swin Transformer 模型的识别 AUC 分别为 0.930、0.974(图2a)。EfficientNet-B0 模型性能次之,平均 AUC 为 0.9518,精确率 0.8796,召回率 0.8827;其增生性瘢痕、瘢痕疙瘩识别 AUC 分别为 0.878、0.977(图2c)。本研究建议将该最优模型作为后续搭建瘢痕管理系统的技术基础。

2 不同模型在瘢痕亚型分类任务中的性能

三、病例分析

本研究追踪多组完整瘢痕诊疗病例,并将病例图像纳入数据集。图 3 展示最优模型 Swin Transformer 在不同随访周期给出的 VSS 评分结果。尽管人工智能打分存在小幅偏差,但整体变化趋势与评估结论均得到资深皮肤科医师认可。病例1(图 3a):患者胸部局部瘢痕疙瘩,AI 初始 VSS 评分为 8.6 分。随访 1 个月时,患者出现毛细血管扩张、色素沉着等治疗后常见不良反应,模型对应的色泽、血管分项评分同步升高,与临床皮损表现一致。随访 2 个月后不良反应缓解,色泽评分由 2.6 降至 2.4,改善趋势明显(图 3b)。随访 3 个月时,色泽、厚度、血管三项指标均显著好转(图3c),VSS 总分由 11.3 降至 9.0,充分证实 Swin Transformer 可智能、有效地评估瘢痕治疗效果。 

瘢痕严重程度评分模型在多组完整瘢痕诊疗病例中的应用效果

四、与皮肤科医师人工评估的性能对比

为对比Swin Transformer 与临床医师的评估水平,本研究分别计算模型与 5 名皮肤科医师各分项评分、VSS 总分的平均绝对误差(MAE)。5 名医师组内组内相关系数(ICC)为 0.923,说明医师间评估一致性极佳。 以 3 名参与数据集标注的资深医师给出的标准 VSS 评分为参照,Swin Transformer 在血管、色泽两项的MAE(0.4862、0.5014)略占优势;若对比 5 名医师整体评估水平,该模型在血管(MAE=0.4466)、柔软度(MAE=0.4222)及 VSS 总分(MAE=1.0409)三项指标上的误差显著更低(图 4a)。 图 4b 显示,医师人工评估易受环境因素干扰产生判断偏差,例如光照条件会影响同一瘢痕的色泽判分。本数据集包含 5 组重复图像样本,结合 5 名医师的 VSS 打分结果(图 4c-4g)可见:医师评估最易在瘢痕厚度(绿色标识)、血管分布(红色标识)两项出现主观偏差。

AI5名皮肤科医生在严重程度评分任务中的MAE比较

研究结论

本研究证实,深度学习模型可实现瘢痕精准分型与温哥华瘢痕量表(VSS)自动打分,具备开展精准瘢痕诊断、客观严重程度评估的应用潜力。在瘢痕疗效评估任务中,Swin Transformer 模型的平均绝对误差(MAE)低于皮肤科医师。未来,深度学习模型可依托精准诊断与客观 VSS 评分,助力瘢痕个体化治疗及严重程度评估工作。

Abstract

    Scars affect millions of patients each year. High recurrence makes it difficult to treat. There are a variety of treatments for different subtypes of scars, however, significant individualized differences in the efficacy of these treatments exist. Thus, an accurate and objective tool to assist physicians in regarding scars is necessary. This study aimed to demonstrate the effectiveness and application value of intelligent systems in scar clinical diagnosis and efficacy assessment. An intelligent system can be designed to assist physicians in providing personalized treatment plans for scarring patients and monitoring the effectiveness of treatment. In this study, deep learning models were trained using standardized imaging of 3000 normal skin, 2142 scar and 1431 other skin diseases. All scar images were matched to Vancouver Scar Scale (VSS) scores determined by three experienced dermatologists to train efficacy assessment models. We evaluated the performance of various models and compared the best-performing model with five dermatologists. The results showed that Swin transformer achieved the highest Area Under the Curve (AUC) of 0.9696 in scar subtype classification, the precision and recall were 0.9027 and 0.8876, respectively. For scar efficacy assessment, Swin transformer also performed the best consistence with the lowest average Mean Absolute Error (MAE, 0.5137) for VSS item scores. Compared with human performance, Swin transformer showed better objectivity and coherence (average MAE of 0.4369) but with a very small sample. The study demonstrated that the deep learning system enabled more accurate scar subtype diagnosis and more objective and consistent efficacy assessment, demonstrating the potential to assist physicians in personalizing scar management.



https://blog.sciencenet.cn/blog-3558836-1547463.html

上一篇:Phenomics丨皮肤上的“好细菌”也在默默修护屏障!新研究发现痤疮皮肤杆菌色氨酸代谢物IEt通过AHR促进皮肤屏障修




    
收藏 IP: 39.144.250.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...
扫一扫,分享此博文

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-17 16:33

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部