上传时间:时间:2025-08-27 17:38:01
目的:构建并验证一种端到端深度学习模型,用于在胸部 CT 上自动鉴别良恶性肺结节,并评估其在不同设备、不同地域人群中的泛化能力。
设计:多中心、回顾性模型开发与外部验证研究。
地点:训练/调优数据来自 3 家三级医院(A、B、C),外部测试数据来自 2 家独立医院(D、E)。
受试者:2018 年 1 月–2023 年 12 月行胸部 CT 的 11 820 例肺结节患者(恶性 3 967 例,良性 7 853 例)。
干预:采用 3D-ResNet50 架构,以原始 DICOM 为输入,输出良恶性概率。
主要终点:受试者工作特征曲线下面积(AUC)。
次要终点:敏感度、特异度、F1 值、决策曲线分析(DCA)。
结果:内部测试 AUC 0.928(95%CI 0.903–0.951);外部测试 AUC 0.915(95%CI 0.896–0.933)。敏感度 90.2%,特异度 85.7%,优于传统 radiomics(AUC 0.835)。DCA 显示在 10–80% 风险阈值区间均具临床净获益。
结论:该 AI 模型在多中心、多设备场景下均表现稳健,可辅助放射科医师提高肺结节诊断效率并减少过度随访。
关键词:人工智能;肺结节;深度学习;CT;诊断;多中心验证
1 引言
低剂量胸部 CT(LDCT)筛查使肺结节检出率升至 24–51%,但 >90% 结节为良性[1]。传统影像评估依赖医师经验,主观性强,易导致漏诊或过度随访。Radiomics 与深度学习方法近年来取得突破,但多数研究样本量小、单中心、未能覆盖不同 CT 厂商与层厚差异。本研究基于 3D-ResNet50 构建端到端模型,并在 5 家医院完成多中心验证,探索临床落地可行性。
2 方法
2.1 研究设计与伦理
回顾性收集 5 家医院胸部 CT;伦理批件:阜外医院 2023-科-112;豁免知情同意。按照 TRIPOD-AI 及 CONSORT-AI 拓展声明报告[2]。
2.2 数据来源
训练/调优:医院 A(6 204 例)、B(2 737 例)、C(1 879 例)。
内部测试:从三家医院随机留取 1 000 例。
外部测试:医院 D(720 例)、E(1 280 例)。
纳入标准:①CT 层厚 ≤1.25 mm;②结节直径 4–30 mm;③病理或 ≥24 个月稳定随访确诊。
排除:①既往肺癌史;②严重呼吸运动伪影;③磨玻璃结节 <5 mm。
2.3 金标准
恶性:手术病理或经皮穿刺活检证实;良性:≥24 个月稳定或病理证实。
2.4 图像预处理
重采样:各向同性 1 mm³;
窗宽/窗位:肺窗 (-1000, -600);
数据增强:旋转±15°、翻转、弹性形变、Gamma 校正;
归一化:Z-score。
2.5 模型架构
3D-ResNet50(ImageNet-3D 预训练);输入 128×128×64 voxel;输出 0–1 概率。超参数:batch 16,Adam,初始学习率 1e-4,Cosine 退火;训练 200 epoch,早停 patience 20。
2.6 传统对照
手工 radiomics:提取 1 409 个特征(PyRadiomics),LASSO+SVM。
2.7 统计分析
主要指标:AUC 及其 95%CI(DeLong)。
敏感度、特异度、PPV、NPV、F1。
决策曲线分析(rmda 包)。
亚组:结节类型(实性/磨玻璃/部分实性)、直径(<10 mm/10–20 mm/>20 mm)、设备厂商(GE/Philips/Siemens)。
2.8 可解释性
Gradient-weighted Class Activation Mapping (Grad-CAM) 生成热区图,由 2 名高年资放射科医师盲评定位准确性。
2.9 临床模拟
外部测试集由 3 名低年资(≤5 年)与 3 名高年资(≥10 年)医师分别在无/有 AI 辅助下判读,记录诊断时间、正确率。
3 结果
3.1 基线特征
共 11 820 例,恶性 33.6%,良性 66.4%;结节中位直径 12 mm;磨玻璃结节占 28%。五家医院 CT 参数差异见表 1。
3.2 模型性能
内部测试 1 000 例:AUC 0.928(95%CI 0.903–0.951),敏感度 90.2%,特异度 85.7%,F1 0.878。
外部测试 2 000 例:AUC 0.915(95%CI 0.896–0.933),敏感度 88.4%,特异度 86.9%。
传统 radiomics:AUC 0.835(内部),差异显著(P<0.001)。
3.3 亚组分析
结节类型:实性结节 AUC 0.905,磨玻璃 0.937,部分实性 0.921(Pheterogeneity=0.11)。
直径:<10 mm AUC 0.901,10–20 mm 0.931,>20 mm 0.945(Pheterogeneity=0.03)。
设备:GE 0.918,Philips 0.910,Siemens 0.921(Pheterogeneity=0.18)。
3.4 可解释性
Grad-CAM 热区图对 92.4% 恶性结节正确标记实性成分或分叶/毛刺区域,放射科医师一致性 κ=0.89。
3.5 临床模拟
低年资医师:无 AI 准确率 71.3%,有 AI 87.2%(P<0.001),平均诊断时间由 4.1 min 降至 2.4 min。
高年资医师:无 AI 准确率 83.5%,有 AI 91.7%(P=0.02),时间由 2.8 min 降至 1.9 min。
3.6 错误分析
假阳性 214 例中,肉芽肿 46%,结核瘤 22%;假阴性 78 例中,原位腺癌 64%,提示对早期磨玻璃型腺癌敏感性不足。
4 讨论
4.1 主要发现
本研究构建了迄今为止最大样本的多中心肺结节 AI 诊断模型,内外部 AUC 均 >0.91,显著优于传统 radiomics,并在不同设备、不同地域人群中表现稳健。
4.2 与既往研究比较
LUNA16 冠军模型 AUC 0.905[3],但仅使用单中心低剂量 CT;本研究纳入常规剂量与 LDCT 混合数据,仍保持高性能,表明模型对剂量差异不敏感。
4.3 临床价值
① 辅助基层医院低年资医师提升诊断准确率至与高年资医师相当;② 减少 30–40% 不必要的随访 CT;③ 决策曲线显示在 10–80% 风险阈值区间均有净获益。
4.4 局限性
① 磨玻璃型早期腺癌敏感性有待提升;② 缺乏前瞻性、干预性研究验证;③ 未纳入 PET-CT 或液体活检等多模态信息。
4.5 未来方向
① 引入时序 CT(随访扫描)提升早期腺癌检出;② 融合 PET 代谢信息;③ 开展多中心前瞻性临床试验(NCT06012345 已启动)。
5 结论
基于 3D-ResNet50 的 AI 模型在 11 820 例多中心数据中表现出色,可辅助放射科医师提高肺结节良恶性鉴别效率,具备良好的临床转化前景。
致谢
感谢五家医院放射科及信息科;研究获国家重点研发计划(2022YFC2009900)及腾讯觅影联合基金支持。
参考文献(节选)
[1] National Lung Screening Trial Research Team. Reduced lung-cancer mortality with low-dose CT screening. N Engl J Med. 2011;365:395-409.
[2] Liu X, et al. A comparison of deep learning performance against health-care professionals in detecting diseases from medical imaging: a systematic review and meta-analysis. Lancet Digit Health. 2019;1:e271-e297.
[3] Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest CT. Nature Medicine. 2019;25:954-961.
在学术研究中,存在着不同类型的论文,各有其特点和应用范围。下面,我将列举一些常见的学术论文类型。1.研究论文研究论文是指对一个特定的问题进行研究,包括提出研究问题、研究方法、实验分析、结论等。这种论文常见于科学研究和社会科学领域。2.综述论文综述论文通常是对一个主题或者领域的现有文献进行总结和概括,包括文献来源、文献分类、问题总结、发展趋势等方面的内容。这种论文通常可用于对某个领域的发展和演变进行...
论文录用和发表是两个不同的环节,通常来说,论文首先需要被录用,然后才能发表。论文录用是指期刊编辑部同意刊登作者的文章,并经过内部审稿环节合格后,向作者发送录用通知。这时候,文章已经符合期刊的基本要求,杂志社同意刊登文章。然而,这并不意味着文章已经发表,还需要经过后续的修改、校对、排版、印刷等环节,直到在线发表或者见刊发表。在线发表或者见刊发表是文章正式与读者见面的环节,此时文章已经经过严格的审稿和...
职称这一事物,不同等级所对应的待遇差别极大!职称等级直接决定了工资收入的高低,在其他方面,如评优、晋升等,职称等级也是一项关键指标。职称通常分为初级、中级和高级,部分地区的高级职称还细分为副高级和正高级。为何咱们事业单位的同事都竭尽全力去评定职称呢?还不是因为不同等级的待遇差距过于悬殊!接下来,我就为大家详细讲解一下,不同职称的待遇究竟相差多少,评定高级职称是否值得。 &nb...
在学术研究的广阔天地里,文献综述是连接已知与未知、过去与未来的重要桥梁。然而,许多研究者在撰写文献综述时常常遭遇“找不到文献”的困境,这不仅影响了综述的完整性,也可能限制了研究的深度和广度。本文结合逻辑推导、概念泛化以及技术辅助三大策略,并通过具体实例解析,为这一难题提供全面的解决方案。一、逻辑推导策略:构建研究问题的逻辑链条面对“找不到文献”的困境,逻辑推导策略是首要选择。这一策略强调从抽象到具...
本文聚焦于MBA论文选题,深入剖析其核心原则。指出MBA论文选题质量对研究深度、实用性与学术价值具有决定性作用,与学术型硕士论文侧重理论探索不同,MBA论文更强调问题导向与管理实践。通过阐述实践导向、价值显著、聚焦具体、创新适度、可行可控、关联自身、符合规范这七大核心原则,结合丰富案例与实战经验,为MBA学生精准锁定高价值选题、规避常见误区提供全面指导,助力其在论文写作中取得优异成绩。一、引言在学...
在撰写文献综述时,论点的构建是至关重要的一环,它不仅仅是简单陈述,更是文献梳理过程中的逻辑支撑。论点需要与文献内容紧密相连,并能引导读者进行深入思考。例如,基于近期频繁降雨和天气预报,推断出“明天需穿雨衣雨鞋上班”这一结论,就是一个典型的论点形成过程。这一过程依赖于具体的事实依据和逻辑推理。然而,在文献综述写作中,作者往往过于注重研究本身,而忽视了论证这一基础逻辑形式。这可能导致论证不充分,论点不...
学术著作主要包括以下几种类型:学术专著:这是指在某一学科或专业的研究成果撰写的著作,比较有针对性,只针对一个专业或者是一个方向的内容进行研究。学术编著:包括基础论著、技术理论、应用著作。基础论著指的是针对某一个领域的新成果,经过分析并且整理撰写而成的。技术理论针对的是生产实践的技术经验,应用著作指的是总结社会实践中的理论著作。学术译著:指的是将外文著作翻译成中文的著作。古籍整理:这是对古代文献的整...
撰写论文着实是件让人头疼的事,特别是面对空白文档,一个字也写不出来的时候。不过今天,我想和你分享一套我私藏的论文“邪道”速成法,助你告别无效熬夜。 一,先别匆忙动笔,咱们得先搭建好框架,再往里面填充内容!在撰写论文之前,你一定要先搭建好整篇文章的框架,明确大标题、小标题以及三级标题,这就好比建造房屋需先有一张设计图一样。 然后,我们先创建一个专门的文件夹,将所有相关文献都一并放...
实证论文写作中,自变量选择是关键且具挑战性的环节。本文结合已刊发核心期刊论文,归纳总结出实证论文自变量选择的10类依据,包括基于“差异化结果”“理论与实践的反差”“群体差异”“中国特色”“共识中的难点”“潮流趋势(大背景)”“化整为零”“化零为整”等,并分别结合具体案例进行详细阐述,旨在为科研人员提供自变量选择的思路与方法,助力其在实证研究中得出创新观点。一、引言实证论文,尤其是量化论文,犹如一座...
随着互联网的快速发展,知识的传播范围越来越大,但同时也衍生了知识的剽窃问题。为了保证学术界的诚信,学术论文查重成为必要的工作。维普论文查重系统就是一款常用的查重工具。那么,维普的查重原理是什么?它有哪些应用?一、维普查重原理维普查重原理基于文本比对技术进行判断。具体来说,它将原文本和待检测文本进行分词,将分词结果转化成数字特征向量,再通过特定算法计算相似度,最终生成查重报告。相似度超过设定阈值(通...