摘要:
目的:通过使用临床医学数据,构建并验证多种机器学习预测模型,用于前列腺癌风险预测,旨在筛选
出最佳性能模型,并验证其在国内外独立数据集的泛化能力,为前列腺癌的临床决策提供稳健、可信的工具。方
法:选择国家人口健康科学数据中心的前列腺肿瘤患者临床数据,经高级特征筛选移除噪声数据后,按 7:3 划
分训练集和测试集,构建 5 种机器学习模型,包括逻辑回归(logistic regression,LR)、极端梯度提升(extreme
gradient boosting,XGBoost)、随机森林(random forest,RF)、分类特征梯度提升(categorical boosting,CatBoost)、
K 近 邻(K-nearest neighbors,KNN)。 在 测 试 集 上 采 用 受 试 者 工 作 特 征 曲 线 下 面 积(area under the receiver
operating characteristic curve,AUC)、准确率、召回率及 F1 分数综合评价模型性能,同时评估模型在国外患者独
立测试集的表现,最后利用 SHAP 对最佳模型进行特征重要性解析。结果:在五种模型中,XGBoost 模型在内部
测试集上表现最佳,其 AUC、准确率、召回率及 F1 分数分别为 0.894、0.852、0.825、0.834。SHAP 分析显示,总
PSA 水平、碱性磷酸酶、年龄、肌酸激酶同工酶、游离总前列腺特异性抗原(prostate specific antigen,PSA)比值
为最关键特征。同时,XGBoost 模型在独立测试集上同样有着优异的性能(AUC:0.810),证明了其强大的泛化能
力。结论:本研究构建了一个基于 XGBoost 的高性能、可解释的前列腺癌风险预测模型。该模型不仅在中国人
群中表现出色,同时在国际数据中也表现出良好的普适性,可以为临床医生提供精准的风险分层,从而优化诊疗
策略。
中图分类号:
曹丽, 王菁菁, 武丽媛, 赵国斌. 基于可解释机器学习的前列腺癌风险预测模型构建[J]. 神经药理学报, 2026, 16(3): 28-.
CAO Li, WANG Jing-jing, WU Li-yuan, ZHAO Guo-bin. Development and Validation of Machine Learning Models for
Predicting Prostate Cancer Risk: A Multi-Cohort Study[J]. ACTA NEUROPHARMACOLOGICA, 2026, 16(3): 28-.