
医疗AI隐私:当平均保护等于没有保护
慕尼黑工业大学博士生Moritz Knolle向自己提出了一个导致令人不安发现的问题:”我问自己:我会贡献我的数据来训练医疗AI模型吗?”
为了回答这个问题,他和同事们进行了一项系统测试。他们攻击了七个真实世界医疗数据集,包括21,799份心电图和377,110份胸部X光片,使用成员推理攻击(MIA)技术,该技术可判断某个人的数据是否被用于训练特定AI模型。该领域此前一直假设MIA风险足够低,所有患者平均后不会构成真正威胁。
研究团队在《自然》杂志(DOI: 10.1038/s41586-026-10688-0)上报告称,这一假设具有危险的误导性。风险并非均匀分布,对某些患者而言,风险极为严重。
成员推理攻击的工作原理
医疗AI模型通常基于患者记录、图像或生理信号等大规模数据集进行训练。模型要表现良好,必须学习数据中的模式。但学习模式也意味着调整其内部参数,使其对所见过的特定数据点略微更有信心。
MIA正是利用这一点。攻击者可以访问已训练的模型,向其输入一个数据点并记录模型的置信度分数。如果置信度显著高于同等模型在没有该数据点情况下的输出,攻击者即可推断该数据点存在于训练集中。
对于医疗数据而言,这种推断是危险的。知道某个人的数据被用于训练某种模型(例如针对罕见癌症治疗的模型),就会向保险公司或雇主透露该人可能希望保密的信息。
风险的分布
此前的研究将MIA风险报告为所有患者的平均值,通常为低个位数百分比。平均风险为1%的模型看似安全。但Knolle及其合作者,包括慕尼黑工业大学的Daniel Ruckert和哈索·普拉特纳研究所的Georg Kaissis,发现平均值掩盖了严重不均衡的分布。
在训练数据中代表性不足的少数群体患者在隐私风险的第99百分位中占比极高。对于这些个体,MIA成功率可能远高于平均水平,在某些情况下,对最特殊的患者几乎达到确定性。
原因在于统计学原理。模型能很好地学习常见模式,因此它对典型患者的置信度无论是否在训练集中都相似。但对于罕见患者,例如患有罕见症状组合的人,模型的置信度是成员身份的更强信号。模型见过的类似患者样本极少,如果该患者出现在训练数据中,其对模型参数的影响会不成比例地大。
规模的悖论
这一问题因医疗AI自身的优势趋势而加剧。随着模型越来越大、越来越复杂,它们对数据的分析也更加深入,在预测概率中产生更小但更可检测的变化。悖论在于,更大的模型可能隐私性更差。
同样,训练队列越具特异性,例如接受特定癌症治疗的患者群体,每个成员的隐私风险就越大。使数据集在回答临床问题时具有价值的特异性,恰恰也使其成员更容易被识别。
差分隐私作为解决方案
解决方案已经存在。差分隐私(DP)在训练过程中添加少量校准后的随机噪声,从数学上限制模型可能泄露的关于任何个人的信息量。在研究团队的测试中,DP在保持诊断准确性的同时降低了MIA的有效性。
但DP尚未被广泛采用。大多数开发AI模型的医院和诊所并未实施DP,要么是因为他们未意识到这一风险,要么是认为实施工作没有必要。
“目标是为个人提供统计保证,确保作为数据集的一部分不会对您造成伤害,”Knolle告诉《物理世界》杂志。他和同事们目前正在将这项工作扩展到医疗领域的生成式AI模型,这些模型的隐私风险可能更大。
这项研究的核心教训是数学性的,而非技术性的。在隐私领域,如同在医学领域一样,平均值可能产生误导。对普通患者而言较低的风险,对高风险患者而言毫无安慰作用,在医疗AI团队在部署模型之前评估个体层面风险之前,最有可能从AI中获益的患者,也可能承担最大的损失。
Reference: Knolle et al., Nature (2026). DOI: 10.1038/s41586-026-10688-0. Reported by Physics World, July 21, 2026.
婷 翻译

