国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李江涛, 马礼, 李阳
单位:北方工业大学信息学院, 北京 100144
关键词:医疗数据分类,隐私保护,分类标准,大小模型融合,大语言模型,机器学习
基金:北京市自然科学基金(4234083); 国家重点研发计划(2024YFE0200500); 国家重点研发计划(2023YFC3107804); 北京市教育委员会科学研究计划项目(KM202410009003)
医疗数据因涉及面广、数量庞大、种类繁多等特点而导致隐私保护难度增大。为了有效地对医疗数据进行合理分类, 进而依据分类结果采取相应的隐私保护措施, 根据医疗信息敏感程度的不同, 提出一种基于大小模型融合的分类方法, 达到医疗数据分类加密的目的。采用大语言模型(LLM)深度神经网络, 结合医疗数据分类标准(MDCS)对医疗数据集进行特征标注, 然后将LLM的输出特征作为小型文本分类模型的输入, 利用小型文本分类模型长短时记忆(LSTM)网络学习文本中的特征表示, 最后将小型文本分类模型的错误预测结果返回给LLM重新分类, 融合大小模型的分类结果, 从而实现将医疗数据按不同的敏感程度进行精准分类。实验结果表明, 大小模型融合分类方法相比于采用其他不同的分类模型和分类标准, 在模型收敛性、分类准确率、数据分类均衡度等方面都有着显著提升, 验证了大小模型融合迭代机制与医疗数据场景极具契合性, 极大地提升对医疗数据的分类准确率, 实现对医疗数据更高效分类, 从而确保对医疗数据的隐私保护。
来源:2026年第5期
《计算机工程》期刊编辑部