国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:孙雯倩, 徐天辰, 余佩厚, 陈云芳, 张伟
单位:南京邮电大学计算机学院,江苏 南京 210023
关键词:隐私政策,《个人信息保护法》,合规性分析,语料库,自然语言处理
基金:国家自然科学基金(62202406)
数据隐私保护已成为社会关注的焦点,各国和地区正在陆续制定相关的法律法规,但是由于App产品发布的隐私政策存在篇幅长、专业性强等问题,利用自动化手段检测隐私政策的合规性成为亟待解决的技术难题。作为主流解决方法的机器学习模型需要标签注释的数据集进行支撑,而国内目前缺少这样的App隐私政策数据集。在分析欧盟《通用数据保护条例》(GDPR)合规性分析相关工作的基础上,设计适合我国《个人信息保护法》的标签方案,具体包括15个要求标签,然后使用网络爬虫获取10个类别、363个App的中文隐私政策,并对这些隐私政策进行语句级划分和标注,构建包括104 134个隐私政策语句及标签组成的中文隐私政策语料库。采用百度最新开源的预训练语言模型ERNIE对语料库进行训练与测试,实验结果表明,该方案检测准确率达到85.75%。
来源:2025年第12期
《计算机工程》期刊编辑部