状态: 实验性权重可用性: 未发布许可: 仅限研究
敏感片段检测器(实验版)
一个实验性模型,用于标记文本中可能的敏感片段以供下游脱敏。它支持而非替代人工审查。
预期用途
- 通过提出待审片段,辅助隐私保护管线。
- 用于检测/脱敏权衡的研究。
超范围用途
- 对真实个人或健康数据进行唯一、无人工复核的脱敏。
- 任何暗示已移除全部敏感数据的用途。
- 临床或法律决策。
指标
本模型未发布任何经验证的指标。
模型类型
用于敏感片段检测的词元分类模型。
架构
一个经微调的 Transformer 编码器。细节为临时性,可能变更。
训练数据
带敏感片段标注的合成与公开来源文本。未使用任何真实个人或健康记录。
性能说明
未发布定量性能,因为尚未在具代表性的、经许可的评估集上完成验证。此阶段给出的数字会造成误导。
伦理考量
将其呈现为完整的隐私解决方案会造成危害。它是一个研究辅助工具,必须置于人工审查与残余风险评估之后。
隐私考量
模型本身不得基于真实敏感数据训练,也不得用于记忆此类数据。
局限
- 不保证召回;敏感片段会被漏检。
- 主要基于合成数据训练;预期在真实世界中存在分布偏移。
已知失效模式
- 对罕见或新型敏感格式的漏检。
- 过度检测导致对无害文本的不必要脱敏。
