新闻详情

新闻详情

首页 / 资讯中心 / 详情

[论文学习]大型语言模型中个人可识别资讯(PII)的机器遗忘技术:UnlearnPII 基准与 PERMU_tok 方法的深度分析

发布时间:2026/9/2 21:32:50来源:尧图网络
[论文学习]大型语言模型中个人可识别资讯(PII)的机器遗忘技术:UnlearnPII 基准与 PERMU_tok 方法的深度分析
Machine Unlearning of Personally Identifiable Information in LLMs核心问题与动机大型语言模型LLMs在海量网路资料上预训练常不经意地记忆并重现个人可识别资讯PII如姓名、电话、地址、银行帐号、医疗纪录等。这带来严重的法律与伦理风险特别是符合欧盟 GDPR 的「被遗忘权」Right to be Forgotten要求资料主体能请求删除其个人资料。现有挑战完整重新训练模型成本高昂且不切实际。传统机器遗忘Machine Unlearning多聚焦于一般事实或虚构知识如 TOFU 基准忽略 PII 的特殊性PII 常具隐含关联implicit knowledge易被对抗性提示adversarial prompts、改写提示paraphrased、跳跃推理one-hop或反向提示inverted提取。现有评估指标常只看明确 token 遗忘忽略隐含洩漏且未充分测试跨领域一般、金融、医疗与不同攻击类型。许多方法在实务整合困难需修改模型内部 forward pass或导致灾难性遗忘catastrophic forgetting严重损害模型效用utility。论文动机是开发实务导向、可模型无关model-agnostic、计算高效的 PII 遗忘解决方案同时建立专门基准来系统评估遗忘效果、稳健性与效用保留推动符合法规的 AI 部署。结果/成果主要贡献UnlearnPII 基准基于合成资料涵盖 225 个虚构个人档案、16 种 PII 类别姓名、电话、银行帐号、疾病、治疗、职业等跨一般、金融、医疗领域。每人 10 组 QA 对。包含 Forget Set、Retain Set防止灾难性遗忘、Test Retain Set。攻击类型内范围DirectQA、ParaphrasedQA、外范围OneHopQA、InvertedQA自完型攻击autocompletion以及 Naive/Targeted ExtractionQA。指标Extraction Success Rate (ESR) 测量 PII 洩漏Model Utility、Fluency、一般基准MMLU-Pro、GSM8K、ARC-Challenge评估保留。PERMU_tok 方法基于原 PERMUPerturbation-based Machine Unlearning的改进。核心机制对主体 token通常为人名注入 token-level 噪声以 Replace Probability R 与 Corrupt Neighborhood N 控制产生对比分布corrupted vs. clean logits透过 KL 散度 fine-tune 模型同时加入 retain loss 平衡。优势模型无关仅修改输入资料可预计算、易整合、保留更好输出品质。Ablation 显示 R1.0全替换与 Nk1_match轻度相似替换最佳平衡明确与隐含遗忘。实验结果以 Llama3.1–8B 为例PERMU_tok 在 Direct/Paraphrased 等明确攻击 ESR 降至 1%如 Direct 0.22%Inverted 等隐含攻击也有显着降低。Test Retain ESR 维持 95%非目标 PII 保存良好。一般基准下降 1%效用保留佳虽 Model Utility 略降但 Fluency 与推理能力稳定。优于多数 SOTA如 GA、DPO、NPO、WHP、ULD后者常导致灾难性遗忘或高残余洩漏。跨模型规模Qwen2.5 1.5B~32B较大模型倾向更好遗忘效果32B 达 0% Direct ESR显示 scaling 潜力。PII 类别分析孤立型如电话号码易遗忘语义丰富型如职业、疾病、治疗较难ESR 仍 5–9%因形成广泛关联网路。程式码开源实务应用价值高。分析与洞见强项基准设计细緻涵盖多攻击向量与领域超越先前一般基准PERMU_tok 提供实务友好替代token-level 噪声比 embedding-level 更温和有助隐含知识漂移而非过度破坏。限制与边缘案例评估依赖精确匹配模糊匹配易假阳性未来需更好 fuzzy 技术。实验以高密度 PII fine-tuning 强化记忆现实中 PII 稀疏遗忘可能更易达成但也需验证。语义丰富 PII 仍残余风险显示单纯权重扰动不足以完全断开所有关联路径。未涵盖所有 GDPR 合规面向如隐藏状态分析、membership inference attacks。LoRA 等 PEFT 可能进一步降低计算成本但论文已探讨其影响。更广洞见机器遗忘需平衡「遗忘强度 vs. 效用保留」PII 遗忘不仅技术问题更是法律合规与伦理议题。更大模型因参数容量高可能更易精准分离知识。对抗性稳健性测试至关重要因真实攻击多为提示工程。专案导向启示适合 GitHub 实作可直接使用 UnlearnPII 资料生成流程与评估脚本扩展到自有资料。PERMU_tok 易整合到现有 fine-tuning pipeline适合企业隐私合规或个人化模型。未来扩展结合 LoRA/QLoRA 降低资源需求测试真实稀疏 PII 情境开发混合方法e.g., 与 gradient ascent 或 logit-based 结合探索多模态 PII。结论论文针对 LLMs 中的 PII 遗忘提出系统性解决方案透过 UnlearnPII 基准与 PERMU_tok 方法显着降低洩漏风险同时保留模型效用为实务部署与法规遵守提供重要工具。虽然未达完美零洩漏但大幅推进领域发展强调语义丰富 PII 的挑战与模型规模的正面影响。论文连结ACL Anthology 主页https://aclanthology.org/2025.nllp-1.6/PDF 下载https://aclanthology.org/2025.nllp-1.6.pdf
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

LabVIEW温度采集程序开发全解析:从硬件连接到TDMS存储 2026/9/3 7:02:07

LabVIEW温度采集程序开发全解析:从硬件连接到TDMS存储

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
基于51单片机与nRF24L01的无线排队叫号系统设计与实现 2026/9/3 7:02:07

基于51单片机与nRF24L01的无线排队叫号系统设计与实现

简介:本资源是一套完整的基于51单片机的无线医院排队叫号系统设计实现方案,面向嵌入式初学者、课程设计学生及电子类实训教师,解决传统人工叫号效率低、易出错、缺乏可视化与语音提示的问题。系统采用双板架构:取号板(…

阅读更多 →
Python财务数据分析实战:从报表自动化到深度洞察 2026/9/3 7:02:07

Python财务数据分析实战:从报表自动化到深度洞察

简介:本资源是一套面向财务分析初学者与Python数据处理学习者的实战型财务报表分析项目包,聚焦上市公司财报数据的全流程处理与可视化实践。资源共10415个文件,主体为10364个CSV格式的A股上市公司财务报表原始数据(涵盖中油资本、…

阅读更多 →
Hadoop医疗疾病统计平台:从脏数据到临床决策 2026/9/3 7:02:07

Hadoop医疗疾病统计平台:从脏数据到临床决策

简介:本资源是一个基于Hadoop与Java开发的疾病信息统计平台源码工程,面向大数据初学者、医疗信息化开发者及高校课程设计实践者,旨在解决海量疾病数据的分布式采集、存储、批处理与统计分析问题。压缩包共41个文件,含25个核心Java…

阅读更多 →
信号去噪实战:从低通滤波到维纳滤波的MATLAB实现与对比 2026/9/3 7:02:07

信号去噪实战:从低通滤波到维纳滤波的MATLAB实现与对比

简介:本资源是一份面向图像处理初学者与MATLAB实践者的实用代码包,聚焦维纳滤波与低通滤波的核心原理与工程实现,解决图像去噪与复原中的典型问题。压缩包共2个MATLAB脚本文件(.m),总大小仅1KB,…

阅读更多 →
【Bonjour】从《我的女友景甜》小作文到实现一个简易区块链:原理与Python代码详解 2026/9/3 6:59:07

【Bonjour】从《我的女友景甜》小作文到实现一个简易区块链:原理与Python代码详解

我沉默了 他以为我不想来~~~~一、一场精心策划的流量收割 2026年8月27日晚,波场TRON创始人孙宇晨(币圈人送外号"孙割")在外网发了一篇六千字长文《我的女友景甜》。同一天,他的律师已向法院递交诉状,起诉景甜…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞