几家医院想共同研究,但不能交换病历
几家医院都想提高某种疾病的诊断模型,但病人隐私不允许把原始病历集中到一起。一个可行思路是:每家医院在本地训练,把模型更新汇总,而不是交换病人明细。
金融机构面临类似问题。银行、支付平台、电商平台和物流平台都掌握小微企业的部分信息,但原始数据不能随意共享。联邦学习试图在数据不出域的前提下共同训练模型。
原始客户数据不直接集中
各方在本地训练或计算
汇总模型信息形成共同能力
第七章
隐私保护、协同建模与金融数据孤岛
本章补齐课程总览中的联邦学习模块,介绍横向联邦、纵向联邦、FedAvg、安全聚合、差分隐私和金融机构协同建模。
本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。
金融机构、平台企业和公共部门掌握的数据互补性强,但受隐私、合规和商业边界限制,原始数据往往不能集中。
几家医院都想提高某种疾病的诊断模型,但病人隐私不允许把原始病历集中到一起。一个可行思路是:每家医院在本地训练,把模型更新汇总,而不是交换病人明细。
金融机构面临类似问题。银行、支付平台、电商平台和物流平台都掌握小微企业的部分信息,但原始数据不能随意共享。联邦学习试图在数据不出域的前提下共同训练模型。
原始客户数据不直接集中
各方在本地训练或计算
汇总模型信息形成共同能力
联邦学习解决的是“数据不能合在一起,但模型希望一起学”的问题。它不是为了炫技,而是为了数据治理和协同建模。
银行有还款记录,电商平台有经营流水,物流平台有发货数据。三方数据合在一起很敏感,但协同建模能更全面评价小微企业信用。
如果没有明确授权,联邦学习是否就可以绕过数据合规要求?
联邦学习的类型取决于参与方样本和特征的重叠关系。
判断联邦类型先看两个问题:客户是否重叠?特征是否相似?答案不同,技术路线就不同。
多家农商行各自有不同地区客户但字段类似,这是横向联邦;银行和电商平台服务同一批商户但字段不同,这是纵向联邦。
在普惠金融中,哪一种联邦学习更常见?为什么?
FedAvg 是横向联邦学习中最经典的算法:各客户端本地训练模型,服务器按样本量加权聚合参数。
FedAvg 的直觉是每家机构先在本地学习,再把模型更新汇总。样本多的机构通常权重更大。
几家县域银行共同训练风险模型,每家只上传模型参数更新,不上传客户明细。中心服务器聚合后再把新模型发回各机构。
如果大机构样本多但客户结构与小机构差异很大,按样本量加权是否公平?
只上传模型参数并不等于绝对安全。攻击者仍可能通过梯度或参数反推出部分训练数据,因此需要额外隐私机制。
“不上传原始数据”不等于“没有隐私风险”。参数和梯度也可能泄露信息,因此需要安全聚合和差分隐私。
如果某县只有少数高风险客户,模型更新可能暴露这些客户的特征。加入噪声和聚合保护可以降低被反推的风险。
隐私保护越强,模型精度可能越低。金融机构应该如何权衡?
先用一句业务语言解释这个概念,再回到公式和算法。能讲给客户经理听懂,才说明真正理解了。
可以把本章方法放到跨机构协同建模中理解:数据不动、模型动,但合规责任不能省略。
读完“金融应用场景”后,试着用一个普惠金融场景说明它解决了什么问题、依赖什么假设、可能在哪里失败。
联邦学习项目首先是治理项目,其次才是算法项目。参与方、用途、授权、审计和退出机制必须先讲清楚。
在联合反欺诈项目中,需要明确哪些风险信号可共享、模型结果如何使用、误伤客户如何申诉、参与机构如何承担责任。
如果联邦模型导致错误拒贷,责任应如何划分?