AI在金融中的应用Courseware

第四章

聚类算法与金融应用

无监督学习、客户画像与隐含结构发现

本章围绕无监督学习的金融价值,介绍相似性度量、K-means、K-means++、肘部法则、聚类评估、高斯混合模型和 EM 算法。

本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。

01

无监督学习的本质与价值

聚类不依赖预先标注的违约、欺诈或流失标签,而是从数据内在结构中发现相似群体。

给一班学生分组

如果老师不了解学生,最开始可能不会直接判断谁成绩好,而是先观察:谁擅长数学,谁表达能力强,谁动手能力强,谁需要更多基础训练。分组的目的不是贴标签,而是更有针对性地教学。

聚类在金融中也是这样。我们先不急着判断谁违约,而是先看客户结构:稳定经营型、季节波动型、快速成长型、低活跃型,之后再设计不同产品和风控策略。

无标签

暂时不知道真实风险结果

找相似

根据行为和特征形成群体

差异化

不同群体采用不同服务和监控方式

  • 在普惠金融中,许多客户缺少完整征信记录。聚类可以从交易行为、经营周期和资金流特征中形成客户画像。
  • 聚类结果不是最终决策,而是分析入口。每个簇都需要结合业务解释、风险指标和后续表现进行验证。
  • 无监督学习尤其适合探索性分析、特征构造、策略分层和异常样本识别。
怎么理解

聚类不是为了直接决定谁能贷款,而是帮助我们先看清客户结构。它是“画像工具”,不是“审批按钮”。

普惠金融例子

同样是小微商户,有人流水稳定但规模小,有人规模大但波动强。聚类可以把这两类客户分开,再设计不同授信策略。

课堂追问

聚类结果出来后,为什么还要用后续违约率或经营表现验证?

02

相似性度量方法

不同距离度量对应不同的“相似”定义。度量选择错误会直接导致聚类结果失真。

dE(xi,xj)=∑k=1p(xik−xjk)2d_{E}(x_i,x_j)=\sqrt{\sum_{k=1}^{p}(x_{ik}-x_{jk})^2}
  • 欧式距离适合量纲一致、变量已标准化且簇形状接近球形的数据。
  • 余弦相似度 cos⁡(x,y)=x⊤y∥x∥∥y∥\cos(x,y)=\frac{x^{\top}y}{\|x\|\|y\|} 更关注方向而非规模,适合消费结构、资产配置比例和文本向量。
  • 动态时间规整 DTW 适合比较时间序列形状,例如两家企业现金流节奏相似但时间上存在滞后。
  • 马氏距离 dM(x,μ)=(x−μ)⊤Σ−1(x−μ)d_M(x,\mu)=\sqrt{(x-\mu)^{\top}\Sigma^{-1}(x-\mu)} 能考虑变量相关性,适合金融多指标联合异常识别。
怎么理解

距离度量决定了模型眼中的“像不像”。选择距离前,先问业务上到底比较规模、结构,还是时间节奏。

普惠金融例子

两个农户收入总额不同,但一年中的收支季节性非常相似。欧式距离可能认为他们差异大,DTW 或结构比例可能更合适。

课堂追问

如果变量单位不同,例如收入金额和交易次数,为什么必须先标准化?

03

K-means 算法

K-means 通过最小化簇内平方和寻找簇中心,是最经典的聚类方法。

min⁡C1,…,CK∑k=1K∑xi∈Ck∥xi−μk∥2\min_{C_1,\ldots,C_K}\sum_{k=1}^{K}\sum_{x_i\in C_k}\|x_i-\mu_k\|^2
  • 算法交替执行两步:把样本分配到最近簇中心;根据簇内样本重新计算中心。
  • 簇中心更新为 μk=1∣Ck∣∑xi∈Ckxi\mu_k=\frac{1}{|C_k|}\sum_{x_i\in C_k}x_i。这个更新有明确均值解释,但对异常值敏感。
  • K-means++ 通过更稳健的初始化降低陷入较差局部解的概率。
怎么理解

K-means 找的是几个“代表性中心”。它适合快速分群,但不擅长处理形状复杂或异常值很多的数据。

普惠金融例子

银行可以用 K-means 把小微客户分成稳定经营型、快速成长型、季节波动型和低活跃型,再给出不同服务策略。

课堂追问

如果某个簇只有极少数客户,是新机会,还是异常噪声?如何判断?

04

肘部法则与聚类评估

聚类没有真实标签时,不能只凭视觉效果判断。需要结合内部指标、稳定性和业务可解释性。

Silhouette(i)=b(i)−a(i)max⁡{a(i),b(i)}Silhouette(i)=\frac{b(i)-a(i)}{\max\{a(i),b(i)\}}
  • 肘部法则观察簇内平方和随簇数增加的下降速度。当下降幅度明显变缓时,可作为候选簇数。
  • 轮廓系数同时考虑簇内紧密度和簇间分离度,值越高通常表示聚类结构越清晰。
  • 金融场景还需要看簇的业务稳定性:不同时间窗口、不同抽样下,同一类客户画像是否仍然存在。
怎么理解

选簇数不是数学题的唯一答案,而是数学指标和业务可解释性的折中。

普惠金融例子

模型可能建议分成 8 类,但客户经理只能清楚解释 4 类。实际落地时,4 类方案可能更适合培训和执行。

课堂追问

一个聚类方案统计指标很好,但业务人员完全解释不了,是否应该采用?

05

高斯混合模型 GMM

GMM 把数据视为多个高斯分布的混合,允许样本以概率形式属于多个簇,因此属于软聚类。

p(x)=∑k=1KπkN(x∣μk,Σk),∑k=1Kπk=1p(x)=\sum_{k=1}^{K}\pi_k\mathcal N(x\mid\mu_k,\Sigma_k),\quad \sum_{k=1}^{K}\pi_k=1
  • GMM 输出责任度 γik=p(zi=k∣xi)\gamma_{ik}=p(z_i=k\mid x_i),可以解释为客户属于第 kk 类的概率。
  • 与 K-means 相比,GMM 能表达椭圆形簇和不同方差结构,更适合风险边界不清晰的客户群体。
  • GMM 对分布假设更强,且需要注意协方差矩阵估计稳定性。
怎么理解

GMM 的“软分配”很适合金融客户,因为很多客户并不完全属于某一类,而是处在两类之间。

普惠金融例子

一个商户既有稳定社区零售特征,又开始出现线上销售增长。GMM 可以给出它属于两类的概率,而不是强行归入一类。

课堂追问

软分类结果如何帮助银行设计过渡型客户服务?

06

EM 算法的统一框架

EM 用于含有隐变量的最大似然估计。聚类中的簇标签就是典型隐变量。

Q(θ∣θold)=EZ∣X,θold[log⁡p(X,Z∣θ)]Q(\theta\mid\theta^{old})=\mathbb E_{Z\mid X,\theta^{old}}[\log p(X,Z\mid\theta)]
  • E 步估计隐变量的后验分布,例如每个样本属于每个簇的概率。
  • M 步在当前隐变量分布下更新模型参数,例如混合权重、均值和协方差。
  • K-means 可被视为硬分配版本的 EM 思想;GMM 则保留了概率责任度。
怎么理解

EM 可以理解为“先猜隐藏标签,再根据猜测更新参数”,如此反复。它适合标签看不见但结构存在的问题。

普惠金融例子

客户真实经营类型可能无法直接观察,但交易数据中隐含了类型差异。EM 就是在这些隐藏类型和模型参数之间交替更新。

课堂追问

如果初始猜测很差,EM 会不会得到错误结果?如何缓解?

07

金融应用案例

  • 农户数字信贷:根据经营周期、收入季节性、交易频率和历史还款行为进行客户分群,形成差异化授信策略。
  • 交易反欺诈:使用聚类发现正常交易模式,再把远离主要簇或频繁跨簇迁移的账户列为风险线索。
  • 供应链金融:根据企业上下游关系、应收账款周期和现金流结构识别核心企业、稳定配套企业和高波动企业。
怎么理解

案例分析时,不要只说“可以聚类”。要说明分群后如何改变授信、定价、营销、复核或风险监控。

普惠金融例子

农户分群后,季节波动型客户可以采用还款周期更灵活的产品;稳定经营型客户可以降低审核频率;异常迁移客户进入预警名单。

课堂追问

同一个客户从一个簇迁移到另一个簇,可能意味着什么?