AI在金融中的应用Courseware

第三章

递归回归算法与正则化

在线更新、数值稳定与过拟合控制

本章解释最小二乘闭式解在金融场景下的局限,系统介绍梯度下降、SGD、动量、Adam、递归最小二乘以及 LASSO、Ridge 和 Elastic Net。

本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。

01

最小二乘法的局限性

普通最小二乘的闭式解清晰优雅,但在大规模、高维、实时更新的金融场景中存在计算和稳定性问题。

调水温:一次调准很难,边试边调更常见

洗澡时水太冷,你不会先计算一个完美公式再调水龙头。更常见的做法是调一点、试一下,再继续修正。梯度下降和递归更新就是这种“边观察、边调整”的思想。

金融模型面对的是不断变化的数据。客户今天还款、明天经营、下个月行业变化,模型不能永远停留在第一次训练的状态。

当前状态

模型现在的参数和误差

新反馈

新样本告诉我们方向偏在哪里

小步调整

沿着误差下降方向逐步修正

正则化像给模型装“刹车”

一个学生为了记住训练题,把每道题答案都背下来,考试换题就不会了。过拟合也是这样:模型把历史样本里的偶然噪声当成规律。

正则化的作用像刹车:不让模型为了追求训练集完美而把参数调得过于极端。普惠金融中,稳健比漂亮的训练集分数更重要。

过拟合

把噪声当规律

惩罚项

限制模型复杂度

稳健性

换一批客户仍能保持效果

β^=(X⊤X)−1X⊤y\hat\beta=(X^{\top}X)^{-1}X^{\top}y
  • 当特征数量大、样本持续流入或 X⊤XX^{\top}X 接近奇异时,直接求逆会带来较高计算成本和数值不稳定。
  • 金融数据常出现强相关特征,例如多个消费频率指标、多个资产价格指标或多个宏观变量。多重共线性会放大参数估计方差。
  • 递归算法的目标是在不反复重算全部历史样本的情况下,随新数据到来更新参数。
怎么理解

闭式解适合讲清楚原理,但不一定适合实时业务。金融数据不断进入,模型也需要能逐步更新。

普惠金融例子

线上小微信贷每天新增申请和还款记录,如果每次都从头训练模型,成本高且反应慢;递归更新能更快吸收新信息。

课堂追问

哪些金融场景必须在线更新?哪些场景可以定期离线重训?

02

梯度下降与 SGD

梯度下降把参数估计看作目标函数最小化问题。SGD 每次使用一个或一小批样本更新,适合数据流和大规模训练。

θt+1=θt−ηt∇θL(θt)\theta_{t+1}=\theta_t-\eta_t\nabla_{\theta}L(\theta_t)
  • 负号表示沿损失函数下降最快的方向移动。学习率 ηt\eta_t 决定每一步移动幅度。
  • 在实时信用评分系统中,新申请、新还款、新逾期会持续进入系统。SGD 可以逐步吸收新信息,而不必每天完整重训。
  • SGD 的噪声既是缺点也是优点:它会带来震荡,但也可能帮助模型跳出局部不佳区域。
怎么理解

SGD 的直觉是“每看到一条新样本,就把模型方向修正一点”。它不追求一步到位,而追求持续改进。

普惠金融例子

一个农户按月还款,系统每个月都能观察到新的还款行为。SGD 可以把这些新行为逐步纳入风险评分。

课堂追问

如果新数据中有异常值,SGD 为什么可能比批量训练更容易受冲击?

03

动量方法与 Adam

动量方法通过累积历史梯度方向减少震荡;Adam 进一步为不同参数设置自适应学习率。

vt=γvt−1+η∇θL(θt),θt+1=θt−vtv_t=\gamma v_{t-1}+\eta\nabla_{\theta}L(\theta_t),\quad \theta_{t+1}=\theta_t-v_t
  • 动量项 vtv_t 类似“速度”,能够在稳定方向上加速,在来回震荡方向上相互抵消。
  • Adam 使用一阶矩和二阶矩估计:mt=β1mt−1+(1−β1)gtm_t=\beta_1m_{t-1}+(1-\beta_1)g_t, vt=β2vt−1+(1−β2)gt2v_t=\beta_2v_{t-1}+(1-\beta_2)g_t^2。
  • 参数更新为 θt=θt−1−αm^tv^t+ϵ\theta_t=\theta_{t-1}-\alpha\frac{\hat m_t}{\sqrt{\hat v_t}+\epsilon}。在金融神经网络、文本模型和高维特征模型中较常见。
怎么理解

动量像给优化方向加了惯性,Adam 像给每个参数配了自己的步伐。它们解决的是“怎么更稳、更快地走到较好解”。

普惠金融例子

在高维交易特征模型中,有些变量变化频繁,有些变量很稀疏。Adam 的自适应学习率能更灵活地处理这种不均衡。

课堂追问

优化器越复杂,模型一定越好吗?如何用验证集判断?

04

递归最小二乘

递归最小二乘直接更新参数估计和协方差矩阵,适合参数可能随时间缓慢变化的金融时间序列问题。

Kt=Pt−1xtλ+xt⊤Pt−1xt,βt=βt−1+Kt(yt−xt⊤βt−1)K_t=\frac{P_{t-1}x_t}{\lambda+x_t^{\top}P_{t-1}x_t},\quad \beta_t=\beta_{t-1}+K_t(y_t-x_t^{\top}\beta_{t-1})
  • 其中 KtK_t 是增益向量,PtP_t 是参数不确定性的矩阵表达,λ\lambda 是遗忘因子。
  • 遗忘因子小于一时,模型会更重视近期数据,适合市场结构变化、客户行为迁移或宏观周期转换。
  • 递归方法需要监控数值稳定性;异常样本可能快速改变参数,因此要结合异常检测和稳健损失。
怎么理解

递归最小二乘特别适合“关系会慢慢变”的场景。遗忘因子就是告诉模型:近期数据是否应该更重要。

普惠金融例子

利率市场化后,客户对存款利率变化的反应可能变快。用遗忘因子可以让模型更重视近期行为,而不是被多年旧数据拖住。

课堂追问

遗忘因子设得太小或太大,分别会有什么风险?

05

正则化的基本原理

正则化通过在损失函数中加入复杂度惩罚,牺牲少量训练集拟合能力,换取样本外稳定性。

min⁡β  1n∑i=1n(yi−xi⊤β)2+λΩ(β)\min_{\beta}\; \frac{1}{n}\sum_{i=1}^{n}(y_i-x_i^{\top}\beta)^2+\lambda\Omega(\beta)
  • L0 范数计算非零参数个数,直接对应变量选择,但优化困难。
  • L1 范数 ∥β∥1=∑j∣βj∣\|\beta\|_1=\sum_j|\beta_j| 会产生稀疏解,适合自动特征选择。
  • L2 范数 ∥β∥22=∑jβj2\|\beta\|_2^2=\sum_j\beta_j^2 会收缩参数,适合处理多重共线性和提升数值稳定性。
  • L∞ 范数限制最大参数绝对值,可用于控制极端暴露或最大敏感度。
怎么理解

正则化可以理解成给模型“降噪”和“收敛”。金融模型宁可少抓一点训练集细节,也要在未来样本上稳定。

普惠金融例子

如果一个信用评分模型用了几百个高度相似的交易变量,训练集效果可能很好,但换一个月份就失效。正则化能压制这种脆弱性。

课堂追问

为什么普惠金融模型更需要稳健,而不是只追求训练集准确率?

06

LASSO、Ridge 与 Elastic Net

三类正则化回归对应不同的业务需求:变量筛选、稳定预测和相关特征组处理。

min⁡β  RSS+λ[α∥β∥1+(1−α)∥β∥22]\min_{\beta}\; RSS+\lambda\left[\alpha\|\beta\|_1+(1-\alpha)\|\beta\|_2^2\right]
  • LASSO 会把部分系数压缩为零,适合从大量候选变量中形成较简洁的评分卡特征集合。
  • Ridge 会保留所有变量但压缩系数,适合多个变量共同反映同一风险维度的情形。
  • Elastic Net 同时具备稀疏性和稳定性,适合高维且相关性强的金融特征。
金融应用提示

农户信用评分可以先用 LASSO 筛选关键特征,再使用 Ridge 或 Elastic Net 提升稳定性,并通过时间切分验证模型是否能跨期泛化。

怎么理解

LASSO 像筛选变量,Ridge 像把变量影响力压平,Elastic Net 适合“变量很多且互相关联”的中间情况。

普惠金融例子

农户信贷中,交易次数、交易金额、收款天数可能都反映经营活跃度。Elastic Net 比单纯 LASSO 更可能保留这一组相关变量。

课堂追问

如果要向学生或银行客户经理解释模型,变量少一点是否更有价值?

07

本章练习

  • 解释为什么高维信用评分模型容易过拟合,并说明 L1 与 L2 惩罚的不同作用。
  • 为实时风控场景设计一个递归更新流程,写出数据进入、参数更新、异常监控和人工复核四个环节。
  • 比较 SGD、Momentum 和 Adam 在收敛速度、稳定性和可解释性上的差异。
怎么理解

练习题建议用真实业务语言回答,不要只写公式。先说明业务场景,再说明变量、假设和可能的失败点。

普惠金融例子

例如“欺诈识别”的回答可以从低欺诈率、误报成本、人工审核资源和客户体验四个角度展开。

课堂追问

如果你的模型把很多正常客户误判为高风险,对普惠金融目标有什么影响?