AI在金融中的应用Courseware

第五章

强化学习与金融应用

探索利用、长期价值与序列决策

本章介绍强化学习的基本范式、马尔可夫决策过程、多臂老虎机、UCB、贝尔曼方程、DQN、Actor-Critic 及其金融应用。

本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。

01

什么是强化学习

强化学习研究智能体如何在环境中通过试错学习策略,以最大化长期累计奖励。

学骑车不是看答案,而是不断试错

学骑车时,没有人能提前告诉你每一秒该把车把转几度。你会摔、会调整、会慢慢知道怎样保持平衡。强化学习研究的就是这种通过行动和反馈学习策略的过程。

金融决策也常常不是一次性判断。授信额度给多少、什么时候调整、如何控制风险,都需要在长期反馈中不断修正。

状态

现在处在什么情况

动作

下一步怎么做

奖励

这个动作带来什么后果

试新餐馆与老餐馆:探索和利用

你知道一家老餐馆很稳,这是利用;你偶尔尝试一家新店,这是探索。如果永远只去老店,可能错过更好的选择;如果每天都试新店,又可能踩坑。

普惠金融也有类似矛盾:如果银行只服务已有信用记录的客户,就会错过很多真实可靠但缺少记录的新客户;但如果探索太多,风险也会上升。

利用

选择当前看起来最好的方案

探索

给不确定但可能优秀的方案机会

平衡

在学习机会和风险成本之间权衡

max⁡π  Eπ[∑t=0∞γtrt]\max_{\pi}\; \mathbb E_{\pi}\left[\sum_{t=0}^{\infty}\gamma^t r_t\right]
  • 策略 π(a∣s)\pi(a\mid s) 表示在状态 ss 下选择动作 aa 的规则。奖励 rtr_t 可以是收益、风险调整收益、客户响应或风险成本的函数。
  • 与监督学习不同,强化学习的标签不是事先给定的,而是由行动后的环境反馈产生。
  • 金融场景天然具有序列性:今天的授信额度、组合权重或营销策略会影响明天的风险和收益。
怎么理解

强化学习关注的不是一次预测是否正确,而是一连串决策最终带来什么长期结果。

普惠金融例子

授信额度不是一次性问题。额度给高了可能短期收益高但未来违约增加;额度给低了可能客户流失。强化学习正是处理这种长期权衡。

课堂追问

如果奖励函数只奖励短期放款收益,会诱导模型做出什么危险行为?

02

马尔可夫决策过程 MDP

MDP 是强化学习的数学框架,把动态决策问题拆成状态、动作、转移概率、奖励函数和折扣因子。

M=(S,A,P,R,γ)\mathcal M=(\mathcal S,\mathcal A,P,R,\gamma)
  • 状态空间可以包含客户画像、市场状态、账户余额、宏观变量或历史行为摘要。
  • 动作空间可以是是否授信、授信额度、组合权重、止损比例或推荐产品。
  • 状态转移 P(st+1∣st,at)P(s_{t+1}\mid s_t,a_t) 描述动作如何影响未来。金融系统的难点在于转移机制常常非平稳。
  • 折扣因子 γ\gamma 控制远期收益的重要性。长期客户价值模型通常需要较高折扣因子,短期交易策略则可能更低。
怎么理解

MDP 的关键是把业务流程拆成状态、动作和反馈。拆得清楚,强化学习才有意义。

普惠金融例子

在小微循环贷中,状态可以是客户最近流水、还款记录和行业景气度;动作是调高、维持或调低额度;奖励是收益减去风险成本。

课堂追问

金融环境真的满足马尔可夫假设吗?如果不满足,应如何补充历史信息?

03

探索-利用困境

探索意味着尝试不确定但可能更好的动作;利用意味着选择当前已知表现最好的动作。

at=arg⁡max⁡a[μ^a+clog⁡tNa(t)]a_t=\arg\max_a\left[\hat\mu_a+c\sqrt{\frac{\log t}{N_a(t)}}\right]
  • 过度利用会使模型陷入局部最优,例如只向历史表现好的客群投放金融产品,忽略潜在新客群。
  • 过度探索会带来成本和风险,例如向风险不明客户过度放贷。
  • UCB 算法把当前收益估计和不确定性奖励相加,对样本少但潜力大的动作给予探索机会。
怎么理解

探索不是乱试,而是在可控风险内保留学习机会。普惠金融尤其需要探索,否则模型永远偏向已有优质客户。

普惠金融例子

如果银行只服务历史记录完整的客户,新农户和新商户永远得不到信用积累机会。适度探索可以帮助发现被传统征信遗漏的好客户。

课堂追问

探索带来的风险应由谁承担?模型、银行、客户,还是需要制度设计分担?

04

多臂老虎机 Bandit

Bandit 是强化学习的简化版本:每次选择一个动作并立即观察奖励,但不显式建模长期状态转移。

Regret(T)=Tμ∗−∑t=1TμatRegret(T)=T\mu^*-\sum_{t=1}^{T}\mu_{a_t}
  • 遗憾值衡量算法与始终选择最优动作相比损失了多少收益。
  • 金融营销、智能投顾产品推荐、线上额度策略和组合资产选择都可以用 Bandit 建模。
  • Contextual Bandit 进一步引入客户特征或市场状态,使策略能够因人、因时、因场景而变化。
怎么理解

Bandit 很适合没有复杂长期状态、但需要边做边学的金融策略选择。

普惠金融例子

对不同小微客户推送不同还款提醒方式,系统可以边观察响应率边调整策略。Contextual Bandit 会根据客户特征选择更合适的提醒方式。

课堂追问

营销场景和授信场景都能用 Bandit,但风险约束有什么不同?

05

贝尔曼方程与价值函数

贝尔曼方程把长期价值分解为当前奖励和下一状态价值,是强化学习的核心递归结构。

Vπ(s)=Eπ[rt+γVπ(st+1)∣st=s]V^{\pi}(s)=\mathbb E_{\pi}\left[r_t+\gamma V^{\pi}(s_{t+1})\mid s_t=s\right]
  • 最优价值函数满足 V∗(s)=max⁡aE[rt+γV∗(st+1)∣st=s,at=a]V^*(s)=\max_a\mathbb E[r_t+\gamma V^*(s_{t+1})\mid s_t=s,a_t=a]。
  • Q 函数 Q(s,a)Q(s,a) 表示在状态 ss 采取动作 aa 后的长期价值,适合直接比较不同动作。
  • 在组合管理中,短期收益高但增加未来回撤风险的动作,可能在长期价值上并不优。
怎么理解

贝尔曼方程的直觉是:今天的选择价值 = 今天的收益 + 未来机会的价值。

普惠金融例子

给客户一个较小额度可能当前利息收入低,但能积累还款记录,未来形成长期优质客户关系。价值函数能表达这种长期视角。

课堂追问

在普惠金融中,长期客户价值应如何衡量?只看利润是否足够?

06

深度强化学习

深度强化学习用神经网络近似价值函数或策略函数,使模型能够处理高维状态。

L(θ)=E[(r+γmax⁡a′Q(s′,a′;θ−)−Q(s,a;θ))2]L(\theta)=\mathbb E\left[(r+\gamma\max_{a\prime}Q(s\prime,a\prime;\theta^-)-Q(s,a;\theta))^2\right]
  • DQN 使用神经网络近似 Q 函数,并通过经验回放和目标网络提高训练稳定性。
  • Actor-Critic 同时学习策略和价值函数:Actor 负责选择动作,Critic 负责评价动作。
  • 金融应用必须特别注意回测偏差、交易成本、流动性约束和极端风险。模拟环境若不可信,强化学习结果也不可信。
怎么理解

深度强化学习能力强,但对环境模拟高度依赖。金融中不能只看回测曲线,要先怀疑回测是否真实。

普惠金融例子

组合管理中的强化学习策略如果没有加入交易成本和流动性限制,可能在回测中很好看,但真实交易无法执行。

课堂追问

为什么金融强化学习比游戏强化学习更难验证?

07

金融应用与边界

  • 组合管理:强化学习可以动态调整仓位,但必须纳入交易成本、风险约束和样本外回测。
  • 授信策略:可以把额度调整视为序列决策,但奖励函数不能只看放款收益,还要纳入违约、投诉和合规成本。
  • 智能投顾:可根据客户风险偏好和市场状态动态推荐资产组合,但需要可解释披露和风险适当性控制。
怎么理解

强化学习适合辅助策略优化,不适合在没有约束和监督的情况下自动做高风险金融决策。

普惠金融例子

授信策略可以用强化学习提出额度调整建议,但最终仍应受到监管规则、风险政策、人工复核和客户申诉机制约束。

课堂追问

哪些金融决策可以自动化?哪些必须保留人工审核?