学骑车不是看答案,而是不断试错
学骑车时,没有人能提前告诉你每一秒该把车把转几度。你会摔、会调整、会慢慢知道怎样保持平衡。强化学习研究的就是这种通过行动和反馈学习策略的过程。
金融决策也常常不是一次性判断。授信额度给多少、什么时候调整、如何控制风险,都需要在长期反馈中不断修正。
现在处在什么情况
下一步怎么做
这个动作带来什么后果
第五章
探索利用、长期价值与序列决策
本章介绍强化学习的基本范式、马尔可夫决策过程、多臂老虎机、UCB、贝尔曼方程、DQN、Actor-Critic 及其金融应用。
本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。
强化学习研究智能体如何在环境中通过试错学习策略,以最大化长期累计奖励。
学骑车时,没有人能提前告诉你每一秒该把车把转几度。你会摔、会调整、会慢慢知道怎样保持平衡。强化学习研究的就是这种通过行动和反馈学习策略的过程。
金融决策也常常不是一次性判断。授信额度给多少、什么时候调整、如何控制风险,都需要在长期反馈中不断修正。
现在处在什么情况
下一步怎么做
这个动作带来什么后果
你知道一家老餐馆很稳,这是利用;你偶尔尝试一家新店,这是探索。如果永远只去老店,可能错过更好的选择;如果每天都试新店,又可能踩坑。
普惠金融也有类似矛盾:如果银行只服务已有信用记录的客户,就会错过很多真实可靠但缺少记录的新客户;但如果探索太多,风险也会上升。
选择当前看起来最好的方案
给不确定但可能优秀的方案机会
在学习机会和风险成本之间权衡
强化学习关注的不是一次预测是否正确,而是一连串决策最终带来什么长期结果。
授信额度不是一次性问题。额度给高了可能短期收益高但未来违约增加;额度给低了可能客户流失。强化学习正是处理这种长期权衡。
如果奖励函数只奖励短期放款收益,会诱导模型做出什么危险行为?
MDP 是强化学习的数学框架,把动态决策问题拆成状态、动作、转移概率、奖励函数和折扣因子。
MDP 的关键是把业务流程拆成状态、动作和反馈。拆得清楚,强化学习才有意义。
在小微循环贷中,状态可以是客户最近流水、还款记录和行业景气度;动作是调高、维持或调低额度;奖励是收益减去风险成本。
金融环境真的满足马尔可夫假设吗?如果不满足,应如何补充历史信息?
探索意味着尝试不确定但可能更好的动作;利用意味着选择当前已知表现最好的动作。
探索不是乱试,而是在可控风险内保留学习机会。普惠金融尤其需要探索,否则模型永远偏向已有优质客户。
如果银行只服务历史记录完整的客户,新农户和新商户永远得不到信用积累机会。适度探索可以帮助发现被传统征信遗漏的好客户。
探索带来的风险应由谁承担?模型、银行、客户,还是需要制度设计分担?
Bandit 是强化学习的简化版本:每次选择一个动作并立即观察奖励,但不显式建模长期状态转移。
Bandit 很适合没有复杂长期状态、但需要边做边学的金融策略选择。
对不同小微客户推送不同还款提醒方式,系统可以边观察响应率边调整策略。Contextual Bandit 会根据客户特征选择更合适的提醒方式。
营销场景和授信场景都能用 Bandit,但风险约束有什么不同?
贝尔曼方程把长期价值分解为当前奖励和下一状态价值,是强化学习的核心递归结构。
贝尔曼方程的直觉是:今天的选择价值 = 今天的收益 + 未来机会的价值。
给客户一个较小额度可能当前利息收入低,但能积累还款记录,未来形成长期优质客户关系。价值函数能表达这种长期视角。
在普惠金融中,长期客户价值应如何衡量?只看利润是否足够?
深度强化学习用神经网络近似价值函数或策略函数,使模型能够处理高维状态。
深度强化学习能力强,但对环境模拟高度依赖。金融中不能只看回测曲线,要先怀疑回测是否真实。
组合管理中的强化学习策略如果没有加入交易成本和流动性限制,可能在回测中很好看,但真实交易无法执行。
为什么金融强化学习比游戏强化学习更难验证?
强化学习适合辅助策略优化,不适合在没有约束和监督的情况下自动做高风险金融决策。
授信策略可以用强化学习提出额度调整建议,但最终仍应受到监管规则、风险政策、人工复核和客户申诉机制约束。
哪些金融决策可以自动化?哪些必须保留人工审核?