AI技术 · 2026-08-15

让 AI 长出“肌肉记忆”

Agent 经验沉淀的原理与实操:上下文窗口不是记忆,技能才是

心理学把长期记忆分为“知道什么”与“会做什么”。过去两年,行业一直在给大模型补第一套系统;而真正决定 Agent 长期可靠性的第二套系统——技能沉淀——正在成为新的工程焦点。

心理学教科书里有个经典区分:人的长期记忆分两套系统。背单词、记公式,靠的是陈述性记忆,存“是什么”;骑自行车、打字、系鞋带,靠的是程序性记忆,存“怎么做”。两套系统的衰退曲线完全不同——三年不碰自行车,跨上去照样能骑;三个月不背单词,词汇量肉眼可见地缩水。

过去两年,整个行业都在给大模型补第一套系统。RAG、向量数据库、知识库、百万级上下文,让 AI 能“查到”几乎任何事实。但第二套系统始终是块短板:你花一下午教会 AI 一整套流程——部署的先后顺序、报错的排查路径、周报的格式约定——换个会话,它忘得干干净净,一切从头再来。

真正让人疲惫的从来不是 AI 不够聪明,而是聪明无法累积。这篇文章讲清楚三件事:为什么长上下文救不了失忆;“技能”在工程上长什么样;以及怎么把自己的经验灌进去。

一、上下文窗口不是记忆

先纠正一个常见误解:Agent 的健忘,不是因为窗口不够长。大语言模型本质上是一台无状态(stateless)的推理引擎——每次调用都从零开始,会话内有效,会话外归零。窗口从 128K 扩到 1M,改变的只是“这一次能看多少”,而不是“下一次还记得多少”。

有人退而求其次:把历史对话全存下来,下次全量塞回去。这条路在企业实践里同样走不通,原因有三:

原始对话噪声太大

一场三十轮的排障对话,对下次任务有用的信息可能只有三条,其余是澄清、歧途和重复。全量灌入,浪费预算不说,还稀释了真正重要的信号。

历史不能泛化

用户在某次对话里说过什么,不等于他一贯的偏好。记忆需要的是从一次性交流里蒸馏出稳定的东西,而不是囤积原文。

历史没有治理

哪些该长期保留、哪些该到期清除、哪些根本不该落盘,聊天记录本身回答不了这些问题。

结论

记忆不是存储,是一套围绕“存什么、怎么检索、何时更新、何时遗忘”的管理系统。

二、记忆的三层抽屉

设计得当的记忆系统长什么样?认知心理学早在 1972 年就给出了分类法:情景记忆(episodic)、语义记忆(semantic)、程序性记忆(procedural)。2023 年普林斯顿团队的 CoALA 框架(Cognitive Architectures for Language Agents)把这套分类正式搬进了语言智能体的架构设计,如今主流编程 Agent 的实现里都能看到它的影子。

长期记忆的三层抽屉:情景记忆、语义记忆、程序性记忆及其工程对应物
图 1 · 记忆的三层抽屉与 Agent 的工程对应物。程序性记忆(右侧)是最常被忽视的一层,它决定的是 AI“怎么做”而非“说什么”。
记忆类型存什么工程对应物典型问题
情景记忆经历过什么(带时间戳的事件)会话日志、自动摘要噪声大、会过期
语义记忆长期成立的事实与偏好配置文件、知识库、RAG需要核验与保鲜
程序性记忆遇到某类任务该怎么做技能目录 skills/最缺建设,最值得投入

三只抽屉里,程序性记忆常年是最被忽视的那只。业内一个很准的观察是:语义记忆决定答案说了什么,程序性记忆决定动作怎么做。检索错一条事实,答案顶多偏一点;检索对一个流程,AI 会照着验证过的路径执行,而不是每次即兴发挥一条新的。这也是为什么记忆架构做得好的团队,几乎都把“可复用的流程”单独拎出来管理——它值得一套独立的存储、检索和更新规则,混在事实库里只会被处理得面目模糊。

三、技能文件:程序性记忆的工程形态

2025 年 10 月,Anthropic 推出 Agent Skills,资深开发者 Simon Willison 评价其影响力可能超过 MCP。抛开产品光环,核心设计其实朴素:一个技能就是一个文件夹,里面放一份说明文件(SKILL.md),外加可选的脚本和参考资料。

真正精妙的是加载方式,官方称为“渐进式披露”(progressive disclosure):

渐进式披露三层加载机制:元数据目录、技能全文、参考文件与脚本
图 2 · 渐进式披露的三层按需加载。装五十个技能,常驻的只有一份百 token 级的“通讯录”。

这套机制顺带回答了一个老问题:为什么不该把所有规范都塞进系统提示词?静态配置是“永远在场”的,不管任务用不用得上,token 都得一直付;技能是“按需到场”的,还附带可执行脚本——确定性高的活(重命名、格式转换、批量处理)交给脚本跑,比让模型逐字生成代码又快又稳。

四、经验变技能的两条路

有了容器,下一个问题是:内容从哪来?目前实践中有两条路线。蒸馏式:你提供原材料——一叠接口文档、一个项目目录、一段 URL,或者干脆就是刚刚跑通的那套流程——由 Agent 自己归纳总结,生成技能初稿;也可以“录制”:你当着 AI 的面把流程做一遍,它看着记下来。结构化编写:你已经有一份成熟 SOP,直接按规范写成技能:名称、触发条件、步骤、边界、示例,一次到位。

蒸馏式结构化编写
你提供材料(文档 / 目录 / 刚跑通的流程)成型的规范设计
控制感弱,偏自动归纳强,逐步精确定义
适合经验还散落各处,没整理过方法已定型,要严格执行
风险学得太泛、重点跑偏设计含糊,错误被固化

生产环境里真正好用的打法是两条路线接力:先用蒸馏从真实材料里长出初稿,再用结构化方式精修触发条件和步骤边界。先让经验落袋,再打磨成器。

有个细节容易被忽略:技能的“激活描述”重要性不亚于技能本身。模型是靠描述来判断该不该触发技能的——描述写得含糊,或者两个技能描述互相重叠,要么永远触发不了,要么触发错对象。花在“什么时候用、什么时候不用、用完达到什么效果”这三句话上的工夫,回报率极高。

五、搬进你自己的工作流

上面偏工程。但技能这件事,价值最大的场景未必在写代码,而在一切“重复出现、有正确做法、依赖个人经验”的工作里。以高校里的科研与教学为例,至少有五件事值得立刻技能化:

  1. 论文复现流程

    从数据下载、预处理口径、模型超参到结果图表,把复现一篇论文踩过的坑按顺序记下来,下次复现同类论文直接调用。

  2. 数据库取数的固定口径

    CSMAR、Wind 各字段的含义差异和常见坑——股票代码前后缀、复权方式、行业分类版本——写成技能后,AI 每次取数都按你的口径来,而不是现猜。

  3. 期刊投稿材料准备

    不同期刊的格式要求、参考文献样式、投稿系统操作步骤,整理成技能,改投时不再逐项核对。

  4. 课件与讲义的学期更新

    “把最新数据更新进课件、保持案例时效性、检查与上一版差异”这套动作每学期都做,最值得固化。

  5. 实验室交接手册

    新研究生入组的环境配置、组会汇报格式、代码规范,与其每次口头讲,不如沉淀成一组技能——这几乎等于把实验室的隐性知识变成了可传承的资产。

判断一件事值不值得做成技能,标准很简单:它是否会再次发生,且第二次发生时你希望它自动按上次的正确做法执行。是,就值得;只发生一次的,做完就扔。

六、四个坑

技能不是知识库

只是存放资料,笔记软件和 Wiki 更合适。技能存的是“以后还要照着做”的流程,混着放的结果是两头都做不好。

宁小勿大

一个技能覆盖“用 Python 清洗 A 股日线数据”,远好过覆盖“所有数据处理”。技能太大,触发就模糊;规则太细,维护就困难。聚焦的技能才可靠

技能会过期

流程依赖的环境在变:接口改版、政策更新、工具迁移。一份过期的流程比没有流程更危险——AI 会一丝不苟地执行错误。技能目录应纳入版本控制,定期回溯。

敏感环节保留人工审批

涉及资金、生产环境、对外沟通、删除操作的技能,不要关掉审批开关。技能影响的是未来所有相关行为,不能当成普通回答看完就算。

写在最后

评价一个 AI 助手,短期看模型,长期看积累。模型决定单次任务的上限,技能决定经验能否复利——这一次省下的不是几句提示词,而是以后永远不用再把同一套流程讲第二遍。

上手不需要仪式感。就从最近刚跑通的一件事开始:一次数据清洗、一次投稿、一次环境配置。让 AI 把它记下来。技能库这种东西,是从第一份技能开始复利的。

参考资料

  1. Anthropic 工程博客:Equipping agents for the real world with Agent Skills — anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills
  2. Sumers et al., Cognitive Architectures for Language Agents (CoALA) — arxiv.org/abs/2309.02427
  3. Mem0: Procedural Memory Explained — mem0.ai/blog/procedural-memory-explained-teaching-ai-agents-how-to-perform-tasks