原始对话噪声太大
一场三十轮的排障对话,对下次任务有用的信息可能只有三条,其余是澄清、歧途和重复。全量灌入,浪费预算不说,还稀释了真正重要的信号。
AI技术 · 2026-08-15
心理学把长期记忆分为“知道什么”与“会做什么”。过去两年,行业一直在给大模型补第一套系统;而真正决定 Agent 长期可靠性的第二套系统——技能沉淀——正在成为新的工程焦点。
心理学教科书里有个经典区分:人的长期记忆分两套系统。背单词、记公式,靠的是陈述性记忆,存“是什么”;骑自行车、打字、系鞋带,靠的是程序性记忆,存“怎么做”。两套系统的衰退曲线完全不同——三年不碰自行车,跨上去照样能骑;三个月不背单词,词汇量肉眼可见地缩水。
过去两年,整个行业都在给大模型补第一套系统。RAG、向量数据库、知识库、百万级上下文,让 AI 能“查到”几乎任何事实。但第二套系统始终是块短板:你花一下午教会 AI 一整套流程——部署的先后顺序、报错的排查路径、周报的格式约定——换个会话,它忘得干干净净,一切从头再来。
真正让人疲惫的从来不是 AI 不够聪明,而是聪明无法累积。这篇文章讲清楚三件事:为什么长上下文救不了失忆;“技能”在工程上长什么样;以及怎么把自己的经验灌进去。
先纠正一个常见误解:Agent 的健忘,不是因为窗口不够长。大语言模型本质上是一台无状态(stateless)的推理引擎——每次调用都从零开始,会话内有效,会话外归零。窗口从 128K 扩到 1M,改变的只是“这一次能看多少”,而不是“下一次还记得多少”。
有人退而求其次:把历史对话全存下来,下次全量塞回去。这条路在企业实践里同样走不通,原因有三:
一场三十轮的排障对话,对下次任务有用的信息可能只有三条,其余是澄清、歧途和重复。全量灌入,浪费预算不说,还稀释了真正重要的信号。
用户在某次对话里说过什么,不等于他一贯的偏好。记忆需要的是从一次性交流里蒸馏出稳定的东西,而不是囤积原文。
哪些该长期保留、哪些该到期清除、哪些根本不该落盘,聊天记录本身回答不了这些问题。
记忆不是存储,是一套围绕“存什么、怎么检索、何时更新、何时遗忘”的管理系统。
设计得当的记忆系统长什么样?认知心理学早在 1972 年就给出了分类法:情景记忆(episodic)、语义记忆(semantic)、程序性记忆(procedural)。2023 年普林斯顿团队的 CoALA 框架(Cognitive Architectures for Language Agents)把这套分类正式搬进了语言智能体的架构设计,如今主流编程 Agent 的实现里都能看到它的影子。
| 记忆类型 | 存什么 | 工程对应物 | 典型问题 |
|---|---|---|---|
| 情景记忆 | 经历过什么(带时间戳的事件) | 会话日志、自动摘要 | 噪声大、会过期 |
| 语义记忆 | 长期成立的事实与偏好 | 配置文件、知识库、RAG | 需要核验与保鲜 |
| 程序性记忆 | 遇到某类任务该怎么做 | 技能目录 skills/ | 最缺建设,最值得投入 |
三只抽屉里,程序性记忆常年是最被忽视的那只。业内一个很准的观察是:语义记忆决定答案说了什么,程序性记忆决定动作怎么做。检索错一条事实,答案顶多偏一点;检索对一个流程,AI 会照着验证过的路径执行,而不是每次即兴发挥一条新的。这也是为什么记忆架构做得好的团队,几乎都把“可复用的流程”单独拎出来管理——它值得一套独立的存储、检索和更新规则,混在事实库里只会被处理得面目模糊。
2025 年 10 月,Anthropic 推出 Agent Skills,资深开发者 Simon Willison 评价其影响力可能超过 MCP。抛开产品光环,核心设计其实朴素:一个技能就是一个文件夹,里面放一份说明文件(SKILL.md),外加可选的脚本和参考资料。
真正精妙的是加载方式,官方称为“渐进式披露”(progressive disclosure):
这套机制顺带回答了一个老问题:为什么不该把所有规范都塞进系统提示词?静态配置是“永远在场”的,不管任务用不用得上,token 都得一直付;技能是“按需到场”的,还附带可执行脚本——确定性高的活(重命名、格式转换、批量处理)交给脚本跑,比让模型逐字生成代码又快又稳。
有了容器,下一个问题是:内容从哪来?目前实践中有两条路线。蒸馏式:你提供原材料——一叠接口文档、一个项目目录、一段 URL,或者干脆就是刚刚跑通的那套流程——由 Agent 自己归纳总结,生成技能初稿;也可以“录制”:你当着 AI 的面把流程做一遍,它看着记下来。结构化编写:你已经有一份成熟 SOP,直接按规范写成技能:名称、触发条件、步骤、边界、示例,一次到位。
| 蒸馏式 | 结构化编写 | |
|---|---|---|
| 你提供 | 材料(文档 / 目录 / 刚跑通的流程) | 成型的规范设计 |
| 控制感 | 弱,偏自动归纳 | 强,逐步精确定义 |
| 适合 | 经验还散落各处,没整理过 | 方法已定型,要严格执行 |
| 风险 | 学得太泛、重点跑偏 | 设计含糊,错误被固化 |
生产环境里真正好用的打法是两条路线接力:先用蒸馏从真实材料里长出初稿,再用结构化方式精修触发条件和步骤边界。先让经验落袋,再打磨成器。
有个细节容易被忽略:技能的“激活描述”重要性不亚于技能本身。模型是靠描述来判断该不该触发技能的——描述写得含糊,或者两个技能描述互相重叠,要么永远触发不了,要么触发错对象。花在“什么时候用、什么时候不用、用完达到什么效果”这三句话上的工夫,回报率极高。
上面偏工程。但技能这件事,价值最大的场景未必在写代码,而在一切“重复出现、有正确做法、依赖个人经验”的工作里。以高校里的科研与教学为例,至少有五件事值得立刻技能化:
从数据下载、预处理口径、模型超参到结果图表,把复现一篇论文踩过的坑按顺序记下来,下次复现同类论文直接调用。
CSMAR、Wind 各字段的含义差异和常见坑——股票代码前后缀、复权方式、行业分类版本——写成技能后,AI 每次取数都按你的口径来,而不是现猜。
不同期刊的格式要求、参考文献样式、投稿系统操作步骤,整理成技能,改投时不再逐项核对。
“把最新数据更新进课件、保持案例时效性、检查与上一版差异”这套动作每学期都做,最值得固化。
新研究生入组的环境配置、组会汇报格式、代码规范,与其每次口头讲,不如沉淀成一组技能——这几乎等于把实验室的隐性知识变成了可传承的资产。
判断一件事值不值得做成技能,标准很简单:它是否会再次发生,且第二次发生时你希望它自动按上次的正确做法执行。是,就值得;只发生一次的,做完就扔。
只是存放资料,笔记软件和 Wiki 更合适。技能存的是“以后还要照着做”的流程,混着放的结果是两头都做不好。
一个技能覆盖“用 Python 清洗 A 股日线数据”,远好过覆盖“所有数据处理”。技能太大,触发就模糊;规则太细,维护就困难。聚焦的技能才可靠。
流程依赖的环境在变:接口改版、政策更新、工具迁移。一份过期的流程比没有流程更危险——AI 会一丝不苟地执行错误。技能目录应纳入版本控制,定期回溯。
涉及资金、生产环境、对外沟通、删除操作的技能,不要关掉审批开关。技能影响的是未来所有相关行为,不能当成普通回答看完就算。
评价一个 AI 助手,短期看模型,长期看积累。模型决定单次任务的上限,技能决定经验能否复利——这一次省下的不是几句提示词,而是以后永远不用再把同一套流程讲第二遍。
上手不需要仪式感。就从最近刚跑通的一件事开始:一次数据清洗、一次投稿、一次环境配置。让 AI 把它记下来。技能库这种东西,是从第一份技能开始复利的。