ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Agent Memory 实践指南:Agent 到底该记住什么,放在哪里,什么时候想起来

Agent Memory 实践指南:Agent 到底该记住什么,放在哪里,什么时候想起来 Agent 记得越多为什么工作不一定更稳本文从 Memory 的完整链路、六类内容、四种读取方式和九类载体出发对照 Codex、Claude Code、Hermes、OpenClaw 的实际机制给出重度用户分六阶段建立可恢复、可搜索、可审阅、可执行 Memory 系统的方法。Agent 用久后常有一个反直觉的问题它明明记住更多干活却没有更稳。它记得你喜欢简短回答却忘了项目为什么采用某个架构它保存了上周讨论却在这次任务里找错版本AGENTS.md、CLAUDE.md、MEMORY.md 越写越长关键规则反而被淹没。问题不在于 Agent 有没有记忆而在于不同东西都被扔进同一个“记住”。当前任务、历史记录、项目知识、重复流程、个人偏好和安全规则保存方式、读取时机和约束强度完全不同。把这几层分清Memory 才会从聊天记录变成能长期工作的系统。这篇指南主要围绕三个更贴近实践的问题展开一条信息应该放在哪里什么时候需要进入上下文Agent 想起以后它只是参考还是一条必须执行的约束01Memory 不是一个文件而是一条影响行动的链很多人把 Memory 理解成“把过去保存下来”。这只做了第一步。完整过程至少有十个环节TEXT输入 → 提取与写入 → 存储 → 建索引 → 检索与路由 → 筛选 → 组装进当前上下文 → 与当前证据和指令一起判断 → 行动 → 根据结果更新、压缩、过期或删除图 1Memory 从输入到维护的完整行动链任何一环出错最后都可能表现成“Agent 记性不好”。可问题完全不同。它可能根本没写下关键决定也可能写下了却搜不到还可能搜到了旧版本或者找对了内容却把过去的偏好当成当前命令。最危险的一种情况是它把外部网页或邮件里的话写进长期记忆几天后再把那句话当成你的授权。所以Memory 的质量不能只看“召回率”。2026 年的 MemoryArena 把记忆放进多会话、相互依赖的任务里检查过去经验是否真的改善后续行动MemSyco-Bench 更进一步专门观察 Agent 什么时候应该受 Memory 影响、怎样使用已经召回的 Memory。两组研究指向同一个现实找到了不等于用对了。先把五个常被混用的词拆开名称大白话问题常见载体Context模型这一刻看到了什么当前 prompt、消息、tool output、已打开文件Memory哪些过去状态会被保存并在以后重新引入自动记忆、MEMORY.md、daily notes、历史索引Knowledge base有哪些资料可以在需要时查询docs、wiki、数据库、文件库Instruction / policyAgent 应该怎样做AGENTS.md、CLAUDE.md、Rules、configExecution state这项任务做到哪接下来干什么Goal、plan、checkpoint、decision log↔ 左右滑动查看完整表格它们的关系并不复杂。Memory 决定哪些过去状态有机会重新进入 Context知识库提供可查的材料instruction 指导行为execution state 保存正在变化的任务现场。至于高风险动作能不能执行要交给权限、Hook、sandbox、测试或审批。长上下文没有取消这些分工。它只是让更多内容有机会同时出现。内容越多过时事实、重复说明和相互冲突的规则也越容易挤进来。Anthropic 的 context engineering 实践因此强调紧凑、高信号的 Context并保留文件路径、查询或链接让 Agent 在需要时再取材料。02先分清六种“要记住的东西”文件名会变内容类型更稳定。面对任何一条信息先判断它属于下面哪一类。图 2六种 Memory 内容及其不同处理方式第一类当前任务状态它回答的是目标是什么做到哪一步已经作过哪些决定哪些路走不通下一步是什么。这类 Memory 的首要任务是恢复。一次迁移做到一半一篇研究跨了三天一个排障任务经过两次上下文压缩只要新会话能重新进入正确分支Memory 就发挥了作用。2026 年 6 月的 MAGE 论文把这个问题单独拿出来。作者认为只按语义相似度整理历史会拆散执行依赖也容易把成功路径和错误 trace 混在一起。MAGE 用层级状态树和当前 active path 管理任务并设计 Grow、Compress、Maintain、Revise 四类操作。论文在 MemoryArena 的实验中报告任务成功率平均提高 7.8–20.4 个百分点同时 Token 消耗下降 55.1%。这组结果对实践的启发很直接长任务首先需要可恢复的状态结构。第二类过去经历它回答的是以前发生过什么当时做了什么结果怎样。聊天记录、daily notes、工具调用、失败日志都属于这一层。它们是证据适合搜索不适合全部塞进每次启动的 prompt。要查“上周为什么放弃方案 B”就去搜当时的讨论和日志平时不必把上周所有对话都带在身上。第三类稳定知识它回答的是项目或领域里目前确认什么是真的。架构说明、API 约定、数据口径、研究结论、决策记录都可以进入这一层。与经历不同知识需要去重、核验、注明来源和更新时间。一次对话里出现的说法还只是候选多个证据确认、冲突得到处理以后才适合成为“当前可信事实”。第四类可重复流程它回答的是这类事情以后应该怎样做完并验收。如果一套步骤反复成功就不要只留一句“记住以后这么做”。把适用条件、输入、工具、步骤、输出、验收标准和失败回退写成 Skill、runbook 或脚本。这样的 procedural memory 能被调用也能被检查。第五类长期偏好它回答的是这个用户或团队通常喜欢怎样合作。比如默认使用某个技术栈、回答偏短、提交前先跑某组检查。一次性选择不该立刻升级成长期偏好。当前任务的明确要求也始终高于旧偏好。偏好适合小而稳、可查看、可修改、可撤销。第六类权限与安全边界它回答的是哪些动作需要批准什么数据不能碰什么限制必须执行。这一类可以被记录却不能只靠“记得”。Claude Code 官方明确把 CLAUDE.md 和 auto memory 视为 Context要阻断某类工具调用需要 PreToolUse Hook。OpenClaw 文档也明确写道Memory 可以保存审批背景但不执行 policy。生产发布、凭证使用、数据删除、外部发送之类的限制要落到 Hook、approval、sandbox、CI、测试或定时任务。六类内容之间可以流动但不能随便升级TEXT当前对话与工具结果 → checkpoint当前任务必须恢复的状态 → episodic log保留发生过什么 → verified knowledge核验、去重、带来源的事实 → Skill / runbook重复成功并能验收的流程偏好走另一条路先区分本次选择、项目约定和个人长期偏好。只有最后一类适合跨项目自动注入。Policy 更不能从经验自动升级。一次跳过审批没有出事不会因此变成以后都可以跳过审批。03决定效果的还有两层什么时候读有多大权力同一条内容放对了类型还要放对访问路径。访问方式适合什么典型动作每次常驻少量身份、根规则、项目地图启动时加载 AGENTS.md、CLAUDE.md、精简 MEMORY.md任务激活某目录规则、当前 Goal、专项说明进入作用域或开始任务时加载按需搜索历史会话、daily notes、知识库、topic files先检索再读取命中的原文冷归档旧项目、原始日志、低频证据需要审计或追溯时再打开↔ 左右滑动查看完整表格常驻并不天然更可靠。常驻内容每轮都占 Context也会持续放大陈旧和冲突。OpenAI 的 Harness Engineering 实践把短 AGENTS.md 当成目录把结构化 docs 当成 system of recordAnthropic 则建议保存轻量的路径和查询让 Agent just-in-time 取资料。共同原则很清楚地图常驻正文按需。另一层是影响强度参考信息历史记录、知识库检索结果、自动偏好必须与当前事实一起判断。共享指令AGENTS.md、CLAUDE.md、Rules应该遵循但仍依赖模型正确理解。机械约束Hook、approval、sandbox、test、CI在固定时点执行、阻断或验收。Memory 越接近行动越需要来源、作用域、时间和权限。外部网页、邮件、issue 和 tool output 默认只是 evidence不能因为被 Agent 读到就自动取得长期指令权。2026 年 7 月的 MemGhost / WhisperBench 研究的正是这条攻击链外部内容先进入 durable state再影响未来会话中的行为。04九类载体究竟各自放什么下面这张表直接回答五个问题每类载体适合放什么、不该放什么、何时读取、谁维护以及能否强制。载体最适合放不要放何时读取谁维护能否强制AGENTS.md项目地图、共享约定、关键命令、完成标准全部架构文档、长教程、原始历史启动或进入目录团队版本化维护否属于 ContextCLAUDE.mdClaude Code 每次要知道的项目入口与规则多步骤流程、局部文件规则、自动发现事实启动或进入作用域团队或用户维护否属于 ContextRules某目录、文件类型、主题的局部约束全局项目地图、很长的操作流程命中 scope 时对应模块 owner通常不能Skills重复步骤、工具组合、验收、失败回退一条偏好、当前进度任务需要时流程 owner可执行结果仍需验证Hooks固定时点必须运行、阻断或检查的动作背景知识和解释性文字生命周期事件发生时平台 / 仓库维护者可以取决于配置Goals / plans / checkpoints当前目标、约束、进度、决定、开放问题、下一步跨项目偏好、原始资料库当前任务持续读取和更新当前执行者约束状态不等于权限Daily notes / session history当天事件、观察、失败、证据线索每次都要读的根规则恢复或搜索时Agent 记录人可审阅否知识库 / docs / wiki稳定知识、架构、来源、决策记录全量塞进启动 prompt需要时检索领域 owner 与团队否自动记忆 / profile少量稳定偏好、重复纠正、环境事实一次选择、未核验推断、硬权限启动注入或自动召回Agent 提议人可审阅否↔ 左右滑动查看完整表格这张表背后只有四个判断它是什么类型作用域多大什么时候需要出现如果忘了后果只是麻烦还是会造成不可接受的动作例如“这个仓库使用 pnpm”可以放根指令“修改支付模块后要执行哪八步”更适合 Skill“没有人工批准不得向生产发布”必须有 Hook 或 approval“上周为什么暂缓支付重构”应该去 decision log 或 session history 搜“用户偏好先给结论”才适合自动记忆。05Codex、Claude Code、Hermes、OpenClaw 各自怎样组织 Memory四个产品用的文件名不同解决的仍是同几类问题。不要只看它们有没有一个叫 MEMORY.md 的文件要看启动上下文、当前状态、历史检索、流程能力、自动写入和硬控制怎样组合。图 3Codex、Claude Code、Hermes 与 OpenClaw 的 Memory 分工CodexAGENTS.md 与 repo docs 管团队共识local memories 管辅助召回Codex 的AGENTS.md可以放在全局、仓库和子目录层级更具体位置的说明作用于更具体的范围。它适合做短地图项目入口、关键命令、共享规范、验证方法以及应该继续读哪些 docs。OpenAI 的 Harness Engineering 实践把架构文档、execution plan、progress 和 decision log 放进版本库让代码与决策一起变化。2026 年 6 月的 Codex-maxxing for long-running work 也强调 durable thread、daily notes、开放问题和可验证目标目标要写结果、约束和验证方式不能只留一句模糊愿望。Codex Skills 负责重复 workflowGoals、plan、checkpoint 负责当前任务Hooks、sandbox、approval 和 tests 负责硬约束。Local memories 与 ChatGPT Memory 分离默认关闭保存在~/.codex/memories/。官方把它当作 generated state而不是团队主要控制面。必须让所有协作者知道的内容仍应留在 AGENTS.md 和 checked-in docs。重度使用建议先把 repo 内的执行计划和决策记录做扎实再考虑开启 local memories。个人召回可以自动化团队事实必须可 diff、可 review、可回滚。Claude CodeCLAUDE.md、Rules、Skills、Hooks 各有自己的作用域Claude Code 每次 session 从 fresh Context 开始。跨会话主要依靠人写的CLAUDE.md与 Claude 维护的 auto memory。官方建议把 CLAUDE.md 控制在 200 行以内只放每次都需要知道、且无法直接从代码推断的内容。某类文件或目录的局部要求放进.claude/rules/多步骤 procedure 做成 Skill固定时点必须执行或阻断的要求做成 Hook。Auto memory 的MEMORY.md前 200 行或 25KB 会在启动时加载topic files 按需读取。/memory可以查看实际加载了什么开关 auto memory并直接浏览或修改 plain Markdown。重度使用建议相同错误第二次发生再判断要不要写 CLAUDE.md重复流程进入 Skill局部要求进入 path-scoped Rule高风险动作进入 PreToolUse Hook。Auto memory 只收稳定偏好与反复纠正定期用/memory审阅。Hermes小容量常驻 Memory、全历史搜索与写入审批Hermes 把常驻 Memory 做得很小MEMORY.md上限 2,200 charactersUSER.md上限 1,375 characters。会话启动时注入 frozen snapshot本次会话新写的内容要到下次会话才会出现在 prompt 中。具体旧对话不必挤进这两份文件。session_search使用 SQLite FTS5 搜索历史里的真实消息。项目上下文按.hermes.md → AGENTS.md → CLAUDE.md → .cursorrulesfirst match子目录可以通过 AGENTS.md progressive discovery 添加更具体说明。Skills 继续承担 procedure。Hermes 还有一个很适合重度用户的控制write_approval: true可以先 staged memory 或 Skill 写入再由人 approve 或 reject。重度使用建议让 MEMORY.md 只保留环境与高价值经验USER.md 只保留稳定偏好具体往事交给session_search。先开启写入审批观察哪些内容经常被提议、哪些提议其实只是一次性选择。OpenClawdaily notes、长期 Memory、知识层与主动召回分开OpenClaw 的 Memory 以 workspace 中的 plain Markdown 为基础。MEMORY.md保存整理后的长期事实、偏好与决定memory/YYYY-MM-DD.md保存当天观察、工作状态和会话摘要。前者适合少量启动内容后者进入索引按需搜索。默认memory-core使用 SQLite 的 keyword vector hybrid search并通过memory_search与memory_get找回材料。memory-wiki负责 provenance-rich 的知识层保存 claims、evidence、contradiction 和 freshness它不替代日常 active recall。Compaction 前的 memory flush 可以先留下关键状态。Dreaming 是默认关闭的后台 consolidation可把短期候选提升到长期 Memory并把过程写进DREAMS.md供审阅。Active memory 同样是 opt-in只用于符合条件的持续交互会话one-shot、heartbeat 和内部 helper 等路径不会自动得到同样的主动召回。重度使用建议daily notes 保留过程MEMORY.md 只留整理后的长期项memory-wiki 放带来源的稳定知识。对会影响行动的条目补上when / expiry / authority / avoidapproval、sandbox 和 scheduled task 继续承担执行控制。06长期使用 Agent怎样分六个阶段用好 MemoryMemory 系统最容易失败的方式是第一天就开始搭一个庞大的自动知识库。更稳的顺序是先解决最昂贵、也最容易验证的问题。图 4重度 Agent 用户掌握 Memory 的六阶段顺序第一阶段让长任务可恢复为每个长任务维护七项goal / constraints / done criteria / current state / decisions / open loops / next step。重大分叉、上下文压缩、暂停和交接前写 checkpoint。失败分支也要留但明确标记invalid或superseded。恢复测试很简单开一个新会话只靠 checkpoint 和仓库现状能否准确说出下一步并解释为什么第二阶段把根指令缩成地图审查根 AGENTS.md 或 CLAUDE.md。只保留每次必须知道的规则、入口、关键命令、边界和验证方法。架构说明、长教程、研究材料移进版本化 docs根文件写路径和“何时读取”。能从代码、配置或 package scripts 直接读出的信息不必再复制一遍。重复副本越多版本冲突越难处理。第三阶段把 Rules、Skills、Hooks 分开局部范围的要求进入 nested AGENTS 或 path-scoped Rules。重复的多步骤工作进入 Skill并写清输入、输出、验收与失败回退。必须阻断的动作进入 Hook、approval、sandbox、test、CI 或 scheduled task。这一阶段的验收标准不是“文档更齐了”而是三类问题各归其位提醒归提醒流程归流程权限归权限。第四阶段让历史和知识可搜索原始会话与 daily notes 留在 episodic layer。检索最好同时支持精确关键词与语义相似ID、错误码、人名、日期靠关键词更可靠概念问题再用 semantic retrieval。稳定知识进入知识库前至少补source / observed_at / scope / confidence / supersedes / expires_at。检索命中以后还要与当前用户指令、最新代码和现行文档核对。旧 Memory 没有资格自动压过新证据。第五阶段谨慎打开自动记忆优先选择可以 review、approval、diff 和 rollback 的写入方式。只有跨至少两个任务重复出现、能够验证、未来仍有价值的内容才考虑进入长期 Memory。外部网页、邮件、issue、聊天转发和 tool output 只作为证据候选。它们可以推动调查不能直接把自己升级为持久指令。第六阶段固定做 Memory gardening 与回归每月或每个里程碑检查一次常驻上下文内容是否仍准确能否缩短是否应移到按需文件。删除陈旧项合并重复项处理冲突把低频信息降级到知识库或归档。然后用自己的高频任务做回归换会话能否恢复目标能否搜到正确资料旧规则会不会压过新规则硬限制是否真的阻断自动记忆是否可见、可改、可删除好的 Memory 不靠只增不减维持。它要能把经历提升为知识把重复成功固化为流程也要能让旧事实过期让错误经验退出。07判断一条信息该放哪只问四句好用的 Agent不必读完历史。任务状态放进 Goal、plan 或 checkpoint团队共识放进 AGENTS.md、CLAUDE.md 和 Rules重复流程做成 Skill大块资料留在知识库按需搜索稳定偏好才交给自动记忆必须执行的限制落到 Hook、approval、sandbox 和测试。下次想让 Agent“记住”一件事先问四句这是当前状态还是长期事实每次必看还是需要时搜索它只是提醒还是硬规则什么时候应该更新或删除这四句答清楚Memory 才开始真正有用。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表