ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek-Agent-Harness-2026终极指南-第5章第22节-六层架构-上下文工程:Agent的眼睛与记忆

DeepSeek-Agent-Harness-2026终极指南-第5章第22节-六层架构-上下文工程:Agent的眼睛与记忆 上下文工程Agent 的眼睛与记忆Agent 的上下文窗口就是它的内存消息历史是堆栈系统提示是BIOS。这节把上下文从玄学变成工程——它决定了 Agent 能看到多少世界、能记住多少信息也是成本第13节的核心变量。本文导航为什么上下文是 Agent 的命门一句话类比体系窗口是内存历史是堆栈上下文里到底装了什么系统提示Agent 的 BIOS上下文注入策略把最重要的信息放进去压缩时机内存满了怎么办小结下节预告第 22 节。六层架构第三层上下文引擎。前面第 21 节我们给了 Agent 双手工具系统但你有没有想过——Agent 靠什么看世界答靠上下文。模型是无状态的第 11 节讲过它的全部世界就是每次请求时塞进messages的那一串内容。你往上下文里放什么它就看见什么放不下它就看不见。所以上下文工程 决定 Agent 的眼睛能看到多远、记忆能存多少。为什么上下文是 Agent 的命门说它是命门一点不夸张三个原因它决定能力边界上下文窗口塞满了Agent 就失明失忆再强的模型也白搭。它直接决定成本token 是论钱算的第 13 节上下文越长越贵。V4.1-Flash 有 1M 上下文但你真每次都塞 1M token那账单会教你做人。它影响质量塞太多无关信息模型会淹没在噪音里反而答不好。所以上下文不是越大越好是**刚刚好的艺术**——放最重要的省下最贵的。一句话类比体系窗口是内存历史是堆栈为了更好地理解我把上下文和计算机内存对标这一整套类比第 7 节的 Karpathy 类比深化非常管用上下文要素计算机类比一句话理解例子上下文窗口内存RAM模型一次能同时看多少1M token 窗口消息历史调用栈StackAgent 一路做过的动作记录user/assistant/tool 消息系统提示BIOS/ROM一开机就固化、永远在的基础规则“你是编程助手遵守安全约束”工具结果寄存器/临时变量最近一次行动的返回值文件内容、命令输出记住这张表。后面聊上下文工程的每个技巧都是在对这张表做扩容/回收/注入操作窗口不够 → 加长窗口 or 压缩历史太杂 → 裁剪/提炼系统提示太长 → 精简定稿工具结果太肥 → 截断/摘要。上下文里到底装了什么一个典型 Agent 单次请求的messages从肚子里看大概是这样messages [ {role: system, content: 系统提示(BIOS)}, # 固化规则 {role: user, content: 用户的任务说明}, # 本轮任务 {role: assistant, content: 模型第一轮思考tool_calls}, # 历史动作 {role: tool, content: 工具1执行结果}, {role: assistant, content: 模型第二轮思考tool_calls}, {role: tool, content: 工具2执行结果}, {role: user, content: (可选)追加的指令}, ... # 一直累加到窗口上限 ]几类内容的占比讲究系统提示只占一小块但权重最高BIOS 不能乱历史动作assistanttool 交错占大头是记忆的主体工具结果最肥的部分——一个read_file可能塞进几万字文件内容是 token 黑洞用户输入相对稳定。所以上下文工程的主战场就是管理那堆越来越肥的历史动作和工具结果。后面第 11 章v0.6 上下文工程进阶会教你 token 记账、压缩、注入的完整实现这里先把装了什么、谁最肥想清楚。系统提示Agent 的 BIOS系统提示system prompt值得单独拎出来讲——它是 Agent 的人格底座 安全红线每次请求都在权重最高。它的典型内容分四块角色定义你是谁“你是 DeepPilot一个编程智能助手”工具使用规范什么时候该调工具、怎么调呼应第 21 节描述即提示词安全约束不允许做什么呼应第 20 节熔断、第 10 章权限输出格式什么时候该收尾、怎么给最终答案呼应第 18 节终止条件。一个坏系统提示长什么样写得又臭又长、自相矛盾、混杂无用的AI 圆滑话术。好系统提示是精简、自洽、可执行的操作手册。把系统提示写好的完整方法含逐段解析、版本管理、回归测试是第 53 节的主线。这里先记住它的地位它是 BIOS——想清楚再写别乱改改一次要重新评估整体行为容易引入回归。上下文注入策略把最重要的信息放进去既然上下文有限且昂贵那么**每次该放什么进去就是纯粹的取舍**。我把注入策略归纳成三层从高频到低频第一优先级每次必放 系统提示 当前任务 最后几轮历史 第二优先级按需注入 相关文件内容、搜索结果、当前工作区状态 第三优先级只在必要时 全量历史、超大文件、全量工具文档一个实用原则——上下文是一个金字塔塔尖是系统提示当前任务最重要、最精简往下逐层变厚但重要性降低塔底是最肥的历史和工具结果可压缩。注入时由顶向下取舍放不下就从塔底砍。实操上第 11 章 v0.6 会用文件树注入、git 状态注入来提高工作区感知——那是把眼睛真正打开的时刻。压缩时机内存满了怎么办上下文窗口再大也有限1M 也怕大文件反复读。当历史堆到快顶格就得分寸地压缩——但压缩的时机和代价很讲究是否循环进行剩余窗口充足?继续累积历史压缩策略滑动窗口: 丢最旧的占位符: 工具结果改摘要模型摘要: 用模型压缩模型腾出空间, 继续循环三种压缩策略各有代价策略做法代价滑动窗口只保留最近 N 轮丢失早期上下文可能忘任务占位符替换工具结果改成结果已省略可重新调用模型可能需重新调工具额外成本模型摘要让模型把历史概括成摘要每次摘要是一次额外 API 调用压缩没有银弹只有权衡滑动窗口最省最糙占位符省钱但可能触发重查模型摘要质量高但每个循环要额外花钱。真正生产级做法是按 token 水位自动切换——这部分是第 11 章 v0.6 的核心实现我会彻底展开。此刻需要你记住的是上下文满了不是灾难但要主动管理压缩的时机什么时候触发和策略用什么方式是上下文工程的核心决策。小结上下文是 Agent 的眼睛和记忆也是成本命门追求刚刚好而非越大越好。四件套类比窗口内存、历史堆栈、系统提示BIOS、工具结果寄存器所有技巧都是对它们做扩容/回收/注入。上下文里有四类内容其中工具结果最肥是 token 黑洞是压缩主战场。系统提示是 BIOS角色工具规范安全输出四块精简自洽别乱改。注入看优先级按金字塔由顶向下取舍放不下从塔底砍。压缩靠权衡滑动窗口/占位符/模型摘要三种策略按 token 水位自动切换v0.6 实现。下节预告眼睛和记忆有了但一个更大的安全命题浮出水面Agent 什么都能做凭什么相信它不乱来下一节讲权限模型——Agent 的缰绳自动放行/人工审批/直接禁止三级信任模型外加为什么最小权限是私有化部署的核心卖点。如果觉得本文对你有帮助欢迎点赞、收藏、关注三连本系列持续更新中关注不迷路~
返回列表