ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

agentic-stack 数据飞轮原理:如何把人工审核的运行记录,转化为可复用的训练语料与评估集

agentic-stack 数据飞轮原理:如何把人工审核的运行记录,转化为可复用的训练语料与评估集 agentic-stack 数据飞轮原理如何把人工审核的运行记录转化为可复用的训练语料与评估集【免费下载链接】agentic-stackOne brain, many harnesses. Portable .agent/ folder (memory skills protocols) that plugs into Claude Code, Cursor, Windsurf, OpenCode, OpenClaw, Hermes, or DIY Python — and keeps its knowledge when you switch.项目地址: https://gitcode.com/gh_mirrors/ag/agentic-stackagentic-stack 是一个可移植的.agent/大脑记忆 技能 协议可接入 Claude Code、Cursor、Windsurf、OpenCode、Codex、Hermes 等十几种智能体环境。它的数据飞轮Data Flywheel功能可以把你在这些环境中人工审核通过的运行记录一键转化为脱敏的轨迹记录、上下文卡片、评估集Eval Cases与训练语料Training-Ready JSONL——全程本地运行不训练模型、不上传数据。数据飞轮是什么一条本地的语料生产线数据飞轮并不是模型训练而是训练前的准备层preparation layer。它的核心链路只有 6 步步骤产物回答的问题1. 人工审核通过approved run这次输出我认可2. 脱敏redacted trace去掉了什么敏感信息3. 上下文卡片context card哪些流程规则可复用4. 评估用例eval case哪些行为必须持续生效5. 训练语料training JSONL未来可喂给什么数据集6. 下游模型可选SLM / adapter之后才考虑的事也就是说审核越多 → 语料越多 → 评估与记忆越准 → Agent 表现越好 → 审核成本越低这就是飞轮的由来。输入把我认可的这次运行写成 approved-runs.jsonl飞轮的起点是一个本地文件.agent/flywheel/approved-runs.jsonl每行一条已脱敏、已人工审核的运行记录。一条记录大约包含instruction当时的任务指令input_redacted/output_approved脱敏后的输入与人工认可的输出human_review审核状态accepted / edited与修改幅度redaction_status与pii_level脱敏是否通过、敏感信息等级stable_rules/failure_modes沉淀出的规则与失败模式仓库里提供了两条无真实 PII 的脱敏样例房产线索录入、SaaS 工单分诊可以直接参考格式示例说明examples/flywheel/README.md脱敏样例数据examples/flywheel/approved-runs.redacted.jsonl字段定义JSON Schemaschemas/flywheel/approved-run.schema.json一键导出把审核记录变成 5 类可复用产物准备好输入文件后只需一条命令安装到项目后位于.agent/tools/python3 .agent/tools/data_flywheel_export.py导出结果按日期写入.agent/flywheel/exports/YYYY-MM-DD/包含 5 类核心产物trace-records.jsonl脱敏轨迹供检索、评估、上下文压缩复用每条都带input_hash而非原始输入见 schemas/flywheel/trace-record.schema.jsontraining-examples.jsonl结构为 指令 上下文 输入 输出 元数据含train/validation/test切分标签是标准 SFT 语料形态见 schemas/flywheel/training-example.schema.jsoneval-cases.jsonl每条都写明expected_behavior期望行为、forbidden_behavior禁止行为与评分细则rubric天然适合做回归评估集见 schemas/flywheel/eval-case.schema.jsoncontext-cards/按域/工作流生成的紧凑规则卡Markdown JSON浓缩稳定规则、工具契约、需要人工批准的环节见 schemas/flywheel/context-card.schema.jsonflywheel-metrics.json就绪度指标总轨迹数、可训练数、脱敏通过率、上下文压缩比例见 schemas/flywheel/flywheel-metrics.schema.json 完整原理文档docs/data-flywheel.md导出逻辑的单测可参考 tests/test_data_flywheel_export.py。隐私模型默认本地优先Local-first飞轮的默认姿态对新手很友好可以逐条对照❌ 无网络调用、❌ 无遥测、❌ 不训练模型导出中不保存原始输入raw run ID 一律哈希脱敏必须通过redaction_status: passed后样本才会被标记为可训练.agent/flywheel/默认 gitignore视为私有运行时状态只有脱敏后的示例适合提交积累到多少条开始有用官方就绪度门槛文档给出了规划性阈值不是科学切割线照着积累即可10–25 条产出第一张有用的上下文卡片25–100 条建立第一套评估集观察到重复失败模式100–300 条开始测量上下文压缩与路由收益500–1500 条可做窄域小模型 / adapter 实验2000–10000 条工作流域级语料库10000 条且含负样本严肃的垂直领域语料库 好的首批候选是窄而重复的任务线索录入抽取、CRM 字段规范化、工单分类、跟进话术起草等做一个全能 Agent当法律顾问这类宽任务不适合起步。与记忆系统的关系各司其职数据飞轮不替代.agent/记忆而是补充情景记忆回答发生了什么语义记忆回答学到了什么上下文卡片回答哪些流程规则可复用评估用例回答什么必须持续有效训练样例回答什么未来可变成数据集并且它是模型无关的Gemma、Qwen、Llama、Mistral、DeepSeek 都可作为未来下游目标飞轮只负责导出干净的本地产物。快速上手三步走 安装 agentic-stack 后把样例格式复制到项目内的.agent/flywheel/approved-runs.jsonl参考 examples/flywheel/每完成一次人工认可的运行追加一行脱敏记录redaction_status必须为passed定期执行python3 .agent/tools/data_flywheel_export.py查看flywheel-metrics.json中的可训练数量与脱敏通过率决定何时升级到上下文卡片、评估集或训练语料一句话总结先审核、再脱敏、后导出。agentic-stack 数据飞轮把人工审核这件最贵的事变成了一条可持续运转的本地语料生产线。【免费下载链接】agentic-stackOne brain, many harnesses. Portable .agent/ folder (memory skills protocols) that plugs into Claude Code, Cursor, Windsurf, OpenCode, OpenClaw, Hermes, or DIY Python — and keeps its knowledge when you switch.项目地址: https://gitcode.com/gh_mirrors/ag/agentic-stack创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表