
dotnet/skills Token用量管理揭秘eng/dashboard 分析工具链深度解析【免费下载链接】skillsRepository for skills to assist AI coding agents with .NET and C#项目地址: https://gitcode.com/GitHub_Trending/skills17/skillsdotnet/skills 是 .NET 团队维护的AI 编程代理技能库为 Copilot、Codex 等编码代理提供 C# / .NET 领域技能。由于每次代理运行都要消耗 Token仓库在 eng/dashboard/ 目录下搭建了一套完整的Token 用量管理与技能价值分析工具链它统计每次评测的输入/输出/缓存 Token对比带技能 vs 不带技能的成本差异并自动生成可视化看板与 PR 评测报告帮助新手也能看懂这个技能到底省了多少 Token、值不值得装。为什么 AI 技能需要 Token 用量管理一个技能SKILL.md本质上是一段给 AI 看的说明书。它被加载后好的技能让代理少走弯路用更少 Token 更快完成任务差/噪声技能白白占用上下文甚至拖慢回答。所以仓库的评测体系核心问题不是分数高不高而是加载技能后Token 消耗和耗时真的降了吗eng/vally-adapter/README.md 中明确写道分数只用于诊断不作为改进门槛——真正的门槛是带技能组相对基线组的可信改进。上图就是评测流水线在 PR 上自动留下的 Skill Evaluation Results 评论每个技能的偏好差、95% 置信区间、胜负场次和质量分一目了然。工具链全景eng/dashboard 里的 8 个关键文件 文件角色一句话说明dashboard.html看板入口单页应用引入 Chart.js承载所有标签页dashboard.js调度中枢生成每个插件 Skill Value Token Usage标签页按需懒加载 JSONskill-value.js价值计算回答装了这个技能Token 少多少、时间省多少token-usage.js用量统计汇总 Agent/Judge Token、缓存命中、按天/按插件出图generate-benchmark-data.ps1数据生产把评测产物 results.json 转成看板 JSON并维护数据保留窗口generate-token-data.ps1开发辅助生成 14 天逼真的假 Token 数据用于本地调试看板dashboard-freshness.js数据保鲜判断评测证据是否落后于当前部署版本stale/currentbuild-replay-sessions.ps1 / purge-replay-sessions.ps1会话回放把评测会话日志整理成可回放格式并按天数清理旧会话这套目录与 plugins/ 下的技能一一对应每个插件如 dotnet-msbuild、dotnet-test都有一条独立的评测与成本曲线。Token 用量看板4 张总览卡片怎么读 打开看板后token-usage.js 会从data/token-usage.json拉取数据先渲染一排汇总卡片Agent Tokens—— 干活的编码代理消耗的 Token 总量Judge Tokens—— 负责当裁判给结果打分的模型消耗卡片会显示它占总量的百分比Tokens In / Out—— 输入与输出 Token 占比输入通常是大头Cache Read—— 缓存读命中量并直接给出缓存命中率输入 Token 中有多少命中了提示缓存Scheduled vs PR—— 定时任务跑的成本和 PR 触发评测的成本分开统计。 新手看重点缓存命中率是控制成本的第一抓手。脚本中还内置了合理假设——定时评测的缓存命中通常在 30%~70%而 PR 触发的评测因为提示重复度低命中率只有 15%~55%见 generate-token-data.ps1。三组趋势图 一张明细表定位成本异常 看板第二部分是每日 Token 用量图表由 Chart.js 绘制Total Tokens Per DayScheduled vs PR一眼看出哪天的成本突增、是例行巡检还是 PR 评测引起的Token Breakdown Per Day把每日输入拆成非缓存输入 / 缓存读 / 缓存写 / 输出四段缓存策略变差时会立刻显现Agent vs Judge Per Day区分干活与评审两种开销。第三部分是按插件维度的小图与可展开明细表插件 → 技能 → 运行记录逐层下钻token-usage.js 中的renderBreakdownTable方便回答是哪个插件把成本吃掉了。Skill Value 页一个技能到底值多少 Tokenskill-value.js 实现了看板的首屏标签页它用双组对照实验说话基线组baseline不加载技能技能组treatment加载被测技能各跑一遍同样的场景输出人话结论加载该技能后模型 X 在典型场景下约少用 M% 的 Token、少花 Y% 的时间不加载时约 p% 的场景过不了检查。为了让结论可信页面内置了三道防糊弄规则阈值取值含义最少配对样本5 次不足 5 次配对观测只显示信号不足不给数字激活率下限50%技能很少被触发时差异是稀释出来的结论被抑制滚动窗口最近 20 次运行只看近期表现不被远古数据带偏数据生产流水线从评测产物到看板 JSON ⚙️看板只是展示层真正的数据由 CI 流水线生产评测运行eng/vally-adapter/ 基于 Vally 引擎在同一提交上分别跑 baseline / 单技能 / 整插件三种变体再由配对比较裁判打分数据转换generate-benchmark-data.ps1 读取评测产物 results.json按插件生成PluginName.json质量效率历史同时追加token-usage 条目和紧凑索引skill-value.json自动清理同一脚本支持按保留窗口天数清除过期条目空文件直接删除保证看板数据不过肥本地开发没有 CI 时跑一下generate-token-data.ps1就能得到 14 天、固定随机种子可复现的假数据覆盖定时与 PR 两类来源看板瞬间活起来。数据保鲜与会话回放让看板永远可信 新鲜度检查dashboard-freshness.js 会对比评测证据所在提交与看板部署提交落后就打上 stale 黄色警告并用人话告诉你数据落后了 N 天——避免拿旧数据做新决策会话回放build-replay-sessions.ps1 把评测代理的原始事件日志JSONL摊平、重命名并生成回放清单点进看板就能复盘代理每一步做了什么purge-replay-sessions.ps1 则按天数自动归档清理控制仓库体积。新手上手清单 ✅先看 Token Usage 标签页确认 Scheduled 与 PR 的成本比例是否符合预期再盯一下缓存命中率卡片判断技能价值看 Skill Value 页优先信样本≥5 且激活率≥50%的技能其余当作信号不足观察即可本地体验克隆仓库后运行 generate-token-data.ps1 生成演示数据用浏览器打开 dashboard.html零配置即可预览全部图表效果。小结dotnet/skills 的 eng/dashboard/ 目录是一套教科书级的Token 用量管理实践采集评测流水线→ 转换PowerShell 脚本→ 展示JS 看板→ 保鲜stale 检测 过期清理闭环完整。它让我们第一次能像看电费账单一样审视 AI 技能的开销——让每一个技能都用数据证明自己的价值。【免费下载链接】skillsRepository for skills to assist AI coding agents with .NET and C#项目地址: https://gitcode.com/GitHub_Trending/skills17/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考