ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

00 · STAR 总览:Better Harness 是什么

00 · STAR 总览:Better Harness 是什么 00 · STAR 总览Better Harness 是什么5 分钟读懂 QoderAI/better-harness——一个给AI 编码代理的工作方式做体检的开源系统不评审代码评审产生代码的那个工作循环。一图速览你的编码代理Claude Code / Cursor / Qoder / Codex ...Better Harness/better-harness五维评分 证据findings 修复计划下一个任务真的更顺关键事实值评估模型Agent Work Loop v4820 行模型文件报告契约 v25评审结构5 维 × 15 项检查每项有稳定 check id证据状态7 级Present / Wired / Exercised / Outcome-supported / Missing / Unobserved / Not applicable支持宿主10 个Claude Code、Codex、Qoder、Cursor、Qwen Code、Copilot、Pi、Kimi Code、WorkBuddy、Grok确定性能力30 capability 脚本根 CLI 12 个顶层命令三档受众分级测试90 测试文件含文档链接图完整性测试许可证MITS — SituationAI 写代码越来越快工作流成了短板AI 编码代理改代码的速度已经远超团队工作流的承载能力。项目 README 列出了五个典型症状目标模糊——代理自信地解决了错误的问题路径即兴——工作过程不可复现能跑但没证据——验证不完整或缺失速度压过安全——评审和交付检查被绕过经验丢失——同样的坑下个任务再踩一遍关键洞察只 review 最终 diff 看不到这些系统级问题。diff 只回答改了什么回答不了代理是怎么理解任务、怎么执行、怎么验证、怎么交付的。T — Task给产生 diff 的那个循环做体检不评估代码质量评估围绕代码的工作循环是否健康并且每条结论必须有证据支撑——没观察到的行为就明说没观察到不编分数。项目的自我定位写在 roadmap 里“证据与控制面evidence and control plane不是又一个编码代理运行时”。宿主负责跑模型Better Harness 负责回答这个项目的 harness 够不够好、哪里该修、修了之后真的变好了吗。A — Action三层开源资产第一层 · 评估模型——五个维度回答五个问题维度回答的问题证据来源Task Understanding代理知道目标和完成的定义吗AGENTS.md、spec、DESIGN.mdControlled Execution工作走在可复现的受支持路径上吗Skills、命令、MCP、沙箱边界Change Validation有证据证明改动真的生效吗测试、lint、Hooks、诊断Reliable DeliveryAI 速度是否绕过了质量闸门人工评审、CI/CD、恢复路径Learning Capture下个任务能受益于这次吗可复用 Skills、Memory配套两个防作弊机制证据上限制静态配置最多撑到 74 分演练过最多 94 分只有可比的后续改善结果能到 100和修复/有效性分离修完只更新 Repair Progress维度分数要等下一个可比任务才允许变动。第二层 · 工程实践——六个判据域会话证据、项目 harness、代理资产定制、bootstrap 规格、循环工程、运行时契约。每条评分判据都有出处和发射条件连根 AGENTS.md 超过 200 行算 finding这种细节都有明确规则。第三层 · 可运行实现——/better-harness一条命令跑通五步流水线冻结证据包 → 三个互相隔离的只读证据代理 → 主代理单点裁决 → 八道质量闸门 → 校验渲染成自包含 HTML 或原生 Canvas 报告。R — Result可复核的体检报告和一套行业稀缺的诚实标准一份有边界的报告五维概览 按严重度High/Medium/Low排序的 findings——每条带证据引用、影响、aiFixPrompt修复入口、预期产物与验收检查——外加证据简报和显式的未判定清单。每条 finding 可直接行动aiFixPrompt是机器可读的修复回调契约带 revision 控制与拓扑绑定修完由独立的只读代理复核为 verified / partial / blocked。纵向诚实多次运行的趋势视图只声明记录README 明确注明不是因果证明。十宿主覆盖同一套判据Qoder/Cursor 出原生 Canvas其余八家出自包含 HTML Markdown JSON 报告。谁该读这个系列你是谁建议路径技术负责人想评估团队 AI 工作流00本篇→ 02 评估模型平台/工具工程师想借鉴架构04 架构 → 03 实现想给自己团队造一个类似的05 MVP 指导 → 06 技术取舍代理工程实践爱好者01 工程实践 → 02面试表述QBetter Harness 到底评的是什么不评代码质量评的是产生代码的那个工作循环——代理怎么理解任务、怎么执行、怎么验证、怎么交付。只看最终 diff 看不到这些系统级问题所以需要一套独立的证据驱动评审。Q它和普通的 lint/CI 有什么区别lint 评审代码本身Better Harness 评审工作流程。关键差异在证据上限制装了一堆 hooks 在 lint 里是加分项在这里静态配置最多撑到 74 分——因为配置存在和机制被使用是两件事。Q三层资产各自解决什么评估模型定义怎么判分工程实践定义怎么检查可运行实现把前两层变成一条命令跑通的流水线。判据与判定分离是防止自己查自己打分的结构保障。记忆点Better Harness 的本质是——不看你改了什么代码看你产生代码的过程有没有证据没证据的地方诚实地写着没观察到。
返回列表