第 15 篇:评估体系 —— Benchmark、Evals 与持续优化闭环
系列定位:面向有 3+ 年经验的后端开发者,从零构建 Agent Harness 工程能力体系 上一篇回顾:[第 14 篇]我们拆解了 Agent 可观测性——Tracing 三层原语(Run/Trace/Thread)、Trace Analyzer Skill 的 Boosting 式改进闭环、可观测性注入(给 AI 看的观测数据),以及 OpenTelemetry GenAI 语义规范的落地。可观测性解决了"发生了什么"的问题,但紧接着的一个问题同样关键:改了 Harness 之后,怎么知道是变好了还是变差了? 本篇核心问题:如何量化 Agent 的能力?如何知道这次 Harness 改动...