验证与评估 (V)
ETCLOVG 之 V 层:把任务与 trace 转成反馈的五阶段生命周期。基准接地、就绪校验、trace 捕获、多层判定、持续回归。
本节对应综述《Agent Harness Engineering: A Survey》§8,是 ETCLOVG 七层的第六层。核心主张:harness 感知的评估应把上报分数 视作模型—harness 对的属性,而非模型单独的属性——评估协议要么跨模型锁定 harness,要么把 harness 配置作为显式实验因子。 与常规 LLM 评估(对固定输入给输出打分)不同,harness 评估度量的是一个执行 episode:任务在环境中接地、agent 随时间与 工具和状态交互、trace 被捕获、评判者同时判定最终结果与到达它的路径。一个中心动机是:评估基础设施噪声会伪装成模型失败 ——失败运行可能源于损坏的工具、陈旧上下文、未重置的沙箱、flaky 测试、基准歧义或不稳定的评判者。
五阶段任务→反馈生命周期
评估被重构为一条质量控制回路,沿一次评估运行的因果路径分五阶段:
阶段一:任务与基准接地
对 LLM agent,任务不是一句自然语言 prompt,而是由环境状态、可用工具、允许动作、约束、终止条件、成功判据定义的嵌入式 问题。综述按领域归类基准:
| 领域 | 基准 | 特征 |
|---|---|---|
| 软件工程/终端 | SWE-bench、Terminal-Bench | 接地于真实 GitHub issue + 仓库快照,跑测试验证补丁;强结果验证器需要强任务接地 |
| Web/浏览器/computer-use | WebArena、VisualWebArena、BrowserGym、WorkArena、OSWorld | 成功由浏览器/桌面/应用状态变化定义;既是评估问题也是环境设计问题 |
| 跨域/企业工作流 | AgentBench、GAIA、TheAgentCompany、WorkArena++ | 跨 OS/数据库/浏览/工作流测泛化;贡献在覆盖广度 |
阶段二:执行前就绪校验
常在 leaderboard 中隐形却关键:agent 开始前须校验环境/依赖、工具、上下文状态、权限边界、预算、评判者已正确初始化,否则 下游失败无法归因。此阶段是跨层的——工具就绪连到 T 层,上下文就绪连到 C 层, 权限就绪连到 G 层。若工具描述跨运行变化,基准就不再测同一动作空间;若记忆/上下文未重置,agent 可 受益于泄漏状态。评判者本身也须预先校验:确定性 grader 查 flakiness,LLM-as-Judge 的 prompt/rubric/judge 模型应版本化。
阶段三:受控执行与 trace 捕获
rollout 是评估基本单位(任务、模型配置、harness 配置、动作序列、中间观察、最终状态、评分结果)。受控 rollout 固定偶发 变差源(环境状态、工具可用性、超时、预算、权限、评判者版本);残留非确定性时,重复 rollout 应暴露方差而非藏在单一分数后。 综述强调 trace-native 评估:trace 应记录模型输出、工具调用与结果、状态变化、上下文快照、错误、重试、恢复、token/延迟/成本 ——它们区分表面相似的失败(一个 agent 从未找到相关文件,另一个找到却产出无效补丁),也能揭示不良的成功(基准利用、过量 工具调用、越权)。HAL 把日志与 trace 当一等评估物,R2E-Gym 把可执行轨迹与混合验证器联到测试期与训练期反馈。评估应报告 success-cost-latency 前沿而非只排成功率。
阶段四:多层判定与失败归因
综述给出三层判定:
- outcome-level(终局是否达成):可扩展、可比较,但把整段 episode 压成一个值、掩盖是否稳健/安全/高效。必要但不充分。
- trajectory-level(路径质量):工具选择、动作次序、是否越权、能否恢复、上下文一致性;最终答案正确而轨迹不可接受是常见 情形。此层把基准结果转成分层工程反馈:选错工具→改工具接口,遗忘约束→调上下文层,空转不恢复→补编排生命周期控制。
- evaluator-level(评判者是否可信):G-Eval 显示 LLM 评判可更贴合人类但偏好 LLM 生成文本;MT-Bench/Chatbot Arena 识别 position/verbosity/self-enhancement 偏置。应把评判者当“受测组件”而非系统外 oracle,偏好分层 grader(确定性检查客观 状态、LLM 判语义/轨迹、人工审计模糊或高风险)。
失败归因很少是单标签分类,而是对完整 trace 的诊断过程:模糊任务规约→选错工具、过压上下文→遗忘约束、沙箱依赖问题→ 触发增本的恢复行为、flaky judge→掩盖有效解。阶段四输出的不只是判定,而是可供阶段五反馈的结构化诊断。
阶段五:持续回归与部署反馈
回归应由 harness 改动(工具描述、压缩策略、沙箱镜像、权限规则、judge prompt)触发,而非仅模型改动——因组件交互,局部 改进可致全局回归。实践是维护分层评估套件:工具 schema 的单元式测试、局部决策的单步测试、端到端的全 rollout 测试、长程 连贯的多轮模拟。通用框架 promptfoo/DeepEval/RAGAS/lm-evaluation-harness 提供构件;生产失败 trace 可转为回归用例,形成 监控与评估的闭环。更新方向把评估器用作训练信号(R2E-Gym、verifiers 的 RL 式环境)乃至把 harness 设计本身作为自动搜索 对象(Meta-Harness)——在此框架下评估不是管线终点,而是让 harness 得以改进的信号。