评估方法与决策
开放式任务没有标准答案,评分靠 LLM-as-a-Judge——但评判模型有自己的偏见(最典型的是长度偏差)。而“数小时内得出切换决策”有一个隐含前提:观察到的分数差异是真实信号,不是抽样噪声。3 个百分点的差异,常常完全落在噪声带宽之内。
有了评估环境、数据集与指标,核心问题是:怎么打分?有标准答案的任务(数学题、SQL)用二元判定即可;开放式任务(客服对话、报告)才是本页主题。
LLM-as-a-Judge
开放式任务没有标准答案可自动对比,人工评估又贵又难规模化。LLM-as-a-Judge 让语言模型按专家定义的评分标准(Rubric)评判,在自动化规模与人类专业判断间取平衡。但它有已知局限:评判模型可能有偏见,最典型的是长度偏差——倾向给更长、更详尽的回复打高分,哪怕内容并不更正确。三种防范:Rubric 里显式惩罚冗长并规定长度上限;配对比较前先把两个候选长度控制到相近;定期审计评分与长度的相关性——若高分几乎总伴随长回答,说明评判已被长度带偏。
Rubric 四准则(Scale AI,“Rubrics as Rewards”):(1) 基于专家指导——反映领域知识,捕捉核心事实与推理步骤,而非语言流畅度等表面特征;(2) 全面覆盖——涵盖准确性/连贯性/完整性/安全性,且不仅定义正面标准,还明确陷阱(Pitfall)(高风险常见错误);(3) 标准重要性权重——分必要项/重要项/可选项/陷阱项,支持一票否决(Veto)(如客服场景幻觉一旦出现即否决,无论其他维度多优秀),这也能防关键词堆砌式的奖励作弊;(4) 自包含评估——每项独立可操作,把“展示了深刻理解”这种抽象标准改为“引用至少两个权威理论并准确解释如何支持结论”这种可验证标准。Rubric 是迭代产物——通过试用收集分歧、从抽象准则逐渐演化为详尽的判例集,还要主动防范奖励作弊(明确惩罚幻觉、讨好用户、关键词堆砌、回避棘手问题)。
配对比较与模型排名
除了给单个回答打分,还可以让两个回答两两对决、用相对胜负排名。Elo 评分(源自国际象棋)通过大量两两对决量化相对能力:分差越大强者预期胜率越高(A 1200 vs B 1000,预测 A 约 76% 胜率),爆冷会带来更大的分数调整、让排名快速收敛。其统计基础是 Bradley-Terry 模型——每个模型抽象为一个潜在实力分,对决胜率由分差决定,Elo 是它的在线更新工程实现。Chatbot Arena 用匿名随机对决:用户盲选更优回应,数百万次投票得出排名,优势是不需定义“绝对标准”、只需判断“A 和 B 哪个更好”,局限是排名取决于用户问了什么(编程题问得多,擅编程的模型排名就偏高)。
当配对评判由 LLM 而非人类完成时,要防范位置偏差(Position Bias)——评判模型会系统性偏向某个位置(通常是先出现的),即使两个候选内容对调判决也不变。标准缓解是交换顺序各评一次(A 在前、B 在前各评一次取平均;更严格的只在两次一致时才计入,否则记平局或送人工)。配对比较不仅是评估手段,也是后训练的重要信号来源——把“对比哪个更好”引入训练正是 GRPO 一类算法的思路(用候选间相对优劣估计优势,细节属后训练范畴)。
评估驱动的模型选型
模型选择不是“选最强的”,而是评估驱动的多维权衡。理清吞吐与延迟只需知道推理分两阶段:Prefill 一次读入完整上下文,决定首字延迟 TTFT(上下文越长越慢);Decode 逐 token 生成,决定出字速度,也直接决定思考时长(50 tokens/s 生成 2000 思考 token 就要 40 秒)。关注 p95 尾部延迟(比均值更反映真实体验)。成本不应孤立评估——一个便宜但成功率低的模型因频繁重试实际可能更贵。性能按场景取指标:日常看 Pass@1,关键操作看 Pass^k(稳定性),探索性看 Pass@k / Best@k。
一个关键提醒:预算—能力曲线。固定预算下的单点成绩不足以判断长程能力——RE-Bench 显示,2 小时预算下最佳 agent 约为人类专家的 4 倍,但人类从增加时间中获益更大,32 小时时得分约为 agent 的 2 倍。短预算领先不能外推成长时间运行能力,选型要在接近真实任务时长的多个预算点上比较。实践中常用多模型协同:轻量模型处理简单请求降本,强模型处理复杂任务保质。
Agent 成本是非线性的:每轮把之前所有历史一起发送,若不用 KV Cache,第 1/2/3 轮是 1000/2000/3000(累积 6000 而非 3000),轮次越多差距越大;思考 token 与工具返回注入后每轮反复计费又是放大因素。所以成本优化的核心不在选便宜模型,而在控制轮次和上下文增长——输入侧三类杠杆最有效:KV Cache 复用(降 30%–60% 输入成本)、上下文压缩、模型分层路由。生产环境应建实时成本监控,并设每任务成本上限(agent 陷入循环或探索过深时自动终止)。
统计显著性:分差小于噪声带宽时,不做切换
“数小时内得出切换决策”有个隐含前提:观察到的分数差异是真实信号,而非抽样噪声。评估集规模有限、模型输出又不确定,这个前提不自动成立。粗估噪声带宽用二项分布标准误 √(p(1−p)/n):100 个用例、成功率 70%,标准误 ≈ 4.6%,95% 置信区间约 70% ± 9 个百分点。所以“新模型 73% vs 旧模型 70%”这 3 个百分点完全落在噪声内——据此切换与掷硬币差别不大。
由此得一条实用原则:分差小于噪声带宽时,不做切换决策。但下结论前应换更灵敏的方法:同一批任务上对比两个配置,正确的默认做法是配对分析(逐题比胜负、只看结果不同的用例,McNemar 检验),它扣除了“题目本身难易”这一共同噪声源,比“两个独立成功率相减”灵敏得多。Agent 评估还有额外的非确定性(温度采样、工具波动、环境时序)——同一模型同一数据集两次运行也会漂移,所以每个配置跑 3–5 次取均值并报告波动。还要警惕多重比较:并行验证 6 个假设,即使每个都用 95% 置信度,“至少一个假阳性”的概率是 1 − 0.95⁶ ≈ 26%——应对是收紧单个门槛(Bonferroni)或对正向结论做独立复跑。