把 LLM 评测的经验直接搬到 Agent 上,几乎一定会翻车。一个单轮的 Chat 模型,输入是 prompt、输出是文本,你可以用困惑度、ROUGE、人工打分甚至一次 API 调用的准确率来度量它。但一个 Agent 是"模型 + 工具 + 规划 + 记忆 + 环境"的复合系统,它的输出不是一段文本,而是一段轨迹:若干次模型调用、若干次工具调用、若干次状态变更,最终才收敛到某个结果。评测对象从"一句话"变成了"一个过程",这意味着整个评测体系的底层假设都要重写。
本文不打算罗列 Benchmark 榜单,而是从我在生产环境落地 Agent 评测的几次返工出发,讲清楚端到端任务评测、轨迹追踪、可观测性埋点和回归评测集建设这四件事怎么做才不是"自嗨"。