当你辛辛苦苦开发了一个Agent(智能体,能自主调用工具完成任务的AI系统),上线后却发现效果忽好忽坏——有时精准完成任务,有时反复试错甚至崩盘。更头疼的是,日志里只能看到用户说了什么和Agent最后回了什么,中间调用了哪些工具、规划是否合理、哪一步出了错,完全是个黑盒。这种"看不见"的问题,正是Agent评测要解决的核心。

Agent评测的本质,是回答"Agent好不好?到底哪里好、哪里不好?"从而为下一轮迭代指明方向。它不同于传统模型评测——传统机器学习关心"算得准不准",大模型评测关心"模型能力强不强",而Agent评测面对的是一个"模型+系统+工具+流程"的复杂系统,必须回答:当模型被放进真实业务里,和Prompt、工具链、记忆、状态管理耦合在一起后,能不能稳定交付好的结果。

因此,Agent评测不能只看最终结果,还要看过程和效率。两个Agent可能都"做对了",但一个路径清晰、工具调用稳定、可复现;另一个反复试错、靠偶然命中。如果只看答案,两者会被误判为同一水平,但工程价值天差地别。所以评测至少需要覆盖四层:结果层(任务是否完成)、过程层(规划是否合理)、效率层(耗时、Token、工具调用次数)、风险层(是否越权或误操作)。

这一切的基石是观测。Agent的一次执行涉及用户输入、意图识别、工具调用、结果整合等多层链路,任何一层出问题都可能导致最终效果劣化。但如果日志系统只能看到"用户说了什么"和"最后回复了什么",就无法定位根因。因此工业界发展出了Trace系统(追踪,记录Agent全路径执行过程),将黑盒内部的逻辑推理过程完整披露。

有了观测,才能建立评测体系。美团图灵团队在两年实践中沉淀了一套核心方法论:评测体系不是堆指标,而是"搭桥"——在模型能力指标和业务结果指标之间建立一层面向任务系统的桥梁指标。以AI搜索为例,业务关心DAU和留存,搜索系统关心召回率和点击率,Agent层则关心意图识别是否准确、检索是否有效。只有把这些层次串起来,才能回答"为什么业务指标变差"以及"模型能力提升为什么没有带来业务收益"。

评测方法上,客观评测(自动化规则)和主观评测(人工判断)需要并行。用客观评测覆盖高频结构化部分,用主观评测覆盖开放性复杂场景,再用主观评测校准客观评测,最后规模化交给自动化系统。

主观评测最大的难点不是"没人会评",而是"不同的人评得不一样,机器和人评得也不一样"。图灵团队的关键认知是"人人一致、人机一致"。人人一致:需要一个"独裁者"角色拉齐产品、运营、研发、QA的标准,避免各自为政。人机一致:机器评测结果必须与人工评测结果保持一致,否则不置信。具体做法是把模糊指标下钻成更细的Rubric(评分细则),再把每个Rubric尽可能二元化(是/否/未知)。例如,评价模型回复是否"口语化",经典错误是直接打0-10分;改进版是拆成三个二元问题:是否以"您"指代骑手?是否使用"甭客气"等口语词汇?是否包含"吧""呢"等语气词?这种下钻法大大降低了分歧。应用这套方法,数字站长业务的人机一致率达到99%,Beam团队从62%提升到92%。



Agent评测是一门实践科学,从执行链路看包含五个关键环节:采集、清洗、评测、质检、分析归因。这五个环节与线上AB、持续观测共同构成数据飞轮。很多团队一开始就想设计复杂精妙的指标体系,但越复杂越难执行。正确的起步路径是:从高频核心场景起步,先定义少量关键指标;从生产环境收集Bad Case(坏案例,暴露能力边界的样本)和Good Case(好案例,定义高质量完成的范式);用它们喂养评测体系,再反哺Prompt、Skill和模型优化。履约数字站长业务从20多个指标起步,一年后扩展到近200个指标。


随着长程Agent(Long-horizon Agent,需要多步规划才能完成复杂任务的智能体)的兴起,比如Claude Code、龙虾、爱马仕等,评测范式正在发生根本变化。短程Agent(ChatAgent)时代,评测关心"回答得好不好";长程Agent时代,评测关心"事情办没办成,以及是怎么做成的"。长程Agent需要多步骤拆解、多次调用工具、动态调整策略,其执行轨迹信息密度极高,人工评测成为瓶颈。


Skill(技能,Agent可调用的功能模块)生产门槛越来越低,未来每个产运研同学都可能创建Skill,这要求评测系统足够简单、标准化、自动化。Skill全生命周期包括定义、开发、测试、发布、运营等环节,当前痛点在于大家不知道怎样写好Skill,也缺乏全生命周期的评测工具。


长程Agent评测正在从人评主导走向机评主导。基座模型能力持续突破,执行轨迹信息密度高,Skill数量增长快,人工大规模标注不可持续。因此,人工更应该做高价值标准设计和Rubric对齐,AI更适合规模化运行和回归验证。评测基础设施至少需要具备全链路回放、Case管理、执行沙箱、AI评测引擎、报告与归因、回归机制、准入准出门禁等能力,才能真正成为生产系统的一部分。

总结来说,Agent评测正在从"打分动作"走向"基础设施能力"。评测对象从"回答"变为"任务系统",评测方法从"文本质量评测"转向"行为评测"。对开发者而言,最重要的不是一开始就搭建完美体系,而是让数据飞轮高效转起来——从线上Bad Case中不断萃取评测资产,让评测真正服务于迭代。

内容与图片版权归原作者所有 · 原文: https://tech.meituan.com/2026/08/07/Agent-Evaluation.html