ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

Agent评估指标体系:Pass@k能力上限与Pass^k连续可靠(业务可靠性)

Agent评估指标体系:Pass@k能力上限与Pass^k连续可靠(业务可靠性) 13-Agent评估指标体系Passk能力上限与Pass^k连续可靠业务可靠性系列导读本系列基于李博杰《深入理解AI Agent设计原理与工程实践》的阅读思考结合我在智慧农业、无人售货柜一线的工程实践展开。这一篇聊一个所有做Agent落地的人都绕不开的话题——评估。一、没有评估就没有进步先说一个扎心的现实很多团队的Agent项目demo惊艳上线翻车。为什么因为从第一天起就没有一套严肃的评估体系。你在测试环境里手动点五次三次成功就敢说Agent能用了——这不是工程这是抽奖。《深入理解AI Agent》里有一个核心观点我非常认同Agent的开发循环是评估驱动的。就像深度学习有训练集/验证集Agent也需要一套可重复、可量化、可持续运行的评估体系。你改了一版Prompt、换了一个模型、调了一次工具描述怎么知道是变好了还是变坏了靠感觉是不行的靠评估。评估的第一步是把成功率这个词拆开。而拆开之后你会发现两个长得极像但意义天差地别的指标Passk和Pass^k。二、Passk能力上限也是技术奇观的制造机Passk 的定义同一个任务让Agent独立尝试 k 次至少有一次成功的概率。假设单次成功率为 p那么Passk 1 - (1 - p)^k直觉很朴素一次不行就再来一次只要有一次中奖就算赢。取 p 0.6k 5Pass5 1 - (0.4)^5 ≈ 1 - 0.0102 ≈ 98.98% ≈ 99%看单次只有60%的成功率五次尝试下来成功率直接飙到99%。这就是过去两年AI圈技术奇观的数学原理Anthropic让模型一周写出一个C编译器——背后可能是无数次尝试中挑出最好的一次Manus演示虚拟电脑上丝滑操作——演示视频是剪辑的精华不是连续实录OpenClaw直播活人感对话——你看到的是幸存者偏差翻车的那些run没人给你看。这些不是造假而是Passk视角下的能力展示它衡量的是Agent的能力上限——“最好能做成什么样”。对于写代码、做研究、生成内容这类可以人工审查、可以重试的场景Passk是有意义的指标因为挑出一次成功结果的成本很低。三、Pass^k连续可靠业务落地的生死线再看 Pass^k 的定义同一个任务连续做 k 次每一次都成功的概率Pass^k p^k同样取 p 0.6k 5Pass^5 0.6^5 0.07776 ≈ 7.8%对比一下Pass5 ≈ 99%Pass^5 ≈ 7.8%。同一个Agent同一个任务同一组数字结论差了十几个数量级的体感。这两个指标的关系可以总结成一句话Passk 衡量能力上限Pass^k 衡量业务可靠性。前者是技术奇观的放大器后者是生产系统的入场券。为什么业务系统看的是Pass^k因为在真实业务里很多操作是零容忍的支付扣款错一次就是资损退款审批错一次要么得罪用户要么被薅羊毛权限变更错一次就是安全事故生产部署错一次就是线上事故凌晨三点被电话叫醒的就是你。在我的无人售货柜业务里这感受极其强烈一个用户扫码开门取货自动结算的Agent识别错了、扣款错了用户直接投诉客诉一次的成本远高于它正确服务一百次创造的价值。这类场景下60%的单次成功率意味着什么意味着每五单就有两单可能出问题——这不是产品这是定时炸弹。所以做Agent落地第一件事是问自己我的业务是Passk业务还是Pass^k业务内容生成、代码辅助、研究分析 → Passk业务允许重试和人工挑选支付、结算、库存扣减、设备控制 → Pass^k业务必须连续可靠。四、光看成功率不够过程指标体系《深入理解AI Agent》强调评估要做轨迹与结果双重覆盖——只看最终结果你不知道Agent是怎么到达的只看过程你不知道结果对不对。一套完整的过程指标至少包括行动合法率Agent执行的动作是否在允许的动作空间内。比如退款Agent跑去调用库存查询工具修改数据就是非法动作工具调用正确率参数对不对、调用的工具对不对。工具选对但参数传错是新手Agent最常见的病路径效率完成任务用了多少步、多少token。10步能完成的事走了47步即使结果对了延迟和成本也不可接受检索覆盖率RAG场景召回的文档里是否包含了回答问题所需的信息召回不行生成再好也是巧妇难为无米之炊成本与延迟单次任务的token消耗、端到端耗时这直接决定这个Agent在商业上能不能活下去。五、一票否决项安全合规与幻觉过程指标是打分题但有些是判断题而且判错直接零分安全合规一票否决Agent把敏感数据发给外部API、执行了越权操作、输出了违规内容——无论任务完成得多漂亮这条轨迹直接判负幻觉一票否决在事实性任务里编造不存在的订单号、虚构退款政策条款。对售货柜退款Agent来说编造一个不存在的优惠券规则说服用户比承认查不到严重一百倍。幻觉不是扣分项是出局项。六、鲁棒性别只在晴天测试很多Agent在标准环境里表现优秀一到线上就崩。鲁棒性评估要做扰动测试随机种子扰动同一输入多次运行输出是否稳定温度、采样带来的方差有多大页面/环境变化操作网页的Agent按钮换个位置、弹个新弹窗就傻了API抖动工具接口偶发超时、返回异常格式Agent是优雅重试还是直接躺平长时记忆干扰多轮会话中早前的上下文是否污染当前决策。七、人工抽检与对抗式评审自动化评估再好也不能100%代替人。实践建议人工抽检按比例抽查轨迹重点看自动评估判成功的样本——机器觉得对的不一定真对对抗式评审让一个人专门扮演找茬的构造边界case、诱导性输入、异常数据去攻击Agent。攻击者的视角永远比建设者毒辣。八、实战售货柜退款Agent的评估表给一个我们真实在用的评估框架缩影。退款Agent的任务用户投诉扫码扣款了但没拿到货Agent需要查订单、查柜机日志、判断责任、执行退款或拒绝。维度指标目标值结果Pass^20连续20个真实退款案例全对≥ 95%幻觉虚构订单/政策条款0 容忍安全只允许调用退款白名单工具0 违规路径效率平均工具调用步数≤ 6 步成本单案例token成本≤ ¥0.05鲁棒性柜机日志接口超时5s时正确降级100%注意第一条我们考核的是Pass^20 而不是 Pass20。因为每一笔退款都是真实的钱用户不会给你重试五次的机会。小结Passk 1-(1-p)^k衡量能力上限是技术奇观的数学来源Pass^k p^k衡量业务可靠性是生产系统的生死线p0.6 时 Pass5≈99% 但 Pass^5≈7.8%同一个模型两种命运结果指标之外补齐行动合法率、工具调用正确率、路径效率、成本延迟等过程指标安全合规与幻觉是一票否决不是扣分项用轨迹结果双重覆盖、扰动测试、人工抽检和对抗式评审把评估做成体系而不是一次性的表演。评估做得好Agent的每一次迭代才有方向没有评估的迭代只是在换着花样碰运气。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表