
上个月一号早上我习惯性打开控制台看账单好家伙客服机器人这个功能一个月烧掉的钱比它带来的转化还刺眼。我把调用日志抽样拉出来看了一圈越看越不对劲——起码七成的提问是你们几点下班发票能开吗帮我查下订单到哪了这种一句话就能答完的事。而这些请求全被我送进了自家最贵的旗舰模型。相当于我请了一位博士后坐在前台专门回答厕所在哪。于是我决定给项目加一层模型路由model routing模型路由就是在请求进门时先分类简单问题分给便宜的小模型难的才请出大模型。狠一点的做法叫级联调用cascading级联调用先一律让小模型上答不好再自动升级找大模型救场。听着都很美对吧我第一次跑的时候还挺得意觉得自己用 AI 管 AI架构优雅得很——我让旗舰模型亲自当路由器每个请求先问它一句这题简单吗再决定分给谁。结果跑了一周账单比不加路由还高了 8%平均响应时间也翻了一倍。原因特别朴素路由这一步本身也是一次大模型调用钱一分没少花延迟还多出一截。同事看完我的架构图憋了半天来了句你这门卫的工资比里面上班的还高。行这话说得难听但在理。推翻重来第二版我把路由器从最贵的换成了最便宜的。规则先上高频 FAQ 命中的直接走模板答案压根不进模型剩下的请求用 embedding向量嵌入把文本变成一串数字方便机器算相似度加一个轻量逻辑回归分类器判断类型成本约等于零判断不准的一律默认给小模型。旗舰模型从全员营业变成了只接疑难杂症。这一版上线路由本身的开销降到可以忽略不计。然后我就撞上了第二个坑也是这个方案里真正难的部分——难度这个信号远没有想象中好判断。我一开始偷懒拿问题短简单当规则用结果被现实教育了帮我写周报四个字是生成类任务小模型写出来就是一篇流水账用户直接投诉反过来一段三百字的技术报错贴进来看着挺唬人其实是我们 FAQ 里躺了半年的已知问题。你看长度根本不能代表难度任务类型是问答、生成还是推理和领域熟悉度才是关键变量。我后来把分类器改成了按任务类型领域打标准确率才肉眼可见地爬上来。写到这儿插一句产品同学听说账单砍了六成第二天就兴冲冲跑来想把省下的预算拿去做两个新功能。我赶紧把报表收起来——省下的钱是拿来填下次事故的真不是拿来花的。光省钱还不行路由错了得有安全网兜底。我们现在的设计是小模型答完先过一道自查置信度confidence模型对自身答案的把握程度低就自动升级到大模型重答用户点了不满意的案例会自动回流进标注池每月喂回分类器重新训练一次。上线时是灰度放的先切 10% 流量观察了一周两类错误率都稳住了才全量。现在的状态是七成流量走小模型总成本降了六成多答对率只掉了不到两个百分点而且大半还是被兜底捞回来的。说实话路由这事到现在也没有标准答案。云厂商这两年都推出了托管路由服务听着省心实际是黑盒分流逻辑一变你连招呼都不会收到自己搭呢分类器要持续养数据业务一变方向整套策略就得重新校准。另外也别神化这套玩法——小模型的能力上限摆在那复杂推理、多轮长对话这类任务路由器再聪明也该直接放行给大模型硬省那点钱最后都是事故工单。如果你手上也有项目在拿同一个旗舰模型硬扛全部流量不妨先去抽一百条日志看看说不定你会跟我一样发现博士后正坐在前台。看完了记得回来聊聊你的场景里简单请求和硬核请求的比例是多少你是愿意自己养一个分类器还是干脆信云厂商的黑盒路由评论区见我是真的想知道大家这笔账都是怎么算的。