模型路由:按任务选模型

不同模型在能力、速度与价格上差异很大。模型路由(Model Routing)用一个判别器把每个请求分派给最合适的模型:简单任务走小模型省钱,难题走大模型保质量,从而在预算内维持整体效果。它是成本敏感场景下的核心优化手段。

是什么

路由层位于用户与一组候选模型之间。它对输入做轻量判断(分类、难度估计或相似度),选出目标模型并把请求转发过去。对用户而言接口不变,但后端被智能分配。好的路由应可解释、可回退,并在路由不确定时默认走更稳的模型。

为什么值得做

一直用最强模型会浪费成本,全用小模型又会掉质量。路由把算力花在刀刃上:多数简单请求由小模型消化,少数困难请求才升级到大模型,整体性价比更高。在大规模服务中,这一差额能显著节省开销。

怎么做

训练一个轻量路由器预测「哪个模型能答对」。RouteLLM(Ong 等, 2024)用强模型标注的偏好数据训练分类器,按阈值决定走小模型还是大模型:

# 伪代码:按路由器置信度分流
if router.predict_hardness(query) > threshold:
    return strong_model(query)
else:
    return small_model(query)

RouterBench(Hu 等, 2024)提供了评测路由策略的统一基准,便于横向比较不同路由器。

注意点

  • 路由判错会把难题误派给弱模型,需关注路由本身的准确率。
  • 阈值决定成本与质量权衡,应按业务目标调。
  • 候选模型更新后,路由器最好同步再标注与重训。
  • 路由层本身引入延迟,需确保判别足够轻量。

实践建议

路由判错会把难题误派给弱模型,因此路由本身准确率很关键,应单独评测。阈值决定成本与质量的权衡,按业务目标调节:成本敏感则偏低阈值多用小模型,质量敏感则偏高。候选模型更新后,路由器应同步再标注与重训,避免分布漂移。路由层要足够轻量,否则自身延迟抵消了分流收益。建议保留 fallback:路由不确定时默认走更稳的大模型,而非冒险走小模型。对安全敏感请求,可强制走经过对齐的大模型,不进入小模型路由。记录每次路由决策与最终质量,用于离线分析误分流案例,持续修正路由器。可先用规则路由快速上线,积累足够标注数据后再训练学习型路由器,平滑演进而非一步到位。

小结

模型路由用轻量判别器把请求分给最合适的模型,让简单任务走小模型、难题走大模型,兼顾成本与质量。关键在路由准确率与阈值的业务对齐,并随模型更新而维护。

参考与延伸阅读

本文累计阅读