LMSYS 发布开源 LLM 路由框架 RouteLLM
Blog RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing LLMs have demonstrated remarkable capabilities across a range of tasks, but there exists wide variation in their costs and capabilities, as seen from the plot of performance against cost in Figure 1. ... Isaac Ong, Amjad Almahairi, Vincent Wu, Wei-Lin Chiang, Tianhao Wu, Joseph E. Gonzalez, M Waleed Kadous, Ion Stoica July 1, 2024
LMSYS Chatbot Arena 团队发布 RouteLLM,一个基于偏好数据训练的开源 LLM 路由框架,在强弱两个模型间分流查询以降低成本。
原文给出四种路由器的实测数据和开源框架入口,读者可以据此评估在强弱模型间分流能否降低调用成本。
Isaac Ong*、Amjad Almahairi*、Vincent Wu、Wei-Lin Chiang、Tianhao Wu、Joseph E. Gonzalez、M Waleed Kadous、Ion Stoica2024年7月1日
LLM 在一系列任务中展现出了卓越的能力,但它们的成本和能力存在很大差异,如图1中性能与成本的关系图所示。总体而言,能力更强的模型往往比能力较弱的模型更昂贵。这导致在实际部署 LLM 时面临一个两难境地——将所有查询路由到最大、能力最强的模型可以获得最高质量的响应,但成本可能很高;而将查询路由到较小的模型可以节省成本,但可能导致响应质量下降。

图1:各种 LLM 的性能与成本关系图。性能以 Chatbot Arena 上的 Elo 衡量,成本按每百万 token 计算,假设输入/输出比例为1:1。通过在两个模型之间进行路由,我们理想情况下可以获得比任一模型单独使用更好的性能成本比。
LLM 路由为此提供了一种解决方案,即每个查询首先由一个系统处理,该系统决定将其路由到哪个 LLM。理想情况下,所有可以由较弱模型处理的查询都应路由到这些模型,而所有其他查询则路由到更强的模型,从而在保持响应质量的同时最小化成本。然而,这实际上是一个具有挑战性的问题,因为路由系统在路由时必须同时推断传入查询的特征和不同模型的能力。
为了解决这个问题,我们提出了 RouteLLM,一个基于偏好数据的 LLM 路由原则性框架。我们对 LLM 路由问题进行了形式化,并探索了增强技术以提高路由器性能。我们使用 Chatbot Arena 的公开数据训练了四个不同的路由器,并证明它们可以在不牺牲质量的情况下显著降低成本,与仅使用 GPT-4 相比,在 MT Bench 上成本降低超过85%,在 MMLU 上降低45%,在 GSM8K 上降低35%,同时仍达到 GPT-4 性能的95%。我们还公开发布了所有代码和数据集,包括一个新的用于服务和评估 LLM 路由器的开源框架。
路由设置
在我们的路由设置中,我们关注的是存在两个模型的情况:一个更强、更昂贵的模型,以及一个较弱但更便宜的模型。在这种设置下,我们的目标是通过在两个模型之间进行路由,在实现高质量的同时最小化成本。

图2:随机路由器在 MT Bench 上的性能
通过图2可以最好地理解这一点,该图展示了一个在 MT Bench 上随机在两个模型之间路由的路由器的性能。具体来说,我们在这里是在 GPT-4 和 Mixtral 8x7B 之间进行路由,它们的性能分别用红色和灰色虚线表示。对于任何路由器,我们都可以绘制类似的性能与 GPT-4 调用次数(这代表了所产生的成本,因为 Mixtral 调用的成本可以忽略不计)的关系图。
我们使用偏好数据来训练我们的路由器,这建立在先前工作(1,2)的基础上。每个数据点包含一个提示以及两个模型在该提示上响应质量的比较,即可能是第一个模型胜出、第二个模型胜出或平局。使用偏好数据使我们能够了解不同模型的优势和劣势,以及它们与查询的关系,这对于训练路由器非常有效。对于我们的基础数据集,我们利用了来自Chatbot Arena的公开数据。我们还研究了数据增强技术,使用黄金标签数据集和LLM评判器来进一步提升性能。
我们使用Chatbot Arena数据和数据增强的混合训练了四个路由器:
- 一种相似度加权(SW)排名路由器,基于相似度执行“加权Elo计算”
- 一种矩阵分解模型,学习模型回答提示效果的评分函数
- 一种BERT分类器,预测哪个模型能提供更好的响应
- 一种因果LLM分类器,也预测哪个模型能提供更好的响应
结果
我们在三个流行的基准上评估了这些路由器:MT Bench、MMLU和GSM8K,下面展示MT Bench和MMLU的结果。在评估中,我们在GPT-4 Turbo作为强模型和Mixtral 8x7B作为弱模型之间进行路由。我们使用之前的随机路由器作为基线。
图3:路由器在MT Bench上的性能(左)仅使用Arena数据训练(右)使用LLM评判器增强的Arena数据训练。
图3展示了我们的路由器在MT Bench上的性能。对于仅使用Arena数据集训练的路由器,我们观察到矩阵分解和SW排名都表现出色。值得注意的是,矩阵分解在使用26%的GPT-4调用的情况下达到了GPT-4性能的95%,与随机基线相比大约便宜48%。
使用LLM评判器增强Arena数据使所有路由器都有显著改进。在这个增强数据集上训练时,矩阵分解再次成为表现最好的路由器,达到95% GPT-4性能所需的GPT-4调用次数进一步减半至总调用次数的14%,比随机基线便宜75%。
图4:路由器在MMLU上的性能(左)仅使用Arena数据训练(右)使用来自MMLU验证集的黄金标签数据增强的Arena数据训练。
相反,在图4的MMLU上,当仅使用Arena数据集训练时,所有路由器表现都很差,接近随机水平,我们将此归因于大多数MMLU问题属于分布外。然而,使用来自MMLU验证集的黄金标签数据增强训练数据集使所有路由器都有显著性能提升,我们表现最好的因果LLM路由器现在仅需54%的GPT-4调用即可达到95%的GPT-4性能,比随机基线便宜14%。重要的是,这个约1500个样本的增强数据集不到整体训练数据的2%,证明了即使样本数量很少,数据增强也是有效的。
RouteLLM与商业产品对比
图6:我们的路由器与现有路由系统在MT Bench上的比较(左)使用gpt-4-turbo-2024-04-09和llama-2-70b-chat(右)使用gpt-4-turbo-2024-04-09和mixtral-8x7b-instruct-v0.1
在图 6 中,我们还报告了我们表现最佳的路由器在 MT Bench 上相对于 Martian 和 Unify AI 的性能,这两款产品是公司发布的 LLM 路由产品。我们使用最新的 GPT-4 Turbo 作为强模型,并根据此处详述的方法,选择 Llama 2 70B 或 Mixtral 8x7B 作为弱模型。我们的路由器展示了非常出色的结果,达到了与这些商业路由器相同的性能,同时成本降低了 40% 以上。
泛化到其他模型
虽然我们在上述评估中是在 GPT-4 和 Mixtral 之间进行路由,但为了展示我们框架的泛化能力,我们还展示了在不同模型对之间路由时的 MT Bench 结果:Claude 3 Opus 和 Llama 3 8B。重要的是,我们使用了相同的路由器,没有任何重新训练,而且 Claude 3 Opus 和 Llama 3 8B 的响应并不存在于我们的训练数据中。

图 7:路由到 Claude 3 Opus 和 Llama 3 8B 时,路由器在 MT Bench 上的性能。
即使替换了模型对,我们在图 7 中仍观察到所有路由器在 MT Bench 上都取得了出色的结果,性能与我们最初的模型对相当。这表明我们的路由器已经学习到了一些能够区分强模型和弱模型的问题的共同特征,这些特征无需额外训练即可泛化到新的模型对。
结论
这些结果证明了我们的路由器能够在保持高质量响应的同时实现显著的成本节约。它们还凸显了数据增强在仅使用少量数据的情况下提升路由性能的有效性,为改进真实世界用例中的路由性能提供了一条可扩展的路径。
基于这项研究,我们在 GitHub 上创建了一个用于服务和评估路由器的开源框架。我们还在 HuggingFace 上发布了我们所有的路由器和数据集,供公众使用。
我们很期待看到你在此基础上构建出什么!如果你遇到任何问题或有任何建议,请告诉我们。如需完整细节,请参阅我们的 arXiv 论文。
致谢
我们感谢 Tyler Griggs 对本文提供的宝贵反馈。
引用
@misc{ong2024routellmlearningroutellms,
title={RouteLLM: Learning to Route LLMs with Preference Data},
author={Isaac Ong and Amjad Almahairi and Vincent Wu and Wei-Lin Chiang and Tianhao Wu and Joseph E. Gonzalez and M Waleed Kadous and Ion Stoica},
year={2024},
eprint={2406.18665},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2406.18665},
}
@misc{chiang2024chatbot,
title={Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference},
author={Wei-Lin Chiang and Lianmin Zheng and Ying Sheng and Anastasios Nikolas Angelopoulos and Tianle Li and Dacheng Li and Hao Zhang and Banghua Zhu and Michael Jordan and Joseph E. Gonzalez and Ion Stoica},
year={2024},
eprint={2403.04132},
archivePrefix={arXiv},
primaryClass={cs.AI}
}
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org