基于大型语言模型(LLM)的应用包含一系列任务,以提升解决现实问题的能力,这些任务在不同后端上具有动态需求量。现有的服务系统将LLM应用的资源需求视为黑箱,这导致由于不当排队顺序和后端预热延迟而损害了端到端的效率。我们发现LLM应用的资源需求可以通过概率需求图(PDGraph)以一般而准确的方式进行建模。然后,我们提出Hermes,利用PDGraph实现LLM应用的高效服务。在面对概率需求描述时,Hermes应用Gittins策略来确定可以最小化平均应用完成时间的调度顺序。它还使用PDGraph模型在适当时刻帮助预热冷后端。对各种LLM应用的实验确认,Hermes可以有效提升应用服务效率,使平均完成时间减少超过70%,P95完成时间减少超过80%。
Liu et al.(星期二)研究了这个问题。