Core claim
论文的核心判断不是“多模型共存”,而是 request-level autoscaling 在 LLM 长服务时间下仍会被活跃模型数卡住;Aegaeon 用 token-level scheduling 和低成本 preemptive autoscaling 才把池化密度推到生产可用。
Long tail + burst
Aegaeon 的问题背景是 Alibaba Cloud Model Studio 这类模型市场:模型很多、请求分布极不均匀,dedicated serving 会给低频模型预留整张 GPU,同时热门模型又需要额外冗余抗突发。
The bottleneck
即使请求总量低,LLM 请求服务时间长也会让很多模型同时处于 active 状态。现有 autoscaling 只能等一个请求完成后再换模型,少配 GPU 会让新模型请求在队首阻塞。
Token-level pivot
request-level 让模型 B/C 等待模型 A 的完整请求完成;token-level 则在每步 prefill/decoding 之间抢占,把 pending model 拉上 GPU,从而减少 TTFT/TBT deadline miss。
SLO lens
论文把 SLO 定义为 token deadline 达标比例。TTFT 太慢会造成用户明显停顿;单个后续 token 延迟可能被已输出内容缓冲掩盖,因此 prefill 与 decoding 需要不同调度策略。
System shape
Proxy 接收不同模型请求;实例被划分为 prefill 和 decoding;每个实例内部有 scheduler、VRAM buffer、unified CPU KV cache、model cache,并通过 Redis 同步请求状态。
Why split phases
prefill-first 会在突发请求中伤害 TBT;decoding-first 会在长输入请求中伤害 TTFT。Aegaeon 因此把 GPU pool 分成 prefill partition 和 decoding partition。
From tens of seconds to token-loop feasible
Fragmentation control
Aegaeon 启动时一次性申请模型权重和 KV cache 所需 VRAM,monkey-patch 参数分配进入自管 buffer;CPU 侧用 unified KV cache 处理不同模型 KV 形状,减少碎片和复制阻塞。
The hidden race
为了继续压低 autoscaling 延迟,Aegaeon 让 KV swap-in 和 swap-out 在不同 CUDA stream 异步执行;但推理、源块和目标块都有依赖,必须用 event 保护。
Goodput boundary
Production readout