arXiv cs.AI· Kartik Ramesh, Kaidi Fu, Zihan Zheng, Jiahuan Yu, Fabio Oliveira, Carlos Costa, Minjia Zhang·· 4 小时前AI 评分37
FluidPD:面向 SLO 的 Prefill-Decode 解耦 LLM 服务原地弹性伸缩
FluidPD: In-Place Elasticity for SLO-Aware Prefill-Decode Disaggregated LLM Serving
AI 导读
FluidPD 为 Prefill-Decode 解耦的 LLM 服务提供 SLO 感知的原地弹性伸缩。FluidToken 在 decode 端空闲时把部分 prefill 计算卸载过去以应对瞬时失衡,FluidRole 则让运行中的 worker 原地切换 P/D 角色,无需重载模型或重启引擎。
来源:arXiv cs.AI · arxiv.org