AGI Hunt· sh_reya·· 3 小时前AI 评分38
数据库老兵押注负载感知推理:批处理 LLM 任务可省大量重复计算
AI 导读
数据库从业者 sh_reya 看好 workload-aware inference,认为预先掌握全部请求即可对批处理 LLM 任务做整任务规划。做法包括在同一 LLM 操作内重排请求以共享 KV cache、先执行选择性最高的过滤器、跨操作复用文档的 KV cache。还可在请求共享前缀时换用不同的 attention kernel,让共享 KV 只从 HBM 读一次,而非每请求读一次。
来源:AGI Hunt · agihunt.info