跳到正文
原文
AGI Hunt· vllm_project·· 5 小时前AI 评分42

vLLM-Omni 流式架构首音频块仅 47ms,绕过整段生成等待

AI 导读

vLLM-Omni 的流式架构把语音生成首个音频 chunk 的 wall-clock 延迟压到约 47ms,无需等待完整序列生成。Talker 将 codec 码流式写入共享内存环形缓冲区,Code2Wav 分块消费并逐块输出 PCM,客户端随解码随收;而默认 transformers.generate() 需先生成全部 codec 码再一次性解码。

来源:AGI Hunt · agihunt.info