跳到正文
热点事件持续更新

Qwen3-Omni 单卡 RTX 5090 首包延迟降至 23ms

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026 年 10 月 5 日,AGI Hunt 报道称,Fractalyze 团队针对 vLLM-Omni 上的 Qwen3-Omni 完成优化,使其能够在单张 RTX 5090 上运行。据报道,在 AWQ 4bit 量化、batch-1 文本提示的测试条件下,首段音频生成时间(首包音频延迟)从 213ms 降至 23ms。报道还提到,完整工件已发布在 Hugging Face;vLLM 官方呼吁将相关优化贡献回上游 vLLM-Omni。目前该事件处于优化成果公开、等待上游合并的阶段,报道未提及后续合入时间表或更多硬件上的测试数据。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    Fractalyze 优化 Qwen3-Omni:单张 RTX 5090 首包音频延迟从 213ms 降至 23ms

    Fractalyze 团队优化了 vLLM-Omni 上的 Qwen3-Omni,使其能在单张 RTX 5090 上运行;在 AWQ 4bit 量化、batch-1 文本提示测试中,首段音频生成时间从 213ms 降至 23ms。完整工件已发布在 Hugging Face,vLLM 官方呼吁将优化贡献回上游 vLLM-Omni。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。