跳到正文
原文
Google Research·· 15 天前AI 评分37

绕过推理瓶颈:Google Research 用 Retrieve-for-Train 加速复杂 AI 搜索

Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train

AI 导读

Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。

来源:Google Research · research.google