AGI Hunt· Bulky_Ring_244·2026-09-30 21:07· 3 小时前AI 评分46「对话式个人档案」RAG 应用砍到两次模型调用,首 token 延迟仍偏慢RAG 应用砍到两次模型调用后,首 token 延迟依然偏慢AI 导读「对话式个人档案」RAG 应用砍到两次托管模型调用:先分类消息并按需改写为检索 query,再基于本地 Tantivy 索引至多 5 份文档生成回答,但串行调用使首 token 延迟仍偏高。来源:AGI Hunt · agihunt.info#教程/实践#RAG#部署/工程查看事件全部后续