AGI Hunt· kylelostat·· 11 小时前AI 评分35
Ai2 新论文解谜 Olmo 3 训练:短上下文相当的两模型长上下文表现迥异
新论文解谜 Olmo 3 训练:短上下文相当的两模型长上下文表现迥异
AI 导读
Ai2 研究者 abertsch72 发布论文 Cracks in the Foundation,解释训练 Olmo 3 时发现的一个谜题:两个模型在短上下文评测上几乎表现一致、使用完全相同的训练数据,但在长上下文扩展后行为却截然不同。作者 kylelostat 将携该论文与 7B 混合架构模型 Olmo Hybrid 参加 COLM 2026 会议。
来源:AGI Hunt · agihunt.info