跳到正文
原文
AGI Hunt· Lennart Carstens-Behrens·· 3 小时前AI 评分53

300M 参数的 PFLM 在无真实语言的合成数据上预训练,靠上下文学会学习语言

300M 模型只学「非语言先验」,在上下文中学会学会语言

AI 导读

Lennart Carstens-Behrens 提出的 PFLM(Prior-Fitted Language Model)是一个 300M 参数的字节级 transformer,预训练数据完全不含任何真实语言,训练序列全部由循环结构因果模型(SCM)生成,且同一语言从不出现两次,权重全程冻结、纯靠上下文学习。

来源:AGI Hunt · agihunt.info