跳到正文
原文
AGI Hunt· Kyrannio·· 2 小时前AI 评分27

LLMJunky 自嘲在训练两个「SLM」:9 个月预训练,奖励机制靠零食

博主自嘲在训练两个「小型语言模型」:9 个月预训练,奖励机制靠零食

AI 导读

LLMJunky 用大模型训练口吻晒娃式自嘲:手上两个「SLM」正在 post-training,各自预训练花了 9 个月,算力账单还在来。RL 除「奖励黑客」(一哭就有零食)外进展顺利,幻觉率高、输出高度重复(「为什么」问 400 遍)、对蔬菜和睡觉拒绝率极高。这两只「模型」在「制造混乱」基准上碾压,在「收拾混乱」上翻车。

来源:AGI Hunt · agihunt.info