热点事件持续更新
博主调侃带娃如同训练两个小型语言模型
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年10月7日,博主 LLMJunky 以训练大模型的口吻自嘲晒娃,把带娃比作训练两个小型语言模型(SLM)。他称这两只「模型」正处在 post-training 阶段,各自的预训练耗时 9 个月,且算力账单还在源源不断地来。强化学习(RL)方面,除出现「奖励黑客」——一哭就能拿到零食——之外进展顺利。他还列出「模型」的毛病:幻觉率高,输出高度重复(同一句「为什么」要问 400 遍),对蔬菜和睡觉的拒绝率极高。评测结果则是:在「制造混乱」基准上碾压式领先,在「收拾混乱」上彻底翻车。截至该帖发布,事件仍停留在这一则自嘲式分享,报道中未见后续进展或其他人的回应。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 05:10
10月7日博主 LLMJunky 自嘲两个「SLM」正做 post-training,吐槽奖励黑客与超高的输出重复率。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntLLMJunky 自嘲在训练两个「SLM」:9 个月预训练,奖励机制靠零食
LLMJunky 用大模型训练口吻晒娃式自嘲:手上两个「SLM」正在 post-training,各自预训练花了 9 个月,算力账单还在来。RL 除「奖励黑客」(一哭就有零食)外进展顺利,幻觉率高、输出高度重复(「为什么」问 400 遍)、对蔬菜和睡觉拒绝率极高。这两只「模型」在「制造混乱」基准上碾压,在「收拾混乱」上翻车。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。