跳到正文
热点事件持续更新

博主调侃带娃如同训练两个小型语言模型

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026年10月7日,博主 LLMJunky 以训练大模型的口吻自嘲晒娃,把带娃比作训练两个小型语言模型(SLM)。他称这两只「模型」正处在 post-training 阶段,各自的预训练耗时 9 个月,且算力账单还在源源不断地来。强化学习(RL)方面,除出现「奖励黑客」——一哭就能拿到零食——之外进展顺利。他还列出「模型」的毛病:幻觉率高,输出高度重复(同一句「为什么」要问 400 遍),对蔬菜和睡觉的拒绝率极高。评测结果则是:在「制造混乱」基准上碾压式领先,在「收拾混乱」上彻底翻车。截至该帖发布,事件仍停留在这一则自嘲式分享,报道中未见后续进展或其他人的回应。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    LLMJunky 自嘲在训练两个「SLM」:9 个月预训练,奖励机制靠零食

    LLMJunky 用大模型训练口吻晒娃式自嘲:手上两个「SLM」正在 post-training,各自预训练花了 9 个月,算力账单还在来。RL 除「奖励黑客」(一哭就有零食)外进展顺利,幻觉率高、输出高度重复(「为什么」问 400 遍)、对蔬菜和睡觉拒绝率极高。这两只「模型」在「制造混乱」基准上碾压,在「收拾混乱」上翻车。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。