热点事件持续更新
HouseholdBench:评估 LLM 预测家庭经济行为
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,arXiv cs.CL 收录的 HouseholdBench 提出用 6 项美国住户调查、32 个预测任务,评估 LLM 对家庭消费、收入、劳动、预期与住房行为的预测能力。研究测试了 13 个闭源与开源权重 LLM,结果显示多数模型超过 no-change baseline,表现最好的模型把数值结果误差降低 12.2%;但梯度提升树在多数任务上排名第一,开源权重模型整体落后。研究还发现,经微调并对每个观测聚合 16 次预测后,一个 4B 开源权重模型可追平闭源模型的表现。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
HouseholdBench 显示多数 LLM 优于 no-change 基线,但梯度提升树仍在多数任务居首。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CLHouseholdBench:评估 LLM 作为家庭经济行为预测器的表现
HouseholdBench 用 6 项美国住户调查和 32 个预测任务,评估 LLM 对家庭消费、收入、劳动、预期与住房行为的预测。13 个闭源与开源权重 LLM 中多数超过 no-change baseline,最佳模型将数值结果误差降低 12.2%,但梯度提升树在多数任务排名第一,开源权重模型落后。微调并对每个观测聚合 16 次预测,可让 4B 开源权重模型追平闭源模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。