跳到正文
热点事件持续更新

HouseholdBench:评估 LLM 预测家庭经济行为

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,arXiv cs.CL 收录的 HouseholdBench 提出用 6 项美国住户调查、32 个预测任务,评估 LLM 对家庭消费、收入、劳动、预期与住房行为的预测能力。研究测试了 13 个闭源与开源权重 LLM,结果显示多数模型超过 no-change baseline,表现最好的模型把数值结果误差降低 12.2%;但梯度提升树在多数任务上排名第一,开源权重模型整体落后。研究还发现,经微调并对每个观测聚合 16 次预测后,一个 4B 开源权重模型可追平闭源模型的表现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CL
    HouseholdBench:评估 LLM 作为家庭经济行为预测器的表现

    HouseholdBench 用 6 项美国住户调查和 32 个预测任务,评估 LLM 对家庭消费、收入、劳动、预期与住房行为的预测。13 个闭源与开源权重 LLM 中多数超过 no-change baseline,最佳模型将数值结果误差降低 12.2%,但梯度提升树在多数任务排名第一,开源权重模型落后。微调并对每个观测聚合 16 次预测,可让 4B 开源权重模型追平闭源模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。