arXiv cs.CL· Jin Huang, Diego Ferreras Garrucho, Yutong Xie, Walter M. Yuan, Qiaozhu Mei, Chen Lian, Jonathon Hazell·· 4 小时前AI 评分37
HouseholdBench:评估 LLM 作为家庭经济行为预测器的表现
HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior
AI 导读
HouseholdBench 用 6 项美国住户调查和 32 个预测任务,评估 LLM 对家庭消费、收入、劳动、预期与住房行为的预测。13 个闭源与开源权重 LLM 中多数超过 no-change baseline,最佳模型将数值结果误差降低 12.2%,但梯度提升树在多数任务排名第一,开源权重模型落后。微调并对每个观测聚合 16 次预测,可让 4B 开源权重模型追平闭源模型。
来源:arXiv cs.CL · arxiv.org