跳到正文
原文
arXiv cs.CL· Amanda Fitch·· 2 天前AI 评分35

措辞胜过顺序:Gemma 4 的行为评测

Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4

AI 导读

对 Google 预训练模型 Gemma 4-e4b 的行为评测发现,输入两份冲突文档时,来源语义框架对答案的影响显著强于文档顺序。评测含 13 个条目、784 次前向传播,模型偏好先读到的第一份文档,但首因效应强度随表面措辞波动至少 5 倍。两份文档逐字模板相同时首因效应显著增强,整体措辞变化则削弱位置偏差。

来源:arXiv cs.CL · arxiv.org