跳到正文
原文
arXiv cs.CL· Gurbir Arora, Toni J. B. Liu, Jiajun Bao, Rapha\"el Sarfati, Christopher J. Earls·· 4 小时前AI 评分38

LLM 组合任务中的因果与可解释结构

Causal and Interpretable Structures in LLM Compositional Tasks

AI 导读

Llama、Qwen、Gemma 和 Mistral 在 LLM 组合任务中呈现一致的逐层表示机制。中间层使用基于其中两个 token 推断关系的联合表示,后层使用涉及全部三个 token 的联合表示;限制到因果相关联合表示还能提升下一 token 预测准确率。另一些 token 关系虽具几何结构,却在下一 token 预测中不具因果作用。

来源:arXiv cs.CL · arxiv.org