AGI Hunt· LoudYogurtcloset7856·· 7 小时前AI 评分32
Reddit 用户用 AI 做 LLM 可解释性研究:称指令力呈线性表征
小白用 AI 做可解释性研究:称验证指令力呈线性表征
AI 导读
一位 Reddit 用户让 AI 全程设计并执行 LLM 可解释性研究,称祈使 vs 陈述的指令力在残差流中折叠为一维线性子空间、第 1 层探针准确率达 100%。研究用线性探针、因果激活修补和稀疏自编码器(SAE)检验 5 个假设,SAE 重构解释方差 99%、找到 55 个纯度 ≥80% 的单义特征。作者坦承不懂研究,结果真实性待验证。
来源:AGI Hunt · agihunt.info