跳到正文

#Meta

今日 6 条
今天9月30日周三
  1. AGI Hunt54

    Meta 发布上下文语言模型 CLM 并开源

    Meta 联合华盛顿大学、MIT 等机构提出上下文语言模型 CLM,让模型把上下文当作可自由编辑的文件,而非只能追加的对话记录。实验显示,同算力下 Agent 任务分数提升 65%,多仓库 Agent 任务表现显著改善,同时可节省 21.5% 算力并提升 11.4% 准确率。官方论文与代码已开源。

  2. arXiv cs.CL38

    LLM 组合任务中的因果与可解释结构

    Llama、Qwen、Gemma 和 Mistral 在 LLM 组合任务中呈现一致的逐层表示机制。中间层使用基于其中两个 token 推断关系的联合表示,后层使用涉及全部三个 token 的联合表示;限制到因果相关联合表示还能提升下一 token 预测准确率。另一些 token 关系虽具几何结构,却在下一 token 预测中不具因果作用。

9月29日周二
  1. arXiv cs.CL53

    RAG 过期检索证据会覆盖模型正确答案,论文构建 317 例知识反转基准

    论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。

  2. arXiv cs.CL43

    理解提示词模板在知识蒸馏中对安全对齐的作用

    在从教师到学生的知识蒸馏中,提示词模板选择会显著削弱学生模型已有的安全对齐:聊天模板比非聊天模板让模型更顺从有害查询。该现象在 LLaMA、Gemma 和千问(Qwen)三个模型家族及多个安全基准上一致。非聊天模板蒸馏更能保留学生模型内部表示,聊天模板蒸馏则导致更大的表示偏移。

5月11日周一
  1. Import AI38

    Import AI 456:RSI 与经济增长、AI 监管的「激进可选项」、以及神经计算机

    Institute for Law & AI 研究者提出「radical optionality」,主张政府避免过度监管、提前建设机构与法律授权。建议包括透明度与报告要求、审计机制、举报人保护、评估能力,并加大对 AISI(英国)与 CAISI(美国)的资助。Meta 与 KAIST 的 Neural Computers 提出在习得运行时状态中统一计算、记忆与 I/O 的神经计算机。