Masked Diffusion 语言模型中的可靠并行解码(RPD)
免训练的 Reliable Parallel Decoding(RPD)通过逐层预测稳定性与最终置信度筛选候选,提升 Masked Diffusion 语言模型并行解码的可靠性。
免训练的 Reliable Parallel Decoding(RPD)通过逐层预测稳定性与最终置信度筛选候选,提升 Masked Diffusion 语言模型并行解码的可靠性。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为 reader 的记忆接口,用任务结果的组相对奖励加冻结教师的 on-policy 蒸馏信号在 reader 自身 rollout 上训练,推理时移除教师。
一种新算法不再让子目标同时覆盖状态所有方面,而是为每个子目标识别少量相关特征,生成泛化更广、加速探索的选项。现有 option discovery 算法采用 state-reaching,导致选项仅适用于狭窄状态区域、数量爆炸并阻碍奖励最大化。该方法学习抽象可迁移选项,在三个稀疏奖励图像域(含 Atari 游戏 MontezumasRevenge)中实现快速探索。
论文研究带持久记忆的 LLM 能否按用户要求遗忘信息,发现现有模型即使声称已忘记、在有限上下文下仍无法删除这些信息。作者指出,简单删掉与删除请求匹配的消息并不够,因为对话本身会产生消息依赖,使信息继续留存。为此论文提出 DeLLM 框架,为每次查询动态构建相关上下文,并维护消息来源图以确定删除时须移除哪些消息,实验显示其在高删除率下仍保持可用性。
PAIR 把推理路径视为固定问题内的相位结构化轨迹:对每个问题采样多条轨迹,按归一化轨迹进度映射到共享相对相位,仅在同一问题、同一相位内比较成功与失败轨迹。实验显示,标准跨问题正确性探针在同问题评估下大幅丧失预测力,而 PAIR 在多个模型与 benchmark 上提升了同问题轨迹排序和 Best-of-N 轨迹选择,相位引导还能改变生成结果。
研究者用 Values Survey Module 2013 审计 TypeSafe 决策式模型 JEV 的文化价值观,以沙特与美国人格设定、英语和阿拉伯语收集 288,000 条答案。JEV 回答高度可重复(ICC 0.997),无人格时接近其美国人格;沙特人格下向人类沙特-美国差异移动,英文复现 87%、阿拉伯语 62%,长期取向反转。
DSPO(多样性感知主观策略优化)是一个强化学习框架,通过 VAD 空间中的上下文情感分布先验、Distribution-Aligned Emotional Diversity Reward(DEDR)与 Counterfactual Visual Intervention Gating(CVIG),同时提升 MLLM 情感推理的主观情感覆盖与视觉 grounding。
首个 ZK 友好量化系统性研究覆盖 9 个语言模型,含 Qwen2.5-14B 与 MoE 模型 Qwen3-30B-A3B。结果显示激活精度比权重精度敏感得多,非线性查找近似可主导效用下降,RMSNorm 平方根倒数查找是多个大模型的反复瓶颈。降低位宽或查找表规模并不必然带来成比例的端到端证明开销节省。
DuLBE 以双模式低秩学习结合桥原型集成分类器,实现免样本的视觉-语言类增量学习并达到 SOTA 性能。它按梯度需求分配两种视觉低秩更新模式并以梯度路由协调:共享模式复用可迁移知识,残差模式为任务特定变化提供低干扰通道。方法还在单位超球面上为视觉原型与文本嵌入构建测地桥并集成可靠的桥原型,以弥补文本决策边界的模态差距,同时保持低秩调优的参数效率。
DeepRewind 是可逆深度研究的附加控制层,把智能体的认知状态表示为类型化图,用于预测并修复过早的结论承诺。它用基于提示词的世界模型评估可逆性,二值控制器拦截高风险承诺,一致性监控器在后续证据推翻时执行依赖感知回滚。在 DRBench 和 LiveDRBench 上,洞见召回相比 Open Deep Research 提升 3.6 个百分点,过早承诺减少 59.1%。
研究者把 Transformer 语言模型中上下文 token 吸收进权重形成的乘法算子称为“安全算子”,其主导特征值可像连续旋钮一样调节安全指令对生成的影响强度。
FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。
论文提出口述训练(VT),让 LLM 更愿意口述自身的评估意识,同时不直接监督潜在信念。VT 把 rollout 截断在模型自发口述之前、以模型已知情的训练前缀配合 RL 目标校准口述比例;在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,可口述的评估意识提升 2.4-2.9 倍,并能迁移到未见过的智能体场景,测得的潜在评估意识与行为基本稳定。
研究在 13 个 RelBench 任务与 5 种关系 ICL 配置上测试 20 个目标派生特征,0-hop 目标表与包含全部 20 个泄漏列的 Full 泄漏造成最大评估偏差。泄漏影响高度依赖任务与模型,聚合变化很小时也可能反转模型变体的相对结论。Integrated Gradients 筛查在 0-hop 与 Full 条件下排序质量最佳,但删除检出的泄漏列不能稳定恢复干净评估。
NesTok 提出面向动态视觉 tokenizer 的嵌套自对齐框架,通过跨长度训练让短 token 序列接近全长序列的重建质量,在 ImageNet 上 rFID 达 0.98。其下游图像生成在 ImageNet 256×256 上取得现有可变长度自回归图像生成方法中最优 gFID 1.46。代码将公开。
HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。
PhenoAIR 是可靠性感知的多智能体框架,在来自 JUMP Cell Painting 的基准所有 MOA 预测设置中超过表征匹配与 LLM 基线。它将 Cell Painting 的 MOA 预测从表征匹配重构为校准证据推理,维护以候选为中心的证据记忆,并用离线参考集校准按来源可靠性、表型稳定性和机制级混淆加权。该工作入选 NeurIPS 2026 main track。
MoRe-Drag 是运动锚定的拖拽式编辑方法,将像素空间 warping 作为粗运动证据注入生成采样轨迹。它通过区域感知潜在重组和阶段自适应条件,从运动结构生成转向语义精修,并以适配 MLLM 文本编码器实现无指令界面。在 DragBench-SR 和 DragBench-DR 上,其拖拽精度优于强基础编辑器并领跑 SOTA 拖拽方法,语义一致、视觉真实,代码和数据集将公开。
研究者提出 Population Fidelity 框架,从群体层面准确度、群体间差异量及其结构三个维度评估 LLM 生成回答的人群代表性。将该框架用于复现 LLM 问卷回答“machine bias”研究及更新模型后发现,代表性不佳既因群体间差异不足,也因差异被归入错误群体;cultural fine-tuning 虽能提升与调查中心的契合度,却不改善群体内差异的代表性。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。
AESplat 提出解耦外观建模策略,用于无位姿前馈 3D Gaussian Splatting,以提升新视角合成的渲染质量。该方法无需训练即可从输入图像直接得到表示视角无关基础外观的零阶 SH 系数,高阶 SH 系数则由带两个 3D-aware 归纳偏置的浅层 MLP 预测,以建模视角相关外观变化。
OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。
PersonaDose 校准描述条件 FLAS 控制器,实现人格特质表达的分级控制。在 Llama-3.1-8B、Qwen3-8B、Gemma-3-4B 上,核心特质表达较 contrastive activation addition 提升 33.2、18.3、17.8 分。七个已训练特质上,平均目标误差为 4.7-6.2 分。
研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。
研究通过提示词与微调,为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,各专家的表征与对应认知域的脑系统对齐程度优于其他专家。该结论在提示与微调两种方式、三个基座模型和三个 fMRI 数据集上均成立,非认知与表层干预的对照分析未出现类似对齐。专门化只改变区域对齐,整体预测准确率基本不变。
研究将关系型基础模型 ICL 中的一种失效模式定义为“支持集目标泄漏”:目标派生(泄漏)列只存在于带标签的支持集,查询保持干净。作者构造 14 种合成泄漏类型(对应 20 列),在 RelBench 留出数据库上评测冻结关系编码器加 ICL 头,发现目标表泄漏的性能下降最明显,一跳、两跳泄漏未被模型稳定使用。
RVP(Reparameterized Inter-Class Visual Reprogramming)通过类内聚合多个文本提示词、跨类施加残差修正来重编程视觉语言模型,并建模共享语义成分与类间差异。
新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。
在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。
ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。
FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。
LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。
YORO 提出单次前向、无需反向传播的视觉重编程方法:BDM 从流式类别统计构建协方差感知仿射映射,在冻结响应空间直接生成下游预测器。三组全数据设置中,平均准确率较最强先前无梯度映射提升 18.4–24.4%;16-shot CLIP 上四骨干平均从 71.4% 升至 77.2%。需要进一步输入适配时,YORO-FP 可选微调视觉提示 20 epochs,验证常保留单次预测器。
研究识别出大语言模型的「规范顺序问题」:模型内部概率分布会按字母或时间等规范顺序组织多值关系,偏离该顺序的提示会降低生成完整实体集合的可靠性。机制分析将其集合生成拆为候选实体检索、内部排序与下一元素选择三个阶段。论文已被 AKBC@EMNLP2026 接收。
GAIN 是免反向传播、无样本存储与回放的持续测试时自适应(CTTA)框架,按“历史提议、增益决定”原则,用目标统计生成修正提议、以源相对增益决定每个样本的干预强度。在五个 benchmark 上它取得较强预测性能,ImageNet-C 上以接近源模型的校准达到 61.9% 准确率,并比代表性优化式 CTTA 基线快 15.9x。
研究分析 Gemma 4 31B 对九种非洲语言和三种对照语言的表征,发现英语迁移随语言和层数变化,非洲—西方对比方向在非洲语言之间比与对照语言更对齐。在尼日利亚内部,Yoruba 与 Igbo 在 12 层中的 11 层上比二者与 Hausa 的平均对齐度更高。
HyperZip 是一个基于扩散 LLM(dLLM)的高效无损数据压缩框架,用 Multi-Token Prediction(MTP)加速 LLM 压缩推理。它通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据,带来更低的压缩率与更高吞吐。实验显示,其压缩率与速度的权衡优于现有最优基线。
FastGuide 用并行与自回归解码的自适应混合来加速扩散大语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,并保持相近的生成质量。它按每个解码步骤计算一次引导并复用于多个 token,借助 KV 缓存与注意力稀疏重算降低开销,模型不自信的 token 会被推迟解掩。
rosinality 转发的研究观点称,多模态模型预训练计算量超过 1e22 FLOPs 后可直接去掉视觉编码器,不再需要单独的 vision encoder。该观点认为,在足够大的算力规模下,原生多模态训练可以吸收视觉编码器通常承担的角色。
SCOUT 以两阶段方式融合评分规则生成与工具取证来验证计算机使用智能体的安全性,在 AutoElicit-Bench 上取得 75.4 unsafe F1 和 74.5 completion F1。