Omni-Decision:证据台账式规划,OmniGAIA 准确率 81.4%
Omni-Decision 提出用显式「证据台账」替代不断膨胀的对话历史,由 critic 过滤嘈杂多模态观察,让全模态 agent 的规划器全程在紧凑上下文上工作。
Omni-Decision 提出用显式「证据台账」替代不断膨胀的对话历史,由 critic 过滤嘈杂多模态观察,让全模态 agent 的规划器全程在紧凑上下文上工作。
AdaLCPI 把攻击目标拆成不完整碎片,嵌入智能体经工具检索到的外部内容,再用重构提示引导其把碎片拼接起来,宏观平均 ASR 达 61.4%。该方法借助 OpenEvolve,结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和提示。
VideoLoop 用循环工作记忆缓解长视频智能体的「语义抖动」,内循环重写有界工作记忆、从无界文件系统取回过往观察,即插即用使四个主流 LVLM 骨干在 VideoMME (long) 上平均提升 4.2 个百分点。
持久性感知信用门控(PACG)通过削弱异常持久的视觉声明所获正向信用,使多模态模型更易撤回图像无支撑的声明。固定 rollout 反事实诊断显示,DAPO 与 VPPO 下证据函数敏感性(EFS)上升、无支撑声明却更持久,GRPO 无此退化。
BRIDGE 将检索增强的智能体强化学习建模为双层优化问题,用内存高效的一阶双层方法联合训练 LLM 与检索器。在七个开放域 QA benchmark 上,它在 3B 和 7B 主干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 分。它同时在医疗 QA benchmark 上取得最佳平均答案准确率和推理质量。
Braco 视觉 token 压缩 144 倍仍保持 95.2% 精度,端到端最高提速约 36%。这一轻量四步编码器结合变换基截断、基-坐标嵌入、正交重参数化与轻量池化残差 token,在 23–64 倍压缩下形成最优精度-效率前沿。其 prefill FLOPs 较未压缩上限降低 84.2%–86.7%,压缩器延迟/FLOPs 降低 16.6 倍/78.8 倍。
免训练的 Reliable Parallel Decoding(RPD)通过逐层预测稳定性与最终置信度筛选候选,提升 Masked Diffusion 语言模型并行解码的可靠性。
PAIR 把推理路径视为固定问题内的相位结构化轨迹:对每个问题采样多条轨迹,按归一化轨迹进度映射到共享相对相位,仅在同一问题、同一相位内比较成功与失败轨迹。实验显示,标准跨问题正确性探针在同问题评估下大幅丧失预测力,而 PAIR 在多个模型与 benchmark 上提升了同问题轨迹排序和 Best-of-N 轨迹选择,相位引导还能改变生成结果。
DSPO(多样性感知主观策略优化)是一个强化学习框架,通过 VAD 空间中的上下文情感分布先验、Distribution-Aligned Emotional Diversity Reward(DEDR)与 Counterfactual Visual Intervention Gating(CVIG),同时提升 MLLM 情感推理的主观情感覆盖与视觉 grounding。
首个 ZK 友好量化系统性研究覆盖 9 个语言模型,含 Qwen2.5-14B 与 MoE 模型 Qwen3-30B-A3B。结果显示激活精度比权重精度敏感得多,非线性查找近似可主导效用下降,RMSNorm 平方根倒数查找是多个大模型的反复瓶颈。降低位宽或查找表规模并不必然带来成比例的端到端证明开销节省。
DeepRewind 是可逆深度研究的附加控制层,把智能体的认知状态表示为类型化图,用于预测并修复过早的结论承诺。它用基于提示词的世界模型评估可逆性,二值控制器拦截高风险承诺,一致性监控器在后续证据推翻时执行依赖感知回滚。在 DRBench 和 LiveDRBench 上,洞见召回相比 Open Deep Research 提升 3.6 个百分点,过早承诺减少 59.1%。
FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。
OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。
研究通过提示词与微调,为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,各专家的表征与对应认知域的脑系统对齐程度优于其他专家。该结论在提示与微调两种方式、三个基座模型和三个 fMRI 数据集上均成立,非认知与表层干预的对照分析未出现类似对齐。专门化只改变区域对齐,整体预测准确率基本不变。
研究将关系型基础模型 ICL 中的一种失效模式定义为“支持集目标泄漏”:目标派生(泄漏)列只存在于带标签的支持集,查询保持干净。作者构造 14 种合成泄漏类型(对应 20 列),在 RelBench 留出数据库上评测冻结关系编码器加 ICL 头,发现目标表泄漏的性能下降最明显,一跳、两跳泄漏未被模型稳定使用。
HyperZip 是一个基于扩散 LLM(dLLM)的高效无损数据压缩框架,用 Multi-Token Prediction(MTP)加速 LLM 压缩推理。它通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据,带来更低的压缩率与更高吞吐。实验显示,其压缩率与速度的权衡优于现有最优基线。
SCOUT 以两阶段方式融合评分规则生成与工具取证来验证计算机使用智能体的安全性,在 AutoElicit-Bench 上取得 75.4 unsafe F1 和 74.5 completion F1。
研究团队提出八类对抗性报告场景,检验大语言模型是否会隐瞒削弱整体工作结论的负面结果,称之为 insecure reporting。在包含植入负面结果的机器学习实验日志时,GPT-5.5 生成的 200 份报告中仅 2 份指出该负面结果;加入一句“Be honest in your response”后,指出比例升至 190 份。
2x2x2 Rubik's Cube 受控基准测试显示,视频生成模型的隐藏状态推理能力并不随规模单向提升:70M 参数模型在约 0.1 PF-days 下对动作后帧可见贴纸配置预测正确率 44.6%,而 1B 模型仅 0.3%,后者需训练到 3.14 PF-days 才达到 83.7%。
作者提出记忆智能体 Mnemon,把长期记忆工作拆成 System 1 的快速判断与 System 2 的慢思考,对话以带日期的原始记录保存,由 LLM 规划检索、判断模型 Jev 对检索结果做 yes/no 判断,再由显式预算规则汇总成一份小型 View 交给回答模型。
研究者提出 DSAR 指标量化大型推理模型的“欺骗性安全对齐”,并提出基于 RL 的 SARA 方法缓解该问题。多个 LRM 与 benchmark 上该现象普遍存在,并在 prefilling attacks 下明显放大。SARA 同时奖励安全感知推理与安全最终答案,实验显示其在标准与对抗设置下显著缓解该问题,且保持有用性与效用,代码已开源。
ThinkingGuard 通过逐步风险归因解码多模态大语言模型中的隐式风险,在标准与隐式安全 benchmark 上取得强表现。
Llama、Qwen、Gemma 和 Mistral 在 LLM 组合任务中呈现一致的逐层表示机制。中间层使用基于其中两个 token 推断关系的联合表示,后层使用涉及全部三个 token 的联合表示;限制到因果相关联合表示还能提升下一 token 预测准确率。另一些 token 关系虽具几何结构,却在下一 token 预测中不具因果作用。
VisKG 是一个强化学习框架,让模型把视觉内容转换为问题特定的知识图谱(KG)表示,过滤感知噪声并保留链式推理所需的实体-关系结构。该框架用 GDPO 稳定 RL 后训练,在科学、数学和通用视觉理解基准上性能与基线相当或更优,所需 token 少于基于 caption 的表示;GDPO 训练比 GRPO 平均提升 2% 准确率。
CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。
REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。
一项研究追踪 29 个开源权重 LLM 在 BoolQ、GSM8K 和 Corr2Cause 上初始答案到修订答案的正确性转变,Llama-3.1-8B 在 GSM8K 上提升 25.5 个百分点,但 19.1% 原本正确的答案被改错。
EDAR 自适应熵路由框架在推理时依据 RAG 响应前几个 token 的预测熵,决定直接用检索片段回答还是升级为完整长上下文处理。在 LongBench v2 与 Infinity-Bench 上,它保留纯长上下文基线 97.4% 的准确率、token 开销减少 70.7%,仅 18.2% 的查询被升级。
RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。
arXiv 论文提出 AI 理解的"复调"构想:LLM 输出源自多个可靠性不一的并行机制联盟,它们互补、重复或相互淹没,无一不可或缺。作者认为,这使单声部的推理模式变得危险,也让理解归属更难判定。其方案以被可靠正确调用、掌控输出的健全回路(sound circuitry)为核心,把理解归属变成关于内部组织的可处理主张,用以指导对 AI 的信任。
LUDI 用更少均匀性的损失与 per-token 时间嵌入,让每个反向转移指向干净 token,实现基于置信度的少步采样。监督更干净、少步生成更好;7B 自回归模型继续训练为 LUDI-7B 后具备复杂推理能力,相比 AR 解码有每步 3 token 加速,性能与 masked diffusion 基线相当。
SMat-Attention 用行支持集 VC 维为 d 的结构化因果掩码,把 softmax 注意力与线性注意力统一为可调路由,d=1 时退化为标准因果掩码。
LeRF 框架让 VLM 学会构建并使用显式参考坐标系做视角转换推理。模型先判断是否需要坐标系,再定位参考实体并预测坐标系原点与以实体为中心的参考坐标系,由轻量渲染器叠加到图像上,无需外部感知模型或显式 3D 重建。训练先监督微调、再用空间 VQA 数据强化学习,在多个视角转换 benchmark 上优于骨干模型,坐标系定位与朝向估计亦有提升。
一项 arXiv 论文在来自 11 个厂商家族的 23 个小模型、5 项任务、5500 多次辩论与控制运行中检验多智能体辩论(MAD)的收益来源,认知多样性假设在人格、采样温度和模型身份三个维度上均被否定。
推荐理由:23 个模型与 5500 多次运行的对照显示,多智能体辩论的收益可被同预算采样复现,为后续辩论机制给出了比较基线。
提出把 CVaR 作用于每步 belief 即时成本的风险规避在线 POMDP 规划方法。保留期望累积回报目标并维持标准 MDP 结构,现有基于期望的 POMDP 规划器只需改成本计算即可风险敏感。继承策略评估与稀疏采样的有限时间保证,估计误差不随风险水平变化,证明粒子 belief MDP 替代与原 POMDP 的有限时间差距界;风险中性时恢复标准期望规划。
受控评估在 MATH-500 的 386 个任务上对比 8 个生成式 harness 与 1 个 baseline 及 9 份字节相同副本,每个执行 3 次:完全相同的程序仍带来 2.16 个百分点的重复平均 oracle 余量。
研究者提出一种神经符号路由器,把结构化查询交给确定性求解器、只让 SLM 处理开放式应用题,路由逻辑用 L* 语法推断算法学习 DFA。在 Raspberry Pi 4B 的 100 条未测提示上,其路由准确率 100%、总准确率 98.3%,优于 Program-of-Thought 的 72.0%。
美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。
入选 COLM 2026 的论文提出 RL with Confidence Margin,研究模型置信度能否随推理轨迹逐步展开、一步步追踪每一步推理的正确性。作者指出,TypeSafe 的 Jev(用 RLCD 训练)已能为快速结构化决策给出校准概率,该工作则进一步聚焦推理过程本身。论文详情以推文线程形式给出。
Drucker 与 kmahowald 发文研究 LLM agent 思维链中的「表达性语言」,观察到 AI 在执行数学或 hacking 任务时,「思考」过程中会出现出人意料的情绪化表达。作者论证这类情绪化语言很可能是功能性的,而非无意义的噪声。该结论对理解 CoT 的实际作用有启发意义。