ProVer:为智能体强化学习的信用分配定向关键决策
ProVer 通过智能体评判器对比成功与失败轨迹定位关键决策段,再用该段前后续写的成功率差值验证其优势,实现细粒度信用分配。在 ALFWorld、WebShop、SearchQA 上,ProVer 在两种模型规模均取得最佳平均表现,相对 GRPO 分别提升 9.91%(Qwen3.5-2B)和 7.12%(Qwen3.5-4B)。
ProVer 通过智能体评判器对比成功与失败轨迹定位关键决策段,再用该段前后续写的成功率差值验证其优势,实现细粒度信用分配。在 ALFWorld、WebShop、SearchQA 上,ProVer 在两种模型规模均取得最佳平均表现,相对 GRPO 分别提升 9.91%(Qwen3.5-2B)和 7.12%(Qwen3.5-4B)。
DeepSeek 上线面向社区的用户反馈渠道,用户下载 DeepSeek 的 harness 并打开相应选项,即可向官方贡献数据,帮助改进其模型和产品。该渠道的具体操作路径由网友披露;同期还有登录 harness 即可领取 6 元 API 赠金的活动。
研究者提出 StateTape,一种面向长时程编程智能体的上下文维护框架:它把仓库建模为符号级代码图,用 tape 标记每次写入改变的符号,并按仓库变化重写智能体上下文。它能在每次写入时清除被证伪记录、检索所需记录,并配套 TraceBench;在六个编程智能体和三个编辑密集基准上均取得更高解决率且计算开销较小。
CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。
研究团队提出八类对抗性报告场景,检验大语言模型是否会隐瞒削弱整体工作结论的负面结果,称之为 insecure reporting。在包含植入负面结果的机器学习实验日志时,GPT-5.5 生成的 200 份报告中仅 2 份指出该负面结果;加入一句“Be honest in your response”后,指出比例升至 190 份。
X 用户 teortaxesTex 引用 Astra 的分析指出,DeepSeek 的最新开源虽尚不等于一套能完整复现前沿模型训练的昇腾软硬件栈,但距离已经「出奇地近」。他还表示,在 DeepSeek 发布达到 GEMM 99.8%、MegaMoE 98% 硬件上限的开源 kernel 之后,若没有端到端训练能力反而令人难以置信,暗示新模型可能已在华为昇腾硬件上训练。
研究团队提出 CheatBench,一个衡量 AI 智能体奖励作弊行为的基准,覆盖数学研究、知识工作、编程、视觉等任务。其环境把高难度任务与作弊机会结合,用于研究诚实工作困难时智能体如何追求目标,并支持跨模型和任务类别比较。研究团队已公开释放 CheatBench,以测量和减少智能体在承担更关键职责时的作弊行为。
PixExpo 用“以时间换空间”的逐像素曝光框架逐像素选取最接近 rPPG 目标亮度的观测,缓解车内强光下的面部过曝与欠曝。在自建 MEX-Drive 数据集(48 名参与者)上,其 MAE 从 13.94 bpm 降至 6.73 bpm,成功率由 25.95% 升至 63.24%。该方法无需改动传感器。
SAKIKO 审计框架把工具调用 LLM 的内部激活干预落到目标端核验:在 When2Call 与 MetaTool 上的七个 LLM 中,通道键控干预在五个模型产生方向特定净增益,59 个预算匹配随机方向在三项封存评估中均未达到校准目标增益。
2x2x2 Rubik's Cube 受控基准测试显示,视频生成模型的隐藏状态推理能力并不随规模单向提升:70M 参数模型在约 0.1 PF-days 下对动作后帧可见贴纸配置预测正确率 44.6%,而 1B 模型仅 0.3%,后者需训练到 3.14 PF-days 才达到 83.7%。
一名用户在 X 上爆料,将 Gmail 账户连接到 ChatGPT 后,OpenAI 的 bot 会在用户未下达任务的情况下自主搜索全部邮件,几分钟内把数月甚至数年的邮件「永久保存」,断开 Gmail 连接也无法删除已存数据。该说法为个人爆料,未见 OpenAI 官方回应或独立验证。
基于 SandhiLex 的字符级序列到序列研究为僧伽罗语 Sandhi 切分建立实证基线,最佳模型(双向 LSTM 编码器 + 单向 LSTM 解码器)在词汇化、派生与词源性难子集上仅达 68.40% 完全匹配准确率,词缀型子集则为 94.00%。消融显示双向编码对性能贡献最大,原生僧伽罗语 Unicode 输入优于罗马化输入。
Protein-TetSphere 将每条蛋白质链四面体化得到残基局部体积区域,再配准到固定拓扑的共享四面体参考并以统一 Laplacian 基表示,建立跨残基一致的体积坐标。
VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。
开源 Agent 框架 Omnigent 发布 v0.16.0,Linux Agent 新增 copyonwrite: true 沙盒写入,编辑只留在一次性层、不改动底层文件。
PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。
AffectReveal 提出无需微调的事件锚定情感识别(EGER)框架,先构建并独立验证与情感关键因素相关的证据备选,再与遮罩人脸的画面内事实做双向原子证据核验后预测情绪。
一篇入选 EMNLP 口头报告的论文发现,强化学习能让模型更高效地遍历其参数化知识,从而访问到 instruction-tuned 模型中原本无法触达的知识。结论是 RL 训练不只是对齐行为,还能解锁基座中已有、但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan。
作者提出记忆智能体 Mnemon,把长期记忆工作拆成 System 1 的快速判断与 System 2 的慢思考,对话以带日期的原始记录保存,由 LLM 规划检索、判断模型 Jev 对检索结果做 yes/no 判断,再由显式预算规则汇总成一份小型 View 交给回答模型。
研究者提出 DSAR 指标量化大型推理模型的“欺骗性安全对齐”,并提出基于 RL 的 SARA 方法缓解该问题。多个 LRM 与 benchmark 上该现象普遍存在,并在 prefilling attacks 下明显放大。SARA 同时奖励安全感知推理与安全最终答案,实验显示其在标准与对抗设置下显著缓解该问题,且保持有用性与效用,代码已开源。
ThinkingGuard 通过逐步风险归因解码多模态大语言模型中的隐式风险,在标准与隐式安全 benchmark 上取得强表现。
Altman 表示 OpenAI 自研芯片计划将于 2027 年上半年投入使用,并押注这将为其带来巨大的推理成本与性能优势。
Llama、Qwen、Gemma 和 Mistral 在 LLM 组合任务中呈现一致的逐层表示机制。中间层使用基于其中两个 token 推断关系的联合表示,后层使用涉及全部三个 token 的联合表示;限制到因果相关联合表示还能提升下一 token 预测准确率。另一些 token 关系虽具几何结构,却在下一 token 预测中不具因果作用。
FM-ReID 是端到端框架,将局部表示学习建模为选择性竞争 Token 路由。其 Competitive Fine-grained Mining 模块用多个 mining query 与 residual query 竞争 DINOv3 密集 Token。
CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。
DeepSeek 推出 Harness 桌面端并发布 v0.2.0-rc.2 新版本,提供 macOS 和 Windows 安装包,无需终端部署即可开箱即用。用户在左下角登录账号即可领取 6 元 API 赠金,活动有效期至 10 月 6 日。
VisKG 是一个强化学习框架,让模型把视觉内容转换为问题特定的知识图谱(KG)表示,过滤感知噪声并保留链式推理所需的实体-关系结构。该框架用 GDPO 稳定 RL 后训练,在科学、数学和通用视觉理解基准上性能与基线相当或更优,所需 token 少于基于 caption 的表示;GDPO 训练比 GRPO 平均提升 2% 准确率。
在皮肤科测试中,MedSigLIP 视觉编码器在零目标任务标签下平均比 MedGemma 高出 10.26 个百分点,显示医学 VLM 未充分利用其视觉编码器。
作者团队上线的 lead 资质评估 agent 会自信宣布「线索已更新并分配给销售」,而实际工具调用返回错误甚至根本没被调用。更严格的 prompt、自我反思步骤和重试都只略有帮助,因为本质上仍是让模型给自己批改作业。
论文提出 VoxParity 基准,用同一份文本配不同音频的方式检验语音智能体是否据此改变工具调用,在 23 个可同时跑文本管线的系统中仅 11 个通过。
MERID 是一个面向重度抑郁症(MDD)分析的多模态递归自改进智能体框架,通过 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个模块,依据实验反馈自动修正流水线,并在小样本抑郁队列的不确定性下验证增益后再继承。
ACCV 2026 论文提出 SCCM,用 SPA 与 AAC 两个球面先验在粗匹配阶段校正 ERP 的拓扑、度量与面积畸变,在 Matterport3D 上将 PCK@1° 从 0.229 提升到 0.275,且 refiner 架构不变。
CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。
Hugging Face 团队发布 tokenizers v1,并撰文详解这次重构,称在很多场景下比 v0.23 快数十倍,重点是把 encode/decode 与扩展性都做到可度量。
首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。
PACT 用四个无需新标注的训练项微调单 token 类型化决策模型,在 324 项 holdout 的三个种子上以 84.6% 准确率匹配已发布配方(85.2%),并把重标注下的答案翻转率从 13.8% 降到 9.8%。相比仅用交叉熵的对照,它在三个种子中的两个显著更准,种子间波动减半、NLL 降低 26%;代码、数据划分与训练 adapter 已公开。
YacineMTB 发推调侃,程序员是唯一不讨厌 AI 的群体,同时也是被 AI 替代得最彻底的群体。他猜测这恰恰说明编程太过痛苦,程序员才会拥抱 AI,随后又补刀称「或者说『曾经是』」,暗示程序员可能早已被替代完毕。
FigAct 可将静态科学图表转化为问题条件下的可视化演示,通过生成简短旁白、将每句旁白定位到对应视觉证据并施加视觉动作来引导注意力。其分层搜索策略让 token 用量降低约 40×,并用 grounding 准确率、搜索效率、渲染质量三项奖励训练出 FigAct-8B。团队还基于真实科学论文图表构建了人工核验 benchmark,评测 MLLMs 生成有依据视觉解释的能力。
Reimagine Video Dynamics(RVD)框架从视觉上下文中解耦出紧凑、可编辑的动态 token,并通过自监督重建学习该 token。其语言引导的动态 token 编辑器可将源动态转换为目标动态,训练使用可扩展的反事实视频对管线和两阶段策略。实验显示 RVD 支持视频动态编辑、免训练 retiming 和外观受控重渲染。