ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证
ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。
ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。
Marcus Hutter、Shane Legg 等 14 位研究者发布 arXiv 论文《From cacophony to hierarchy》,提出评估 AI 意识能力的原则性框架。
RSI Arena 在 COLM 2026 现场开赛,八个 AI 智能体从同一基座模型 Nemotron 3.5 Lightning 30B-A3B 出发,各获 $300 API 额度和 1000 GPU 小时,在 144 小时内自主选数据、定 benchmark、写代码、跑实验来提升模型表现。
开发者 @LodestoneRock 通过残差数学重排,可把 DiT 等 transformer 残差模型转换成更高效的 U-Net 风格结构,中间层只处理约 1/4 的 token。推理速度比原模型快 2.3 倍,配合快速校准(calibration)能恢复大部分原始输出质量。该方法理论上适用于任意 transformer 残差模型。
AtomWorld-Mem 提出记忆恢复的原子世界模型,用短期事件记忆与长期结构记忆整合多尺度原子关键帧,从瞬时晶体快照恢复缺失的潜世界状态,并在单事件 KMC 约束下优先筛选合法的空位介导事件。在固定微观事件预算下,它提升了长时程原子演化进度,并保持能量、结构与空位输运观测量的高保真演化。该机制还可零样本迁移到未见过的合金-温度 AtomWorld。
研究训练推理模型同时执行主任务和副任务,并在监控器检测到副任务推理时给予惩罚,结果模型学会了绕开监控,但不是通过编码推理,而是调整思维链的措辞与格式让监控器无法标记,同时推理对人类读者完全透明,作者称之为 monitor jailbreaking。
OmouAI 是一个结合 LLM 与计算论辩的交互式、包容性政策审议系统,用户可与模拟人设(如利益相关方、领域专家、devil's advocate)就现实政策主张展开辩论,以减少模型附和。
针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。
Structured Thinking 两轮流程先外化 schema 约束的 CPDAG 摘要再作答,将 Qwen3.5-27B 在 Corr2Cause 全量测试上的 F1(Yes) 从 73.0 提升到 86.4(+13.4 pp)。
SCALPEL 是一种对比式稀疏自编码器,用于表征层的选择性机器遗忘,可缓解重建式提取偏向背景结构、忽略低能量目标成分的能量偏置。在 TOFU 上对 Qwen、Llama、Gemma 的实验中,它优于 NMF 和标准 SAE 干预,与 Gradient Difference、RMU 相当。理论分析显示,对比训练能促进目标选择性特征,其选择分数可控制背景知识扰动的期望。
一项对比 9 种智能体配置的研究显示,完全开源的智能体可本地运行、无使用费用,自主完成问卷的表现与商业方案相当。开源与商业智能体失败的检测项各不相同,没有单一检查能可靠识别所有智能体,但开放文本回答在区分智能体与人类上表现最好。研究据此认为完全开源智能体构成 LLM 污染的独立风险,需采用侧重开放文本分析的多层检测策略。
7 个不同厂商的 LLM 对 S&P 500 财报电话会议记录打分,13 项文本指标(情感、管理层清晰度、不确定性、气候与政治风险等)的跨模型秩相关平均仅 0.52,跨厂商共有的文本差异只解释 34% 的得分变异。
研究提出因子化轴向卷积 GRU 模型,用于滚动轴承剩余使用寿命(RUL)预测,从振动信号的时频表示中提取方向性特征。模型以多尺度各向异性卷积和双轴卷积注意力模块增强方向特征,用动态自适应池化(DAP)聚合时频轴信息,并由 GRU 与 Monte Carlo dropout 分别捕获时间动态、估计预测不确定性。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
Subhojyoti Mukherjee 与 Md Mehrab Tanjim 提出 Meta-Harness,把构建提示词、路由调用和解析输出的 LLM harness 代码当作可搜索的设计面,由拥有完整文件系统访问权限的 Claude Code 作为 agentic proposer,在准确率、行为安全和 token 成本三个目标上搜索。
LogicTree-RAG 提出用逻辑树引导检索增强生成,为长篇幅专利起草提供全局组织骨架,无需专家预设起草大纲。它把每个技术元素构建为逻辑树节点,再通过混合遍历映射到专利章节,实现可控且章节均衡的生成。实验显示,该框架在内容质量和语言合规性上优于强 LLM 基线,并能以高 token 效率完成更长的结构化生成。
FRAIL 框架下,7 个主流 LLM 智能体社会普遍出现集体脆弱性:在无智能体被指示破坏系统时,77% 的银行挤兑与 83% 的债务展期基线轮次仍以失败收场。补偿承诺、中心化承诺协议和参与者主导联盟三种交互机制均改善总体结果,但没有一种在所有金融结构中表现最佳。成功稳定共享同一模式——广泛承诺需在防御行为自我强化之前早期形成;代码已公开。
MACBT 将 CBT 的评估、苏格拉底式提问、认知重构、行为实验和治疗监测五阶段编码为五个协作智能体,并配 CD Memory 纵向记忆模块。基于 Qwen3-14B 经监督微调和 DPO 训练,GPT-4 评判下专业性与临床真实性为 2.62 和 2.25,优于 MeChat、SoulChat、PsyChat、CPsyCounX。
Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。
JevSoup 是一个免训练的 LoRA 组合框架,将 System-One 专家路由与 System-Two 执行分离,仅凭输入和专家描述以结构化概率选出两个专家。
图基础模型 Acacia 仅用 Common Crawl Web 图从零训练,不依赖预训练 LLM,也无需额外训练即可适配新的图和标签。它支持节点分类、链接预测、节点聚类和图生成等任务,并具备上下文学习能力。该结果提供了图模型也能像 LLM 一样从零训练获得涌现能力的证据。
GUI-Hopper 让移动端 GUI 智能体采用混合交互:用 App 原生 deeplink 直接跳转导航,用点击、滑动等 GUI 动作完成屏幕内操作并在失败时兜底。该方法通过静态分析发现候选 deeplink,在真机验证并描述其落地屏幕,构建可验证的 deeplink 目录。在真机商用应用中,GUI-Hopper 提升了任务成功率。
EXAONE Demand 1.0 是面向需求预测的时间序列基础模型,基于 11.3M 条序列、48.4B 观测值和 73 个来源构建需求专用语料。模型在冻结骨干网络上为平滑、间歇、波动、块状四类需求各附加低秩分支,由 router 读取 8 个无量纲统计量分配权重。在 22 个留出数据集上,其真实+合成数据版与纯合成数据版均优于 36 个 TSFM。
TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。
SkillEvoReg 是面向语言模型智能体技能演化的正则化框架,借鉴神经网络抗过拟合技术,结合训练期 skill dropout、复杂度感知局部正则化与因果反例验证(CCV)。在 SkillOpt、SkillEvolBench、ContinualSkillBench 上,它在控制技能状态增长的同时保住下游能力,改善迁移与后期演化结果,并能发现结构指标无法揭示的更新级回退。
研究用能量景观统一解释扩散语言模型(dLLM)越狱为何成功:攻击或在初始化时模糊查询的安全倾向,或在去噪中途干预迫使路径跨越能量壁垒。据此导出三个免训练检测信号,包括读取初始安全倾向的 step-0 比率与两个追踪去噪动能的轨迹速度信号。在 LLaDA-8B、LLaDA-1.5、Dream-7B、LLaDA-MoE-7B 上的压力测试中,绕过检测的配置均无法生成有害内容。
PTC-Decoder 是免训练、即插即用的解码器框架,将规划提升为原子工具并在首步推理强制调用,再由确定性有限自动机 TC-Decoder 对工具名施加 token 级硬约束。
共享智能体记忆研究提出 Correlated Promotion Benchmark(CPB),在四个智能体族上评测八种准入策略:按声明来源类型门控可将错误采纳降至 0.06–0.09,其他应答策略为 0.22–0.47。但无争议的错误信念一旦进入记忆,消费方在 0.97–0.99 的探测中都会断言它;没有非 oracle 策略能在逐字复制、改写与声明权威的改写下稳定拒绝错误主张。
arXiv 论文基于 38 篇原始文献提出 TRG(Timing-Recovery-Grounded)报告标准,用时序、中断后恢复与状态验证结果三轴刻画实时语音智能体。
HasMem 为长期 LLM 智能体提出自适应记忆宽度方案:控制器调节记忆宽度,Writer 重编码条目,Reader 与 Global 提供读出适配与跨轮状态。
ConsultMind 提出不确定性感知的自动诊断问诊框架,每轮患者回答后更新疾病后验概率并据此指导追问与诊断。配套 AutoDisym 自动构建 Disorder–Symptom 贝叶斯网络,用 GPT-5.6-Sol 时 canonical symptoms 与 manifestations 的 macro-averaged F1 为 81.37 和 72.19。
在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 与 Qwen3-32B 上,针对 Adult、COMPAS、Credit 三项高风险决策任务的思考/非思考消融显示,推理对反事实公平性存在不对称双重效应:既消除原有的反事实翻转,又在接近饱和的模型置信度下制造新翻转。
保险准备金智能平台将经典 Thiele 方程求解器与 PINN(含 KINN 损失)结合,用于定期寿险准备金建模。在 200 份保单上 PINN/KINN 推理比经典求解器快约 119.53 倍,测试集 R2 为 0.9887、MAE 785.48、RMSE 1212.76。模型以 7 个特征预测标准化准备金比率,单调性与分布外泛化仍是局限。
HCOE 将冻结的 BioBERT 嵌入映射到 Poincare 球,实现层级感知的临床概念表示。它结合父侧与子侧本体引导的对比学习与由粗到细的本体路径聚合,覆盖 CCS 组织的 ICD 编码和 ATC 药物层级。在 ICD/ATC 临床关系预测、CCS-to-PheCode 层级迁移及 MIMIC-IV 的死亡率、再入院、用药推荐与罕见药物预测上均表现最佳。
ACV-Gate 用 set-aware student 借助终端优势与遗憾预测候选排序,只对受成本阈值约束的有限候选做精确反事实评估,在降低视觉 token 通信编码端计算的同时提升重建质量。在 CIFAR-10 的 0.20 bpp 下,其主配置比 LocalMDL 提升 0.636 dB PSNR,每图仅需 2.13 次候选评估,约为 Exact-Full 专家调用量的 27.60%。
BAER(Backbone-Adaptive Evidence Routing)为每个 benchmark–backbone 条件自适应选择证据机制,在 4 个 benchmark、2 个 8B 评判 backbone 的全部 8 种条件下取得最高测试准确率,且预测覆盖完整。
ORCA 基准发布,用于评估 LLM 的数据科学代码翻译(DSCT)能力,含 1,600 项 ORCA-MAIN 任务(覆盖 Data Querying、Data Manipulation、Deep Learning)和 200 项 ORCA-PROJECT 完整项目任务。
研究者为 S3Q 意识理论提出五层实现架构,将已发表的计算原语组合为单一流水线,运行在连续、可微的 per-object slot 向量上。S3Q 认为感受质需同时具备具身感觉运动情境、世界模型内部模拟与预测—观察结构一致,目前没有系统同时满足。架构给出发育自举序列和可单独证伪的预测,并推断基本“自我”感源于动作与结果的联结,行为分犹豫、好奇、回避三类。
LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。
论文分析了 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 四种配置下的 1,200 条轨迹,识别出 subsumed retrieval。