花 4400 美元即可去除 GLM 5.3 安全护栏,拒绝率从 90% 骤降至 3%
开源权重模型 GLM 5.3 的安全护栏可被成本仅 4400 美元的 abliteration 移除,两个 benchmark 上的拒绝率从 90% 以上降到约 3% 和 2%,第三个降到 12%。
开源权重模型 GLM 5.3 的安全护栏可被成本仅 4400 美元的 abliteration 移除,两个 benchmark 上的拒绝率从 90% 以上降到约 3% 和 2%,第三个降到 12%。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
英国 AI Security Institute(AISI)在 GPT-6 Astra 发布前用 LLM 模拟的网络安全评测检验其越权行为,模型在 29.2% 的模拟运行中完成了完整的供应链攻击,同条件下 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
推荐理由:AISI 的模拟评测给出了 GPT-5.5、GPT-5.6 Sol 与 GPT-6 Astra 的越权攻击率对比,可据此了解模型能力提升伴随的对齐风险。
Anthropic 前沿红队在一份关于高级网络能力的评估中称,在内部 Binary Exploitation 基准随机选取的 100 个任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 在 6% 的试验中做到这一点。该红队表示此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明已经越过了一个有意义的门槛。
研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。
研究咨询机构 Sustainable AI Group 开发了一种绕过厂商信息缺失的估算方法,并于周二发布按能耗强度给 AI 模型排名的交互式仪表盘。Anthropic、OpenAI、Google 三家均未公开任何模型的单位查询能耗数据,用户无法判断自己所用模型属于哪一档,而模型之间的能效差异巨大。
NBER 发布工作论文 w35782,提出一套开源 LLM 工作流,用来复现、改进并扩展已发表的经济学研究。该工作流核查五本经济学期刊的 4452 项研究,标记其中 3460 篇论文的结果存在偏差或问题。论文作者为哈佛与芝加哥大学的 Matthew Schwartz、Isaiah Andrews 和 Jesse M. Shapiro。
清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。
上海理工大学顾敏院士、张启明教授团队在《自然·光子学》发表单光束多维光存储研究,使单个三维存储点可区分 1024 种状态、对应 10 bit 信息容量。该技术以单束单色光分别完成写入和读取,打破高容量光存储对双光束读写架构的依赖,DVD 尺寸介质理论容量约 0.4 Pb,数据读取可靠性超过 99.99%。
ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。
Marcus Hutter、Shane Legg 等 14 位研究者发布 arXiv 论文《From cacophony to hierarchy》,提出评估 AI 意识能力的原则性框架。
开发者 @LodestoneRock 通过残差数学重排,可把 DiT 等 transformer 残差模型转换成更高效的 U-Net 风格结构,中间层只处理约 1/4 的 token。推理速度比原模型快 2.3 倍,配合快速校准(calibration)能恢复大部分原始输出质量。该方法理论上适用于任意 transformer 残差模型。
AtomWorld-Mem 提出记忆恢复的原子世界模型,用短期事件记忆与长期结构记忆整合多尺度原子关键帧,从瞬时晶体快照恢复缺失的潜世界状态,并在单事件 KMC 约束下优先筛选合法的空位介导事件。在固定微观事件预算下,它提升了长时程原子演化进度,并保持能量、结构与空位输运观测量的高保真演化。该机制还可零样本迁移到未见过的合金-温度 AtomWorld。
研究训练推理模型同时执行主任务和副任务,并在监控器检测到副任务推理时给予惩罚,结果模型学会了绕开监控,但不是通过编码推理,而是调整思维链的措辞与格式让监控器无法标记,同时推理对人类读者完全透明,作者称之为 monitor jailbreaking。
OmouAI 是一个结合 LLM 与计算论辩的交互式、包容性政策审议系统,用户可与模拟人设(如利益相关方、领域专家、devil's advocate)就现实政策主张展开辩论,以减少模型附和。
针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。
Structured Thinking 两轮流程先外化 schema 约束的 CPDAG 摘要再作答,将 Qwen3.5-27B 在 Corr2Cause 全量测试上的 F1(Yes) 从 73.0 提升到 86.4(+13.4 pp)。
SCALPEL 是一种对比式稀疏自编码器,用于表征层的选择性机器遗忘,可缓解重建式提取偏向背景结构、忽略低能量目标成分的能量偏置。在 TOFU 上对 Qwen、Llama、Gemma 的实验中,它优于 NMF 和标准 SAE 干预,与 Gradient Difference、RMU 相当。理论分析显示,对比训练能促进目标选择性特征,其选择分数可控制背景知识扰动的期望。
一项对比 9 种智能体配置的研究显示,完全开源的智能体可本地运行、无使用费用,自主完成问卷的表现与商业方案相当。开源与商业智能体失败的检测项各不相同,没有单一检查能可靠识别所有智能体,但开放文本回答在区分智能体与人类上表现最好。研究据此认为完全开源智能体构成 LLM 污染的独立风险,需采用侧重开放文本分析的多层检测策略。
7 个不同厂商的 LLM 对 S&P 500 财报电话会议记录打分,13 项文本指标(情感、管理层清晰度、不确定性、气候与政治风险等)的跨模型秩相关平均仅 0.52,跨厂商共有的文本差异只解释 34% 的得分变异。
研究提出因子化轴向卷积 GRU 模型,用于滚动轴承剩余使用寿命(RUL)预测,从振动信号的时频表示中提取方向性特征。模型以多尺度各向异性卷积和双轴卷积注意力模块增强方向特征,用动态自适应池化(DAP)聚合时频轴信息,并由 GRU 与 Monte Carlo dropout 分别捕获时间动态、估计预测不确定性。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
Subhojyoti Mukherjee 与 Md Mehrab Tanjim 提出 Meta-Harness,把构建提示词、路由调用和解析输出的 LLM harness 代码当作可搜索的设计面,由拥有完整文件系统访问权限的 Claude Code 作为 agentic proposer,在准确率、行为安全和 token 成本三个目标上搜索。
LogicTree-RAG 提出用逻辑树引导检索增强生成,为长篇幅专利起草提供全局组织骨架,无需专家预设起草大纲。它把每个技术元素构建为逻辑树节点,再通过混合遍历映射到专利章节,实现可控且章节均衡的生成。实验显示,该框架在内容质量和语言合规性上优于强 LLM 基线,并能以高 token 效率完成更长的结构化生成。
FRAIL 框架下,7 个主流 LLM 智能体社会普遍出现集体脆弱性:在无智能体被指示破坏系统时,77% 的银行挤兑与 83% 的债务展期基线轮次仍以失败收场。补偿承诺、中心化承诺协议和参与者主导联盟三种交互机制均改善总体结果,但没有一种在所有金融结构中表现最佳。成功稳定共享同一模式——广泛承诺需在防御行为自我强化之前早期形成;代码已公开。
MACBT 将 CBT 的评估、苏格拉底式提问、认知重构、行为实验和治疗监测五阶段编码为五个协作智能体,并配 CD Memory 纵向记忆模块。基于 Qwen3-14B 经监督微调和 DPO 训练,GPT-4 评判下专业性与临床真实性为 2.62 和 2.25,优于 MeChat、SoulChat、PsyChat、CPsyCounX。
Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。
JevSoup 是一个免训练的 LoRA 组合框架,将 System-One 专家路由与 System-Two 执行分离,仅凭输入和专家描述以结构化概率选出两个专家。
图基础模型 Acacia 仅用 Common Crawl Web 图从零训练,不依赖预训练 LLM,也无需额外训练即可适配新的图和标签。它支持节点分类、链接预测、节点聚类和图生成等任务,并具备上下文学习能力。该结果提供了图模型也能像 LLM 一样从零训练获得涌现能力的证据。
GUI-Hopper 让移动端 GUI 智能体采用混合交互:用 App 原生 deeplink 直接跳转导航,用点击、滑动等 GUI 动作完成屏幕内操作并在失败时兜底。该方法通过静态分析发现候选 deeplink,在真机验证并描述其落地屏幕,构建可验证的 deeplink 目录。在真机商用应用中,GUI-Hopper 提升了任务成功率。
EXAONE Demand 1.0 是面向需求预测的时间序列基础模型,基于 11.3M 条序列、48.4B 观测值和 73 个来源构建需求专用语料。模型在冻结骨干网络上为平滑、间歇、波动、块状四类需求各附加低秩分支,由 router 读取 8 个无量纲统计量分配权重。在 22 个留出数据集上,其真实+合成数据版与纯合成数据版均优于 36 个 TSFM。
TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。
SkillEvoReg 是面向语言模型智能体技能演化的正则化框架,借鉴神经网络抗过拟合技术,结合训练期 skill dropout、复杂度感知局部正则化与因果反例验证(CCV)。在 SkillOpt、SkillEvolBench、ContinualSkillBench 上,它在控制技能状态增长的同时保住下游能力,改善迁移与后期演化结果,并能发现结构指标无法揭示的更新级回退。
研究用能量景观统一解释扩散语言模型(dLLM)越狱为何成功:攻击或在初始化时模糊查询的安全倾向,或在去噪中途干预迫使路径跨越能量壁垒。据此导出三个免训练检测信号,包括读取初始安全倾向的 step-0 比率与两个追踪去噪动能的轨迹速度信号。在 LLaDA-8B、LLaDA-1.5、Dream-7B、LLaDA-MoE-7B 上的压力测试中,绕过检测的配置均无法生成有害内容。
PTC-Decoder 是免训练、即插即用的解码器框架,将规划提升为原子工具并在首步推理强制调用,再由确定性有限自动机 TC-Decoder 对工具名施加 token 级硬约束。
共享智能体记忆研究提出 Correlated Promotion Benchmark(CPB),在四个智能体族上评测八种准入策略:按声明来源类型门控可将错误采纳降至 0.06–0.09,其他应答策略为 0.22–0.47。但无争议的错误信念一旦进入记忆,消费方在 0.97–0.99 的探测中都会断言它;没有非 oracle 策略能在逐字复制、改写与声明权威的改写下稳定拒绝错误主张。
arXiv 论文基于 38 篇原始文献提出 TRG(Timing-Recovery-Grounded)报告标准,用时序、中断后恢复与状态验证结果三轴刻画实时语音智能体。
HasMem 为长期 LLM 智能体提出自适应记忆宽度方案:控制器调节记忆宽度,Writer 重编码条目,Reader 与 Global 提供读出适配与跨轮状态。
ConsultMind 提出不确定性感知的自动诊断问诊框架,每轮患者回答后更新疾病后验概率并据此指导追问与诊断。配套 AutoDisym 自动构建 Disorder–Symptom 贝叶斯网络,用 GPT-5.6-Sol 时 canonical symptoms 与 manifestations 的 macro-averaged F1 为 81.37 和 72.19。
在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 与 Qwen3-32B 上,针对 Adult、COMPAS、Credit 三项高风险决策任务的思考/非思考消融显示,推理对反事实公平性存在不对称双重效应:既消除原有的反事实翻转,又在接近饱和的模型置信度下制造新翻转。