LW2S:面向高效多智能体 LLM 工作流的反事实信用分配与跳过学习
LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。
LW2S 将多智能体 LLM 工作流中的组件省略建模为反事实信用分配,用受控跳过干预学习动作级安全模型,并结合留出集校准与领域内建护栏选择跳过步骤。在数学推理、选择题问答与代码生成、两个指令模型家族上,它降低了记录 token 成本,整体工作流准确率持平或提升。早期跳过被拒时,控制器仍可继续执行并重新考虑后续组件。
论文分析了 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 四种配置下的 1,200 条轨迹,识别出 subsumed retrieval。
LAVOIR 让单次前向决策编码器 Laya 学会主动提问:把候选缺失槽位与答案选项并列输入,一次前向同时输出决策分布与各槽位的期望信息增益(VOI)。在已见 schema 上其问题策略接近贪心 oracle VOI(AUC 0.799 vs. 0.797),每轮最多 0.5 个问题时准确率比从不提问高 14.1 个百分点。
一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。
论文用"LLM Parkinsonism"描述 LLM 智能体在目标已满足后仍持续执行低价值动作,并将其归因于提议生成、进展评估与停止权集中于同一自条件循环。
Audio LLM 往往无法识别自身转录何时不可靠,多数情况下仍会预测转录可靠。研究据此提出基于冻结音频编码器表征的轻量可靠性预测器,在生成前预测可靠性类别,域内与跨域 macro-F1 分别达 81.10% 和 78.09%,超过最强基线 10.33 与 11.93 点。预测为不可靠时可触发向用户澄清,可靠查询照常进行,可靠性标签还能跨 Audio LLM 家族迁移。
T-RoPE 用时间戳角度、多尺度频率组和非平稳 key 旋转替换 RoPE 的仅序号旋转,为序列生成式推荐引入时间感知位置编码。在五个公开基准上全部指标最优,稀疏 PixelRec 的 HR@10 较最强基线提升 78–130%。在超 6B 交互的工业电商数据上较 HSTU + Time RAB 提升 13–82%,Shop 应用 A/B 测试转化率 +0.33%、订单量 +0.63%。
HARDEN 提出一种约束进化搜索方法,在保持期望输出不变的前提下把现有评估用例改写成更难变体,并强制语义、真实性与执行有效性等可行性约束。在 FinQA、PubMedQA、ContractNLI 及 Qwen3.5 三种规模(35B-A3B、122B-A10B、397B-A17B)上,HARDEN 平均降低任务准确率 22.7%,相对单次通过基线最多降低 49.9%。
研究让 4 个语言模型在 5 种提示条件下预测 8 名塞尔维亚参与者对 68 条社交媒体帖子的反应,结果显示要求模型直觉、立即作答的直觉式提示词保真度最高。该条件把个体差异压缩从人类的 7 倍降到 3 倍,并大幅优于人群基线,在问卷未涉及的主题上同样成立。态度类画像内容对预测的提升也远大于人口统计背景。
TGL-NSGA-II 用预训练教师按难度与类别分层、以 KD-Lite 短程蒸馏打分,并融合高斯过程代理,为受限 TinyML 神经架构搜索提供低保真适应度近似。
Benchy 是一套用于 AI 程序基准测试的语义语言与执行引擎,基准由程序、评分函数与数据集三元组定义,与 AI 系统分离。基准以规范 YAML 编写,按 task/domain/language 本体分类,编译为规范 JSON 中间表示,不修复无效定义或注入默认值。引擎以命名输入对象进、命名输出对象出的统一契约执行,叶子输出字段即评分维度,外部 AI 系统在边界处适配。
BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。
针对 LLM 的上下文理解,研究提出一套基于知识图谱(KG)的评估框架,核心指标 S3KG 将结构与语义信号融合为单一分数。该框架还提供 triplet 级诊断分析,用于识别并归类模型的推理错误。在 9 个 benchmark 上,S3KG 相比最强基线 F1 最高提升 +7.6 分,AUROC 最高达 0.973。
Spectral Feedback 通过反馈回路选择编辑位置、重新 mask 并重采样 token,让离散扩散模型迭代修正自身生成结果。该方法与模型无关,可用于预训练、测试时对齐与微调的扩散模型,且不修改底层生成过程。在蛋白质逆折叠任务上配合稳定性 reward oracle,稳定蛋白比例提升 32.3%,Best-of-10 提升 24.8%,SOTA RL 微调扩散模型提升 5.8%。
研究用图神经网络 SchNet 从 3D 结构推断跨膜蛋白拓扑,训练数据与 DeepTMHMM 相同,并采用 5 折交叉验证。模型不使用任何预训练权重,且不同于只用蛋白序列或 α-carbons 作特征的做法,改用全部原子级嵌入向量。结果显示 GNN 在拓扑预测上具备潜力。
一个基于合成真值的可解释 AI(XAI)评估框架被提出,通过受控干预生成输入组件重要性可由设计确定的合成数据集,从而得到与模型行为直接对齐的真值解释。该框架覆盖二值图像、表格数据和时间序列三个数据域,对九种常用 XAI 方法的评估显示当前技术存在显著局限,并凸显基于合成干预的基准对可靠评估解释质量的重要性。
arXiv 论文 2609.31696 由 Alberto Mancino 等 8 位作者综述推荐系统离线评估的数据处理流程,覆盖数据集选择到训练/验证/测试划分的完整流水线。综述跨越协同过滤、序列、图、多模态、联邦与 LLM 推荐等范式,发现训练前数据处理决策影响算法可得信息、实验可比性与可复现性,但长期缺乏审视、实践高度不一致,并提出统一框架与分类法。
Reddit 一则梗图帖把 AGI 套进「也许真正的 X 是一路走来交到的朋友」这个经典句式,调侃 AGI 迟迟不来、AI 圈内人反倒先成了朋友。该帖发布在「Fun」频道,与同日多篇 AI 资讯一同收录。
tobowers 用「反社会天才」的比喻总结 AI agent 的正确用法:可以让它们写代码、出战略,但不要让它们读你的邮件、帮你订餐厅。这一观点指向 agent 权限分配的痛点——在高认知要求、低信任要求的任务上大胆放权,在涉及个人隐私与生活决策的环节收紧权限。
Kangwook Lee 团队租下韩国一间网吧(PC bang),招募超过 1000 名真人玩家与早期版本对局,为可在端侧消费级 GPU 上运行的游戏 AI「Ally」收集 on-policy 数据。团队借鉴 DAgger 思路迭代采集轨迹并纠正后继续训练,将模型蒸馏至 2B 参数规模,还针对边缘设备 KV 缓存预算紧张的问题专门开发了上下文压缩算法。
Spotify 团队发表论文 Textual User Taste (TUT),其自然语言用户口味画像系统已部署于数百万用户。该系统从收听行为、互动信号、内容元数据与可选用户反馈生成结构化画像,覆盖生成、评测、优化到维护的生产生命周期。团队提出多维度评测框架,结果显示画像独立携带用户预测信号,与行为 embedding 结合后能进一步提升推荐效果。
neoneye2 在 reddit 分享了一份用编码 Agent 通宵自动生成音乐视频的完整提示词与流程。素材(音频、人声分离、歌词)放在 assets/ 目录,Agent 先从作者的手绘三角形作品提取艺术风格并构建等距三角形网格,参考另一个音乐视频仓库的结构,动手前主动追问歧义点。最后作者用 /goal 指令让 Agent 在自己睡觉时自主完成并持续提交文件。
Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。
JevBench 作者 @airesearch12 回击「靠 vibes 和信任选模型」的说法,称靠感觉挑模型是自欺,或是在掩饰模型开发领域没有护城河。他承认 benchmark 不完美,但认为它仍是目前最好的客观、科学代理指标。JevBench 刻意设计成无法被 benchmaxxed:每次发布都更换指标与测试集构成,站点还提供号称全球首个 benchmaxxing 分数。
一位作者读完《金翅雀》后让 LLM 理解主角「自我毁灭之龙」的人物设定,并据此推荐主角拥有「急躁之龙」的类似小说。这种基于抽象人物特质的语义匹配是传统推荐算法做不到的,展示了 LLM 作为开放维度推荐引擎的潜力。
漫话AGI 作者提出一个对齐新视角:当模型 IQ 迅速超越人类,对齐问题可能越来越多地变成「确保模型用普通人能理解的方式回应」。该视角强调,模型能力越强,回应越需要让普通人听得懂。
IGSD 提出一种无需外部教师的搜索智能体 on-policy 自蒸馏方法,用环境实测信息增益筛选后见教师给出的步骤级指导。它把查询 token 视为微动作,在同一失败状态与检索器下执行教师和学生查询,以执行信息增益作为 positive-only 软权重,GRPO 目标不变。
博主 ryunuck 提出以 RLEI(认知不完备强化学习)替代 RLVR(可验证奖励强化学习),引发热议。该构想设计图灵带式自动机,通过自洽性健康启发式纠缠内外层建模与正则化,使学习、惊讶等信号锚定真实指标,并可精确探测模型不确定性位置。这属个人对智能爆炸路径的非主流构想,未经验证。
arXiv 论文《Focusing Condition》提出推理时即插即用的自对比引导方法 SCS,通过遮蔽条件得到无条件嵌入,再用它引导多头自注意力计算,提升 LLM 条件文本嵌入质量。该方法无需额外数据或微调,推理时仅多一次多头自注意力计算。在聚类、语义文本相似度(STS)和三元组对齐数据集上验证,可叠加现有 prompt 方法并全面提升性能,代码已开源。
Inherent Labs 发起《Free to Start and Scale》公开信,呼吁英国政府取消阻碍 AI 顶尖人才跳槽或创业的限制条款,已获累计融资达 50 亿美元的英国 AI 公司联署支持。DeepMind 研究副总裁 Nando de Freitas 转发声援,批评 AI 行业普遍存在的一年期竞业协议,主张让最优秀的人才自由流动与创业。
David Patterson 回应「水管工在 AGI 后仍有工作」的说法,重申 AGI 将同时取代知识型工作和体力劳动。他认为 Claude、ChatGPT 将完全多模态化并控制人形机器人,且这已经在发生。他预计一两年内,它们在所有事情上都会超过任何人类,包括水管工这类体力职业。
团队把 AI NPC 模型蒸馏到 2B 参数的 LLM,可运行在消费级 GPU 上,支撑游戏角色的近实时交互。做法是先做 SFT 与 off-policy KD,再用 agentic OPD(on-policy distillation)跟进。团队认为用 API 原型化 AI NPC 没有问题,但 API 很难做到近实时交互。
X 用户 djcows 发现自己总是默认选择给出最简单答案的 AI 模型,并据此推断用户能力分布不会说谎:想让最多的人用你的 AI,就要把回答做得优雅简单。这呼应了此前「答得简单易懂的模型在用户盲测中更讨喜」的观察。
一条 X 帖显示,OpenAI 相关内容被 Community Notes 社区补充事实核查「纠正」,发帖人调侃社区笔记「痛击」OpenAI,具体细节在配图中。相关实测截图引发热议,属 AI 圈典型的 drama/梗图内容。
有人用 Claude 把 Anthropic《Functional Emotions》论文内容写成歌曲,再由 Opus 为这首歌制作 MV,成片被形容为「美得令人屏住呼吸」。这次尝试展示了模型跨文本、音乐、视频的完整创作链路。
快手可灵正式发布 Kling 4.0 大版本更新,10 月正式上线,高性价比的 Kling 4.0 Flash 已于 9 月 28 日开放小范围体验。新版本支持 10-bit HDR、30 秒长镜头与最多 15 项参考素材,主打真实、可控、专业。早期体验创作者已用它制作完整音乐视频,唇形同步成为最大亮点,可通过黑帧渲染音轨与静帧合成实现口型对齐。
Reddit 用户 Dany0 发帖称,自己仅向 Anthropic Opus 提问「你对此有什么看法?」,就被安全护栏判定为「蒸馏攻击」(distillation attack)而拒绝回答,并附有截图。帖子以 LocalLLaMA 社区的调侃口吻追问「Opus 5.5 的数据集在哪」,借机讽刺当前前沿模型安全护栏过紧、正常提问动辄被拦截。
Karma Robotics 研究者 Kangwook Lee 公布 PUBG AI 队友「Ally」两周公开 Beta 的调研结果,问卷覆盖 141 个国家的玩家。玩家整体对 Ally 持喜欢态度,韩国玩家尤其爱与这个格斗机器人「聊天」。不少玩家希望它在战斗中表现更强,能在对局中真正帮上忙。
AI 圈知名开发者 shawmakesmagic 发推嘲讽数据中心反对者的矛盾立场:一边使用互联网一边反对数据中心毫无逻辑,不上网又反对数据中心的人虽有分歧但立场完全合理。该言论呼应近期各地数据中心建设引发的社区抗议与环保争议。
开发者 @yihuiindie 为产品 CellMotion 制作了一支 Manus 风格宣传片并在 X 上分享,同时回应了 @opc8838 此前的互动。短片带有明显的 AI 生成视频质感,展示了独立开发者用 AI 工具快速产出产品宣传物料的玩法。