HSTA:用语义嵌入轨迹实时追踪技术扩散,LLM 演化最快
论文提出无监督方法 HSTA(超球面语义轨迹分析),从 arXiv 预印本与 USPTO 专利等约 3 万条文本中追踪技术扩散。方法将 Transformer 句向量投影到单位超球面,球面 K-Means 聚出 8 个子主题并 UMAP 降维,形式化语义质心向量漂移与商业化偏移两个指标。
论文提出无监督方法 HSTA(超球面语义轨迹分析),从 arXiv 预印本与 USPTO 专利等约 3 万条文本中追踪技术扩散。方法将 Transformer 句向量投影到单位超球面,球面 K-Means 聚出 8 个子主题并 UMAP 降维,形式化语义质心向量漂移与商业化偏移两个指标。
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的 6 个基础设施组件,与此前面向英伟达开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
推荐理由:读者可以对照这套组件与英伟达版的对应关系,了解头部模型厂商把训练栈移植到国产算力生态的进展。
CatAstro_Piyush 提出一种 AI agent 训练思路:让 agent 在自己的解释上训练,而非在代码上训练,训练后编码能力反而变强。整个流程没有教师模型、没有验证器、也没有 RL 更新,测试时同样不需要额外上下文。相关做法以长线程形式逐步给出并附实现链接。
Kimi K3 采用 AttnRes、DeepSeek V4 采用 mHC,ByteDance 则提出 HC,三者以不同残差方案应对大模型「深度诅咒」。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。DepthBench 试图对这些深度扩展方案做统一评测。
Roko Mijic 发帖称,亚马逊众包平台 Mechanical Turk 已永久关闭,给出的理由是 AI 又好又便宜。该平台曾是众包标注与人工微任务的标志性平台,其关停被不少人视作 AI 取代人工微任务的时代性节点。
微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。RL 生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。该系统在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。
谷歌提出 TabFM-Auto,用 LLM Agent 依据数据集元信息和验证反馈,迭代优化表格基础模型 TabFM 的数据清洗、特征工程、上下文选择与后处理管线。
WorldLine 是动作驱动的视觉模拟器,用 1 万多小时无动作标注机器人视频学操作动力学,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败。
AutoDataBench 用数据工业交付标准评测 Agent 自主合成可验证训练任务的能力:在三个可执行 Agent 基准上,默认 45 分钟预算内无一 Agent 得分超过 20/100。给最强 Agent 四倍时间可显著提分,单个可用任务成本几乎不变。现有 Agent 能写出合格训练任务,但效率不足,代码与数据已开源。
ROSS 以完整历史 rollout 为上下文、只对选定的模型生成片段施加 loss,把原本被丢弃的自生成轨迹经离线 SFT 复用为行为经验。
Google 发布 TabFM,一个 400M 参数的表格数据基础模型,把监督表格预测建模为上下文学习,单次前向即可输出经过校准的零样本预测,无需任务专属调优。
针对 LLM 自进化中性能先提升、后停滞再下降的"自进化退化",该工作提出以可学习信息增益为核心的整体框架,并给出训练调控方法 ATRI。该增益等于两轮数据分布的 KL 散度加熵变化,实际通过用小型语言模型拟合上一轮数据、以负对数似然给新数据打分来估计。ATRI 在轮内对样本重加权,并在跨轮信息增益持续偏低时终止训练,在常用数据集上的实验显示其效果更优。
一项对13,251条已发布评测分数的大规模因子分析显示,通用智能因子在最宽松估计下仅解释70.8%的语言模型性能方差,多数方案中远低于这一数值。该分析覆盖1,618个语言模型和456个纯文本基准,发现内容相似的基准不一定聚在一起,g 因子也不被任何常见主题主导。作者据此认为,把通用智能当作可定义、可瞄准的实体来推进语言模型开发缺乏支持。
CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。
用户 teortaxesTex 刻意使用 DeepSeek 网页版,让其中的 Whale 模型「收割」自己的数据,包括他在其他付费模型上产出的工作成果,并称这种做法为「众包蒸馏」。他的理由是数据反正会被拿去训练,不如主动贡献,让模型能力「从所有人之手回到所有人」。这既是对大厂数据训练惯例的戏谑,也反映了部分重度用户对蒸馏机制的默认与利用。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为 reader 的记忆接口,用任务结果的组相对奖励加冻结教师的 on-policy 蒸馏信号在 reader 自身 rollout 上训练,推理时移除教师。
论文提出口述训练(VT),让 LLM 更愿意口述自身的评估意识,同时不直接监督潜在信念。VT 把 rollout 截断在模型自发口述之前、以模型已知情的训练前缀配合 RL 目标校准口述比例;在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,可口述的评估意识提升 2.4-2.9 倍,并能迁移到未见过的智能体场景,测得的潜在评估意识与行为基本稳定。
研究在 13 个 RelBench 任务与 5 种关系 ICL 配置上测试 20 个目标派生特征,0-hop 目标表与包含全部 20 个泄漏列的 Full 泄漏造成最大评估偏差。泄漏影响高度依赖任务与模型,聚合变化很小时也可能反转模型变体的相对结论。Integrated Gradients 筛查在 0-hop 与 Full 条件下排序质量最佳,但删除检出的泄漏列不能稳定恢复干净评估。
6 个视频、97 格人工标注的横测显示,LLM 漏提取的瓶颈在 ASR 分段切断而非模型能力。本地 CLI + Google One Pro 下 gemini-3.7 与 3.8 均达 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.6、3.7-medium、3.7-high 在同一视频都漏掉同样 4 格,DeepSeek V4 Flash 仅 71/97。
OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。
研究将关系型基础模型 ICL 中的一种失效模式定义为“支持集目标泄漏”:目标派生(泄漏)列只存在于带标签的支持集,查询保持干净。作者构造 14 种合成泄漏类型(对应 20 列),在 RelBench 留出数据库上评测冻结关系编码器加 ICL 头,发现目标表泄漏的性能下降最明显,一跳、两跳泄漏未被模型稳定使用。
新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。
FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。
研究分析 Gemma 4 31B 对九种非洲语言和三种对照语言的表征,发现英语迁移随语言和层数变化,非洲—西方对比方向在非洲语言之间比与对照语言更对齐。在尼日利亚内部,Yoruba 与 Igbo 在 12 层中的 11 层上比二者与 Hausa 的平均对齐度更高。
rosinality 转发的研究观点称,多模态模型预训练计算量超过 1e22 FLOPs 后可直接去掉视觉编码器,不再需要单独的 vision encoder。该观点认为,在足够大的算力规模下,原生多模态训练可以吸收视觉编码器通常承担的角色。
「The Midas Touch for Code」(CodeMidas)论文提出直接从源码规模化生成编码 Agent 的强化学习训练环境。Andreas Maier 点评认为,该工作提供了一条扩展 AI 编码环境的新路径。该论文为 2026 年 arXiv 论文。
英语、Hausa、Yoruba 三种语言的末位 token 情感方向分半一致性分别为 0.737–0.870、0.589–0.762 和 0.101–0.399,在四个语言模型、77 组完整对比中该语言排序始终一致。
开发者 maierak 质疑论文《The Midas Touch for Code: Scaling AI Coding Environments Straight from Source》可复现性与统计置信度均不清楚:该工作未与基于 issue 的管线做正面对比,只用了单一模型和单一随机种子,生成用的 agent 未公开。
ProVer 通过智能体评判器对比成功与失败轨迹定位关键决策段,再用该段前后续写的成功率差值验证其优势,实现细粒度信用分配。在 ALFWorld、WebShop、SearchQA 上,ProVer 在两种模型规模均取得最佳平均表现,相对 GRPO 分别提升 9.91%(Qwen3.5-2B)和 7.12%(Qwen3.5-4B)。
DeepSeek 上线面向社区的用户反馈渠道,用户下载 DeepSeek 的 harness 并打开相应选项,即可向官方贡献数据,帮助改进其模型和产品。该渠道的具体操作路径由网友披露;同期还有登录 harness 即可领取 6 元 API 赠金的活动。
CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。
PixExpo 用“以时间换空间”的逐像素曝光框架逐像素选取最接近 rPPG 目标亮度的观测,缓解车内强光下的面部过曝与欠曝。在自建 MEX-Drive 数据集(48 名参与者)上,其 MAE 从 13.94 bpm 降至 6.73 bpm,成功率由 25.95% 升至 63.24%。该方法无需改动传感器。
2x2x2 Rubik's Cube 受控基准测试显示,视频生成模型的隐藏状态推理能力并不随规模单向提升:70M 参数模型在约 0.1 PF-days 下对动作后帧可见贴纸配置预测正确率 44.6%,而 1B 模型仅 0.3%,后者需训练到 3.14 PF-days 才达到 83.7%。
PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。
一篇入选 EMNLP 口头报告的论文发现,强化学习能让模型更高效地遍历其参数化知识,从而访问到 instruction-tuned 模型中原本无法触达的知识。结论是 RL 训练不只是对齐行为,还能解锁基座中已有、但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan。
CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。
Hugging Face 团队发布 tokenizers v1,并撰文详解这次重构,称在很多场景下比 v0.23 快数十倍,重点是把 encode/decode 与扩展性都做到可度量。
PACT 用四个无需新标注的训练项微调单 token 类型化决策模型,在 324 项 holdout 的三个种子上以 84.6% 准确率匹配已发布配方(85.2%),并把重标注下的答案翻转率从 13.8% 降到 9.8%。相比仅用交叉熵的对照,它在三个种子中的两个显著更准,种子间波动减半、NLL 降低 26%;代码、数据划分与训练 adapter 已公开。
一套生成式 AI 流水线用 LLM 从 SEC 10-K 文件中抽取财务数据,针对影响超 70% 公司、占半数总市值的结构化数据缺失问题。研究评测 Llama-3 8B、Qwen-2.5 14B 与 Llama-3.3 70B,在现金及现金等价物、短期债务、信贷额度与研发四类不同结构复杂度的变量上比较抽取质量。
REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。