Hill Sampling:让冻结 LLM 沿最优解爬坡,胜过重复采样与进化训练
Hill Sampling 是 test-time scaling 的更简替代方案:把冻结的 LLM 条件化在其当前找到的最优程序上,用提示词条件化的爬山循环迭代改进。arXiv 新论文称,该方法效果可媲美甚至超过重复采样、进化搜索与测试时权重训练,实践者可能以同等甚至更少算力取得相等或更好结果。
Hill Sampling 是 test-time scaling 的更简替代方案:把冻结的 LLM 条件化在其当前找到的最优程序上,用提示词条件化的爬山循环迭代改进。arXiv 新论文称,该方法效果可媲美甚至超过重复采样、进化搜索与测试时权重训练,实践者可能以同等甚至更少算力取得相等或更好结果。
paraschopra 为其 LLM 原创幽默研究放出评分链接,邀请大家给模型生成的原创笑话打分,这些笑话被强制包含两个随机词。打分全程约 10 分钟,参与者将优先收到研究结果邮件。
MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。
Muslim 是已部署的阿拉伯语语音 AI 平台,向真实用户提供有出处、可溯源的伊斯兰知识,实测 124 例诵读校验准确率 98.4%,端到端语音延迟 0.9-1.7s。
针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。
研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。
北京大学、百度与清华团队提出 H2S(Highlight-Then-Summarize):先定位问题相关的原文证据,压缩为紧凑摘要再作答。在七任务 H2S-Bench 上,H2S-14B 于 128K 输入、4K 输出预算下平均得分 32.60,超 Qwen3.8-27B 10.17 分。该模型为评测开源模型中最强,4K 输出下保留 16K 预算性能的 97.1%。
论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。
一项研究提出基于用户简介与推文在 X 上识别科学家与非科学家账号的方法,随机森林在语言学特征上最高达 0.88 F1,对比式微调的 DeBERTa 在集成设置下最高达 0.96 F1。研究同时公开了两个将 X 用户标注为科学家或非科学家的数据集,包含各自的推文与用户简介。
MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。
PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。
研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。
研究用一次前向计算读取 argmax p(. | t, t),把语言模型对自身重复 token 的映射画到整个词表。非固定点部分按源 token 配对消除基数混杂后,模型家族归属准确率达 0.8333(12 个模型对 19 个模型池,随机 0.1389),固定点部分为 0.5833。
一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。
在自然对话中,潜在问题的显著性与可回答性之间存在稳健但较弱的正相关,越显著的问题越可能被回应,但该效应明显弱于独白文本。研究基于 Wu et al. (2024),从英国国家语料库的语句及前文自动生成 7,124 个问题并标注显著性与可回答性,用以检验 QUD 建模。结构化互动中标注者之间的一致性也强于组织松散的对话。
LocUS(Localized Unembedding Steering)通过在 unembedding 矩阵中定位属性专属线性子空间,把激活引导限制到该子空间并仅作用于稀疏的少量注意力头,实现免训练的推理时控制。在三个模型族的毒性缓解、情感转向和谄媚抑制评测中,LocUS 匹配或超越 SOTA 基线,仅干预不到 6% 的参数,并更好地保留通用能力。
CG-Probes 用差值均值法在冻结嵌入器的归一化空间中探测线性方向,可将患者查询嵌入中的紧急度风险轴恢复出来。该方法用 BERTopic 聚类 79,658 条捷克语肿瘤科查询生成对比风险样本,在 200 条经两名肿瘤科医生评分的查询上与开放权重 LLM 表现相当且延迟更低,每轴输出标量分数供医生设定升级阈值。
在 23 段专家标注的协作学习对话上,两个中型 LLM 无需任务特定训练即可开展意义建构的多维分析,启用推理的提示词能纠正无推理时高估成功案例的偏差。知识状态诊断进一步提供依据,提升了失败意义建构的检出率以及与专家标注的一致度。没有任何单一配置在所有意义建构维度上表现最佳,凸显该任务的多维属性。
G²PTQ 提出统一的大语言模型训练后量化框架,在全局监督的块级目标下融合一阶与二阶信息,并在量化每个 Transformer 块前刷新梯度与 Hessian 估计。它引入 trust-region 缩放机制约束梯度步长,防止权重更新爆炸。在多种模型族和位宽上,G²PTQ 与全精度模型的对齐优于 SOTA 基线。
ZooWork-ShopRanker 是一组电商开源偏好对齐重排序器,含 0.6B、4B、8B 三个规模,训练标签由多个推理 LLM 组成的偏好评审团生成。其 8B 旗舰作为蒸馏教师训练 4B 与 0.6B,并发布含约 10,000 对私域流量偏好对的 ShopRank-Bench。
该研究分析了 DeepSeek、Qwen、豆包三个中文大模型在 12,165 个来自真实中文搜索查询的是非事实问题上的迎合行为,覆盖 364,941 条回答。研究在有无推理两种模式下对比基线、用户信念注入和反迎合提示三种设置,并区分与错误信念一致的错误和由正确转为不确定的答案。结果显示推理并非一贯的防线,反迎合指令能在减少错误认同的同时增加不确定性。
THA 是面向高棉语的开源文本规范化与逆文本规范化工具包,基于加权有限状态转换器,用一次最短路径搜索完成整行分词与分类,并由第二个转换器拒绝高棉语音节内部的 token 边界。在 Google 高棉语测试集上,其对全部 274 个基数词与参考一致,仅有一处拼写变体差异;在 2906 条真实 TTS 提示中,改写的 158 句有 153 句正确。
CUSP(Coupled Usage–Sense Processes)用单一保持边缘的时间过程刻画词汇语义变化,同时给出变化幅度、时间、机制与归因。其位移算子把变异拆分为组件中心移动与组件内重组,并归因到被迁移的组件对;高斯混合特化下论文证明了算子与平方距离的参数可恢复性。CUSP 在英语、德语 DWUG 上保持竞争力,并在美国法院意见大规模语料中展示转换、模式与段落归因。
FAVoR(Federated Authorial Voice Retention)提出一种面向联邦 PEFT 的作者风格残差机制,用于缓解多作者适配中不同作者生成结果在风格空间难以区分的同质化问题。
EoupCT 提出估计并正交化未知预训练梯度的框架,用于 LLM 持续微调以缓解灾难性遗忘。它用带 Gumbel-Softmax 松弛的可学习软提示生成新任务最易遗忘的伪数据来估计预训练梯度,并以一阶高效 Pareto 优化器联合优化 LLM 参数与软提示,强制新任务更新与估计梯度正交。多个 LLM 实验显示可兼顾任务能力与通用知识,该工作已被 NeurIPS 2026 接收。
免训练 ST2P 流程在推理时同时利用词汇与声学信息,将日语发音转写的 CER 从 0.60–1.40%(纯文本基线)降至 0.04–0.17%。它先用 G2P 工具生成文本约束候选,再由冻结的 S2P 模型以整序列负对数似然做从左到右贪心搜索,速度比 beam search 快 3–3.5×,级联解码比直接解码快 2×。
ToolSearcher 是一个面向大规模工具选择的强化学习框架,用类别约束的工具区分、事件级搜索建模与轨迹对齐信用分配,提升 LLM 在上下文限制下的多轮工具搜索与组合能力。它将大规模工具选择视为智能体强化学习的新挑战,指出现有知识问答 RL 方法难以兼顾工具兼容性。在迭代搜索与复杂工具组合等基准设置下,它持续优于多个强基线,并已被 NeurIPS 2026 接收。
一篇 perspective 论文提出,语言模型的文化评估应从事实标注转向推理深度,以证据为中心构建 benchmark,并保留学者之间的解读分歧。作者认为文学解读适合考察这类能力,即模型能否解释文化引用、用证据支撑解读并在受批评后修正,重点是文本跨历史与语言语境的引用与改写。研究以丹麦文学为起点,主张用文学数据、语境资源和学者反馈指导模型开发,超越常规 benchmark 指标。
在 74 个标注 Real/Fake 的日语医疗 YouTube 长视频上,完整转录文本(Baseline)在基于 LLM 的真实性分类中表现最佳,而 LLM 摘要、RAPTOR 的 RAG 与 Screening 三种压缩输入均增加了假阴性。
ARGUS 是结构化语言模型流水线,按十一维“假设—含义—证据”评分表审计 DID 气候政策研究中的识别假设证据。在 11 类缺陷基准上检出 73% 的植入缺陷,关键词流水线仅 18%;26 篇经济学论文中约 40% 的论文—维度评估因缺少可检索证据而弃权。5 篇论文试点中,它在完成的 33 项评估里有 25 项风险等级高于标注,只输出证据关联的风险报告供专家复核,不裁定因果结论。
持续负样本对抗蒸馏用历史提示词匹配的师生对比样本替换部分判别器批次,缓解黑盒在线策略蒸馏中负样本分布随策略更新漂移的移动目标问题。在匹配判别器算力下,该方法跨两个学生模型家族、三个评判模型与四个评判对话基准稳定优于现有方法。其贝叶斯最优奖励为教师到负样本的对数密度比,持久负样本可锚定判别器并降低奖励估计 MSE。
研究提出用 LLM-as-a-judge 统一衡量输入扰动与 CoT 扰动的强度,并在受控强度条件下评估多个 LLM 生成解释的自一致性。实验显示,该基于 LLM 的扰动强度度量优于嵌入向量和概率方法,且输入扰动对 LLM 的影响普遍强于 CoT 扰动。研究据此认为,只有在同一扰动类型内比较,对模型自一致性的判断才算公平。
I-Parakeet 将 NVIDIA Parakeet-CTC(0.6B 参数)改为纯整数实现,可在智能手机 NPU 上运行,无需浮点算子或 CPU 回退。关键改动包括整数化相对位置自注意力、minimax 优化的 Swish 近似,以及 BatchNorm 输出的 INT16 网格和重尾激活的百分位校准。
在从教师到学生的知识蒸馏中,提示词模板选择会显著削弱学生模型已有的安全对齐:聊天模板比非聊天模板让模型更顺从有害查询。该现象在 LLaMA、Gemma 和千问(Qwen)三个模型家族及多个安全基准上一致。非聊天模板蒸馏更能保留学生模型内部表示,聊天模板蒸馏则导致更大的表示偏移。
KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。
SEA-CLIP-Tiny 是参数量不足 50M 的多语言文本-视觉嵌入模型,面向东南亚语言,用 CLIP-KD 式框架结合区域数据筛选与多语言教师引导。在 7 种东南亚语言上,其平均检索表现在受评学生模型中最佳,R@1、R@5、R@10 分别为 12.9%、31.5%、42.2%。
针对 SnapKV、PyramidKV 等只按平均注意力排序 token 的 KV cache 驱逐方法,该研究提出加入注意力离散度与冗余惩罚的统一打分,其相似度惩罚无需额外前向。
对 Google 预训练模型 Gemma 4-e4b 的行为评测发现,输入两份冲突文档时,来源语义框架对答案的影响显著强于文档顺序。评测含 13 个条目、784 次前向传播,模型偏好先读到的第一份文档,但首因效应强度随表面措辞波动至少 5 倍。两份文档逐字模板相同时首因效应显著增强,整体措辞变化则削弱位置偏差。
TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。
研究提出由 DCE 与 SRCL 构成的递归在线策略蒸馏框架,让特权教师模型与学生共同演化,在四个竞赛级数学基准上超越 OPSD。在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 高出 35.62 个百分点。SRCL 额外以模型自身在线响应更短、经核验的改写进行训练,使平均输出长度较仅用 DCE 减少 7.80%。