HeurEvo:面向时间受限数学优化的求解器增强混合启发式智能体进化
HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。
HeurEvo 是面向时间受限数学优化的 plan–code–component 协同进化框架,联合进化算法结构、实现代码与共享组件池。在组合优化 benchmark 与 MIPLIB 实例上,它能在严格运行时限内找到高质量解,常匹敌或超越需数小时至数天计算的 SOTA 求解器。在六边形填充等非线性几何问题上,它也超过此前最佳结果。
PhenoAIR 是可靠性感知的多智能体框架,在来自 JUMP Cell Painting 的基准所有 MOA 预测设置中超过表征匹配与 LLM 基线。它将 Cell Painting 的 MOA 预测从表征匹配重构为校准证据推理,维护以候选为中心的证据记忆,并用离线参考集校准按来源可靠性、表型稳定性和机制级混淆加权。该工作入选 NeurIPS 2026 main track。
开发者 @jonkragh 盘点 OpenAI DevDay 上被忽视的三个信号:ChatGPT 插件分发窗口、Codex 安全 agent 与 Decisions API。
MoRe-Drag 是运动锚定的拖拽式编辑方法,将像素空间 warping 作为粗运动证据注入生成采样轨迹。它通过区域感知潜在重组和阶段自适应条件,从运动结构生成转向语义精修,并以适配 MLLM 文本编码器实现无指令界面。在 DragBench-SR 和 DragBench-DR 上,其拖拽精度优于强基础编辑器并领跑 SOTA 拖拽方法,语义一致、视觉真实,代码和数据集将公开。
研究者提出 Population Fidelity 框架,从群体层面准确度、群体间差异量及其结构三个维度评估 LLM 生成回答的人群代表性。将该框架用于复现 LLM 问卷回答“machine bias”研究及更新模型后发现,代表性不佳既因群体间差异不足,也因差异被归入错误群体;cultural fine-tuning 虽能提升与调查中心的契合度,却不改善群体内差异的代表性。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,取得 95.3% 的成绩,超过所有基线 LLM。它包含 1,706-chunk、10-source 知识库与跨指南冲突注册表,并按 query-specific focus 和冲突信号对检索证据重排序。评测采用 LLM-as-Judge,避开关键词匹配造成的平均 10.1 个百分点系统性低估,代码已开源。
OpenAI 在 Dev Day 上演示了由约一万个智能体组成的研究集群,协作求解纳维-斯托克斯方程。不同研究团队分别探索不同思路,跨团队保持通信,再汇总整合各自成果,展示了多智能体协同科研的真实运作方式。有转发者称其为现场「最重要的 alpha」。
AESplat 提出解耦外观建模策略,用于无位姿前馈 3D Gaussian Splatting,以提升新视角合成的渲染质量。该方法无需训练即可从输入图像直接得到表示视角无关基础外观的零阶 SH 系数,高阶 SH 系数则由带两个 3D-aware 归纳偏置的浅层 MLP 预测,以建模视角相关外观变化。
OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。
PersonaDose 校准描述条件 FLAS 控制器,实现人格特质表达的分级控制。在 Llama-3.1-8B、Qwen3-8B、Gemma-3-4B 上,核心特质表达较 contrastive activation addition 提升 33.2、18.3、17.8 分。七个已训练特质上,平均目标误差为 4.7-6.2 分。
tszzl 预言,在真正超级智能出现之前,人们会发现神经网络可以分解为某种「演化出来的符号系统」。Quintin Pope 调侃回应:「你说的是一棵特别大的决策树?」二人交锋触及可解释性研究的核心问题——神经网络的内部结构能否被还原为可读的符号化机制。
研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。
研究通过提示词与微调,为感官、空间、数值、推理、社交、抽象六个认知域构建专家 LLM 变体,各专家的表征与对应认知域的脑系统对齐程度优于其他专家。该结论在提示与微调两种方式、三个基座模型和三个 fMRI 数据集上均成立,非认知与表层干预的对照分析未出现类似对齐。专门化只改变区域对齐,整体预测准确率基本不变。
研究将关系型基础模型 ICL 中的一种失效模式定义为“支持集目标泄漏”:目标派生(泄漏)列只存在于带标签的支持集,查询保持干净。作者构造 14 种合成泄漏类型(对应 20 列),在 RelBench 留出数据库上评测冻结关系编码器加 ICL 头,发现目标表泄漏的性能下降最明显,一跳、两跳泄漏未被模型稳定使用。
Ollama 0.35 发布,新增 /v1/systemone 端点,支持基于 TypeSafe Jev API 的决策模型,并同步上线 Nimble 等三个可本地运行的新模型。Nimble 单次决策仅需 91ms,官方随后补充发布了配套博客、决策能力文档与 API 文档。该功能本地运行无额外成本、延迟更低,适用于工单分诊等需要一次性回答一组命名问题的场景。
RVP(Reparameterized Inter-Class Visual Reprogramming)通过类内聚合多个文本提示词、跨类施加残差修正来重编程视觉语言模型,并建模共享语义成分与类间差异。
新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。
在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。
开发者 gandamu_ml 展示了 Minecraft 世界生成器克隆的决策点验证法:不必证明生成顺序分布与 Java 原版一致,只需证明在给定相同顺序时两者结果等价。实现上他借助 LLM 自动寻找合适的决策点,使克隆环境的验证回放流程能无缝切换到接下来需要执行的代码。他坦承不确定 LLM 具体做了什么,但认为该方案理论上可行。
ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。
FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。
LLM-Guided Graph Pruning(LGP)通过 LLM 推理剪枝已有 ANN 图索引中的结构低价值邻居,并用 LLM 选择的替代邻居替换,以解决几何-语义不匹配。在代表性语义检索基准上,LGP 在 DiskANN、HNSW 等图索引上持续优于原始贪心图搜索和基于 LLM 的 reranking。该框架保留原图的稀疏性和高效可导航性。
YORO 提出单次前向、无需反向传播的视觉重编程方法:BDM 从流式类别统计构建协方差感知仿射映射,在冻结响应空间直接生成下游预测器。三组全数据设置中,平均准确率较最强先前无梯度映射提升 18.4–24.4%;16-shot CLIP 上四骨干平均从 71.4% 升至 77.2%。需要进一步输入适配时,YORO-FP 可选微调视觉提示 20 epochs,验证常保留单次预测器。
研究识别出大语言模型的「规范顺序问题」:模型内部概率分布会按字母或时间等规范顺序组织多值关系,偏离该顺序的提示会降低生成完整实体集合的可靠性。机制分析将其集合生成拆为候选实体检索、内部排序与下一元素选择三个阶段。论文已被 AKBC@EMNLP2026 接收。
印度理工学院马德拉斯分校 Wadhwani 数据科学与 AI 学院负责人 Balaraman Ravindran 在 DT Next 专访中表示,AI 正从聊天机器人问答转向能够规划任务、与其他 AI 协作的代理式行动阶段,扩展模型时安全护栏必须与技术发展同步跟上。他还谈到代理式 AI 带来的网络安全挑战、对就业的影响,以及在印度语言场景下的应用。
GAIN 是免反向传播、无样本存储与回放的持续测试时自适应(CTTA)框架,按“历史提议、增益决定”原则,用目标统计生成修正提议、以源相对增益决定每个样本的干预强度。在五个 benchmark 上它取得较强预测性能,ImageNet-C 上以接近源模型的校准达到 61.9% 准确率,并比代表性优化式 CTTA 基线快 15.9x。
研究分析 Gemma 4 31B 对九种非洲语言和三种对照语言的表征,发现英语迁移随语言和层数变化,非洲—西方对比方向在非洲语言之间比与对照语言更对齐。在尼日利亚内部,Yoruba 与 Igbo 在 12 层中的 11 层上比二者与 Hausa 的平均对齐度更高。
HyperZip 是一个基于扩散 LLM(dLLM)的高效无损数据压缩框架,用 Multi-Token Prediction(MTP)加速 LLM 压缩推理。它通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据,带来更低的压缩率与更高吞吐。实验显示,其压缩率与速度的权衡优于现有最优基线。
Sakana AI 发布招聘信息,招募「Forward Deployed Engineer(Defense)」,要求深入防卫与情报领域客户现场,基于 LLM 和 AI 智能体提出解决方案并亲自实现。任职要求包括 LLM/生成式 AI 应用开发经验、数据科学与机器学习项目实务经验,以及在信息保密、封闭网络等严苛约束下交付 AI 的能力,反映 AI 公司向日本防务/情报领域拓展的趋势。
FastGuide 用并行与自回归解码的自适应混合来加速扩散大语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码最高快 4.4 倍,并保持相近的生成质量。它按每个解码步骤计算一次引导并复用于多个 token,借助 KV 缓存与注意力稀疏重算降低开销,模型不自信的 token 会被推迟解掩。
rosinality 转发的研究观点称,多模态模型预训练计算量超过 1e22 FLOPs 后可直接去掉视觉编码器,不再需要单独的 vision encoder。该观点认为,在足够大的算力规模下,原生多模态训练可以吸收视觉编码器通常承担的角色。
SCOUT 以两阶段方式融合评分规则生成与工具取证来验证计算机使用智能体的安全性,在 AutoElicit-Bench 上取得 75.4 unsafe F1 和 74.5 completion F1。
图像聚类基准 VLM4Cluster 发布,覆盖 17 种经典、深度与语言辅助聚类方法及 20 个数据集,并评测鲁棒性、泛化与计算效率三个维度。结果显示语言辅助聚类(LaIC)在语义要求高的基准上推进性能前沿,分布偏移下泛化更强、效果与效率权衡更优,但在大规模和细粒度数据集上增益不稳定,也未系统性降低对抗扰动敏感性。
论文提出 PILLAR,一个基于 Private Information Retrieval(PIR)的隐私保护 RAG 系统,客户端从服务器语料中取回与查询最相似的 k 篇文档,服务器无法获知查询词项与访问模式。
「The Midas Touch for Code」(CodeMidas)论文提出直接从源码规模化生成编码 Agent 的强化学习训练环境。Andreas Maier 点评认为,该工作提供了一条扩展 AI 编码环境的新路径。该论文为 2026 年 arXiv 论文。
英语、Hausa、Yoruba 三种语言的末位 token 情感方向分半一致性分别为 0.737–0.870、0.589–0.762 和 0.101–0.399,在四个语言模型、77 组完整对比中该语言排序始终一致。
OCA(ODE 驱动的交叉注意力)通过常微分方程建模图像到点云(I2P)特征交互,缓解 2D-3D 对应学习中的注意力歧义。该模块可无缝接入现有 I2P 配准框架,作者将其集成进五个 SOTA 基线、在四个公开基准上评测。结果显示配准召回率在标准、微调、零样本设置下分别最高提升 5%、9% 和 15%。
开发者 maierak 质疑论文《The Midas Touch for Code: Scaling AI Coding Environments Straight from Source》可复现性与统计置信度均不清楚:该工作未与基于 issue 的管线做正面对比,只用了单一模型和单一随机种子,生成用的 agent 未公开。
微软推进面向数据系统的 AI SW Factory,覆盖 Targeting、Coding、Reviewing、Ops 四个 SDLC 阶段。在微软数十个代码仓库的规模化部署中,它相比 agentic coding 达到 3 倍工程效率、最高 22 倍 token 效率。
提出 FlexBench 基准与 GM-DPO 分级偏好优化方法,用于改善 VLM 肢体动作描述的细粒度准确性。在三个 VLM backbone 上,GM-DPO 的 GPA 分数较 DPO 提升 2.02-3.40 分,Qwen3-8B 上加权幻觉率降低 21.3%。FlexBench 含 3,105 个镜头、18,161 条评测查询,方法同时保持长文本输出并改善镜头结构。