跳到正文

全部动态

今日 764 条
9月29日周二
  1. arXiv cs.CL35

    措辞胜过顺序:Gemma 4 的行为评测

    对 Google 预训练模型 Gemma 4-e4b 的行为评测发现,输入两份冲突文档时,来源语义框架对答案的影响显著强于文档顺序。评测含 13 个条目、784 次前向传播,模型偏好先读到的第一份文档,但首因效应强度随表面措辞波动至少 5 倍。两份文档逐字模板相同时首因效应显著增强,整体措辞变化则削弱位置偏差。

  2. arXiv cs.CL34

    TRACE:面向流式视频理解的时间审计与条件感知评估基准

    TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。

  3. arXiv cs.CL35

    通过在线策略蒸馏实现推理的递归自我改进

    研究提出由 DCE 与 SRCL 构成的递归在线策略蒸馏框架,让特权教师模型与学生共同演化,在四个竞赛级数学基准上超越 OPSD。在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 高出 35.62 个百分点。SRCL 额外以模型自身在线响应更短、经核验的改写进行训练,使平均输出长度较仅用 DCE 减少 7.80%。

  4. arXiv cs.CL46

    MemProbe:用认知实验范式诊断 Agent 记忆的稳定性-可塑性权衡

    MemProbe 框架通过干扰、错误信息、巩固强度与再巩固窗口四个认知科学实验范式,诊断 Agent 记忆系统的稳定性-可塑性权衡。研究在 56 个 episode 的诊断套件上以统一协议评测六个增量记忆系统,发现聚合分数相近的系统呈现出明显不同的行为画像。该工作已被 EMNLP 2026 Main 接收,代码已公开。

  5. arXiv cs.CL40

    REALMS:面向高维嵌套画像实时精确受众规模测算的 AI 对话系统

    REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。

  6. arXiv cs.CL38

    喂 BabyLMs 吃 Macaroni:语码切换课程带来跨语言收敛

    用 LLM 向英语、荷兰语、中文 BabyBabelLM 语料注入词级与句级语码切换后再预训练小型 decoder-only Transformer,可让平行文本表征(尤其跨书写系统)趋于对齐。按词级语码切换→句级语码切换→单语文档的课程训练,模型在 BabyLM 评测套件上优于未使用该数据的基线。代码、数据与模型已公开。

  7. arXiv cs.CL34

    Inquesto Score:面向语音智能体的可靠性评测协议

    Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。

  8. arXiv cs.CL42

    打破同质化:为创意 LLM 输出构建多样化人设集

    研究将 LLM 人设多样化建模为集合级条件化问题,提出覆盖子集选择、均匀覆盖采样与进化式人设生成等方法。在 AUT 任务上,进化式人设生成相比仅任务提示将回答多样性提升 78.8%、原创性提升 26.1%、整体创造力提升 13.9%,并保持 98.5% 有效性;在 Infinity-Chat 上,人设引发的回答区分度接近随机人设的两倍。

  9. arXiv cs.CL34

    CARGO:面向生产环境智能体 AI 的上下文感知检索门控评估

    CARGO 框架将检索到的参考当作流程范例、以实例观测上下文锚定事实判断、并按检索置信度门控,用于生产环境的智能体 AI 评估。在 246 条样本、7,872 次判断的 CARGO-Bench 上,参考式 judge 会惩罚 100% 的正确实体替换答案且 DI 约为 0,CARGO 将误判降至 0/50、矛盾召回保持 50/50,DI 升至 0.58;但其宽松设计对流程性错误的召回仅 20%。

  10. arXiv cs.CL39

    检索式开放式评估为何失效?长文本医学答案事实性验证的自动分类体系

    一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。

  11. arXiv cs.CL30

    面向 LLM 同声语音到语音翻译的因果感知框架 FAST-CAP

    LLM 同声语音到语音翻译框架 FAST-CAP 提出,包含分解式 S2ST 架构 FAST、因果感知自适应策略 CAP 和因果感知延迟指标。在 CVSS 西班牙语、德语、法语上,它比固定策略最高提升 1.2 BLEU、延迟相对降低 26%。该框架用远少于现有系统的训练数据,在语音翻译质量与说话人保真度上达到 SOTA,延迟相对降低最多 38.8%。

  12. arXiv cs.CL34

    概念与组块统一理论:基于 Cobweb 的扩展与 trellis 实现

    Cobweb 分类与概念形成模型被扩展为统一处理概念与组块的理论,配套实现 trellis 在三个合成语法上完成实验。该理论不限定模态,适用于任何可分解为元素及其关系的经验;实验显示 trellis 能表示句法知识、解析与生成句子,并从样本解析中学习组合结构。论文被 ACS-26 接收作口头报告。

  13. arXiv cs.CL30

    系统性综述筛选自动化的基准框架:SRBench 与 PromptSR

    SRBench 基准数据集以 45,064 条标注数据评估 LLM 在系统性综述(SR)筛选中的表现,覆盖 32 项精选二次研究。其评测框架考虑 SR 中排除文章天然多于纳入文章的类别不平衡问题,并指出传统指标在这类高度不平衡场景下可能产生误导;配套的 PromptSR 工具支持提示词实验、实验管理与结果分析。

  14. arXiv cs.CL50

    Spotify 论文:对话式推荐智能体的合成数据生成与自我改进循环

    Spotify 提出多轮合成数据生成管线与自我改进循环,在冷启动阶段优化对话式推荐智能体的规划与工具调用,规划质量在高度优化的人工提示词基础上再提升 8%。自我改进循环结合基于方差的对比优化与编码智能体的迭代修正,自动定位并修复规划与工具调用错误。系统已在 Spotify 落地,线上 A/B 测试显示用户收听提升 14%、周活跃用户提升 5%、跳过率下降 5%。

  15. arXiv cs.CL37

    SignTrace:用自然语言描述手势,反查中文手语词典词条

    SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。

  16. arXiv cs.CL36

    Cartograph:面向 AI 智能体的联邦式工具发现与运营方认证检索

    Cartograph 是联邦式 MCP 代理,把 AI 智能体的工具发现从 O(n) 改为 O(k) 渐进式披露。在 22 个服务器、374 个工具的部署中仅暴露三个代理工具,49 条查询基准 R@5 为 0.816,高于 Jaccard 基线的 0.592。Rift 三层分析识别出 49 个易混淆簇,网关十次试验平均增加 5ms 延迟(0.8%)。

  17. AGI Hunt36

    国际象棋 AI 对手怎么「输得像人」?开发者探讨可信失误的设计难题

    一位开发国际象棋 AI 对手的开发者收到反馈:测试玩家吐槽 bot 失误得「有意图、要合理」——它把皇后撤离车攻击后,下一步又送回险地。其方案混合 Maia 与 Stockfish 加自定义选步规则,却常像两个不同棋手在轮流行棋。作者认为人类失误源于注意力焦点与执念而非随机走差,难点是建模「可信的盲点」和「思路的延续性」,又不变得可预测,帖子正征集同类经验。

  18. AGI Hunt43

    RecallOps 开源:基于 Hindsight 持久记忆的事故响应 Agent

    开发者开源 RecallOps,一个基于 Hindsight 持久记忆框架、采用 MIT 协议的事故响应 Agent。其工作流为「事故→召回→反思→调查→解决→留存」,会召回相关历史事故并按相关性与时间新旧排序证据,区分成功修复与失败尝试。例如 503 故障会回忆起两起相似事故:一起靠扩大连接池解决,另一起同样修复失败、真因是下游服务故障。

  19. AGI Hunt37

    VC 视角:EDA 芯片设计反馈环太长,AI 智能体难有用武之地

    VC 推荐 Nojan Sheybani 与 Kevin Gubbi 组合在 EDA 芯片设计自动化领域创业,并指出芯片设计生命周期极长,RTL 上游的小改动会在后期产生巨大影响。EDA 中工具运行时间占绝对主导,AI 智能体无法快速迭代,如同每次编译代码要 9 小时以上。改善之道是缩短仿真工具墙钟时间,或用启发式方法快速估算。

  20. AGI Hunt43

    开发者 vibe-code 出 ComfyUI-BubbleText 节点,自动修复漫画气泡框里的乱码文字

    Reddit 用户 arturor1990 发布开源节点包 ComfyUI-BubbleText,可自动擦除 AI 生成图片对话气泡内的乱码字母并写入用户指定的真实文本。该节点支持 emoji,兼容 Anima、Illustrious 和 NoobAI 模型,可配合 LoRA Manager 使用。作者坦承项目是 vibe-coded,节点标签为西班牙语,已在 GitHub 开源并征集反馈。

  21. AGI Hunt38

    斯坦福研究者点破 LLM 验证软肋:「核查」无法形式化保证

    斯坦福研究者 Michael Zlin 指出,LLM 在科学发现任务中的「核查」环节无法形式化验证:即使模型生成的候选集覆盖足够,也没有任何机制能保证模型真的验证了一条声明,而不是生成一段听起来很流畅的验证文本。他认为输出流利不等于推理可信,形式化保证的缺失是当前 LLM 做科学验证的硬伤。

  22. AGI Hunt50

    EO2Weave 实战踩坑:WebMCP 智能体的工具加载、站点信任与移动端设计难题

    浏览器原生 AI 智能体 EO2Weave 团队公开接入 WebMCP 后的三大未决设计难题:工具加载架构、站点 per-origin 授权与移动端定位。工具集增至 30 个以上后选择质量明显下降,团队改为模型只看到 searchtools/calltool 两个工具、其余放目录按需查 schema。移动端用户只看进度、批准或拒绝后离开,当前约 50 个弹窗的缩水桌面式 UX 是最大抱怨。

  23. AGI Hunt37

    「Bad Apple」极限测试:GPT-6 Astra 与 Opus 5.5 接力协作才补上各自短板

    Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。

  24. AGI Hunt48

    AMD 82 亿美元收购 World Labs,Atlas 破解稀疏重建难题

    AMD 以 82 亿美元收购 World Labs,李飞飞称其正把空间智能与 SceniX 的机器人仿真能力结合。Atlas 从零训练,像 LLM 预测下一个 token 一样从 2D 图像预测下一个视角,用生成模型与多视图几何解决稀疏重建难题。Claude Sonnet 5.5 在 Opus 5.5 一周后上线,官方称比 Sonnet 5 快 30% 以上、多数任务便宜最多 30%。