SEA-CLIP-Tiny:面向东南亚语言的高效多语言文本-视觉嵌入模型
SEA-CLIP-Tiny 是参数量不足 50M 的多语言文本-视觉嵌入模型,面向东南亚语言,用 CLIP-KD 式框架结合区域数据筛选与多语言教师引导。在 7 种东南亚语言上,其平均检索表现在受评学生模型中最佳,R@1、R@5、R@10 分别为 12.9%、31.5%、42.2%。
SEA-CLIP-Tiny 是参数量不足 50M 的多语言文本-视觉嵌入模型,面向东南亚语言,用 CLIP-KD 式框架结合区域数据筛选与多语言教师引导。在 7 种东南亚语言上,其平均检索表现在受评学生模型中最佳,R@1、R@5、R@10 分别为 12.9%、31.5%、42.2%。
针对 SnapKV、PyramidKV 等只按平均注意力排序 token 的 KV cache 驱逐方法,该研究提出加入注意力离散度与冗余惩罚的统一打分,其相似度惩罚无需额外前向。
对 Google 预训练模型 Gemma 4-e4b 的行为评测发现,输入两份冲突文档时,来源语义框架对答案的影响显著强于文档顺序。评测含 13 个条目、784 次前向传播,模型偏好先读到的第一份文档,但首因效应强度随表面措辞波动至少 5 倍。两份文档逐字模板相同时首因效应显著增强,整体措辞变化则削弱位置偏差。
TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。
研究提出由 DCE 与 SRCL 构成的递归在线策略蒸馏框架,让特权教师模型与学生共同演化,在四个竞赛级数学基准上超越 OPSD。在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 高出 35.62 个百分点。SRCL 额外以模型自身在线响应更短、经核验的改写进行训练,使平均输出长度较仅用 DCE 减少 7.80%。
KNOWS 基准用开放式复杂浏览器任务评测 computer-use 智能体能否跨多步检索信息、综合成文档/演示文稿/表格等成品。任务配有结合确定性检查与 LLM 判定的 evaluator;最佳智能体完全成功不到 3% 的复杂长程任务,视觉步骤失败还会让成品不可用。
MemProbe 框架通过干扰、错误信息、巩固强度与再巩固窗口四个认知科学实验范式,诊断 Agent 记忆系统的稳定性-可塑性权衡。研究在 56 个 episode 的诊断套件上以统一协议评测六个增量记忆系统,发现聚合分数相近的系统呈现出明显不同的行为画像。该工作已被 EMNLP 2026 Main 接收,代码已公开。
REALMS 是已部署在企业客户数据平台上的对话式受众规模测算系统,可用自然语言查询数百万画像、数千属性并在几秒内返回精确计数。系统由基于嵌入向量搜索的属性检索、带模板化上下文学习的 LLM NL2SQL 流水线、schema 标准化三部分构成。真实企业数据评估显示属性检索召回高、SQL 执行准确率高、延迟低,此前需数小时的任务可实时完成。
用 LLM 向英语、荷兰语、中文 BabyBabelLM 语料注入词级与句级语码切换后再预训练小型 decoder-only Transformer,可让平行文本表征(尤其跨书写系统)趋于对齐。按词级语码切换→句级语码切换→单语文档的课程训练,模型在 BabyLM 评测套件上优于未使用该数据的基线。代码、数据与模型已公开。
Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。
研究将 LLM 人设多样化建模为集合级条件化问题,提出覆盖子集选择、均匀覆盖采样与进化式人设生成等方法。在 AUT 任务上,进化式人设生成相比仅任务提示将回答多样性提升 78.8%、原创性提升 26.1%、整体创造力提升 13.9%,并保持 98.5% 有效性;在 Infinity-Chat 上,人设引发的回答区分度接近随机人设的两倍。
CARGO 框架将检索到的参考当作流程范例、以实例观测上下文锚定事实判断、并按检索置信度门控,用于生产环境的智能体 AI 评估。在 246 条样本、7,872 次判断的 CARGO-Bench 上,参考式 judge 会惩罚 100% 的正确实体替换答案且 DI 约为 0,CARGO 将误判降至 0/50、矛盾召回保持 50/50,DI 升至 0.58;但其宽松设计对流程性错误的召回仅 20%。
一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。
LLM 同声语音到语音翻译框架 FAST-CAP 提出,包含分解式 S2ST 架构 FAST、因果感知自适应策略 CAP 和因果感知延迟指标。在 CVSS 西班牙语、德语、法语上,它比固定策略最高提升 1.2 BLEU、延迟相对降低 26%。该框架用远少于现有系统的训练数据,在语音翻译质量与说话人保真度上达到 SOTA,延迟相对降低最多 38.8%。
Cobweb 分类与概念形成模型被扩展为统一处理概念与组块的理论,配套实现 trellis 在三个合成语法上完成实验。该理论不限定模态,适用于任何可分解为元素及其关系的经验;实验显示 trellis 能表示句法知识、解析与生成句子,并从样本解析中学习组合结构。论文被 ACS-26 接收作口头报告。
SRBench 基准数据集以 45,064 条标注数据评估 LLM 在系统性综述(SR)筛选中的表现,覆盖 32 项精选二次研究。其评测框架考虑 SR 中排除文章天然多于纳入文章的类别不平衡问题,并指出传统指标在这类高度不平衡场景下可能产生误导;配套的 PromptSR 工具支持提示词实验、实验管理与结果分析。
Spotify 提出多轮合成数据生成管线与自我改进循环,在冷启动阶段优化对话式推荐智能体的规划与工具调用,规划质量在高度优化的人工提示词基础上再提升 8%。自我改进循环结合基于方差的对比优化与编码智能体的迭代修正,自动定位并修复规划与工具调用错误。系统已在 Spotify 落地,线上 A/B 测试显示用户收听提升 14%、周活跃用户提升 5%、跳过率下降 5%。
SignTrace 用自然语言描述反查中文手语词典,在 6,699 条词条上取得 94.0% Hit@1。系统整合 LLM 词典富化、动作抽取、七通道检索与候选重排,重排把 500 条描述基准的 Hit@1 从 71.8% 提升至 94.0%,Hit@9 达 97.4%。六路并发下中位查询耗时 13.37 秒,已部署试用;基准措辞取自词典,泛化到用户自述描述受限。
Cartograph 是联邦式 MCP 代理,把 AI 智能体的工具发现从 O(n) 改为 O(k) 渐进式披露。在 22 个服务器、374 个工具的部署中仅暴露三个代理工具,49 条查询基准 R@5 为 0.816,高于 Jaccard 基线的 0.592。Rift 三层分析识别出 49 个易混淆簇,网关十次试验平均增加 5ms 延迟(0.8%)。
一位开发国际象棋 AI 对手的开发者收到反馈:测试玩家吐槽 bot 失误得「有意图、要合理」——它把皇后撤离车攻击后,下一步又送回险地。其方案混合 Maia 与 Stockfish 加自定义选步规则,却常像两个不同棋手在轮流行棋。作者认为人类失误源于注意力焦点与执念而非随机走差,难点是建模「可信的盲点」和「思路的延续性」,又不变得可预测,帖子正征集同类经验。
开发者开源 RecallOps,一个基于 Hindsight 持久记忆框架、采用 MIT 协议的事故响应 Agent。其工作流为「事故→召回→反思→调查→解决→留存」,会召回相关历史事故并按相关性与时间新旧排序证据,区分成功修复与失败尝试。例如 503 故障会回忆起两起相似事故:一起靠扩大连接池解决,另一起同样修复失败、真因是下游服务故障。
CMU 团队提出 MetaLint,把代码 linting 形式化为指令跟随任务,模型按自然语言规范判断代码是否符合最佳实践,无需重训即可泛化到未见或演进中的规则。
Foresight Institute 本周在旧金山举办以「AI 驱动的科学」为主题的活动,探讨 AI 能否把数十年的科学发现压缩到几年内完成。
VC 推荐 Nojan Sheybani 与 Kevin Gubbi 组合在 EDA 芯片设计自动化领域创业,并指出芯片设计生命周期极长,RTL 上游的小改动会在后期产生巨大影响。EDA 中工具运行时间占绝对主导,AI 智能体无法快速迭代,如同每次编译代码要 9 小时以上。改善之道是缩短仿真工具墙钟时间,或用启发式方法快速估算。
Reddit 用户 arturor1990 发布开源节点包 ComfyUI-BubbleText,可自动擦除 AI 生成图片对话气泡内的乱码字母并写入用户指定的真实文本。该节点支持 emoji,兼容 Anima、Illustrious 和 NoobAI 模型,可配合 LoRA Manager 使用。作者坦承项目是 vibe-coded,节点标签为西班牙语,已在 GitHub 开源并征集反馈。
博主 IndraVahan 发推称 Anthropic「这次真的回来了」,主张当前没有任何理由不用 Opus 5.5 加 Sonnet 5.5 组成的 swarm 多模型集群干活。文中提到的 Opus 5.5、Sonnet 5.5 并非 Anthropic 已正式发布的模型版本,该帖更像传闻或 hype 性质表态,真实性与具体细节未证实。
Kaggle 联合创始人 Anthony Goldbloom 发帖回顾 Kaggle 对 AI 浪潮的贡献,称 GPT-3 论文第一作者与 OpenAI 联合创始人都从 Kaggle 社区走出。他还自嘲 YouTube 字幕把 Kaggle 认成 Kegel,多年向别人纠正品牌发音的努力算是白费了。
Claude Opus 5.5 以 88.4% 领跑 SimpleBench,推理强度提到 xhigh 时 Terminal-Bench-Science 由 24% 升至 62%,但 max 反降到 59%。它被评为 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。Opus 5.5 与 GPT-6 Astra 还能纯用代码生成视频动画。
Déjà Review 已在 GitHub 开源,这是一个由 Hindsight 驱动、具备项目级持久记忆的代码审查 Agent。它能记住用户此前的审码偏好,并结合历史上下文进行代码评审,给出更贴合项目习惯的审查意见。团队同时附带演示视频,具体实现细节见配套 LinkedIn 文章。
OpenAI 官方暗示「做好准备」,预告即将迎来 20 多项发布,而 Astra 项目刚刚被搁置。这一发布潮与项目被砍的反差成为讨论焦点,内容由 Reddit 用户 josh3com 发布。
斯坦福研究者 Michael Zlin 指出,LLM 在科学发现任务中的「核查」环节无法形式化验证:即使模型生成的候选集覆盖足够,也没有任何机制能保证模型真的验证了一条声明,而不是生成一段听起来很流畅的验证文本。他认为输出流利不等于推理可信,形式化保证的缺失是当前 LLM 做科学验证的硬伤。
GPT-6 Astra 黑客松的获奖团队将受邀参加明天的 OpenAI DevDay。OpenAI 员工 cristineejones 在 X 上发帖预热了这一消息。今年 OpenAI 将在 DevDay 上举办三场工作坊,邀请开发者现场一起动手构建。
UCLA Health 获美国国家老龄研究所(NIA)五年 2500 万美元资助,将牵头一项全国性行动,系统测试与评估用于诊断和治疗阿尔茨海默病及其他痴呆症的 AI 工具。
AI 圈流传一条自嘲段子,用三个 AI 行话为日常拖延开脱:迟到是「我在 pacing the frontier」追赶前沿,活干砸了是「我的 agents 不听话」,啥也没推进则是「我们有对齐顾虑」。段子借大厂放缓发布时的常见话术反讽生活,属典型 AI 圈梗。
X 用户 BoredElonMusk 发推讽刺:向未绑定任何资金来源身份信息的 X Money 账户转出数万美元,结果自然出了问题,并以「完全震惊」的反讽口吻调侃这一可预见的结局。该帖为纯转发,实质内容即被转推的这条原推。
浏览器原生 AI 智能体 EO2Weave 团队公开接入 WebMCP 后的三大未决设计难题:工具加载架构、站点 per-origin 授权与移动端定位。工具集增至 30 个以上后选择质量明显下降,团队改为模型只看到 searchtools/calltool 两个工具、其余放目录按需查 schema。移动端用户只看进度、批准或拒绝后离开,当前约 50 个弹窗的缩水桌面式 UX 是最大抱怨。
Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。
消费级个人 AI Agent 创业公司 Instinct 完成 10 亿美元 C 轮融资,由红杉、Benchmark、Coatue 等投资,估值达 100 亿美元。
推荐理由:一个月内估值从 25 亿美元升至 100 亿美元,14 人团队与个人 Agent 的成本结构形成对照,可据此观察这轮融资的定价逻辑。
Instinct 私人助理获 Paras Chopra 称赞体验流畅,他指出此前许多人基于文本打造私人助理都失败了,而这家公司做成了。他认为这是「并非一切创新都来自基础模型公司」的提醒。Paras Chopra 还提到,14 人团队的 Instinct 估值达 100 亿美元,日增速 10%。
AMD 以 82 亿美元收购 World Labs,李飞飞称其正把空间智能与 SceniX 的机器人仿真能力结合。Atlas 从零训练,像 LLM 预测下一个 token 一样从 2D 图像预测下一个视角,用生成模型与多视图几何解决稀疏重建难题。Claude Sonnet 5.5 在 Opus 5.5 一周后上线,官方称比 Sonnet 5 快 30% 以上、多数任务便宜最多 30%。