Nature 深度特稿:超越 CRISPR 的新一代基因组编辑器
《Nature》资深记者 Heidi Ledford 发表技术特稿,系统梳理 CRISPR 之后的新一代基因组编辑技术,目标是整段替换缺陷基因、构建复杂细胞回路。
《Nature》资深记者 Heidi Ledford 发表技术特稿,系统梳理 CRISPR 之后的新一代基因组编辑技术,目标是整段替换缺陷基因、构建复杂细胞回路。
H Company 发布面向 computer-use 任务的 Qwen3.8-27B 后训练版本 Holo4-27B。有博主用 Godot 自制吃豆人游戏实测,同一任务下 Holo4-27B 仅 68 次 agent 调用、消耗 240 万 token,原版 Qwen3.8-27B 为 197 次调用、1140 万 token,token 少约 79%、调用次数少 65%。
微软 CEO 萨蒂亚 · 纳德拉在 9 月 27 日发布的采访视频中表示,AI 行业“有点飘了”,领导者容易陷入技术细节、忽视普通用户的真实需求。他认为用户更希望 AI 带来实际利益,能掌控它并从中获益,而不是各种“AI 画饼”。他呼吁在推进 AI 技术的同时赢得消费者和社区信任,仅为了技术而庆祝技术行不通。
LG Innotek 宣布与自动驾驶软件企业 Applied Intuition 合作,在韩国境内部署自动驾驶传感数据采集车辆。其计划以首尔、仁川、京畿道为中心运营车队,到 2028 年部署 20 辆数据采集车和自动驾驶软件开发车,并投放美国、欧洲、日本。车辆搭载摄像头、雷达、激光雷达,采集数据将结合数字孪生环境提升传感器性能、验证系统有效性。
IDC 全球人形机器人跟踪报告显示,2026 上半年全球人形机器人出货量接近 2.5 万台,同比增长 432.1%,市场规模超过 7.4 亿美元,同比增长 322.7%。
影石创新正在研发一款主打拍摄的智能眼镜,优先满足内容创作者的免手持高质量拍摄需求,或采用前镜框可换设计、功能集中在镜腿。知情人士称其大概率搭载阿里千问大模型,影石内部还在探索把端侧生成模型直接部署到产品端。影石此前已获"可穿戴式眼镜"专利授权,采用电池与眼镜主体分离的分体供电设计以减轻头部负重。
岚图追光 S 以 1 分钟 12 圈定圆漂移,拿下“1 分钟内驾驶电动汽车定圆漂移圈数最多”吉尼斯世界纪录,该车使用原厂胎、标准胎压,在水泥地面完成。该车今年 8 月上市,定位“全球首款科技 FUV”,全系标配华为乾崑智驾四激光雷达方案,22.99 万元起售。此前该车还完成 360° 隧道大回环穿越。
微软面向 Microsoft Edge 开发者发布更新,推动 WebMCP 等 API,让 AI 智能体调用网站前端能力完成查信息、填表等任务。同时新增软导航、交互内容绘制等性能指标与 JS 自分析标记,帮助开发者排查单页应用卡顿。OpaqueRange API 则让拼写检查、建议和提示气泡跟着文字走,增删文字时不再错位。
独立研究者 Rowan Howard-Jones 称,联合国贸发会议统计网站 UNCTADstat 在 4 月 13 日至 6 月 19 日间遭到超过 16,000 次扫描,他认为这些扫描极可能由 OpenAI 智能体发起。
Amazon Web Services 的 Amazon CloudWatch Omni 已正式可用,把可观测性问题从系统是否运行转向智能体为何给出错误回答。它内置 17 个评估器,对连贯性、有用性、忠实度和路由正确性等指标打分,并支持从单条 trace 创建评估数据集、持续针对线上流量运行评估。
Autoheal 完成 $7.9M 种子轮融资,由 Innovation Endeavors 领投,其平台用 Evaluator agent 和 Healer agent 评估并修复企业软件工厂中的 AI 智能体。
NinjaTech AI 推出 SuperNinja Enterprise,让大型企业以固定年费在自有云环境中运行 AI 员工,价格还包含其所需的 GPU 算力。
语音 AI 初创公司 Modulate 宣布完成 2500 万美元新融资,用于把音频原生模型带给更多开发者。其模型直接分析对话原始音频中的情绪、语气、意图以及深伪信号,旗舰平台 Velma 底层的 Ensemble Listening Model 架构从 100 多个小型专用音频模型中选择并融合结果,公司称该设计最多比把同样音频交给单个大模型高效 1000 倍。
Okta 认为智能体 AI 安全需跨行业协同防护,其 Blueprint Alliance 联合 AWS、CrowdStrike、Salesforce、ServiceNow,推动安全控制与风险信号在智能体系统间互通。该架构要求为每个 agent 赋予身份、限定权限并跟踪其行为,从而在 agent 偏离预期用途时及时将其阻止。
在最新一期 theCUBE Pod 中,John Furrier 与 Dave Vellante 讨论了 AI 智能体如何重塑企业 IT 系统以及 CoreWeave 的崛起前景。
个人 AI 助手初创公司 Instinct 完成 10 亿美元新融资,估值升至 100 亿美元,C 轮由 Sequoia Capital、Benchmark Capital 和 Coatue 参投。
Momentic 发布 AI 测试智能体 Mo,开发者只需提供应用 URL 和测试意图,它便启动智能体集群尝试数千种排列与边缘用例,并输出测试过程、失败原因、复现步骤和每个 bug 的视频证据,不需要编写脚本或维护测试套件。
MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。
Blitzy 工程总监 Neeraj Deshmukh 在 GraphSummit 上称,公司用 Neo4j 知识图谱为编程智能体提供上下文,把客户代码库逆向构建成动态图谱并接入 GitHub、GitLab。他称智能体的有效上下文约 200,000 至 300,000 tokens,在一亿行代码库上会因压缩结果而丢失信息。Blitzy 6 月称在 SWE-Bench Pro 上得分 84.95%。
Muslim 是已部署的阿拉伯语语音 AI 平台,向真实用户提供有出处、可溯源的伊斯兰知识,实测 124 例诵读校验准确率 98.4%,端到端语音延迟 0.9-1.7s。
Oracle 云工程集团副总裁 Johnnie Konstantas 表示,agentic AI 让智能体及其子智能体可携带个人权限访问数据、甚至对工作流执行操作,身份控制因此必须尽量统一且无处不在。Oracle 已将 agentic AI 方案集成进安全产品组合,并在最新版 AI 数据库中推出面向 agentic AI 的能力,帮助客户在不牺牲数据安全的前提下推进 AI 创新。
针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。
Anthropic 发布 Claude Sonnet 5.5,称其为家族中能力最强的中端模型,输出速度比上一代提升超过 30%。该模型定价与 Sonnet 5 相同,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 20 美分,公司称完成同样工作所需 token 更少,因此成本低 30%。
Qiagen 把药物发现智能体锚定在人工整理的知识基础上,其 Discovery Platform 在整理好的知识库之上叠加 MCP 访问与智能体 Discovery Explorer。该公司的生物信息团队已手工整理生物医学数据超过 25 年,由 150 多名 MD 和 PhD 级专家完成。Qiagen 还于 5 月与 Nvidia 合作推进基于图的 AI 药物发现。
研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。
ServiceNow AI 平台安全产品副总裁 Bhakti Pitre 在 Okta 的 Oktane 活动上表示,应对失控 AI 智能体不能只靠"一键关停",需结合风险与业务上下文决定暂停还是撤销权限。
北京大学、百度与清华团队提出 H2S(Highlight-Then-Summarize):先定位问题相关的原文证据,压缩为紧凑摘要再作答。在七任务 H2S-Bench 上,H2S-14B 于 128K 输入、4K 输出预算下平均得分 32.60,超 Qwen3.8-27B 10.17 分。该模型为评测开源模型中最强,4K 输出下保留 16K 预算性能的 97.1%。
论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。
Meta 成立面向企业的 AI 业务部门 Meta Enterprise Platform,并任命 MongoDB CEO CJ Desai 领导,他将出任首席企业平台官。
分析师 Zeus Kerravala 指出,智能体 AI 每次任务的 token 消耗可达单次推理调用的 10 到 100 倍,按 token 计费让成功上线的 AI 项目成本失控。
一项研究提出基于用户简介与推文在 X 上识别科学家与非科学家账号的方法,随机森林在语言学特征上最高达 0.88 F1,对比式微调的 DeBERTa 在集成设置下最高达 0.96 F1。研究同时公开了两个将 X 用户标注为科学家或非科学家的数据集,包含各自的推文与用户简介。
Bit Cloud 联合创始人 Yonatan Sason 以自己维护的约 120 个组件系统为例,指出代码相似度检索找不全跨仓库的依赖边,因为依赖是系统属性而不是文本属性。
MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。
PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。
研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。
Omdia 分析师 Todd Thiemann 表示,AI 智能体身份安全需要跨技术栈的多层协同防御,而非单一主导平台。对 400 名安全负责人的调研显示,首要阻碍是对攻击来源的困惑与不确定;最受青睐的承担方是数据安全平台,其次是身份平台。Okta 新增 AI 智能体运行时网关,并与 AWS、CrowdStrike 组成 Blueprint Alliance,定义认证、授权和可见性等网关能力。
研究用一次前向计算读取 argmax p(. | t, t),把语言模型对自身重复 token 的映射画到整个词表。非固定点部分按源 token 配对消除基数混杂后,模型家族归属准确率达 0.8333(12 个模型对 19 个模型池,随机 0.1389),固定点部分为 0.5833。
一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。
在自然对话中,潜在问题的显著性与可回答性之间存在稳健但较弱的正相关,越显著的问题越可能被回应,但该效应明显弱于独白文本。研究基于 Wu et al. (2024),从英国国家语料库的语句及前文自动生成 7,124 个问题并标注显著性与可回答性,用以检验 QUD 建模。结构化互动中标注者之间的一致性也强于组织松散的对话。
LocUS(Localized Unembedding Steering)通过在 unembedding 矩阵中定位属性专属线性子空间,把激活引导限制到该子空间并仅作用于稀疏的少量注意力头,实现免训练的推理时控制。在三个模型族的毒性缓解、情感转向和谄媚抑制评测中,LocUS 匹配或超越 SOTA 基线,仅干预不到 6% 的参数,并更好地保留通用能力。