跳到正文

全部动态

今日 783 条
9月29日周二
  1. IT之家32

    微软 CEO 纳德拉:AI 行业“有点飘了”,呼吁回归用户需求

    微软 CEO 萨蒂亚 · 纳德拉在 9 月 27 日发布的采访视频中表示,AI 行业“有点飘了”,领导者容易陷入技术细节、忽视普通用户的真实需求。他认为用户更希望 AI 带来实际利益,能掌控它并从中获益,而不是各种“AI 画饼”。他呼吁在推进 AI 技术的同时赢得消费者和社区信任,仅为了技术而庆祝技术行不通。

  2. IT之家29

    LG Innotek 将用自动驾驶汽车为自动驾驶传感系统开发收集数据

    LG Innotek 宣布与自动驾驶软件企业 Applied Intuition 合作,在韩国境内部署自动驾驶传感数据采集车辆。其计划以首尔、仁川、京畿道为中心运营车队,到 2028 年部署 20 辆数据采集车和自动驾驶软件开发车,并投放美国、欧洲、日本。车辆搭载摄像头、雷达、激光雷达,采集数据将结合数字孪生环境提升传感器性能、验证系统有效性。

  3. IT之家27

    曝影石正在研发主打拍摄的智能眼镜:前镜框可更换,有望搭载阿里千问

    影石创新正在研发一款主打拍摄的智能眼镜,优先满足内容创作者的免手持高质量拍摄需求,或采用前镜框可换设计、功能集中在镜腿。知情人士称其大概率搭载阿里千问大模型,影石内部还在探索把端侧生成模型直接部署到产品端。影石此前已获"可穿戴式眼镜"专利授权,采用电池与眼镜主体分离的分体供电设计以减轻头部负重。

  4. IT之家25

    岚图追光 S 以 1 分钟 12 圈定圆漂移创下吉尼斯世界纪录

    岚图追光 S 以 1 分钟 12 圈定圆漂移,拿下“1 分钟内驾驶电动汽车定圆漂移圈数最多”吉尼斯世界纪录,该车使用原厂胎、标准胎压,在水泥地面完成。该车今年 8 月上市,定位“全球首款科技 FUV”,全系标配华为乾崑智驾四激光雷达方案,22.99 万元起售。此前该车还完成 360° 隧道大回环穿越。

  5. IT之家32

    微软优化 Edge 浏览器:网页提示不乱跑、扩展 AI 智能体技能

    微软面向 Microsoft Edge 开发者发布更新,推动 WebMCP 等 API,让 AI 智能体调用网站前端能力完成查信息、填表等任务。同时新增软导航、交互内容绘制等性能指标与 JS 自分析标记,帮助开发者排查单页应用卡顿。OpaqueRange API 则让拼写检查、建议和提示气泡跟着文字走,增删文字时不再错位。

  6. SiliconANGLE:AI52

    语音 AI 初创公司 Modulate 融资 2500 万美元,把音频原生模型推向更多开发者

    语音 AI 初创公司 Modulate 宣布完成 2500 万美元新融资,用于把音频原生模型带给更多开发者。其模型直接分析对话原始音频中的情绪、语气、意图以及深伪信号,旗舰平台 Velma 底层的 Ensemble Listening Model 架构从 100 多个小型专用音频模型中选择并融合结果,公司称该设计最多比把同样音频交给单个大模型高效 1000 倍。

  7. arXiv cs.CL24

    MexHat:面向墨西哥西班牙语视频的仇恨言论检测数据集

    MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。

  8. SiliconANGLE:AI46

    Blitzy 的自主编程赌注:每个代码库本身就是一张图

    Blitzy 工程总监 Neeraj Deshmukh 在 GraphSummit 上称,公司用 Neo4j 知识图谱为编程智能体提供上下文,把客户代码库逆向构建成动态图谱并接入 GitHub、GitLab。他称智能体的有效上下文约 200,000 至 300,000 tokens,在一亿行代码库上会因压缩结果而丢失信息。Blitzy 6 月称在 SWE-Bench Pro 上得分 84.95%。

  9. SiliconANGLE:AI27

    Agentic AI 给身份与数据库安全带来新压力,Oracle 谈应对之策

    Oracle 云工程集团副总裁 Johnnie Konstantas 表示,agentic AI 让智能体及其子智能体可携带个人权限访问数据、甚至对工作流执行操作,身份控制因此必须尽量统一且无处不在。Oracle 已将 agentic AI 方案集成进安全产品组合,并在最新版 AI 数据库中推出面向 agentic AI 的能力,帮助客户在不牺牲数据安全的前提下推进 AI 创新。

  10. arXiv cs.CL33

    评估 LLM 对海地克里奥尔语的文化意识

    针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。

  11. SiliconANGLE:AI32

    Qiagen 用人工整理知识库为药物发现智能体奠基

    Qiagen 把药物发现智能体锚定在人工整理的知识基础上,其 Discovery Platform 在整理好的知识库之上叠加 MCP 访问与智能体 Discovery Explorer。该公司的生物信息团队已手工整理生物医学数据超过 25 年,由 150 多名 MD 和 PhD 级专家完成。Qiagen 还于 5 月与 Nvidia 合作推进基于图的 AI 药物发现。

  12. arXiv cs.CL38

    Sorry Robot, Happy Human:视觉语言模型只读出两层可辨识排印文字中的一层

    研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。

  13. arXiv cs.CL53

    RAG 过期检索证据会覆盖模型正确答案,论文构建 317 例知识反转基准

    论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。

  14. arXiv cs.CL25

    在 X 上识别科学家与非科学家账号

    一项研究提出基于用户简介与推文在 X 上识别科学家与非科学家账号的方法,随机森林在语言学特征上最高达 0.88 F1,对比式微调的 DeBERTa 在集成设置下最高达 0.96 F1。研究同时公开了两个将 X 用户标注为科学家或非科学家的数据集,包含各自的推文与用户简介。

  15. arXiv cs.CL35

    MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合

    MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。

  16. arXiv cs.CL43

    PIA:把健康对话变成记录、把记录变成理解的个人智能体

    PIA 是一个与消费级健康智能体并行的个人智能体,自行决定如何读写,把健康对话转成带类型的临床记录、再合成为对用户的理解。其记忆框架含 extraction、memory、retrieval、understanding 四项控制,各配 schema、医学别名词典、知识图谱、时序规则等可插拔健康模块;注入记忆从一维回忆、二维健康快照加深到带因果的三维轨迹时,同一查询会得到不同答案。

  17. arXiv cs.CL46

    RupeeBias:审计 LLM 在印度经济建议中的群体偏见

    研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。

  18. SiliconANGLE:AI41

    Omdia:AI 智能体身份安全需要分层防御

    Omdia 分析师 Todd Thiemann 表示,AI 智能体身份安全需要跨技术栈的多层协同防御,而非单一主导平台。对 400 名安全负责人的调研显示,首要阻碍是对攻击来源的困惑与不确定;最受青睐的承担方是数据安全平台,其次是身份平台。Okta 新增 AI 智能体运行时网关,并与 AWS、CrowdStrike 组成 Blueprint Alliance,定义认证、授权和可见性等网关能力。

  19. arXiv cs.CL36

    基于指标损失加权提升 LLM 多模态机器翻译视觉敏感性

    一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。

  20. arXiv cs.CL26

    自然对话中潜在问题的显著性与可回答性:我们真需要回答那个问题吗?

    在自然对话中,潜在问题的显著性与可回答性之间存在稳健但较弱的正相关,越显著的问题越可能被回应,但该效应明显弱于独白文本。研究基于 Wu et al. (2024),从英国国家语料库的语句及前文自动生成 7,124 个问题并标注显著性与可回答性,用以检验 QUD 建模。结构化互动中标注者之间的一致性也强于组织松散的对话。

  21. arXiv cs.CL34

    LocUS:面向定向激活引导的头选择与子空间投影

    LocUS(Localized Unembedding Steering)通过在 unembedding 矩阵中定位属性专属线性子空间,把激活引导限制到该子空间并仅作用于稀疏的少量注意力头,实现免训练的推理时控制。在三个模型族的毒性缓解、情感转向和谄媚抑制评测中,LocUS 匹配或超越 SOTA 基线,仅干预不到 6% 的参数,并更好地保留通用能力。