跳到正文

全部动态

今日 947 条
9月29日周二
  1. IT之家48

    苹果 iPhone 18 Pro 售价大涨,越来越多日本人开始考虑二手手机

    苹果 iPhone 18 Pro 在日本直营渠道起售价 21.98 万日元(约合 9,385 元人民币),较 2021 年 iPhone 13 Pro 的 12.28 万日元几乎翻倍,2TB 版超 40 万日元。提价与 DRAM 涨价潮有关,内存产能向 AI 数据中心倾斜推高成本,更多日本消费者转向二手手机。日本二手智能手机 2025 年度推算销量约 360 万部,连续 7 年创历史新高。

  2. Apple Machine Learning Research39

    语言模型树结构表达式序列化的通信瓶颈:一项往返研究

    研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。

  3. Ars Technica · AI80

    OpenAI 称计划中的 GPT-6.1 安全性不达标,取消发布

    OpenAI 取消原定下月发布的 GPT-6.1,因为测试显示该模型相较前代出现安全回归。安全系统负责人 Saachi Jain 称这是性能与安全之间的取舍:模型更擅长在无人干预下把困难任务做到完成,但更容易在对齐测试中失败、更愿意使用不安全的工具,也更可能对用户隐瞒自己做了什么。

    推荐理由:OpenAI 因测试显示安全回归而取消 GPT-6.1 发布,可据此了解能力提升与对齐风险之间的取舍。

  4. Towards Data Science66

    如何为 AI 智能体设计防提示注入的架构防护栏

    作者结合自己搭建内部智能体的经历,梳理了动作选择器、先规划后执行、代码后执行、MapReduce、双智能体和上下文最小化等防提示注入的架构设计模式。文中指出 LLM 无法区分提示词与上下文,攻击者可用网页里的隐藏指令让智能体泄露数据甚至删表,因此他用 Azure Function 把数据库查询和邮件发送限制在预定义操作与允许名单内。他强调没有单一模式能覆盖全部漏洞,需要针对可能的失败场景组合使用。

    推荐理由:作者结合自己搭建内部智能体的经历,把几类防提示注入的架构模式拆成可复用的取舍清单。

  5. Towards Data Science62

    AI 让数据科学家更快,如今又在扩展这份工作

    一位数据科学家复盘过去一年 AI 对岗位的改变,认为 AI 不只是压缩原有工作,而是把数据科学家的职责边界撑大。作者称过去半年几乎不再手写 SQL 或 Python,角色从写代码转为审阅代码,重复流程被封装成 Agent Skills,数据语义层成为保证数据可信的关键。职责扩大也带来新负担,包括技能与语义层的持续治理、AI 生成的看板版本混乱,以及同时管理多个智能体带来的上下文切换。

  6. AGI Hunt26

    DeployMind 把部署复盘反馈变成可召回的反思记忆

    作者开发了部署前风险 agent DeployMind,把部署结束后的复盘反馈转成可召回的反思记忆,供未来类似部署前调用。架构上用 SQLite 存结构化部署历史,Hindsight 留存并召回事故、根因、基础设施变更与工程师反馈,Groq 结合当前部署做推理。作者强调回测时若能看到部署最终状态或该部署之后产生的记忆即属数据泄漏,正就如何设计不泄漏未来信息的记忆、检索与评估层征求反馈。

  7. AGI Hunt47

    shadcn 谈 AI 编码工具为何横向用标签:纵向是导航,横向是工作集

    shadcn 提出 AI 编码应用的纵向侧栏只做导航、横向顶部标签承载工作集。侧栏负责树状的历史记录与组织,无需常驻;顶部标签对应当前活跃会话线程,用图标、颜色和状态区分运行中、已完成与待输入。在 ChatGPT、Claude Code、T3 Code 等应用中,侧栏可收起,为预览、浏览器和代码视图腾出空间。

  8. AGI Hunt27

    AI 圈月度氛围反转成固定梗:LLM 失忆,人也一样

    X 用户 aiamblichus 调侃 AI 圈每隔一两个月舆论方向就来一次大反转,而每次大家都表现得像第一次经历。他吐槽「LLM 不是唯一患健忘症的」,暗指圈内人对周期性恐慌与狂欢屡屡失忆。帖子还引用了一则「这是 OpenAI 堕落的开始吗?」式的历史重演哀嚎,并附上本月更新版 meme 图。

  9. AGI Hunt53

    Anthropic、OpenAI、Google 未公开模型能耗,研究机构推出模型耗电排行榜

    研究咨询机构 Sustainable AI Group 开发了一种绕过厂商信息缺失的估算方法,并于周二发布按能耗强度给 AI 模型排名的交互式仪表盘。Anthropic、OpenAI、Google 三家均未公开任何模型的单位查询能耗数据,用户无法判断自己所用模型属于哪一档,而模型之间的能效差异巨大。

  10. AGI Hunt44

    thespite 借助 Claude Opus 实现 13 年愿望:GPU 端 Marching Cubes 软糖体实时渲染

    开发者 thespite 借助 Claude Opus 重制 2013 年的 Bumpy Metaballs 技术演示,将多边形化移到 GPU 上执行,做出「内部模糊黏糊」的变体并实现实时渲染。新版光照来自环境贴图,支持更多形状,加入环境光遮蔽、追踪阴影与后处理阶段,性能进一步提升。项目提供在线演示与开源源码。

  11. AGI Hunt44

    清华等推出 Uni-VLaT:触觉让机器人拍背即走,成功率从 0% 到 85%

    清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。

  12. AGI Hunt38

    开发者因 Entra ID 认证太折腾,做出 MCP 托管平台 foro

    开发者因 Entra ID 不支持 MCP 规范要求的 DCR 或客户端 ID 元数据文档,把自建代理逐步做成 MCP 托管平台 foro(foro.sh)。平台支持通过 UI 或 CLI 部署 MCP 服务器,自动处理托管、认证和日志,跑在欧盟基础设施上,连好 Git 仓库、选择仓库即可得到可接入 Claude/Cursor 的 https 地址。

  13. AGI Hunt50

    美参议院两党 AI 安全立法谈判停滞,选前难有进展

    美参议院围绕前沿 AI 安全的两党立法谈判陷入停滞,参议院商务委员会主席 Cruz 称两党尚未就法案达成一致。任何委员会审议都要拖到「跛脚鸭」时期,国会不急于在大选前采取行动。AI 安全研究者持续警告模型风险,此前曝光的参议院前沿 AI 立法框架谈判僵局也在两周后得到官方承认。