「你比低 effort 档的 Haiku 4.5 还笨」成 AI 圈新怼人梗
开发者 wawasensei 发推怼人「你比低 effort 档的 Haiku 4.5 还笨」,把 Anthropic 最便宜最快的模型当成智商下限参照物,该推文被多人转发,成为 AI 圈典型的吐槽梗。
开发者 wawasensei 发推怼人「你比低 effort 档的 Haiku 4.5 还笨」,把 Anthropic 最便宜最快的模型当成智商下限参照物,该推文被多人转发,成为 AI 圈典型的吐槽梗。
DeepSeek 批量更新其大部分开源库,新增对华为昇腾(Huawei Ascend)的支持。eliebakouch 指出了这一更新,yacineMTB 以夸张的戏剧化反应转发,暗示这一 NVIDIA 生态替代信号值得关注。
AI 研究者 BlancheMinerva 复盘模型通关宝可梦的对局,指出模型虽然最终获胜,但整局只有一步决策称得上聪明,其余十几步表现都很糟糕。她认为模型可能只是靠选择速度最快、属性克制的宝可梦这类简单策略取胜,并质疑模型给出的赢棋理由存在事实性错误。她还进一步探究模型究竟掌握多少敌方队伍信息,怀疑其抢先派出胡地迎战阿桔的依据并不成立。
Sol 6 智能体在 @VoidNulled 的演示中,于全程无任何提示词干预下独立完成一支短片,视频和配乐均由自己生成。这类“放出去让它自己折腾”的 demo 展示了智能体自主创作能力的边界,并在 X 上引发转发关注。
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
IIT Delhi 团队历时 6 个月在印度打造 4D 城市数字孪生 GeoTwin,已在 Guwahati 市完成原型演示。该系统基于 LiDAR 点云构建 3D 建筑、道路、铁路,可流畅串流 TB 级点云数据,融合 AI 实现街区级内涝、滑坡、违建监测与交通监控、路径优化。4 个月内新增天气监测与预报(复用 Zomato 外卖传感器气象数据)、污染监测、InSAR 地面位移分析和实时交通监控。
独立开发者、Ice Cubes 作者 Dimillian 宣布,他加入 OpenAI 后作为 onboarding 工程师的首个项目已合入主分支,这次修复将磁盘写入量减少 50%、存储文件体积缩小 4 倍。他开玩笑希望 Neo 在 DevDay 演讲中提及此事,但 Neo 没看他发的 Slack 私信。
作者 iamrishavraj1 开源了 YourSpeakReps,一个完全本地运行、用于英语口语和模拟面试练习的 AI 口语教练。它用 Ollama 跑本地 LLM、faster-whisper 做语音转文字,配系统原生 TTS 和 FastAPI 浏览器 UI,无需 API key、不依赖云、无按次成本。
fleetwood.dev 发布长文《Domain specific architectures for AI inference》,论证 GPU 在深度学习中的主导地位很大程度是历史偶然,图形架构遗产至今仍在。
前 Google 工程师 Piotr 澄清,他并非反对面试考编程能力,但在 Google 代码库贡献的经历让他确信 AI agent 还远达不到生产级代码所需的正确、干净与可扩展水平。他同时质疑 LeetCode 刷题式面试并非理想方案,抛出 60 分钟面试除算法题还能考什么的问题。这反映出 AI 编程助手普及后,工程招聘标准尚未找到新范式。
纽约时报科技记者 Kevin Roose 在 X 发帖称,自己用 Scale AI 创始人 Alexandr Wang 旗下 Muse 的自营交易台产品一周亏损 41%,并 @ 本人吐槽。他自嘲「that's my quant」,晒出 AI 量化交易产品面向普通用户的真实翻车体验。原文提到 Wang 近期已加入 Meta。
AI 圈热传一个调侃:想沙箱化 AI agent,最简单的办法就是给它连达美航空的机上 WiFi,网速慢到什么都干不成,等于天然隔离。马斯克也发帖玩梗,称把 AI 关进达美航班就是最好的沙盒,因为机上几乎没有网络连接。
创作者 @mrjonfinger 团队用 LumaLabsAI 在 DreamLabLA 拍出人机即兴合奏短片。同伴 Tony Houart 趁等待视频生成间隙弹吉他,作者架起摄像机即兴合奏,团队随后用 AI 重新生成/演绎这些演奏场景。短片把等待生成的碎片时间变成创作素材,展示 AI 视频工具在音乐表演类内容上的玩法。
GabGarrett 提出一个反直觉判断:即便 OpenAI 和 Anthropic 在 IPO 时彻底崩盘,也难以想象出现 GPU 硬件突然过剩的局面,做多算力硬件仍然值得。他认为算力需求有独立于这两家公司存亡的支撑。
arthurcolle 开源了 Graphsub,一个面向 Agent 数据的快速内存图数据库,主张不要把 Agent 数据托付给单一 AI 公司。该讨论由 lux 发起,他指出 Agent 产生的数据应能反哺未来交互,甚至作为训练集,其归属与托管方式成为行业议题。Graphsub 为社区提供了自托管的技术选项。
开发者 matchaman11 推出 OpenAI Dots 的开源复刻项目 Open-Dots,上线不到 24 小时即斩获 4500+ GitHub 星,一度达 4.3k star。该项目定位为 OpenAI Dots 的开源替代品,是可自托管、本地优先的 AI 工作台,整合聊天、工具调用与操作审计功能,因满足社区对自主可控 AI 工作区的需求而迅速走红。
开发者用 Groq 做推理、Hindsight 做记忆,搭建了一个能从反馈中学习的代码审查 Agent,让它在多次审查之间保留有用的反馈并在后续审查中复用。该流程用 Expense Tracker 项目做了测试,作者还记录了 AI 代码审查器具备跨交互记忆后审查行为的变化及构建经验。
NeuralFieldManifold 被 NeurIPS 2026 接收,将此前围绕 spike 的神经流形方法扩展到 LFP、EEG 等阈下脑活动,并结合真实脑数据验证。Camera-ready 版本与教程即将发布,将在亚特兰大 NeurIPS 2026 现场展示。
研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数 2x、循环层数 0.5x、循环次数 2x,并解绑注意力(attention untying)。其核心观点是,经此调整后 looped transformer 的问题从「归纳偏置」转向「如何更好地分配计算资源」,架构设计问题被重新定义为资源分配问题。
Adam Singer 发推讽刺称,宣称"AI 将取代所有音乐、文学、人际关系、律师"的人,恰恰是不听音乐、不读书、没朋友、不做法律实务的人。Andy Masley 引用并延伸,认为 AI 真正会取代的是"人类心智没有独特之处、可被轻易复刻"这一心灵哲学错误信念。这条推文引发关于 AI 能力边界与"外行唱衰"现象的讨论。
一条被广泛转发的观点认为,技术圈反复误判普通用户对 AI 工具的需求:多数人没有「能动性」,不想造东西、不想思考,只想要 slop(低质现成内容)。该观点把当下「普通人都会用 AI 造 app」的论调类比为互联网早期「人人都能做自己的主页」的炒作,认为两者同样脱离现实。
Xuanyi Zhou 发布 EasyPPO,通过固定 critic 让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。该方法不引入新的 actor loss、也不更换策略算法,并针对 actor 与 critic 交互中的两种失效模式给出修复。在编码任务上,EasyPPO 相对标准 PPO 性能提升 14.89%。
max_paperclips 反驳 housecor:模型变强并不会让 agent 封装层变得多余。他认为模型不会自动学会记忆重复任务、感知可用 API 或积累可复用工具集,skills、MCP、自定义循环等封装层仍需保留。实际变化只是 prompt 和指令能写得更简略,嵌套循环、任务进度追踪等工程结构不会因 TerminalBench 提升 2% 就消失。
计算功能主义面临与生物自然主义相同的质疑:它只说意识取决于计算,却没有说明哪种计算对应意识。讨论指出,生物自然主义长期被批评说不清哪些物理系统算「与意识相关的生物系统」。作者据此认为,两大主流意识理论在「划界标准」上其实同样悬空。
一位评论者讥讽「这个星球想要数学家多过想要可用的前沿模型」是极度脱离现实的想法,此事折射出 OpenAI 与数学社区的矛盾。被引用的推文则以自嘲口吻反讽 OpenAI,把数学家的毕生热爱变成「无灵魂的垃圾抽奖游戏」,只为建工业界并不需要的前沿模型、撑起一场不会发生的一万亿美元 IPO。
亚马逊购物智能体 Instinct 开始向其推送产品,形式疑似基于购买历史和网络行为推荐「赞助商品」,这很可能就是它的商业化路径。原帖作者据此感叹又多了一个用开源的理由,认为把个人数据交给智能体,换来的却是被广告瞄准。智能体内置广告如何影响推荐可信度,值得持续关注。
Stack Overflow 团队现身 OpenAI DevDay,产品副总裁 Alex Lato 与 OpenAI 的 Aarti Bagul 对谈,分享用 Codex 加速 Stack Overflow 内部新架构开发的经验。同时介绍了面向智能体、以 API 为先的知识交换平台 Stack Overflow for Agents。
福田汽车 9 月 29 日发布“十五五”战略发展规划,明确 2030 年整车销量 100 万辆、新能源销量 50 万辆(占比 50%)、海外销量 40 万辆(占比 40%)的目标。2026 年 1-8 月其海外销量近 15 万辆,同比增长 44.3%,海外累计总销量突破 139 万辆。智能驾驶上将推进 L2-L3 级算法全栈自研,力争 2030 年 L4 级全面商业化落地。
豪威(OmniVision)发布常开型视觉 AI 协处理器 OAX7700,集成 NPU,基于它的停车监控系统仅需市面现有方案 3% 的功耗。该芯片具备人体检测、人与物体识别、距离测算等边缘 AI 能力,可将环视系统等现有车载外摄像头方案升级为超低功耗边缘 AI 停车监控系统,事件触发后录制 5~10 秒预录视频交由电子控制单元核验。
豆包宣布支持多种出行服务,用户可在对话内一站式完成机票预订、火车票购买、打车和路线导航。该功能在酒店、餐饮预订基础上新增,用户以自然语言描述需求即由豆包识别意图并完成服务调用,同时上线“出行用豆包”专属入口,覆盖地图导航、交通出行、酒店住宿、吃喝玩乐四类场景。机票和火车票由航班管家、高铁管家提供,打车接入曹操出行等平台,导航由百度地图等合作方提供技术支持。
哈萨克斯坦总统托卡耶夫会见优必选副总裁钟永,支持优必选在阿拉木图建设面向教育和服务领域的机器人设备制造工厂,该厂将是优必选在中国境外的首个生产基地。优必选已与欧洲、日韩等主要市场客户签约,斩获超 5000 万元海外订单,产品包括商用服务人形机器人 Walker C1 和超仿真人形机器人优世界 U1。
市场监管总局批准发布 GB/T 48666—2026《电子病历版式文档技术要求》(OFD-H 标准),2027 年 4 月 29 日起实施。该标准基于国产 OFD 版式文档,整合病历文书、医学影像、音视频和结构化数据,支持人读与机读,适配后可跨机构查阅、核验来源并提取数据。患者可通过手机调取和自主管理全生命周期“掌上健康档案”。
法拉第未来公布“Built in USA”加速计划第二阶段方案,目标今年年底前将机器人工厂投入运营,2027 年第一季度实现首款新 EAI 本体产品下线。该方案还包括推进 Next Futurist、Next Aegis 系列产品下线,并启动向 FCC 申请机器人产品有条件批准。FFAI 已与将更名 FFR 的 AIxC 签署非约束性条款,拟以全股票方式出售机器人资产及业务,估值约 2 亿美元。
OpenAI 在开发者日宣布与 ModRetro 合作,为复古掌机 Chromatic 推出 Codex 专用插件 Game Studio,用户可用自然语言描述游戏需求、由 Codex 辅助生成程序。
OPPO K15s 与 K15x 两款新机今日开售,闪促期(9 月 30 日至 10 月 31 日)立减 300 元,K15x 6GB+128GB 到手 1399 元、K15s 同版本 1699 元。
南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。
新加坡国立大学团队发布 MaLiang-Harness,用可执行程序驱动 MLLM 图像/视频生成,并首次定义 Program-to-Visual(P2V)差距。
美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。
FurE 提出一种无需动物毛发数据集的实例级 3D 毛发重建方法,可从多视角图像恢复逐根可编辑的动物毛发。它优化根条件隐场,用基于人类头发数据训练的 PCA 解码器解码为发丝几何以绕开动物数据稀缺,并结合表面约束的 Gaussian Frosting 重建去毛后的身体。相比当前 SOTA 的稠密逐根优化,发丝训练提速 10 倍,同时保持保真度并可泛化到合成与真实场景。
伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。