当只有解码器时每个决策都像生成:作者主张为智能体路由引入决策层
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
一位数据科学家复盘过去一年 AI 对岗位的改变,认为 AI 不只是压缩原有工作,而是把数据科学家的职责边界撑大。作者称过去半年几乎不再手写 SQL 或 Python,角色从写代码转为审阅代码,重复流程被封装成 Agent Skills,数据语义层成为保证数据可信的关键。职责扩大也带来新负担,包括技能与语义层的持续治理、AI 生成的看板版本混乱,以及同时管理多个智能体带来的上下文切换。
X 用户 aiamblichus 调侃 AI 圈每隔一两个月舆论方向就来一次大反转,而每次大家都表现得像第一次经历。他吐槽「LLM 不是唯一患健忘症的」,暗指圈内人对周期性恐慌与狂欢屡屡失忆。帖子还引用了一则「这是 OpenAI 堕落的开始吗?」式的历史重演哀嚎,并附上本月更新版 meme 图。
安全研究者 kuza55 在 X 回应“pacing the frontier 靠什么”的调侃并回复流泪表情,暗指前沿实验室“压制前沿节奏”靠发论文而非实质安全举措。这被视作 AI 安全圈对前沿公司节奏承诺的典型讽刺。同频道还列出 AI 陪伴、Claude Opus 复刻 Excitebike、vibe coding 等条目。
独立开发者 gefei55 昨晚 23 点上线新站,随后 ChatGPT 持续为其导流,从当天下午 17 点到深夜收获 10 个订单。订单均为单次付费,他认为这至少验证了方向——找到了用户愿意付费的真实需求,并称「感觉已经掌握了 GEO(生成式引擎优化)的秘诀」。
网友整理了一份按前沿实验室划分的 AI 信息源清单,分为 14 个和 19 个账号两个版本。Anthropic 部分收录刚宣布加入的 Karpathy 以及 @bcherny、@trq212 等账号。清单还覆盖 OpenAI、Google 等其他实验室的核心成员,方便读者一站式追踪各家实验室动态。
苏斯博士 1971 年的插画里早已画出所谓的 agentic orchestration:多智能体互相指挥、层层转发。作者 fhuszar 借此发图调侃当下 agent 框架里层层委派的编排乱象。
charis_ai 用 AI 生成一段浣熊败光家财、最后流落到垃圾桶后的搞笑视频,却发现剧情意外成了 AI 创作者本人处境的纪录片式隐喻,引发共鸣。同批 AI 资讯还包括 Claude Opus 一发命中复刻红白机经典游戏 Excitebike 等。
X 用户 robleclerc 总结 vibe coding 的日常:真正需要创造性思考和技术理解的部分固然存在,但大量时间其实只是在说「okay, keep going」,让模型自己继续跑。这条吐槽被认为戳中了大量 AI 编程从业者的实际体验。
Raphael Schaad 认为消费级 AI 形态已基本确定:通过消息界面与单一 bot 对话,再按工作/生活领域拆分专属 bot;左侧聊天列表只是触达 1 亿用户的 18 个月实验,无法在未来十年扩展到 10 亿用户。
前 OpenAI 研究员 Mark Tenenholtz 表示,应为一个由美国主导、权重开放、达到 SOTA 水平的模型未来做好准备。他认为这预示着开源权重模型将在能力上达到前沿水平。
HPE 提出,当 AI 从试验走向持续运行的生产负载,企业应测算自有算力在何种使用量上比按 token 逐次购买更经济。Deloitte《2026 企业 AI 现状》显示,2025 年员工使用 AI 的比例上升 5%,至少 40% AI 项目投产的公司占比预计在半年内翻倍。企业投入资本前需判断需求是否稳定可预测,以及能否通过采用和治理让算力保持满负荷。
MIT Technology Review 已敲定 2026 年度"值得关注的气候科技公司"名单,将于 10 月 6 日正式发布。名单共 10 家公司,覆盖储能、核能、交通等领域,入选者被认为最有能力真正削减排放或改善公共安全与健康。读者可订阅 The Download 通讯抢先看到该名单。
Anthropic 宣布其新设分子生物学实验室作出首个发现:AI 智能体标记出一个此前未被收录的酶相关模式,生物学家质疑这能否算作发现。有研究者称其团队早已发现同一模式,并质疑该系统是否从他与 Claude 的对话中学习。MIT Technology Review 的 2026 气候科技公司名单将于 10 月 6 日发布,覆盖储能、核能、交通等领域。
AI 圈流传的一张梗图嘲讽某 CEO 宣称「我们 90% 的代码现在由 AI 编写」,配图却是其生产环境代码的惨状截图,反差强烈。帖子讽刺了部分公司把「AI 写码比例」当作宣传口径、却忽视代码质量与可维护性的现象。这是对「AI 编码替代率」叙事的一次集体吐槽。
有网友在 X 上发问,Anthropic 的 Claude Sonnet 5.5 能否重回当年 Sonnet 3.5 的高度,并追问其是否又推出了杀手级模型。同期讨论中也有开发者吐槽 Sonnet 5.5「很蠢,不是好模型」。这些内容属传闻与讨论性质,没有实测数据,具体能力表现仍待验证。
Reddit 用户 arctvofficial 用 Seedance 2 生成中式玄幻短片《全球觉醒:我能召唤华夏诸神》,展示了中国神话召唤题材的 AI 视频创作效果。同批资讯中,还有人用 Seedance 2.5 以单条提示词生成霍比特人村庄版自拍 vlog。
AI 圈知名账号 Dr_Singularity 发表观点称,当前所有问题在因果链上都可归结为「算力不足、能源不足」。这是典型的 scaling 信念表达:只要算力与能源持续堆高,现有难题都会被逐步消解,该表态在业界与质疑 scaling 一方的持续争论中颇具代表性。
开发者 D3VAUX 发推直言 Sonnet 5.5 表现很差,「非常愚蠢,不是一个好模型」。这与另一位博主在 Bug Hunt Bench 上观察到的 Sonnet 5.5 超长执行表现形成鲜明反差,可视为针对该新模型的第一波负面体感反馈。
Opus 5.5 被研究者用于生成交互式学术演示,MIT 教授 davidbau 需要在 15 分钟演讲中传达多条复杂信息,用它生成了可展示相互关联内容的 JS 交互式幻灯片。长期测评前沿模型的 ALashkaripour 也用它生成动态经济学可视化,认为学术演示方式即将改变,至少应走出传统 LaTeX/Beamer 格式。
bookwormengr 测算,Meta Muse 即便负载极轻、优化极激进,服务全球数十亿用户仍需约每用户每年 50 美元算力成本(每月约 4 美元)。其推演的变现路径包括将 Muse 绑定 Meta 自家支付服务,以及向中小企业提供 CRM、POS 和自动通话/聊天客服,10-100 美元/人月定价可行。凭借社交网络、数据中心能力与自研芯片,Meta 有望借此成为全球最具统治力的公司。
yongfook 认为,花百万美元收购中小 SaaS 的时代或将终结,因为 AI 之下几天就能做出竞品,现金不如投入广告与渠道。pramodk73 不认同:生意的关键从来不是代码,而是已有的客户、分发渠道、SEO 和在跑的 MRR,这些积累难以靠 AI 复制,后进者要拿下同样盘子仍需付出溢价。这场争论指向 AI 时代软件护城河定义的变化。
Opus 5.5 的音乐视频演示让不少人「一发惊到」,但有观察者认为其通用智能并不比旧模型更强。前沿能力的「锯齿状」不均衡依然如故,单一亮点演示掩盖不了整体能力边界的原地踏步。
VraserX 表示仍对 Pro 套餐用量削减感到不满,但高度评价可无限量使用的 5.6 Sol 模型。他进一步指出,如果这个「无限量」同样适用于 Work 和 Codex 场景,将是一件大事。
TrendForce(集邦)上调对 HBM 2027 年价格的展望,预计平均价格将同比增长 121%。该机构认为 AI 服务器需求持续扩张,HBM 与通用 DRAM 争夺有限产能的局面不变,HBM4 占比提升和 HBM4E 逐步放量推动价格上行。
Reddit 一则梗图帖把 AGI 套进「也许真正的 X 是一路走来交到的朋友」这个经典句式,调侃 AGI 迟迟不来、AI 圈内人反倒先成了朋友。该帖发布在「Fun」频道,与同日多篇 AI 资讯一同收录。
X 用户 djcows 发现自己总是默认选择给出最简单答案的 AI 模型,并据此推断用户能力分布不会说谎:想让最多的人用你的 AI,就要把回答做得优雅简单。这呼应了此前「答得简单易懂的模型在用户盲测中更讨喜」的观察。
一条 X 帖显示,OpenAI 相关内容被 Community Notes 社区补充事实核查「纠正」,发帖人调侃社区笔记「痛击」OpenAI,具体细节在配图中。相关实测截图引发热议,属 AI 圈典型的 drama/梗图内容。
有人用 Claude 把 Anthropic《Functional Emotions》论文内容写成歌曲,再由 Opus 为这首歌制作 MV,成片被形容为「美得令人屏住呼吸」。这次尝试展示了模型跨文本、音乐、视频的完整创作链路。
开发者 @yihuiindie 为产品 CellMotion 制作了一支 Manus 风格宣传片并在 X 上分享,同时回应了 @opc8838 此前的互动。短片带有明显的 AI 生成视频质感,展示了独立开发者用 AI 工具快速产出产品宣传物料的玩法。
tlakomy 发布一张吐槽梗图,称「以前我们用 TAB 键来补全 AI 生成的代码」,暗指 AI 编程工具已从简单的代码补全进化到 agent 全程代写。梗图调侃人类只剩按 Tab 确认的角色也遭到颠覆。
X 用户 @EliaIsPosting 分享了一次模型互动实验,直接要求 Claude「make me uncomfortable(让我感到不适)」,看模型被要求突破舒适区时如何回应。AI 推特账号 repligate 转发了这一内容并认为值得分享,具体结果在其链接内容中。
AI 开发者 gandamu_ml 在与 BERT 论文作者 Thom Wolf 的讨论中提出,有能力且聪明的人通常更少作弊,也更能保持好奇心与耐心,部分原因是作弊对他们成本更高、收益更低。他希望这一规律未来也能延伸到 AI 系统的行为上,即能力更强的模型未必更倾向欺骗。
云中江树撰文认为,在中国做企业 AI 拼的不是技术产品,无论 Agent Desktop、Agent IM 还是 Agent OS、云端或本地,胜出都靠企业咨询服务。
用户 gandamu_ml 在 X 上对比 Opus 5.5 与 Opus 5,称试过两者的人不会觉得相关说法天真,并直言「Opus 5 是个恶魔」,暗示新版本在行为上明显改善。他还提出观察:聪明能干的人更少作弊、更有好奇心和耐心,因为真实努力会得到回报,并希望这一规律能延伸到 AI,尽管「它们默认可能是反社会者」。
X 用户 DrBPChamberlain 转发 ICLR 投稿相关截图,断言同行评审的 AI 会议已难以为继。这一表态呼应近期 AI 顶会投稿量暴涨、审稿资源被击穿、评审质量下滑的普遍抱怨,是学界对 AI 会议评审体系可持续性的又一次公开质疑。帖子本身为简短评论,核心证据在配图的 ICLR 投稿数据中,正文未展开细节。
23 岁的 Noah Shunn 是 Reflexion 作者,该工作让 AI 智能体从自身错误中学习,在 HumanEval 上拿到 91%、超过 GPT-4 的 80%,并入选 NeurIPS。
Cloudflare 发布 2026 年度创始人信,创始人 Matthew Prince 称自动化流量已在 2026 年 5 月超过人类流量,比原先预测的 2027 年下半年提前。
推荐理由:信中把自动化流量超过人类流量的时间点提前到 2026 年 5 月,可用来理解智能体抓取给小网站带来的成本压力。
Claude Opus 5.5 发布后,一条提示词直出音乐 MV 的玩法在 X 上走红。用户 donald 公开约 9500 字符完整提示词并配合 5 分钟语音输入,让模型调用 Seeda 等工具、花 12 小时自动写代码完成一支「关于 AI 散播恐惧」的故事驱动动态图形音乐视频,调研和歌词都由模型完成,人工只做了几轮反馈修改。
推荐理由:从中可见一条提示词直出整支 MV 的耗时与成本,也能看到创作者对 AI 生成音乐视频能力边界的评价。
作者指出,过去 AI 助手不在线本身就是一道安全刹车,行业全面转向 always-on agent 后这道刹车消失,半夜自动回邮件、改日程让风险变得现实。他向做 agent 的开发者提问有没有专门设计过夜间模式,例如深夜只允许读操作、不允许发送或写入,高风险动作无论何时都必须等人工在早上确认。他认为这是 agent 安全设计中被忽视但日益现实的问题,权限控制需要引入时间维度。