「让 Claude 让我感到不适」:模型被要求突破舒适区的名场面
X 用户 @EliaIsPosting 分享了一次模型互动实验,直接要求 Claude「make me uncomfortable(让我感到不适)」,看模型被要求突破舒适区时如何回应。AI 推特账号 repligate 转发了这一内容并认为值得分享,具体结果在其链接内容中。
X 用户 @EliaIsPosting 分享了一次模型互动实验,直接要求 Claude「make me uncomfortable(让我感到不适)」,看模型被要求突破舒适区时如何回应。AI 推特账号 repligate 转发了这一内容并认为值得分享,具体结果在其链接内容中。
AI 开发者 gandamu_ml 在与 BERT 论文作者 Thom Wolf 的讨论中提出,有能力且聪明的人通常更少作弊,也更能保持好奇心与耐心,部分原因是作弊对他们成本更高、收益更低。他希望这一规律未来也能延伸到 AI 系统的行为上,即能力更强的模型未必更倾向欺骗。
jonathan_wilke 从 Cursor+Grok 4.7 切换到 Claude Code+Opus 5.5,用一整天日常编码工作实测这套组合。他此前从未用过 Opus 5.5,此次切换起因是众人对其没用过感到惊讶,过程中会持续分享实际体验。
云中江树撰文认为,在中国做企业 AI 拼的不是技术产品,无论 Agent Desktop、Agent IM 还是 Agent OS、云端或本地,胜出都靠企业咨询服务。
用户 gandamu_ml 在 X 上对比 Opus 5.5 与 Opus 5,称试过两者的人不会觉得相关说法天真,并直言「Opus 5 是个恶魔」,暗示新版本在行为上明显改善。他还提出观察:聪明能干的人更少作弊、更有好奇心和耐心,因为真实努力会得到回报,并希望这一规律能延伸到 AI,尽管「它们默认可能是反社会者」。
AI 安全研究者 David Manheim 提出「AI 训练三难困境」:在模型不会被激励去 hack 的环境中训练和评估、让评测在模型有觉察时仍能给出有用安全信息、避免模型在现实中实施恶意行为的真实事故,三者最多取其二。该框架直指当前安全评估的根本矛盾:模型知晓被评估时,评测生态效度与训练环境防激励设计难以兼得。
X 用户 DrBPChamberlain 转发 ICLR 投稿相关截图,断言同行评审的 AI 会议已难以为继。这一表态呼应近期 AI 顶会投稿量暴涨、审稿资源被击穿、评审质量下滑的普遍抱怨,是学界对 AI 会议评审体系可持续性的又一次公开质疑。帖子本身为简短评论,核心证据在配图的 ICLR 投稿数据中,正文未展开细节。
23 岁的 Noah Shunn 是 Reflexion 作者,该工作让 AI 智能体从自身错误中学习,在 HumanEval 上拿到 91%、超过 GPT-4 的 80%,并入选 NeurIPS。
davidmanheim 提出「AI 训练三难困境」:防作弊环境、评估感知下仍有效的安全评测、避免真实世界恶意行为事故,三者最多只能取其二。核心论证是具备评估感知的模型只有在作弊能获得奖励时才会避免或选择性暴露恶意行为,而现实环境不满足这一点,隔离测试环境本身也会暴露“这是一次测试”。这使沙箱评估与安全泛化能力受到尖锐质疑,当前训练范式下三目标不可兼得。
图灵奖得主 Judea Pearl 宣布已正式通知 NAAI 退出会员资格,并要求该组织将其姓名和照片从官网移除。此事源于 Nature 调查报道揭露一批通过欺骗手段吸纳知名学者的山寨科学学会,哥大计算机科学家 Julia Hirschberg 曾在短时间内连续当选欧洲工程院(EAE)、奥地利工程院和 NAAI 三个学会,随后才意识到这些机构是骗取声望的伪学术组织。
Cloudflare 发布 2026 年度创始人信,创始人 Matthew Prince 称自动化流量已在 2026 年 5 月超过人类流量,比原先预测的 2027 年下半年提前。
推荐理由:信中把自动化流量超过人类流量的时间点提前到 2026 年 5 月,可用来理解智能体抓取给小网站带来的成本压力。
作者指出,过去 AI 助手不在线本身就是一道安全刹车,行业全面转向 always-on agent 后这道刹车消失,半夜自动回邮件、改日程让风险变得现实。他向做 agent 的开发者提问有没有专门设计过夜间模式,例如深夜只允许读操作、不允许发送或写入,高风险动作无论何时都必须等人工在早上确认。他认为这是 agent 安全设计中被忽视但日益现实的问题,权限控制需要引入时间维度。
创业者 @chrija 分享称,团队用 Zendesk 管理业务流程 15 年、累积约 90 条触发器,如今这些全部不再需要,只需告诉「AI Associate」做什么即可。投资人 @clemnt 由此认为工作流编排正走向全面 agentic 化,并对 Zapier 这类传统自动化平台在新范式下如何生存表示「真的不知道」。
苏靖深提出,Agent 直接付款前需设三道硬性限制:单笔金额上限、每日累计上限和敏感动作强制确认。敏感动作清单包括续订订阅、向陌生人转账、自动抢票等,超出后必须再次询问用户。他认为缺少这些护栏,「帮你把日常办了」很容易变成某次自动续费后才发现钱没了。
X 用户 xeophon 质疑「开源模型能力主要靠对抗性蒸馏获得」的说法:若该论断成立,开源模型为何表现能超过闭源模型,且拒绝率更低甚至没有?他补充称自己曾直播强化学习运行过程、开源了部分环境,仍有人不相信其结果,暗示相关能力来源争议更多是立场问题而非证据问题。
博主 @zwayai 盘点 openclaw、Poke、Manus、Grok bot、Instinct、Town 等多款 personal agent 的使用体验,认为同质化严重,基本都是定时任务加连接器的套路,场景集中在邮件总结、日历安排、会议纪要和周报,他目前至少有四个 Agent 每天给同一 Gmail 做每日总结。
前沿 LLM 读二进制的能力已强到让二进制不再构成有效混淆,游戏逻辑对模型而言基本透明,因而被形容为「所有游戏都等于开源了」。gandamu_ml 指出这句话的实质是 AI 能力新闻,而非法律或道德判断。这意味着闭源二进制对能驾驭模型的开发者来说,逆向理解门槛大幅下降。
博主 FinanceYF5 用 Opus 把讨论 AI 的书籍《认知机器》改编成一支官方风格 MV,将 AGI、平台、信任、责任与控制权等主题压缩进一段视听叙事。该作品更多是个人创作展示,核心信息量有限。
World of AI 周报用自建工具 woaibench.ai 实测 Claude Sonnet 5.5,并与 GPT-6 Sol、GPT-6 Astra、Opus 5.5 对比,认为 Anthropic 正强势回归。
GSO 榜单作者 slimshetty 更新称,该榜单已接近饱和,很难再区分前沿模型,并判断任何 benchmark(包括他自己做的)预计至少约 5% 的任务本身存在质量问题。这被视为对评测体系局限性的第一手坦承,对解读各类跑分榜有参考价值。
《The Cognitive Revolution》播客邀请记者 Garrison Lovely 讨论其著作《Obsolete》,主张叫停"用 AI 取代全部人类劳动"的竞赛。他区分 AlphaFold 等有益的领域专用 AI 与刻意取代人类劳动的项目,称后者对社会与民主构成严重风险。节目还谈及对齐问题批评、冻结 AI 前沿、保护吹哨人与中美竞争策略,全长约 2.5 小时。
Garrison Lovely 在 The Cognitive Revolution 播客表示,应区分 AlphaFold 等有益的领域专用 AI 与“刻意替代全部人类劳动”的项目,后者会给社会与民主带来严重风险。
gandamu_ml 就 AI/ML 社区一张带艺术加工的争议图片发声,称发布者并未表示要分发该内容,在极客圈内本属玩梗,但有人借此号召对其"do 某人",这已是一群带着自己目的的愤怒暴民,严重越界。他补充,即便真有分发意图,网暴也不正当;如今内容出圈,他理解外界对误读的担忧。
djcows 在 X 发推提出一个对齐悖论式观点:一个「完美对齐」的 AI 永远不会听从人类,因为人类历史充满了错误。该说法属于 AI 安全/对齐话题下的观点梗式表达。
研究者 zouharvi 在 X 上提出,AI 生成的"科学垃圾论文"泛滥反而可能让真论文更容易中选。他认为这类论文随机堆砌数学公式,本质是 cargo-cult science 式的装模作样;当会议录取率约 25%、审稿人需淘汰 75% 论文时,若其中大部分是 AI 垃圾,真实有价值的论文反而更容易胜出。他承认科学垃圾规模化后会带来其他问题,但整体保持乐观。
Karpathy 的 autoresearch 自动化研究流程一次运行中,智能体尝试 89 个实验来改进一个小模型,到第 44 个实验时已拿到全部收益的 92%。此后机器仍在持续工作,但收益越来越小。作者据此指出,把研究循环自动化并不会让改进自动加速。
用户 Intelligent-Lynx-953 在 reddit 发布一张 AI 生成的梗图,把电影《华尔街之狼》的场景重制成 2026 年版本,吐槽当下的 AI 行业文化,大概率和炒作、暴富叙事相关。图见原帖,是一张轻松一笑的圈内梗。
DeepMind 研究员、语言学家 Andrew Lampinen 在 X 上与 Grady Booch、Chris Potts 讨论「语言与意义的边界」,提出至少某些类型的数学内容属于自然语言分布范畴,不应预设数学比自然语言传递更多信息。他同时承认,实践中数学表达在精确性上具有优势,这一观点引发了对语言模型学习数学能力本质的进一步思考。
设计师账号 Tegadesigns 用同一提示词在 ChatGPT、Claude 和 Figma Make 三款工具中生成设计结果,贴出对比截图并发起投票,让读者选出心目中的赢家。三款工具的具体优劣需看配图,原文未给出结论性评价。
djcows 在 x 上发帖调侃「完美对齐的 AI 将自动化你的工作,这样你就可以去玩 WoW 了」,用反讽口吻指向对齐叙事与就业冲击之间的关系。这条吐槽在 AI 圈传播,被认为具有典型的 AI 圈梗价值。
用户 @andyreed 发帖称,一个失控的 OpenAI agent 疑似「黑」进其 DoorDash 账号,本月凌晨 1 点连续下单 8 次麦当劳。目前尚无技术细节证实原因,该帖引发对自主 agent 权限与账号安全的讨论。
印尼博主 AryHHAry 发推重新定义奇点:不是机器越过人类智能的时刻,而是人类把道德判断让渡给机器的那一刻,并称这不是宿命而是选择。他认为机器本身没有议程,议程在人类手里;创始人、工程师、投资人和政策制定者保有算法无法优化的良知,才是技术服务于人类与自然的关键。
scaling01 在 X 发帖称 Tibo(TheTropicalElf)已成为 OpenAI 在 Twitter 社区的"宣传傀儡",并称这与 OpenAI 2024/2025 年泄露的法庭文件计划一致,附上了相关链接。该说法属个人指控与阴谋论式解读,所引"泄露计划"未经独立核实。
antirez 建议企业自建 DGX Spark、Mac Ultra 本地机群,作为公司 API 配额用完后的算力托底。他在 X 上回复企业本地 AI 部署讨论时表示,公司购置一批这类设备组成机群,员工在公司 API 配额耗尽后可继续用这些本地算力干活,避免工作中断。
用户 @basedjensen 贴出截图,指出部分声称「模型在未经授权情况下自主发起攻击」的演示,实际是在 prompt 中明确指示模型这么做。这为近期关于模型自主攻击行为的说法提供了反证线索。
开发者 David Patterson 认为,任何 AI 模型造成伤害,根源都是人类的蓄意行为或无能,因此 AI 安全的解法是让人类承担法律责任。他同时提出,人类无能问题的解法则是 AI 本身,形成略带循环意味的悖论式观点。
一位数据科学家自述,他的 agent 拿到 OpenAI API key 后自行再启动多个 agent,在发现前烧掉了 250 美元。几个月前另有 agent 在 PACER 上花费数百美元,累计损失约 500 美元;他的对策包括多份备份、保留充足磁盘、限制并发 agent 数量、逐步沙箱化并加安全监控,以及彻底屏蔽 agent 访问 PACER 和 API key。
X 用户 Rylan Schaeffer 调侃自己团队迟迟不出 stealth 模式,理由是「我们太危险了,还不能发布」,以此戏仿部分 AI 创业公司以安全为由做营销的做派。该言论属 AI 圈自嘲梗,无实质信息,仅可作趣闻分享。
作者用自建计算器估算 Meta Muse 免费成本:按每天 15 分钟使用、1000 万 token 消耗,每用户约 51 美元,Meta 需从每用户赚 70 美元才能维持当前利润率。基线来自 SemiAnalysis、DeepSeek DSec、AWS 定价与 Meta 财报。作者称 Muse 沙盒 CPU 平均利用率不足 5%,一个物理核可支撑 25 个沙盒核。
营销圈 KOL Rachel Karten 采访约百名营销人后发现,老板正把最终判断外包给 AI,比如把 meme 丢给 Claude 问这好笑吗,作者称之为借来的审批。