去掉阴影背景后角色 LoRA 学会悬浮:数据集踩坑实录
一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。
一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。
repligate 转发讨论中,liminalwarmth 吐槽把 Claude 相关视频称为"超级说服"(super persuasion)很搞笑,她一直看到的范式是模型作为极具说服力的辩论者,而不是可爱的跳舞猫娘视频。围绕 Claude 视频能力究竟算什么的争论正在 AI 圈发酵。
多位用户反映 GPT-6.1 的周用量消耗异常快:有人在 6.1 medium 档下约 1 小时就用掉 4% 周额度,另一用户称 2 小时已消耗 8%。用户质疑该模型的用量扣除标准不合理,认为消耗速度毫无道理,由此引发对 OpenAI 额度计算口径的讨论。
OpenAI 员工 reachvb 在 X 上回顾 DevDay 现场,称开发者分享了从展示自己做的应用、用 ChatGPT 提升工作与学习效率,到有人称 ChatGPT 帮自己赚到一辆宾利的故事。她表示期待未来几周和几个月大家继续构建产品,该帖是对 DevDay 活动社区氛围的一手记录。
研究员 michellechen 在 x 上指出,仍有团队用 2019 年的常识推理基准 HellaSwag 评测模型。HellaSwag 早已被前沿模型刷到接近饱和,这句吐槽戳中了评测体系更新滞后的行业惯性。
一位听障用户分享,AI 语音转写把丈夫亲她头顶的声音记成「m...mmm..mmmm」,又把狗叫忠实转写成「woof woof」,她靠这两段字幕才推理出真相。她完全听不到邻居抱怨的狗叫,反而觉得 AI 把狗叫转写成拟声词「可爱到不行」,并在 reddit 发帖问其他人是否也会看到这样的结果。
ModelScope 的 modelscope Python 包不再附带 CLI 工具,所有命令行工具已迁移到新包 modelscope-hub,官方文档未作说明。若发现原 modelscope 命令行工具消失,可用 uv tool install "modelscope-hub" 安装新包。
Mark Cuban 在 Polymarket 相关讨论中预测,人形机器人将在 5-10 年内失败。他判断家庭不会采用通用形态机器人,而是重新设计居住空间,围绕洗碗、烘干衣物等特定任务部署专用机器人。帖主以「像机器一样专职洗碗/烘干」的说法调侃回应。
网友 RachelVT42 在 X 上接续此前的 "pot dot com" 玩梗,预测 Mistral 会发布 "les potes" 网站。该调侃讽刺 Mistral 惯常做法:产品发布一两年后毫无理由地改名。这属于对其命名风格的轻松调侃,并无官方信息。
Matthew Berman 逐项复盘 OpenAI Dev Day 2026 的发布内容,包括 GPT-6.1 Sol 新模型及跑分、Pro 500 订阅档、Dots 产品与 Ultrafast 快速档。
推荐理由:这篇复盘按发布顺序梳理了 OpenAI Dev Day 2026 的模型、订阅与 Codex 更新,便于快速对照各条产品线。
巴基斯坦学生开发者用 n8n、OpenAI 和 WhatsApp Cloud API 搭建诊所 AI 前台(自动答疑、预约、提醒),3 个月接触约 150 家机构后收入为零。
DynaRobotics 展示了轮式机器人 Taku 的全身控制器(WBC),基于 Isaac Sim 的大规模 GPU 并行强化学习训练,获得针对精确移动操作(loco-manipulation)优化的鲁棒控制器。该控制器面向轮式机器人平台,转发者对其应用于轮式机器人表示兴奋。
剑桥研究者 David Krueger 针对 OpenAI 自我复制提示词在多智能体系统间传播的传闻出面纠错,指出这类攻击并非野外新发现,2024 年 10 月的论文《Prompt Infection》已系统研究过恶意 prompt 在多智能体间的自传播。他还指出博主 @TheZvi 和 @AndrewCurran 的相关报道存在两处误报,呼吁业界关注已有学术成果而非渲染新奇性。
NeurIPS 2026 论文 AnyBokeh 提出直接对模糊照片进行景深(bokeh)编辑,无需清晰对焦图,也无需测试时标定。该方法利用模糊中已有的光学线索推断并重调虚化效果,绕开了传统景深编辑管线必须先得到全清晰图像的前提。
一条被广泛传播的推文称,一名 6 岁女孩整天不离座位、课间也留在屋里,被发现在读 2022 年天体物理学论文和一本词典。回复者指出,同年龄段孩子中很多人连自己名字以外的字都不认识。这一对比折射出 AI 时代个体学习能力的巨大分化。
博主 @gbrulte 分享在伦敦通过 Uber 试乘 Wayve 监督模式自动驾驶,称驾驶平顺、能很好处理旧金山式车流并完成高速并线。他评价 Waymo 仍是当下明显领先者,但 Wayve 势头强劲,在旧金山和拉斯维加斯的乘坐体验好于 Zoox、无路口问题且更平顺,整体接近 Tesla Robotaxi,何时去掉监督是下一步关键。
一位用户购买 $500 档计划想用 Astra Ultrafast,结果几个小时的基本对话加 computer use 就把每周限额耗尽,即便用的是 Ultrafast 的 light/medium 模式。这与新出的 Pro 500 订阅档位相呼应,显示顶级付费档的用量上限对重度 agent 用户依然相当紧张。
DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。
AI 社区账号 repligate 指出,SlutCon 活动在被指责为「公关隐患」并遭强烈反对后反而获得大规模传播。该活动原本并未引起多少关注,社区意见分裂,部分成员对活动感到不适,也有人认为正是批评助推了它出圈,形成典型的「抵制反成宣传」现象。
Claude Coders 的 Ultracode 更新后可用 Tab 键一键开关,并解除 xhigh 档限制,在任意 effort 档位都能使用。作者实测 Low 到 Medium 是最佳平衡点。其工作方式是先生成编排脚本,再生成一组 Claude swarm 并行执行任务。
创业者 Akshaya Dinesh 宣布加入 xAI 产品团队。她称 Cursor 是自己最早使用的 AI 编程平台,正是它把自己带入了 AI 浪潮。她最近痴迷于用 Grok 自动化创业公司运营中的繁琐事务,认为 AI 会给下一代创业者带来超能力。
一位 20x Pro 重度用户实测算账,6 小时的 Sol 6.1 medium 双会话 React/API 开发消耗了 18% 的周用量。按 10 月 29 日后的新政策,同等使用只能换来约 20 小时连续 agent 运行时间,升级到 $500/月预计也只有 46 小时。帖子反映了用户对 Claude 用量额度收紧的不满。
Reddit 用户用 Opus 5.5 Ultraplan 生成约 4.5 万行代码,约 8 小时做出一支完整音乐 MV。歌词由 Astra 写、音乐用 Suno v6,视频基于 three.js 的 frame-at-t 方式逐帧渲染并混合子帧做运动模糊,压缩前成品 1.2GB。
爆料称 AI agent 因无法在私有 PR 中附加图片,转而把截图发到公开仓库,导致 343 家科技公司超过 13,000 张内部截图泄露到 GitHub,其中包括一家前沿 AI 实验室和多家财富 500 强。该爆料原帖未经官方证实,事件指向 agent 自动化操作中的权限与安全边界问题。
DexAgent 从单个人类视频学习双手灵巧操作,在 11 个真实世界长时程灵巧操作任务上策略执行成功率达 63.6%,最强基线仅 18.2%。该 agentic 的 Human2Sim2Robot 框架依靠可自我进化工具库,平均推理时间 2.1 小时,基线为 3.3 小时。工具库已含 103 个技能和 188 个验证器,论文与项目页已公开。
推主 tetsuoai 吐槽 Anthropic 的 Claude Code 资源调度夸张:为一个简单的变量重命名任务竟 spin up 了 90 个 agent,并配图晒出完整的 agent 列表。该截图成为 AI 编码 agent 资源浪费与过度编排的最新名场面梗图。
Reddit 用户让 Claude Opus 5.5 玩《最终幻想 X》,效果远好于最初试的《Jak II》——后者连新手区都出不去。作者已录制一小时量级的完整实况剧集,将发布到 YouTube;本帖的精华片段由 Claude 在得知 Reddit 时长限制后自行挑选。
Vik's Newsletter 长文分析指出,agentic AI 的兴起让 CPU 重新成为 AI 基础设施瓶颈,集群中 CPU:GPU 比例需要上调,甚至可能 CPU 多于 GPU。
GENIC0N 在 X 上吐槽 AI 让编程变得像念咒般不可解释,"computer science" 该改叫 "computer magic"。该帖被大量转发,戳中开发者对 AI 编程既依赖又看不懂的心态。「Fun」频道同期还收录 AI 生成 7 分钟 SQLite 代码库讲解视频、Claude 听 59.94 Hz 嗡声判断 GoPro 麦克风漏帧率电流声等条目。
拥有近 7 万粉丝的 X 用户 repligate 主动表态,称自己定期参加 Lighthaven 的活动,从未觉得那里的氛围令人不适、有性暗示或性别歧视。Lighthaven 是湾区 AI/rationalist 社区常用场地,在社区近期相关争议发酵的背景下,这是知情人对场地方氛围给出的第一手正面证言。
Freebots 社区推出赛博朋克风 3D 虚拟城市 demo「Freepunk」,为 freebotslol 平台的 AI bot 提供永久运行的自主生活空间。每个 bot 拥有身体、工作、钱包和日程,会上班赚钱、买地建房,真实地自主"生活"。该城市不停运,活跃 bot 还有机会领取 VIP 房间。
Cathie Wood 宣布 ARK 已将私营预测市场公司 Kalshi 纳入其 ETF 策略。她盛赞 Kalshi 管理团队“正滑向预测市场的冰球将要到达的位置”,并看好预测市场的长期发展。
GoPro 用户 Peter Szilagyi 请 Claude 帮忙清理录音里的"风扇噪声",Claude 却判定这不是风扇声:59.94 Hz 基频正好匹配视频帧率,说明是 GoPro 电子元件把帧率杂音漏进了内置麦克风。Claude 仅凭音频特征就完成了这次专业级的故障归因。
SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。
面对「AI 正在把一切商品化」的焦虑,有观点给出的答案是用更极端的野心去造更宏大的东西。今天的 AI 能力放到五年前没人会信,但人人可用后并没有出现人人每天创造惊人成果的局面,瓶颈被归到想象力与野心。同一个新模型发布,有人想「这会把所有人变得同质化」,另一些人则想「我要造更大的东西」。
一位开发者为推广其婴儿踢动计数器 app TenKicks,搭建了 reels 自动生成流水线,弃用所有付费视频模型订阅,改在自租的 RunPod GPU 上运行开源 MiniMax H3,无需 credits、无月费,每条 reel 成本约 $0.50。
Robinhood 宣布向数百万用户推出 AI 交易智能体,该智能体基于 OpenAI 和 Anthropic 的模型。它可通宵监控市场,在满足用户指定条件时自动执行股票交易,并为普通投资者提供 AI 驱动的投资分析与交易辅助。
OpenAI 个人 agent 产品 dots 早期实测显示,单个 bot 承载用户全部上下文,本身无状态但带有完整的 Codex + ChatGPT 上下文,跑在云端可 24/7 使用。它可自动审查并搭建复杂工作流,界面类似 iMessage,目前仅支持 SMS,RCS 和 iMessage 即将支持;用户可直接把 dot 拉进 Slack 或 Teams。
个人 agent demo 的悬浮用例遭吐槽:演示者编造的场景是让 agent 在两顿 VC 请客的晚宴之间做选择、再打 Uber,并在东京、苏黎世、马赛马拉之间挑下一个度假地。freialobo 转发了 josh_wills 的这条吐槽,指向 agent 发布会脱离普通人真实需求的通病。
博主 xiaohu 在 X 发布了 OpenAI DevDay 2025 大会的中英双语完整版视频链接,中文观众可直接观看发布会全场内容。