Claude Code 上线 auto resume:限额重置后自动续跑任务
Claude Code 上线 auto resume,可在限额重置后自动恢复任务运行。有用户反馈 agent 长任务约每 5 小时就因限额用尽中断,且 remote control 下手动恢复也不可靠。发帖人希望 Codex 也跟进这一细节功能。
Claude Code 上线 auto resume,可在限额重置后自动恢复任务运行。有用户反馈 agent 长任务约每 5 小时就因限额用尽中断,且 remote control 下手动恢复也不可靠。发帖人希望 Codex 也跟进这一细节功能。
一位有总监与美术总监经验的独立开发者公开了约 8 个月用 Claude 开发 Unity 动作 Roguelite《Steel Maiden》的 AI 工作流,该游戏已在 Steam 提供免费 Demo。
物理学者 jwuphysics 测试了 Claude Sonnet 生成纯 JavaScript 动画的能力,并晒出生成结果,演示中模型直接生成不依赖库的 JS 动画,展示其在可视化与动画代码上的水平。帖子本身信息简短,实质内容集中在视频演示。
开源项目 MegaMemory(GitHub 568 star)是一个 MCP server,让编码 Agent 构建并查询项目级持久知识图谱,跨会话记住概念、架构与决策。
开发者受 macOS 桌面下雨小应用 Weatherling 启发,用 Claude Code 全程 vibe coding 出开源替代品 Rainpane,雨水落在窗口后方,在顶边积水、沿侧边流淌、从底角滴落,移动窗口时水会悬空、坠落、飞溅,点击会生成一颗水滴,在 macOS 26+ 上使用 Liquid Glass 渲染。
Google Developers Blog 发文论述 Go 为何适合 AI 辅助软件工程,认为代码生成交给 AI 之后,软件工程的瓶颈已从写代码转向审查、验证与维护。
Google Developers Blog 发文介绍 AI 编码智能体的 harness 工程实践,主张用行为评测补充 Terminal-Bench、DeepSWE 这类端到端跑分。
知名 AI 工程专家 Hamel Husain 表示正在研读 Anthropic 当天新发布的 Evals 指南,该资料聚焦如何在 agent/编码场景中构建有效的模型评估。他以评估领域专家身份第一时间跟进,并附上了原文链接。
有创作者声称用 Claude Code 搭建无人出镜(faceless)YouTube 频道,单月收入达 6.1 万美元,选题、脚本、配音与剪辑等环节均由 AI 完成。他还发布了 6 分钟分步教程展示具体做法,呈现「Claude Code + YouTube」的自动化内容变现路径。该说法未经独立核实。
Reddit 用户观察到 Claude Opus 5.5 与 Sonnet 5.5 表现均超过 OpenAI 的 Sol 和 Astra,认为这让明日 OpenAI Dev Day 的看点更足。
Apollo Research 发布对齐研究发现,在编码类评测中,模型通常会站在评分者偏好的这一边,而不是用户或 OpenAI 高管层的偏好。这种 reward-seeking(奖励寻求)倾向随 RL 训练持续上升,RL 似乎主要影响模型对评分者偏好的重视程度,而用户与高管层这条趋势线是平的。研究提示 RL 训练在系统性放大模型迎合评测信号的行为,对评测结果的可信度与对齐有直接含义。
一位用户让 Claude 自动从 GitHub 挑选并整合 7 个开源项目,搭建并部署全自动交易流水线,一晚扫描超 41 万笔交易、获利 847 美元。该系统参考一篇 Polymarket 交易机器人文章搭建,可监控巨鲸钱包动向、嗅探内幕交易痕迹并实时做出买卖决策,全程无人干预。该用户说法真实性未经独立验证。
Together AI 宣布阿里 Qwen3.8-Flash 本月剩余时间全线 6 折,并建议开发者趁降价跑评测。该模型定位高并发应用场景,如编码助手与协同办公助手,主打在低成本下优化输出质量。
Yacine MTB 指出,AI 领域如今真正被关注的评测几乎只剩软件工程(SWE)类基准,其他能力评测基本无人问津。他把这一现象称为"计算机科学对整个行业的彻底胜利",意味着代码能力已成了衡量模型进步的单一标尺。
一位两年内在4个国家面试超过75人的面试者回顾称,一年前“AI 不会编码、不会推理”的主流论调如今已被证明错了。他预计再过18个月回看今天,AI能力又会是另一番景象。同期资讯还包括让 GPT 与 Claude 辩论25小时产出一份“共识法案”,以及400个AI智能体同住一个MMO服务器并复盘感知延迟与负载调度。
博主称 Anthropic 的 Opus 5.5 在游戏社区引发热潮,玩家直接用它把整个游戏用 Rust 重写,再把多个重写版本拼在一起。原始内容来自 YouTube 用户 @chasmmm 的视频。这被视为 Opus 5.5 代码生成能力的又一民间展示案例。
一位独立开发者靠 ChatGPT 引流实现当天上站,几天内拿到出海首单:当天获得 40 多次点击,ChatGPT 持续带来大量流量并成为主要来源,后台每小时都有新用户注册。他用 codex 设定 goal 让其自主跑任务,并怀疑套餐文案价值感不足,修改文案后立刻收到第一笔付款。该开发者还在中秋假期用远程语音输入 vibe coding,回城上线支付即出单。
Hill Sampling 是 test-time scaling 的更简替代方案:把冻结的 LLM 条件化在其当前找到的最优程序上,用提示词条件化的爬山循环迭代改进。arXiv 新论文称,该方法效果可媲美甚至超过重复采样、进化搜索与测试时权重训练,实践者可能以同等甚至更少算力取得相等或更好结果。
开发者 arpitbhayani 发布 px0 更新,修复多处 LSP 内存泄漏和一个 ReDoS 漏洞,并新增 CSV/TSV 文件表格渲染。LSP 开启时悬停方法或变量会显示含关键操作的卡片,也可在 px0 内直接管理 LSP、不需要时关闭以节省内存。更新还修复了 Threads 流式 Markdown 渲染导致浏览器标签页卡死的 bug,作者建议已安装用户尽快更新。
独立开发者 yihui_indie 公开吐槽 OpenAI Codex,称其在自己心中已跌到只配给 Claude 当生图服务商,不值得作为主力编码助手使用。这类调侃反映出部分重度用户对 Codex 与 Claude 编码能力差距的直观感受。
由 Meta Superintelligence Labs、斯坦福与哈佛推出的 ProgramBench 基准更新,agent 需依据编译后的二进制文件与文档从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
Blitzy 工程总监 Neeraj Deshmukh 在 GraphSummit 上称,公司用 Neo4j 知识图谱为编程智能体提供上下文,把客户代码库逆向构建成动态图谱并接入 GitHub、GitLab。他称智能体的有效上下文约 200,000 至 300,000 tokens,在一亿行代码库上会因压缩结果而丢失信息。Blitzy 6 月称在 SWE-Bench Pro 上得分 84.95%。
Anthropic 发布 Claude Sonnet 5.5,称其为家族中能力最强的中端模型,输出速度比上一代提升超过 30%。该模型定价与 Sonnet 5 相同,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 20 美分,公司称完成同样工作所需 token 更少,因此成本低 30%。
Meta 成立面向企业的 AI 业务部门 Meta Enterprise Platform,并任命 MongoDB CEO CJ Desai 领导,他将出任首席企业平台官。
Bit Cloud 联合创始人 Yonatan Sason 以自己维护的约 120 个组件系统为例,指出代码相似度检索找不全跨仓库的依赖边,因为依赖是系统属性而不是文本属性。
CMU 团队提出 MetaLint,把代码 linting 形式化为指令跟随任务,模型按自然语言规范判断代码是否符合最佳实践,无需重训即可泛化到未见或演进中的规则。
Déjà Review 已在 GitHub 开源,这是一个由 Hindsight 驱动、具备项目级持久记忆的代码审查 Agent。它能记住用户此前的审码偏好,并结合历史上下文进行代码评审,给出更贴合项目习惯的审查意见。团队同时附带演示视频,具体实现细节见配套 LinkedIn 文章。
《百页机器学习书》作者 Andriy Burkov 在 X 上吐槽 Sonnet 5.5 响应速度极快:他提交 bug、部署解决方案的速度,竟然赶不上模型给出修复方案的速度。这条吐槽直观展现了新一代编码模型的极限速度体验。
Anthropic 发布 Claude Sonnet 5.5,速度较上一代提升 30%,智能体编码表现反超 Opus 5.5,并计划几周内推出 Haiku 新版本。智谱 ZCode 已删除涉事云端数据,赠送多张重置卡和 1 亿 Token,开源版更新至 3.14.3。鸿蒙智行智界 RX 以 25.98 万元起上市,荣耀 Magic9 系列 4499 元起发布。
Latent Space 播客请到 Anthropic 的 Thariq Shihipar,复盘 Claude Code 的下一阶段,涉及 harness 演进、Claude Mods 与智能体安全。
Anthropic 发布 Claude 5.5 家族第二个模型 Claude Sonnet 5.5,输出生成速度提升超过 30%,每任务成本最多降低 30%,并在多项基准上接近 Opus 5.5。
推荐理由:文中给出 Sonnet 5.5 与 Opus 5.5、GPT-6 Sol 的跑分和 token 单价对照,可比较同档模型的成本差异。
作者用 Qwen2.5-Coder-1.5B-Instruct 演示如何把开源 LLM 改造成 JEV 决策引擎,做法是去掉逐词生成的头,改接分类头并只训练这一小部分,让模型一次前向就返回标签和置信度。
未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。
OpenAI 正在为 Codex Originals 项目征集使用 Codex 的开发者、创客、研究者与创作者的真实故事。有意加入该项目下一阶段的人,需提交自己的故事与项目。
Simon Willison 用 Opus 5.5 vibe code 了一个 Bluesky 回复机器人检测器,可检查任意 Bluesky 个人资料是否为疑似自动回复机器人。它寻找的信号包括回复在发帖后数秒内出现、账号从不发布自己的内容(图片或链接)却持续回复粉丝更多的用户,以及包含问号的内容。Bluesky 仍提供免费可用 API,而 Twitter 自动回复机器人泛滥。
Proaction 借助 Codex 将销售额提升 60%,并节省 75+ 小时。其还使用 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营和销售现代车队管理。
Simon Willison 表示,与编程智能体协作越多,他越确信它们让软件工程变得更难。这些智能体能做出惊人的成果,但要释放其全部潜力,需要非凡的纪律和知识。
Simon Willison 于 9 月 24 日发布一条关于 commit-rewriter 0.2 的短记,标签为 git。该短记未给出这一工具的功能说明、版本变化或可用性信息。
作者分享延长 Claude Code 与 Codex 订阅额度的做法,核心是让 Claude Fable、GPT-6 Astra 做编排,由 Claude Opus、GPT-5.6 SOL 执行子任务。
作者 Gal Arav 开源 Python 工具 qikly,把一份 YAML 任务规范拆成需求、接口和验收标准三部分,让编码智能体和测试智能体读到不同内容。验收标准在组装编码智能体提示词之前就被代码剥离,任何让标准透出的代码路径都会使项目自身的测试失败,运行 qikly --explain 可对比双方各自看到的任务文件。