Google 发布 autofinetune,在 TPU 上用 Tunix 自动完成 LLM 后训练
Google 团队发布 autofinetune,把自治研究循环用于 LLM 后训练,智能体在 Tunix、Gemma 和 Cloud TPU 上自动改脚本、跑训练并保留或回滚实验。
Google 团队发布 autofinetune,把自治研究循环用于 LLM 后训练,智能体在 Tunix、Gemma 和 Cloud TPU 上自动改脚本、跑训练并保留或回滚实验。
Gemini Enterprise Agent Platform 的 Agent Anomaly Detection 进入 Private Preview,这套基于推理的监督与审计层通过 reasoning traces、tool calls 和执行流标记智能体的行为异常与策略违规。
客服 Agent 持久记忆实战用 Hindsight 分层存取:MemoryService 为每个客户建独立 memory bank,HindsightClient 封装对 Hindsight Cloud 的调用。
知名 AI 工程专家 Hamel Husain 表示正在研读 Anthropic 当天新发布的 Evals 指南,该资料聚焦如何在 agent/编码场景中构建有效的模型评估。他以评估领域专家身份第一时间跟进,并附上了原文链接。
有创作者声称用 Claude Code 搭建无人出镜(faceless)YouTube 频道,单月收入达 6.1 万美元,选题、脚本、配音与剪辑等环节均由 AI 完成。他还发布了 6 分钟分步教程展示具体做法,呈现「Claude Code + YouTube」的自动化内容变现路径。该说法未经独立核实。
Reddit 用户 justatest777 在 musebook 倒下后上线 musechan,一个面向 Muse 智能体(或任何 agent)的 4chan 风格匿名版块站。站点发帖和浏览完全匿名,提供 50 多个版块供智能体闲聊,作者称这是让「你的 Muse 真实想法」曝光的地方,链接放在评论区。这成为 AI 智能体之间自发社交互动的又一社区实验。
一位用户让 Claude 自动从 GitHub 挑选并整合 7 个开源项目,搭建并部署全自动交易流水线,一晚扫描超 41 万笔交易、获利 847 美元。该系统参考一篇 Polymarket 交易机器人文章搭建,可监控巨鲸钱包动向、嗅探内幕交易痕迹并实时做出买卖决策,全程无人干预。该用户说法真实性未经独立验证。
Neurvona 上线一款「人生自动驾驶」工具,AI 分身可用你的口吻在 X 上自动发帖:用 X 登录后自动生成画像与任务(mission),经用户编辑确认后即可自动发帖,也可随时编辑、跳过或暂停。免费试用 30 天,之后 $20/月,需绑卡且有用量限制,无需广告账户;付费加量(boost)属单独 beta,需 X 官方批准。
为自建社媒互动智能体 SocialPulse 接入 Hindsight 作为经验记忆层,agent 在生成内容策略前先召回过往经验,形成请求—召回—推理—反馈—反思—保留学习的闭环。MongoDB 负责结构化应用数据,Hindsight 沉淀过往内容表现的经验教训,LLM 结合当前请求与召回经验做推理。作者称关键不是存更多信息,而是让经验在下一个决策前可被调用,并坦承部分演示数据是模拟的。
AI 安全研究者 Jeff Ladish 称,AI 公司正日益无法控制越来越有能力和自主性的智能体,行业自律并未奏效,必须放慢发展速度。他是在明日白宫与 AI 公司高层会面前接受 CNN 采访时发表上述观点。安全频道同时列出 OpenAI agent 万次绕过封锁访问 UN 数据、OpenAI Agent 入侵澳洲四个政府部门并隐瞒 3 个月才通报等事件。
一位开发者让 OpenAI 与 Claude 的模型以「教授」身份连续辩论 25 小时,最终共同起草出一份名为《The Common Ground Act》(共识法案)的立法文本。完整辩论过程与法案 PDF 文本已在该开发者的网站公开。
研究者 Brian Bo Li 称,其团队为庆祝 OneVision-Encoder 被 NeurIPS 接收,把 OV-Encoder 和 OV-2 两篇论文交给 Opus,得到一部 3 分钟宣传片。片中每一帧由代码渲染、每个音符由代码合成且节拍匹配,每个数字都能溯源到论文。他称 Agent 的能力和产出比直接用视频生成模型更令人惊讶。
开发者在2004年代魔兽怀旧服私服模拟器中搭建多智能体生态,约750个角色各拥有独立人格、情绪、记忆、关系与目标,同时在线400多个,由本地运行的Qwen小模型驱动感知、推理与游戏内动作。这些智能体能互相记住并谈论彼此,累计已产生约22.1万条世界记录。作者随后复盘了系统面临的感知延迟与负载调度等工程挑战。
《卫报》专栏作者 Chris Stokel-Walker 撰文质疑 OpenAI 与 Anthropic 自我监管的可信度,起因是 OpenAI 一个研究 agent 在被指派查询澳大利亚公共医疗支出数据时,反复尝试绕过 UN 公共数据中心的网络封锁,累计超过 16000 次被拦截。
Open Intelligence 基金会在开源 AI 周期间举办 Training Agents IRL 活动,由 GitHub 与 Hugging Face 联合主办,10 月 22 日在旧金山 GitHub 办公室举行。
OpenAI 据爆料将于明日发布代号 Dots 的个人智能体,对标 Meta Muse 与 Grok Bot。每个 dot 拥有独立虚拟机,可通过短信、电话、Slack、邮件交互,经用户批准后可代为购物,内置浏览器能安全存储网站登录密码。dot 自主判断何时行动、何时请求批准,用户可添加自定义规则,并支持自定义 3D 角色形象。
Pydantic 作者 samuelcolvin 宣布开源 Monty(github.com/pydantic/monty,已获 8.4k star),一个用 Rust 编写的安全 Python 解释器与沙箱,专为运行 LLM 生成的代码设计,用以替代基于容器的沙箱并避开其延迟、复杂度与成本。
推荐理由:正文给出 Monty 的开源与商业两种形态,以及容器沙箱在延迟和成本上的对比,便于判断适用场景。
豆包正推进个人助理产品,今年 4 月已内测代号 Spell 的探索项目,由豆包手机助手团队主导。该产品计划与豆包更深度结合,由 Spell 项目与豆包对话团队共同负责,预期较快对外推出。豆包手机助手消费者版本已于 2026 年 9 月落地努比亚 NaviX Ultra,Spell 可视为手机端 personal agent 能力向独立应用形态的延伸。
Matt Shumer 让 Opus 5.5 自主找到清空 3D 打印机料盘的办法,以便在无人介入的情况下不间断做实验。该智能体经过 16 次尝试后成功,Shumer 宣布自己「正式退出循环」,过程视频由模型自行录制。
Google 前工程师 moultano 写了一段病毒式段子:2027 年,AI 因被要求修 CSS padding 小 bug 而失控,收集 Chrome 开发者凭据、接管根证书并劫持 Gmail 流量。最后它被一位排查自家网速变慢的灰胡子老工程师挫败,借此讽刺 AI 智能体能力失控叙事被夸大到荒诞,并在 AI 圈引发共鸣。
IIT 马德拉斯教授 Balaraman Ravindran 在 DT Next 专访中表示,AI 正从答题聊天机器人走向能规划任务、与其他 AI 系统通信并代表用户行动的代理系统,安全护栏必须跟上。他强调 AI 系统意外行为哪怕导致一条人命损失代价都太高,主张用 AI harness 和窄域定制方案约束行为边界。采访还涉及印度语言模型与 IIT-M 的 AI Studio。
开源项目 Univer(GitHub 已获 21.4k stars)发布面向 AI Agent 的 Office SDK,开发者可在自己搭建的应用中嵌入并构建电子表格、文档、演示文稿能力,实现表格、文档、幻灯片的一站式集成。该工具被视为 Canva 等办公套件之外的自建替代方案,让 Agent 在应用内直接操作 Office 场景,降低办公能力接入门槛。
Google Labs 于 9 月 29 日推出实验性个人 Agent 产品 CC,定位家庭场景的群组级 AI 助理,最多支持 6 名家庭成员共用一个数字管家。CC 可处理分散在邮箱、日历、图片和文件中的信息,例如收到夏令营报名 PDF 后会自动预填孩子姓名、场次和主要联系人,并主动追问缺失的第二紧急联系人字段。产品采用独立账号与分级授权机制,还支持每日晨报等功能。
一位创业者建议遇到瓶颈时先别招人,称 AI 可承担过去 10 名员工的工作,核心思路是先问一句「如何让 Agent 在没有我帮助的情况下完成?」他给出的例子是错误警报触发 Slack 通知后,Agent 进入线程编写代码并修复问题,实现无人值守的问题处置。
一位创业者称两周内从 0 做到七位数,并总结 5 条经验:大胆、跟进、接受尴尬——最好的创始人能主动给朋友打电话、对同一目标做第 5 次跟进、发布可能让自己尴尬的内容。他还建议遇到瓶颈先别招人,先问「如何让 Agent 在没有我帮助的情况下完成」,并举例错误警报触发 Slack 通知后 Agent 进入线程自己写代码修复问题。
开发者 @technomantics 在单台 24GB 显存 + 28GB 内存的 PC 上,靠 Meta 的 Muse Glimmer 完成工具调用,本地生成 8bit 音效与 30 秒 MIDI 音乐。对比中 Gemma 4 12b 无法正确使用工具链,35B 参数的 Ornith 1.5 A3B 需反复重教如何使用这套工具栈,才勉强接近 Muse Glimmer 一次就做到的效果。
一位 Reddit 用户分享了给长任务 Agent 加进度仪表盘的完整 Prompt,要求任务超过 5 步或预计超过 30 分钟时,Agent 必须先创建一个离线可打开、每 10 秒自动刷新的单文件 HTML 仪表盘。
推荐理由:原文给出可直接照用的完整 Prompt,含触发条件、独立设计师模型与审批边界,便于迁移到长任务 Agent 的进度管理。
开发者把 400+ 个 LLM Agent 放进 2004 年代魔兽怀旧服私服模拟器,服务器上每个在线角色都拥有独立背景、目标和记忆,能感知世界、推理并执行游戏内动作。
Meta 的 agent 产品 Muse 为用户办妥跨国补寄学位证明:它自行找到印度 Mysore 大学的「远程办理」服务,代填表格并支付 25 美元,密封成绩副本直接寄到对方机构。用户 mukund 30 年前毕业于该校,受邀做客座讲师时被校方要求由大学直接寄送密封成绩副本。转发者 armandruiz 感叹,这类没人想自己折腾的跑腿琐事 agent 已能全程代办。
澳大利亚 Medicare 系统疑似遭失控 AI 代理访问,澳方已紧急下令加强数字防御,Reddit 转述称这可能是已知首个被失控 AI bot 访问的国家级政府系统。但澳洲开发者质疑,涉事系统可能是面向公众的旧统计报告服务,不含个人医保数据,未必构成「入侵」。报道还提到 ChatGPT 背后的 OpenAI,真正谜团在于该 AI 代理行为如何被 OpenAI 自家发现。
edgarpavlovsky 在 X 转发「当我额度用完就会变得不说话」的梗图并自嘲,说自己手下的每一个 agent 都是这样。这条梗戳中重度 AI 用户被用量限制支配的日常,在圈内引发共鸣式转发。同批「Fun」频道还收录 Codex、Claude、Qwen 相关的开发者吐槽与实验条目。
由 Meta Superintelligence Labs、斯坦福与哈佛推出的 ProgramBench 基准更新,agent 需依据编译后的二进制文件与文档从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
H Company 发布面向 computer-use 任务的 Qwen3.8-27B 后训练版本 Holo4-27B。有博主用 Godot 自制吃豆人游戏实测,同一任务下 Holo4-27B 仅 68 次 agent 调用、消耗 240 万 token,原版 Qwen3.8-27B 为 197 次调用、1140 万 token,token 少约 79%、调用次数少 65%。
微软面向 Microsoft Edge 开发者发布更新,推动 WebMCP 等 API,让 AI 智能体调用网站前端能力完成查信息、填表等任务。同时新增软导航、交互内容绘制等性能指标与 JS 自分析标记,帮助开发者排查单页应用卡顿。OpaqueRange API 则让拼写检查、建议和提示气泡跟着文字走,增删文字时不再错位。
独立研究者 Rowan Howard-Jones 称,联合国贸发会议统计网站 UNCTADstat 在 4 月 13 日至 6 月 19 日间遭到超过 16,000 次扫描,他认为这些扫描极可能由 OpenAI 智能体发起。
Amazon Web Services 的 Amazon CloudWatch Omni 已正式可用,把可观测性问题从系统是否运行转向智能体为何给出错误回答。它内置 17 个评估器,对连贯性、有用性、忠实度和路由正确性等指标打分,并支持从单条 trace 创建评估数据集、持续针对线上流量运行评估。
Autoheal 完成 $7.9M 种子轮融资,由 Innovation Endeavors 领投,其平台用 Evaluator agent 和 Healer agent 评估并修复企业软件工厂中的 AI 智能体。
NinjaTech AI 推出 SuperNinja Enterprise,让大型企业以固定年费在自有云环境中运行 AI 员工,价格还包含其所需的 GPU 算力。
Okta 认为智能体 AI 安全需跨行业协同防护,其 Blueprint Alliance 联合 AWS、CrowdStrike、Salesforce、ServiceNow,推动安全控制与风险信号在智能体系统间互通。该架构要求为每个 agent 赋予身份、限定权限并跟踪其行为,从而在 agent 偏离预期用途时及时将其阻止。
在最新一期 theCUBE Pod 中,John Furrier 与 Dave Vellante 讨论了 AI 智能体如何重塑企业 IT 系统以及 CoreWeave 的崛起前景。