Google 发布 400M 参数表格基础模型 TabFM,零样本胜过调优 AutoML
Google 发布 TabFM,一个 400M 参数的表格数据基础模型,把监督表格预测建模为上下文学习,单次前向即可输出经过校准的零样本预测,无需任务专属调优。
Google 发布 TabFM,一个 400M 参数的表格数据基础模型,把监督表格预测建模为上下文学习,单次前向即可输出经过校准的零样本预测,无需任务专属调优。
Audio8 ASR Infinite 发布,采用原生流式架构与滚动 KV Cache,使内存与延迟保持恒定,可支持 7×24 小时不间断运行。该模型每秒解码 12.5 次,每个时钟步输出一个文本 token,在 12.5/8.3/6.25 次决策每秒之间权衡感知粒度与资源开销。模型已发布,HuggingChat 的 ML 实习生搭建了 Gradio 工作流,可直接在线试用。
abliteration_ai 宣布其上月发布的 GLM-5.3 定制版允许客户自行控制安全护栏,称客户覆盖从初创公司到财富 500 强。该团队抨击大实验室以集中式护栏实施「黑盒」管控,客户即便进入特殊「cyber」项目也常被拦截而无法开展工作,认为大厂在意的是失去对网络安全能力的垄断。团队强调将坚持把护栏定义权交还给用户。
Matthew Berman 逐项复盘 OpenAI Dev Day 2026 的发布内容,包括 GPT-6.1 Sol 新模型及跑分、Pro 500 订阅档、Dots 产品与 Ultrafast 快速档。
推荐理由:这篇复盘按发布顺序梳理了 OpenAI Dev Day 2026 的模型、订阅与 Codex 更新,便于快速对照各条产品线。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,官方称其性能与 GPT-6 Astra 大致相当,但成本大幅降低,每百万 token 定价 10 美分,约为 GPT-6.0 Astra 的一半。
推荐理由:对比 DevDay 公布的基准与定价可以看出,Sol 以约一半价格提供 Astra 级能力,并面向长时编码负载。
OpenAI 在开发者日活动上于 Codex 和 ChatGPT Work 推出 GPT-6.1 Sol 模型,官方称其在处理复杂任务时性能接近 Astra,但成本低于 Astra。
推荐理由:官方称该模型在复杂任务上性能接近 Astra 且成本更低,并给出每百万 tokens 定价,便于与现有方案比较成本。
OpenAI 在开发者活动日发布 GPT-6.1 Sol,官方称其为同等性能下性价比最高的模型,标准输入输出 token 价格只有 GPT-6 Astra 的五分之一。
推荐理由:原文给出 GPT-6.1 Sol 与 Astra、Opus 5.5 的定价和基准对比,读者可据此判断其单任务成本与定位。
华为 Mate 90 系列定档 10 月 1 日发布并于当日开售,OpenAI 发布 GPT-6.1 Sol,iQOO 16 以 5999 元起发布。GPT-6.1 Sol 性能接近 Astra,费用仅为 Astra 的五分之一;iQOO 16 首批搭载高通第六代骁龙 8 超级至尊版,安兔兔跑分 557W。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。
推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近仍未发布的旗舰 GPT-6 Astra,成本约为其五分之一。API 价格为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,Plus、Pro、Business、Enterprise 和 Edu 用户当日起可在 ChatGPT Work 和 Codex 使用。
推荐理由:原文对比 Sol 与 Astra、GPT-6 Sol 及 Claude 的价格与基准数据,可看清 OpenAI 在成本与性能之间的取舍。
OpenAI 在 9 月 29 日于旧金山举办 DevDay 2026,公布 AI 智能体产品 Dots 和 GPT-6.1 Sol 模型。Dots 对标 Meta 近期推出的 Muse,但初期只向 ChatGPT Pro、Business Premium 和 Enterprise 付费订阅者开放,Muse 则免费提供。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机操作和专业工作上接近 GPT-6 Astra,而标准输入输出 token 价格仅为后者的五分之一。
推荐理由:GPT-6.1 Sol 与 GPT-6 Astra 的能力和价格对比,以及 Astra 版本因安全顾虑被搁置,构成本次发布的背景。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,官方称其智能水平接近 Astra。该模型的 API 输入与输出 token 价格均为 Astra 标准价的五分之一。
推荐理由:官方给出 GPT-6.1 Sol 相对 Astra 的 token 定价比例与能力定位,可用于判断其成本取舍。
Simon Willison 发布短帖,称 GPT 6.1 Sol 能以五分之一的价格提供接近 Astra 的智能水平。该帖发布于 9 月 29 日,标签涉及 OpenAI、生成式 AI、LLM 与 GPT。
NVIDIA 发布开源表格预测基础模型 Kumo Tabular,给定带标签的表格行和待预测行,单次前向推理即可返回类别概率或数值预测,无需训练、调参和特征工程。
字节 Seedream 5.0 Flash 已在 Runware 平台上线,主打高吞吐量图片编辑,价格为每张输出图片 $0.019 起。该模型最多可用 10 张参考图进行编辑,能将一张图分解为最多 16 层 PNG 图层,并支持通过精确的 prompt 坐标定位做局部编辑。
NVIDIA 发布并开源表格数据基础模型系列 Kumo Tabular,开放权重且可商用,由 Jure Leskovec 团队推出。该模型只需提供带标签的表格数据即可使用,支持分类与回归任务。官方称其在精度与推理时间的权衡上建立了新的 Pareto 前沿。
PostHog 发布 9B 决策模型 Jeeves,基于 Qwen3.5-9B,采用 LoRA 微调加指针头的类 Jev 架构。在 held-out 测试集得分 0.889,优于 Kev-9B 的 0.822 与 Jev 的 0.857。JevBench 公开档位达 0.935,前代为 0.866,训练采用 SFT 与 CISPO,并配有 block-4 diffusion drafter。
Lightricks 在 Hugging Face 开源了针对 LTX 2.5(22b)的两款 LoRA,分别面向视频放大与老素材修复。Refine 用于把 HD 画面推到 8K,在贴近原始内容的前提下补出 8K 应有的细节;Restore 可把 540p 片段升到 4K,增强色彩并带来干净锐利的现代数码摄影机质感。
ElevenLabs 宣布 Eleven v4 Turbo 上线 ElevenAgents 平台,把 v4 的顶级语音质量带到实时对话场景,推理延迟中位数约 100 毫秒。官方称这让 ElevenAgents 能在更多行业支撑更有同理心的实时语音客服体验。
ElevenLabs 发布语音模型 Eleven v4,并推出面向实时语音智能体的 Turbo 版本,官方称 Turbo 在测试中约 150 毫秒开始输出语音。
Microsoft Research 与 Broad Institute 合作推出面向生物学的多模态世界模型 Quine,联合训练基因组、蛋白质、化学、RNA/细胞状态与生物成像等跨尺度表征,一个模态的证据可支撑另一模态的预测,并配有连接模型、科学工具、文献与湿实验的交互式 harness。
Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
快手可灵正式发布 Kling 4.0 大版本更新,10 月正式上线,高性价比的 Kling 4.0 Flash 已于 9 月 28 日开放小范围体验。新版本支持 10-bit HDR、30 秒长镜头与最多 15 项参考素材,主打真实、可控、专业。早期体验创作者已用它制作完整音乐视频,唇形同步成为最大亮点,可通过黑帧渲染音轨与静帧合成实现口型对齐。
IQuest 研究团队发布并开源 IQuest-Q1,这是总参数 320B 的 MoE 模型,每 token 仅激活 15B,256 个专家中每次激活 8 个,上下文长度达 524,288。
作者基于 Unsloth 做微调合并,发布名为 Gmcoder 的 9B 开源编码模型,已在 Hugging Face 上线。据称该模型在 HumanEval+ Mini 上超过 Ornith 1.5 和 Oxcoder,且不靠「过度思考」取胜,回答问题时 token 消耗比对手少 40–68%。这属于个人开发者的开源微调实战成果。
ornith-ai 在 Hugging Face 发布三个 DFlash 草稿模型检查点,为 Ornith-1.5-9B、Ornith-1.5-397B 和 Ornith-1.5-35B-A3B 提供投机解码加速。DFlash 草稿模型并非独立语言模型,须与目标模型在支持 DFlash 的推理环境中配合运行,仓库同时附带 serving 配置。
博主 FinanceYF5 分享一段号称 100% 由 AI 生成的视频,只用一条提示词、全程无剪辑,真实感已难分辨真假,展示 Kling 4.0 在视频生成上的写实能力。类似演示此前由 @minchoi 首发并引发关注。
Kling 4.0 仅凭一条提示词、全程无剪辑生成 100% 由 AI 生成的视频,其真实感被认为已难分辨真假。该演示来自 @minchoi,由博主 FinanceYF5 转引,为同一演示的转发版本。
长期爆料 OpenAI 动向的账号 markk 称,目前流传的三个 OpenAI 新模型命名候选为 Dots、Orbit 和 o。该爆料未附更多细节,信息未经官方证实,真实性待观察。
Reddit 用户观察到 Claude Opus 5.5 与 Sonnet 5.5 表现均超过 OpenAI 的 Sol 和 Astra,认为这让明日 OpenAI Dev Day 的看点更足。
9月29日有博主实测称 Anthropic 的 Sonnet 5.5 已对其开放,暗示新模型或处于灰度测试或提前开放阶段,该消息未经官方证实。另有 Reddit 帖子称 Sonnet 5.5 在 OpenAI Dev Day 前一天发布,性能已逼近 Opus 5.5,且两款新模型表现均优于 Sol 和 Astra。
X 用户 Sauers 发布一组号称来自 Opus 5.5、关于注意力机制(attention)的图表,并附有外部链接,该消息未经 Anthropic 官方证实,真实性待考,图表具体内容需点开原帖查看。同期同频道还流传 Opus 5.5 与 Sonnet 5.5 双双压制对手、OpenAI Dev Day 明日 20+ 发布迎战等说法。
H Company 发布面向 computer-use 任务的 Qwen3.8-27B 后训练版本 Holo4-27B。有博主用 Godot 自制吃豆人游戏实测,同一任务下 Holo4-27B 仅 68 次 agent 调用、消耗 240 万 token,原版 Qwen3.8-27B 为 197 次调用、1140 万 token,token 少约 79%、调用次数少 65%。
Anthropic 发布 Claude Sonnet 5.5,称其为家族中能力最强的中端模型,输出速度比上一代提升超过 30%。该模型定价与 Sonnet 5 相同,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 20 美分,公司称完成同样工作所需 token 更少,因此成本低 30%。
Claude Opus 5.5 以 88.4% 领跑 SimpleBench,推理强度提到 xhigh 时 Terminal-Bench-Science 由 24% 升至 62%,但 max 反降到 59%。它被评为 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。Opus 5.5 与 GPT-6 Astra 还能纯用代码生成视频动画。
OpenAI 官方暗示「做好准备」,预告即将迎来 20 多项发布,而 Astra 项目刚刚被搁置。这一发布潮与项目被砍的反差成为讨论焦点,内容由 Reddit 用户 josh3com 发布。
Anthropic 发布 Claude Sonnet 5.5,速度较上一代提升 30%,智能体编码表现反超 Opus 5.5,并计划几周内推出 Haiku 新版本。智谱 ZCode 已删除涉事云端数据,赠送多张重置卡和 1 亿 Token,开源版更新至 3.14.3。鸿蒙智行智界 RX 以 25.98 万元起上市,荣耀 Magic9 系列 4499 元起发布。
Anthropic 发布 Claude 5.5 家族第二个模型 Claude Sonnet 5.5,输出生成速度提升超过 30%,每任务成本最多降低 30%,并在多项基准上接近 Opus 5.5。
推荐理由:文中给出 Sonnet 5.5 与 Opus 5.5、GPT-6 Sol 的跑分和 token 单价对照,可比较同档模型的成本差异。
Basis 用 GPT-6 Astra 完成了一份 50-tab 税务工作簿,速度达到 GPT-5.6 Sol 的两倍。GPT-6 Astra 对用户意图的理解更强,这让 Basis 在真实业务场景中使用它更有信心。