Unsloth 微调出 9B 开源编码模型 Gmcoder,token 消耗少 40–68%
作者基于 Unsloth 做微调合并,发布名为 Gmcoder 的 9B 开源编码模型,已在 Hugging Face 上线。据称该模型在 HumanEval+ Mini 上超过 Ornith 1.5 和 Oxcoder,且不靠「过度思考」取胜,回答问题时 token 消耗比对手少 40–68%。这属于个人开发者的开源微调实战成果。
作者基于 Unsloth 做微调合并,发布名为 Gmcoder 的 9B 开源编码模型,已在 Hugging Face 上线。据称该模型在 HumanEval+ Mini 上超过 Ornith 1.5 和 Oxcoder,且不靠「过度思考」取胜,回答问题时 token 消耗比对手少 40–68%。这属于个人开发者的开源微调实战成果。
ornith-ai 在 Hugging Face 发布三个 DFlash 草稿模型检查点,为 Ornith-1.5-9B、Ornith-1.5-397B 和 Ornith-1.5-35B-A3B 提供投机解码加速。DFlash 草稿模型并非独立语言模型,须与目标模型在支持 DFlash 的推理环境中配合运行,仓库同时附带 serving 配置。
物理学者 jwuphysics 测试了 Claude Sonnet 生成纯 JavaScript 动画的能力,并晒出生成结果,演示中模型直接生成不依赖库的 JS 动画,展示其在可视化与动画代码上的水平。帖子本身信息简短,实质内容集中在视频演示。
博主 FinanceYF5 分享一段号称 100% 由 AI 生成的视频,只用一条提示词、全程无剪辑,真实感已难分辨真假,展示 Kling 4.0 在视频生成上的写实能力。类似演示此前由 @minchoi 首发并引发关注。
Kling 4.0 仅凭一条提示词、全程无剪辑生成 100% 由 AI 生成的视频,其真实感被认为已难分辨真假。该演示来自 @minchoi,由博主 FinanceYF5 转引,为同一演示的转发版本。
Reddit 用户援引 Intelligence Index 数据称,Sonnet 5.5 单次输出 4.1 亿(410M)输出 token,是「最啰嗦」的模型,并附上评测数据截图。发帖者随后追问该模型是否仍值得使用、有没有人试用过,以及和 LunaMax 相比体验如何。
长期爆料 OpenAI 动向的账号 markk 称,目前流传的三个 OpenAI 新模型命名候选为 Dots、Orbit 和 o。该爆料未附更多细节,信息未经官方证实,真实性待观察。
Reddit 用户观察到 Claude Opus 5.5 与 Sonnet 5.5 表现均超过 OpenAI 的 Sol 和 Astra,认为这让明日 OpenAI Dev Day 的看点更足。
9月29日有博主实测称 Anthropic 的 Sonnet 5.5 已对其开放,暗示新模型或处于灰度测试或提前开放阶段,该消息未经官方证实。另有 Reddit 帖子称 Sonnet 5.5 在 OpenAI Dev Day 前一天发布,性能已逼近 Opus 5.5,且两款新模型表现均优于 Sol 和 Astra。
Together AI 宣布阿里 Qwen3.8-Flash 本月剩余时间全线 6 折,并建议开发者趁降价跑评测。该模型定位高并发应用场景,如编码助手与协同办公助手,主打在低成本下优化输出质量。
X 用户 Sauers 发布一组号称来自 Opus 5.5、关于注意力机制(attention)的图表,并附有外部链接,该消息未经 Anthropic 官方证实,真实性待考,图表具体内容需点开原帖查看。同期同频道还流传 Opus 5.5 与 Sonnet 5.5 双双压制对手、OpenAI Dev Day 明日 20+ 发布迎战等说法。
开发者 amaarora 实测大语言模型能否按其质量标准生成 AWS 架构图,初步结果显示 Opus 5.5 生成的架构图质量惊艳、表现「非常非常好」。实验同步开展人类评审与 LLM 评审的对齐工作,以保证评价结果可靠,目前已进入人机评审对齐阶段,后续结论仍待进一步验证。
Roboflow 发布长文评测称 GPT-6 Astra 是其测试过的最强视觉模型,在 Roboflow Vision Evals 目标检测任务上低推理档位即达 82.1% mAP@50,领先 Qwen3.8 Max 5.4 分、领先 GPT-5.6 Sol 13.7 分。
由 Meta Superintelligence Labs、斯坦福与哈佛推出的 ProgramBench 基准更新,agent 需依据编译后的二进制文件与文档从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
H Company 发布面向 computer-use 任务的 Qwen3.8-27B 后训练版本 Holo4-27B。有博主用 Godot 自制吃豆人游戏实测,同一任务下 Holo4-27B 仅 68 次 agent 调用、消耗 240 万 token,原版 Qwen3.8-27B 为 197 次调用、1140 万 token,token 少约 79%、调用次数少 65%。
Anthropic 发布 Claude Sonnet 5.5,称其为家族中能力最强的中端模型,输出速度比上一代提升超过 30%。该模型定价与 Sonnet 5 相同,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 20 美分,公司称完成同样工作所需 token 更少,因此成本低 30%。
Claude Opus 5.5 以 88.4% 领跑 SimpleBench,推理强度提到 xhigh 时 Terminal-Bench-Science 由 24% 升至 62%,但 max 反降到 59%。它被评为 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。Opus 5.5 与 GPT-6 Astra 还能纯用代码生成视频动画。
Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。
测评机构对 Sonnet 5.5 的写作表现做了量化测试,其平均阅读年级为 6.9,在所测模型中最易读。中等算力档中 Sonnet 5.5 为 7.12,低于 Opus 5.5 的 7.28、GPT-6 Sol 的 7.71 和 Luna 的 8.01,数值越低越易读。
ValsAI 让十个 Claude Sonnet 5.5 智能体使用 Lean 定理证明器,在 15 小时内证出球面上七个电子的最低能量排布(Thomson 问题,N=7)。它们产出 17,895 行形式化证明并被 Lean 内核接受,结论为五角双锥构型。
Anthropic 发布 Claude Sonnet 5.5,速度较上一代提升 30%,智能体编码表现反超 Opus 5.5,并计划几周内推出 Haiku 新版本。智谱 ZCode 已删除涉事云端数据,赠送多张重置卡和 1 亿 Token,开源版更新至 3.14.3。鸿蒙智行智界 RX 以 25.98 万元起上市,荣耀 Magic9 系列 4499 元起发布。
据《华尔街日报》报道,由于内部测试中研究人员提出多项安全隐患,OpenAI 决定取消 GPT-6.1 Astra 的发布,该模型原计划 10 月亮相并部署于 ChatGPT 和 Codex,设计目标是无需人类协助即可处理更复杂的任务。
推荐理由:OpenAI 因内部对齐测试未达标准取消 GPT-6.1 Astra 发布,读者可据此了解前沿模型上线前的安全审查环节。
Claude Opus 5.5 破折号使用量较 Opus 5 下降约 95%,每 1,000 个单词从 15.2 个降至 0.8 个,分号下降 73% 至 1.64 个。
Anthropic 发布 Claude 5.5 家族第二个模型 Claude Sonnet 5.5,输出生成速度提升超过 30%,每任务成本最多降低 30%,并在多项基准上接近 Opus 5.5。
推荐理由:文中给出 Sonnet 5.5 与 Opus 5.5、GPT-6 Sol 的跑分和 token 单价对照,可比较同档模型的成本差异。
Basis 用 GPT-6 Astra 完成了一份 50-tab 税务工作簿,速度达到 GPT-5.6 Sol 的两倍。GPT-6 Astra 对用户意图的理解更强,这让 Basis 在真实业务场景中使用它更有信心。
Simon Willison 发布 Gemini 3.8 TTS Playground,一个填自己的 Gemini API key 就能试听和调试 Google 语音合成接口的在线工具。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,Simon Willison 记录了自己对这些新模型的定价观察与实测表现。
推荐理由:文章给出 Claude Opus 5.5、GPT-6 Sol 与 Luna 的最新定价和实测表现,可以看清这轮模型降价对调用成本的直接影响。
Anthropic 与 OpenAI 相继发布新模型,都主打能力小幅提升而成本明显下降。Anthropic 称 Opus 5.5 在默认设置下处理典型任务比 Opus 5 省约 40%,原因是 token 单价下降且完成任务耗用的 token 更少,并在网络安全、生物学等高风险领域沿用 Fable 5.1 的保护措施,被标记的请求可能被自动、透明地转给旧模型。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。
推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,称它们把前沿智能带入日常工作,区别在于能力与成本的不同平衡。
推荐理由:OpenAI 一次发布两款模型并给出能力与成本的不同取舍,读者可据此比较它们在日常工作场景中的定位。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,这是 Claude 5.5 系列的首个模型。
推荐理由:文章对比了 Claude Opus 5.5 与 Opus 5 在 token 效率、定价和安全分类器上的差异,并给出在 Bedrock 上调用该模型的代码示例。
GPT-6 Astra 帮助 Parallel 的智能体将劳动力市场数据的调研与综合时间及成本各削减一半,对比对象为此前使用的模型。
小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。
推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。
TypeSafe AI 发布 Jev,一种被称作 System One(决策模型)的新形态 LLM,仍然接收文本输入,但输出的是对应类别、是非题答案、评分及置信度的浮点数。
推荐理由:通过对比 Jev 与常规 LLM 在输出形态和计价上的差异,可以判断决策模型适合落在哪些分类与排序任务上。
TypeSafe 发布 Jev,一款用 RLCD 训练、只做决策、分类、路由与打分的模型,宣称比小规模前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
NVIDIA CEO 黄仁勋在 Salesforce Dreamforce 与 Marc Benioff 同台,Salesforce 同期发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练构建。
GPT-6 Astra 提升了 Cognition 旗下 Devin 测试软件并证明其可正常工作的能力,目标是让工程师减少代码审查、交付更多代码。Devin 由此可自行完成测试并验证结果是否可用。
OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。
推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。
OpenAI 发布 GPT-6 Astra,称其为企业场景下能力最强的模型,具备进阶推理、computer use 以及更强的写作与设计判断能力。官方目前只给出能力方向,未披露评测数据、定价与开放时间。
推荐理由:官方给出 GPT-6 Astra 面向企业场景的定位与能力方向,可作为观察工作型模型演进的一手参考。
Google Gemini 3.8 模型强化了推理与自然语言理解能力,可实时处理数据并提供即时反馈,适用于客户支持自动化、金融数据分析与医疗诊断等场景。对哥伦比亚、西班牙及 LATAM 的企业而言,采用时需权衡成本效率、部署速度与文化适配。Norvik Tech 建议先确定具体用例并开展试点项目,衡量效果后再推进集成。