跳到正文

全部动态

今日 24 条
9月29日周二
  1. AGI Hunt37

    「Bad Apple」极限测试:GPT-6 Astra 与 Opus 5.5 接力协作才补上各自短板

    Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。

  2. IT之家31

    IT早报 0929:央视起底快应用弹窗广告乱象;25.98 万元起鸿蒙智行智界 RX 上市;4499 元起荣耀 Magic9 系列发布;智谱 ZCode 已删除涉事云端数据

    Anthropic 发布 Claude Sonnet 5.5,速度较上一代提升 30%,智能体编码表现反超 Opus 5.5,并计划几周内推出 Haiku 新版本。智谱 ZCode 已删除涉事云端数据,赠送多张重置卡和 1 亿 Token,开源版更新至 3.14.3。鸿蒙智行智界 RX 以 25.98 万元起上市,荣耀 Magic9 系列 4499 元起发布。

  3. IT之家76

    OpenAI 取消发布 GPT-6.1 Astra,内部对齐测试未达标准

    据《华尔街日报》报道,由于内部测试中研究人员提出多项安全隐患,OpenAI 决定取消 GPT-6.1 Astra 的发布,该模型原计划 10 月亮相并部署于 ChatGPT 和 Codex,设计目标是无需人类协助即可处理更复杂的任务。

    推荐理由:OpenAI 因内部对齐测试未达标准取消 GPT-6.1 Astra 发布,读者可据此了解前沿模型上线前的安全审查环节。

9月28日周一
9月24日周四
9月23日周三
  1. Ars Technica · AI67

    Anthropic 发布 Opus 5.5,OpenAI 发布 GPT-6 Sol 与 Luna

    Anthropic 与 OpenAI 相继发布新模型,都主打能力小幅提升而成本明显下降。Anthropic 称 Opus 5.5 在默认设置下处理典型任务比 Opus 5 省约 40%,原因是 token 单价下降且完成任务耗用的 token 更少,并在网络安全、生物学等高风险领域沿用 Fable 5.1 的保护措施,被标记的请求可能被自动、透明地转给旧模型。

  2. AWS Machine Learning Blog67

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。

    推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。

  3. OpenAI:官网动态64

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,称它们把前沿智能带入日常工作,区别在于能力与成本的不同平衡。

    推荐理由:OpenAI 一次发布两款模型并给出能力与成本的不同取舍,读者可据此比较它们在日常工作场景中的定位。

9月22日周二
  1. Latent Space81

    小米发布 MiMo-V2.6 系列开放权重模型,旗舰 Pro 为 1T-A42B、训练成本 300 万美元

    小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。

    推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。

9月16日周三
9月12日周六
9月10日周四
  1. OpenAI:官网动态68

    OpenAI 在 API 中上线 GPT-Live-1,支持全双工语音对话

    OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。

    推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。

9月9日周三
  1. OpenAI:官网动态63

    OpenAI 发布 GPT-6 Astra,面向企业场景的最强模型

    OpenAI 发布 GPT-6 Astra,称其为企业场景下能力最强的模型,具备进阶推理、computer use 以及更强的写作与设计判断能力。官方目前只给出能力方向,未披露评测数据、定价与开放时间。

    推荐理由:官方给出 GPT-6 Astra 面向企业场景的定位与能力方向,可作为观察工作型模型演进的一手参考。

9月4日周五
  1. Google AI:DEV 作者专属28

    深度解析:Google Gemini 3.8 模型及其技术能力

    Google Gemini 3.8 模型强化了推理与自然语言理解能力,可实时处理数据并提供即时反馈,适用于客户支持自动化、金融数据分析与医疗诊断等场景。对哥伦比亚、西班牙及 LATAM 的企业而言,采用时需权衡成本效率、部署速度与文化适配。Norvik Tech 建议先确定具体用例并开展试点项目,衡量效果后再推进集成。