跳到正文
热点事件持续更新

实测 TypeSafe 分类模型 Jev 校准不佳

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,AGI Hunt 报道,Dylan Black 对 TypeSafe 新发布的 System One 分类模型 Jev 做了一次系统校准检验:用已知答案的问题来测试模型给出的概率分布是否可靠,结论是 Jev 的概率分布校准不佳。报道称,Jev 的实现方式是在预训练 transformer 末端接一个分类头,输入上下文加多选题即可输出带类型的结果及概率分布。整套校准实验的成本不到 4 美元。目前公开信息仅有这一轮实测结果,未涉及 TypeSafe 方面的回应或后续修正。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    实测 TypeSafe 分类模型 Jev:整套校准实验成本不到 4 美元

    Dylan Black 实测 TypeSafe 新发布的 System One 分类模型 Jev,用已知答案问题做系统校准检验,结论是 Jev 概率分布校准不佳。Jev 在预训练 transformer 末端接分类头,输入上下文加多选题即可输出带类型的结果和概率分布,整套实验花费不到 4 美元。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。