跳到正文
热点事件持续更新

Mercury Decide 韩语基准准确率仅 66.7%

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月1日,AGI Hunt 发布第三方实测报道:Inception Labs 新发布的模型 Mercury Decide 在韩语场景下表现不佳。测试由开发者自行搭建的无污染韩语数据集 ReportJevBench 完成,任务设定为判定 Roblox 聊天举报是否违反平台 ToS,结果显示该模型准确率仅为 66.7%。报道未给出同一任务下其他模型的对比数据,也未说明测试样本量、评分口径与错误类型分布。截至该报道,这是关于 Mercury Decide 韩语能力的第三方实测结果,事件仍停留在单一测评结论阶段,尚无 Inception Labs 方面的回应或第三方复现结果。

AI 根据报道生成 · 40 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    第三方实测 Mercury Decide:韩国语数据集上准确率仅 66.7%

    开发者用自建无污染韩语数据集 ReportJevBench 实测 Inception Labs 新发布的 Mercury Decide,判定 Roblox 聊天举报是否违反 ToS,其准确率仅 66.7%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。