热点事件持续更新
Mercury Decide 韩语基准准确率仅 66.7%
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
2026年10月1日,AGI Hunt 发布第三方实测报道:Inception Labs 新发布的模型 Mercury Decide 在韩语场景下表现不佳。测试由开发者自行搭建的无污染韩语数据集 ReportJevBench 完成,任务设定为判定 Roblox 聊天举报是否违反平台 ToS,结果显示该模型准确率仅为 66.7%。报道未给出同一任务下其他模型的对比数据,也未说明测试样本量、评分口径与错误类型分布。截至该报道,这是关于 Mercury Decide 韩语能力的第三方实测结果,事件仍停留在单一测评结论阶段,尚无 Inception Labs 方面的回应或第三方复现结果。
AI 根据报道生成 · 40 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt第三方实测 Mercury Decide:韩国语数据集上准确率仅 66.7%
开发者用自建无污染韩语数据集 ReportJevBench 实测 Inception Labs 新发布的 Mercury Decide,判定 Roblox 聊天举报是否违反 ToS,其准确率仅 66.7%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。