跳到正文
原文
AGI Hunt· yoavgo·· 4 小时前AI 评分38

COLM 2026 MameLoshnLM 研究:嘈杂翻译淹没母语文本致 LLM 失真

训练数据就是语言的「军队」:嘈杂翻译淹没母语文本致 LLM 失真

AI 导读

UrikaUri 在 COLM 2026 发布 MameLoshnLM 相关研究,借意第绪谚语「语言是有军队的方言」指出多语言 LM 的训练数据就是那支军队。当母语文本被大量嘈杂翻译文本淹没时,模型看似流利,却丢失该语言独有的特质。Yoav Goldberg(yoavgo)转发了这一研究。

来源:AGI Hunt · agihunt.info