arXiv cs.CL· Jing Chen, Giulia Loca, Simona Amenta, Marco Marelli·· 4 小时前AI 评分34
以伪词为探针:LLM 缺乏主导人类伪词处理的亚词级敏感性
Pseudowords as probes: Large Language Models show little of the sublexical sensitivity that governs human pseudoword processing
AI 导读
两项意大利语二选一伪词实验中,五个 LLM 与人类的一致性低于字符 n-gram 模型 fastText,仅在选项含真实词、提供词汇熟悉度线索时才更贴近人类。驱动人类与 fastText 一致的亚词余弦相似度线索未稳定迁移到人类-LLM 对齐,推理 token 消耗与人类处理难度也无一致关系。研究提示 LLM 未必共享主导人类伪词处理的亚词线索,tokenization 与训练数据覆盖是候选解释。
来源:arXiv cs.CL · arxiv.org