arXiv cs.CL· Yasas Ekanayaka, Deshan Sumanathilaka·· 4 小时前AI 评分24
面向僧伽罗语 Sandhi 切分的字符级神经方法
A Character-Level Neural Approach to Sinhala Sandhi Splitting
AI 导读
基于 SandhiLex 的字符级序列到序列研究为僧伽罗语 Sandhi 切分建立实证基线,最佳模型(双向 LSTM 编码器 + 单向 LSTM 解码器)在词汇化、派生与词源性难子集上仅达 68.40% 完全匹配准确率,词缀型子集则为 94.00%。消融显示双向编码对性能贡献最大,原生僧伽罗语 Unicode 输入优于罗马化输入。
来源:arXiv cs.CL · arxiv.org