arXiv:cs.CL(计算语言学,全量分类)· Yasas Ekanayaka, Deshan Sumanathilaka·· 1 天前AI 评分24
僧伽罗语 Sandhi 切分的字符级神经方法研究
A Character-Level Neural Approach to Sinhala Sandhi Splitting
AI 导读
研究基于 SandhiLex 提出字符级序列到序列方法,用原生僧伽罗语 Unicode 输入评测循环编码器-解码器模型。最佳模型为双向 LSTM 编码器加单向 LSTM 解码器,在词汇化、派生和词源性 Sandhi 难子集上仅达 68.40% 精确匹配准确率(字符级 82.08%),远低于规则化词缀子集的 94.00%。消融显示双向编码贡献最大,原生僧伽罗文字优于罗马化输入。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org