跳到正文
原文
arXiv cs.CL· Hikaru Asano, Yotaro Kubo, So Kuroki·· 2 天前AI 评分31

免训练发音转写:用文本约束的声学重打分

Training-Free Pronunciation Transcription via Text-Constrained Acoustic Rescoring

AI 导读

免训练 ST2P 流程在推理时同时利用词汇与声学信息,将日语发音转写的 CER 从 0.60–1.40%(纯文本基线)降至 0.04–0.17%。它先用 G2P 工具生成文本约束候选,再由冻结的 S2P 模型以整序列负对数似然做从左到右贪心搜索,速度比 beam search 快 3–3.5×,级联解码比直接解码快 2×。

来源:arXiv cs.CL · arxiv.org