AI News HubLIVE
站内改写1 分钟阅读

SpeakPay:利用LoRA微调Whisper实现低资源尼泊尔语金融语音识别的领域自适应

尼泊尔的移动支付应用以图形界面为主,对视障用户极不友好。SpeakPay是一个语音优先的数字钱包,通过NepFinSpeech-403数据集(403条尼泊尔语金融语音命令,覆盖237个数字)对Whisper large-v2进行LoRA微调。领域自适应将词错误率从129.95%降至42.58%(相对降低67.2%),天城文数字识别准确率从0.0%提升至73.9%,交易成功率从1.67%提升至33.33%(约20倍提升)。项目全部开源在GitHub上。

来源arXiv Computational Linguistics作者: Biraj Subedi

在尼泊尔,移动支付应用普遍依赖图形化界面,这使视障用户几乎无法独立使用。针对这一可访问性痛点,研究者Biraj Subedi提出了SpeakPay——一个语音优先的数字钱包,并在2026年9月1日提交的arXiv论文中展示了其核心技术:面向低资源尼泊尔语金融语音识别的领域自适应研究。

为支持这项研究,团队构建了NepFinSpeech-403数据集,其中包含403条尼泊尔语金融语音命令,覆盖发送(send)、充值(load)和余额查询(balance)三类常用操作,共涉及237个不同的数字表达。研究者选择Whisper large-v2作为基础模型,并采用LoRA(低秩适配)进行高效微调。在留出测试集上,领域自适应的模型将零样本基线的词错误率(WER)从129.95%降至42.58%,相对降幅达67.2%;天城文数字符号的识别准确率也从0.0%跃升至73.9%。结果表明,任务层面的收益比词级指标所显示的更为显著:领域自适应将交易成功率从1.67%提升到33.33%,约20倍的改善,在个体语音命令层面(符号检验p<10⁻¹⁷)和所有指令类型上均保持一致。

数据效率分析还揭示了一个实用规律:仅需约100条领域特定语音即可将零样本WER减半,而性能大约在300条样本时趋于平台期。这意味着在实际部署中,开发者不一定需要海量数据,少量高质量领域语料就能带来显著提升。与此同时,错误分析显示,模型仍存在系统的数字混淆问题,尤其是零的插入/删除和前缀幻觉,这构成了剩余交易失败的主要来源。

SpeakPay系统本身已作为公开可访问的语音优先Web应用部署,用户无需依赖图形界面即可完成常见的移动支付操作。论文作者也已在GitHub上公开了全部代码、数据集、模型权重以及论文原文,项目地址为https://github.com/subedibiraj/speakpay。这项工作不仅为尼泊尔语金融语音助手提供了可行的技术路径,也为其他低资源语言的领域自适应语音识别提供了参考。