← 返回信息流

精选Apple Machine Learning Research论文

语言辨别能力提升多语言语音模型的语言学习效果

machinelearning.apple.com论文AI评分:70/100

研究指出,在多语言自监督语音模型中,尽管跨语言信息共享有益,但在同等预训练数据预算下仍不及单语模型。通过在预训练阶段强化模型的语言辨别能力,不仅缩小了多语言模型在连续音素和高层级语言学指标上的差距,还保留了显著的跨语言共享优势。该结论基于对HuBERT模型的受控实验得出。

多语言自监督语音模型可以通过跨语言共享信息获益,但在总预训练数据预算相同的情况下,它们的表现仍不及单语言模型。我们表明,在预训练期间增强模型的语言辨别能力可以减少甚至在某些指标上消除这种多语言差距(体现在连续音素和更高层级的语言学测量中),同时保持大量的跨语言共享特性。在一个受控的英语/法语 HuBERT 设置中,我们测试了两种增强语言辨别能力的干预措施:一个辅助语言分类器和基于每种语言的 k-means 目标。在所有干预措施中,连续特征音素辨别错误率(phone-ABX,↓)从双语基线的 11.6% 降低到 10.4%(单语言模型:10.8%),词汇性能(sWUGGY,↑)从 52.1% 增加到 56.7%(单语言模型:58.5%),韵律性能(ProsAudit,词汇子任务,↑)从 68.9% 增加到 72.9%(单语言模型:72.6%)。在 HuBERT 训练的各个阶段,大多数语言学指标上的最大增益出现在第一次迭代时引入语言辨别的情况,而较晚或重复的干预带来的改进较小,并伴随着语言间隔离程度的增加。这些结果支持语言辨别在减少多语言学习额外成本方面的因果作用。

  • * 共同一作

相关阅读与更新。

利用视听数据减少自监督语音模型中的多语言差距

自监督学习(SSL)在语音表示学习方面取得了显著进展。wav2vec 2.0 和 HuBERT 等模型在语音识别等任务中取得了最先进的成果,尤其是在单语言设置下。然而,多语言 SSL 模型在每种单独语言上的表现往往不如它们的单语言对应模型,特别是在像双语设置这样语言数量较少的多语言场景中。在…

通过最小对 ABX 任务在多语言模型中区分形式与意义

我们引入了一套无需训练的 ABX 风格辨别任务,以评估多语言语言模型如何表征语言身份(形式)和语义内容(意义)。受语音处理启发,这些零样本任务衡量是否能在表示中可靠地检测到最小差异。这提供了一种灵活且可解释的探测替代方案。应用于 XLM-R (Conneau et al, 2020) 在各个预训练检查点…

Bottom banner
Bottom banner

发现机器学习中的机遇。

我们的机器学习研究每天都在开辟新领域。

阅读原文