← 返回信息流

精选Apple Machine Learning Research论文

数据约束下的多语言知识迁移:通过词汇干预实现

machinelearning.apple.com论文AI评分:70/100

本文提出LINK方法,在预训练阶段对高资源语言(英语)数据进行词汇级替换,利用双语词典将随机词替换为低资源语言的翻译,以提升低资源语言的知识迁移效果。该方法无需额外训练或翻译系统,仅需近零成本的双语词典。在8种语言、5种模型规模上验证,下游任务性能显著提升,达到同等性能的训练速度最高可提升2倍。

跨语言知识迁移对于为训练数据不足的语言构建高性能多语言语言模型至关重要。当目标语言数据稀缺时,许多涉及科学推理、常识推断和世界知识的下游任务所需的知识必须主要从高资源语言中获取,因此有效的知识迁移至关重要。现有的改进此类跨语言知识迁移的方法需要大量平行语料、翻译系统、辅助模型或额外的训练阶段,而这些对于许多语言而言在很大程度上是不可获得的。我们提出LINK——一种数据层面的干预方法,通过在预训练数据的高资源部分使用双语词汇表进行词汇替换,从而在模型预训练期间改进知识迁移。对于给定的替换比例,高资源(英语)训练语料的一部分中随机选择的单词将被替换为其词级翻译,这不需要额外的模型训练,仅需一个双语词汇表,而该词汇表几乎可以以零成本为任何语言获取。在五种模型规模、八种语言上的评估显示,目标语言下游任务有显著改进,在达到同等性能时训练速度最高可提升2倍。

  • 共同第一作者

相关阅读与更新。

跨语言知识迁移与迭代伪标注在低资源语音识别中的 transducer 应用

语音技术近年来已变得无处不在。然而,不同语言的准确性及由此带来的体验差异显著,这使得该技术并非同样包容。不同语言数据的可用性是影响准确性的关键因素之一,尤其是在训练全神经端到端自动语音识别系统时。

你所知晓的语言会影响你所学习的语言:语言特征对多语言文本到文本迁移的影响

多语言语言模型(LM),如mBERT、XLM-R、mT5、mBART,通过从高资源语言的跨语言迁移,在支持低资源语言的自然语言任务方面取得了显著成功。在这项工作中,我们试图更好地理解此类模型(特别是mT5)如何在语言间迁移语言学和语义知识,尽管在预训练期间并未提供显式的跨语言信号。相反,……

Bottom banner
Bottom banner

发现机器学习领域的机遇。

我们的机器学习研究每天都在取得新的突破。

阅读原文