热点精选
Apple Machine Learning Research论文AI评分:90/100
数据约束下混合预训练的缩放定律
本文研究了在目标数据稀缺时,如何将目标数据与通用数据混合进行预训练。通过超过2000次语言模型训练实验,发现重复使用目标数据15-20次仍可提升性能,并提出了考虑重复效应的混合缩放定律,为数据受限下的预训练提供了实用的混合配置建议。

本文研究了在目标数据稀缺时,如何将目标数据与通用数据混合进行预训练。通过超过2000次语言模型训练实验,发现重复使用目标数据15-20次仍可提升性能,并提出了考虑重复效应的混合缩放定律,为数据受限下的预训练提供了实用的混合配置建议。

本文提出LINK方法,在预训练阶段对高资源语言(英语)数据进行词汇级替换,利用双语词典将随机词替换为低资源语言的翻译,以提升低资源语言的知识迁移效果。该方法无需额外训练或翻译系统,仅需近零成本的双语词典。在8种语言、5种模型规模上验证,下游任务性能显著提升,达到同等性能的训练速度最高可提升2倍。
