← 返回信息流

热点精选Apple Machine Learning Research论文

数据约束下混合预训练的缩放定律

machinelearning.apple.com论文AI评分:90/100

本文研究了在目标数据稀缺时,如何将目标数据与通用数据混合进行预训练。通过超过2000次语言模型训练实验,发现重复使用目标数据15-20次仍可提升性能,并提出了考虑重复效应的混合缩放定律,为数据受限下的预训练提供了实用的混合配置建议。

随着语言模型规模的扩大,其所需的数据量也随之增长——然而许多目标数据源,例如低资源语言或专业领域,其规模本身就十分有限。一种常见的策略是将这些稀缺但宝贵的目标数据与丰富多样的通用数据混合使用,这带来一个根本性的权衡:混合数据中目标数据过少会导致模型对目标领域的暴露不足,而目标数据过多则会过度重复相同的样本,导致收益递减并最终过拟合。我们通过超过2000次语言模型训练实验来研究这一权衡,这些实验涵盖了多种模型规模和目标数据集大小,以及多种数据类型,包括多语言、领域特定和质量过滤的混合数据。在所有设置中,我们发现重复是目标领域性能的核心驱动因素,并且混合训练对重复的容忍度远高于单一数据源训练:稀缺的目标语料库可以被重复使用15至20次,最佳重复次数取决于目标数据规模、计算预算和模型规模。接下来,我们提出了一种考虑重复效应的混合缩放定律,该定律考虑了重复目标词元价值的递减以及通用数据的正则化作用。对缩放定律进行优化提供了一种计算有效混合配置的原则性方法,从而为数据约束下的预训练提供实用的混合建议。

相关阅读与更新。

最优数据混合的缩放定律

大型基础模型通常在来自多个领域的数据上进行训练,其中数据混合——即每个领域所占的比例——对模型性能起着关键作用。选择这种混合的标准方法依赖于反复试验,这对于大规模预训练来说变得不切实际。我们提出了一种系统方法,利用缩放定律为任何目标领域确定最优数据混合。我们的方法……

预训练数据注入下微调过程中的遗忘缩放定律

获得在目标领域表现良好的语言模型的一种普遍策略是,通过在该领域的数据上进行无监督下一词元预测训练来对其进行微调。微调面临两个挑战:i) 如果目标数据量有限(这是大多数实际应用中的情况),模型会迅速过拟合;ii) 模型会偏离原始模型并遗忘预训练……

Bottom banner
Bottom banner

探索机器学习领域的机遇。

我们的机器学习研究每天都在取得新的突破。

阅读原文