← 返回信息流

精选Apple Machine Learning Research论文

GRPO超越英语:非英语和多语言环境下GRPO的大规模研究

machinelearning.apple.com论文AI评分:70/100

该研究针对当前强化学习(RLVR)研究以英语为中心的问题,对多种基础模型、训练语言和推理语言奖励进行了大规模多语言GRPO实证研究。发现用母语训练推理与英语训练差距很小,且存在跨语言迁移,但特定趋势高度依赖模型和语言,有时会导致其他语言能力严重退化。因此,非英语RLVR可带来广泛跨语言收益,但需广泛评估以检测语言特定退化。

GRPO Beyond English:非英语和多语言环境下的GRPO大规模研究

基于可验证奖励的强化学习(RLVR),通常通过组相对策略优化(GRPO)进行优化,已成为提升预训练语言模型推理能力的核心方法,但现有研究仍高度以英语为中心。我们针对多语言和非英语GRPO开展了一项大规模实证研究,覆盖了广泛的基座模型、训练语言以及不同的推理语言奖励设置。我们发现,使用母语进行推理训练与使用英语进行推理训练相比,性能差距通常很小。我们进一步观察到强烈的跨语言迁移效应:用一种语言训练往往能提升其他多种语言的表现。然而,具体趋势高度依赖于模型和语言。在某些情况下,用特定语言训练会导致其他语言上领域外能力的严重退化。我们的分析表明,超越英语的RLVR能够带来广泛的跨语言收益,但也需要广泛的评估来检测特定语言上的性能退化。

  • † Hasso Plattner Institute & ELLIS Unit Potsdam
  • ** 在Apple期间完成的工作

相关阅读与更新。

面向异构偏好对齐的个性化组相对策略优化

尽管大型语言模型(LLM)具备复杂的一般性能力,它们往往难以与多样化的个体偏好对齐,因为标准的后训练方法(如基于人类反馈的强化学习,RLHF)优化的是单一的全局目标。虽然组相对策略优化(GRPO)是一种广泛采用的在策略强化学习框架,其基于组的归一化隐式假设所有……

大型语言模型是否带有英语口音?评估与改进多语言LLM的自然度

Bottom banner
Bottom banner

当前的大型语言模型(LLM)主要以英语作为首要语言进行设计,即便是少数多语言模型也往往表现出强烈的英语中心偏见。就像说话者学习第二语言时可能产生别扭的表达一样,LLM在非英语语言中常常生成不自然的输出,在词汇和语法两方面都反映出英语中心的模式。尽管这一问题的重要性不言而喻,……

探索机器学习领域的机遇。

我们的机器学习研究每天都在取得新的突破。

阅读原文