← 返回信息流

精选Apple Machine Learning Research论文

RISED: 用于智能体多环境选择与自蒸馏的评估标准

machinelearning.apple.com论文AI评分:90/100

该论文针对在多样化交互环境中联合训练单一LLM智能体的问题,提出了一种新的课程学习和数据选择策略。现有方法通常仅在环境层面分配训练或优先考虑局部奖励信号,忽略了跨环境当前回合之间的关系。RISED通过显式考虑这些关系来优化提示组选择,并解决不同环境学习速率差异导致的训练不平衡问题。

在多种交互式环境中联合训练单一大型语言模型(LLM)智能体,作为通向通用智能体的路径,正受到越来越多的关注。现有的课程学习和数据选择策略通常仅在环境层面分配训练资源,或优先考虑基于局部奖励的信号,而未明确考虑跨环境的当前轨迹(rollouts)之间的关系以进行提示组(prompt-group)的选择。同时,由于不同环境的学习速率各异,全失败和全成功的轨迹组可能共存于一个批次中,导致这些数据缺乏组内相对的奖励信号。这两个挑战凸显了仅依赖标量奖励在多环境强化学习中的局限性:它们提供的关于跨环境关系的信息有限,且在奖励相同时无法提供组内的奖励对比。这促使我们采用更丰富的文本反馈,例如描述轨迹行为的评分标准(rubrics),来指导学习。除了将评分标准用作奖励外,我们还将其重新用于指导在线数据选择和策略监督。LLM 裁判使用跨环境共享的预定义评分标准词汇表为每个轨迹打上标签。生成的画像(profiles)用于选择与混合环境批次的整体行为组成相符的数据,同时限制与已选数据的重叠。可用的正面评分标准(描述期望行为)为同策略自蒸馏教师提供了特权上下文,提供了额外的词元级监督;而负面评分标准(描述不期望行为)则引导后续的轨迹生成远离重复出现的失败模式。这些组件共同构成了 RISED。在各种模型骨干网络中,RISED 实现了跨环境的最高平均通过率,并在每个单独的环境中排名第一或第二。对 RISED 的基于评分标准的分析可以进一步表征伴随这些提升而发生的行为变化。

  • † 新加坡国立大学
  • ** 在苹果公司工作期间完成的工作

相关阅读与更新。

从偏好到原则:基于评分标准的地面知识答案对齐

为开放域问答设计有效的奖励信号具有挑战性,因为高质量的回答必须同时满足多个难以用整体标量目标捕捉的答案质量方面。我们引入了一种基于评分标准的奖励框架,该框架根据检索到的证据生成特定查询的评分标准,并将其分解为多个质量维度,从而在……期间提供细粒度的监督。

RubiCap:用于密集图像描述的评分标准引导强化学习

密集图像描述对于视觉-语言预训练和文生图任务中的跨模态对齐至关重要,但扩展专家级标注的成本高昂得令人望而却步。虽然通过强大的视觉-语言模型(VLMs)进行合成描述是一种实用的替代方案,但监督蒸馏往往产生有限的输出多样性和较弱的泛化能力。强化学习(RL)可以克服这些局限性,但其……

Bottom banner
Bottom banner

发现机器学习中的机遇。

我们的机器学习研究每天都在开辟新的领域。

阅读原文