SHELL PULSE

8月20日 · 星期四2

  1. 热点精选Apple Machine Learning Research论文AI评分:90/100

    数据约束下混合预训练的缩放定律

    本文研究了在目标数据稀缺时,如何将目标数据与通用数据混合进行预训练。通过超过2000次语言模型训练实验,发现重复使用目标数据15-20次仍可提升性能,并提出了考虑重复效应的混合缩放定律,为数据受限下的预训练提供了实用的混合配置建议。

    Bottom banner
    machinelearning.apple.com论文原文
  2. 精选Apple Machine Learning Research论文AI评分:70/100

    数据约束下的多语言知识迁移:通过词汇干预实现

    本文提出LINK方法,在预训练阶段对高资源语言(英语)数据进行词汇级替换,利用双语词典将随机词替换为低资源语言的翻译,以提升低资源语言的知识迁移效果。该方法无需额外训练或翻译系统,仅需近零成本的双语词典。在8种语言、5种模型规模上验证,下游任务性能显著提升,达到同等性能的训练速度最高可提升2倍。

    Bottom banner
    machinelearning.apple.com论文原文

8月19日 · 星期三4

  1. 精选智东西by ZeR0 · 论文AI评分:70/100

    美图提出BridgeRemoval,让视频消除不再穿帮

    美图影像研究院提出BridgeRemoval框架,首次将视频目标移除定义为视频到视频的翻译任务,采用随机桥模型直接从源视频先验生成目标,避免扩散模型丢弃结构先验的问题。该方法在DAVIS和BridgeRemoval-Bench数据集上取得最优PSNR,并已落地于美图秀秀、Wink和开拍APP。论文被ICML 2026录用。

    zhidx.com论文产品原文
  2. 精选Apple Machine Learning Research论文AI评分:70/100

    审视大语言模型中的类人行为:模型行为、用户因素与系统提示的多维分析

    该研究对LLM的类人行为进行了多维分析,涵盖思维情感表达、关系建立、拒绝请求等。通过LLM-as-a-judge和人工评估,分析了21,000次多轮对话(涉及GPT-4o、GPT-4.1-mini、Claude-Sonnet-4.6、Gemini-2.5-flash),发现类人行为普遍存在但随模型和用户因素变化。人工评估显示,自我参照和关系建立行为在LLM中比人类更不合适,而边界维护行为则更合适。系统提示可控制这些行为,但需谨慎评估以避免意外效果。研究为负责任的LLM设计提供了建议。

    Bottom banner
    machinelearning.apple.com论文原文
  3. 精选Apple Machine Learning Research论文AI评分:70/100

    倒排索引遍历的P完全性:布尔查询DAG评估的复杂性

    本文研究了在倒排索引上执行复杂布尔查询的理论极限。作者形式化了一种基于DAG的检索语言L_R,并证明其评估问题是P完全的。为解决该问题,他们提出了ComputePN算法,通过正负对偶表示和DAG记忆化,将评估时间严格限制在O(|Q|·|U_active|),避免了指数级展开和全量扫描的开销,为计算检索奠定了理论基础。

    Bottom banner
    machinelearning.apple.com论文原文
  4. 精选Hugging Face Blog论文AI评分:70/100

    你的智能体到底需要多少记忆?

    该研究探讨了智能体记忆的最佳剂量问题,发现不同能力的模型对记忆量的需求不同。强模型适合完整指南集,弱模型适合精选检索,饱和模型则无提升。实验表明,精选检索在准确性和成本上均优,如gpt-oss-120b在任务完成率上提升16.1个百分点,而token开销仅增加5%。

    image
    huggingface.co论文模型原文

8月18日 · 星期二2

  1. 精选智东西by 陈 骏达 · 论文AI评分:70/100

    人大高瓴、IQuest团队提出ClawGym II:将OpenClaw、Claude Code接入黑盒强化学习

    中国人民大学高瓴人工智能学院与至知创新研究院团队提出ClawGym II,一个面向复杂Agent Harness的黑盒强化学习框架。该框架无需修改Claude Code、OpenClaw等Harness内部实现,即可让模型通过真实执行过程进行强化学习,并支持多个异构Harness联合训练同一策略模型。实验表明,黑盒RL能稳定提升模型Agent能力,且共享策略模型可同时从多个Harness中学习。

    zhidx.com论文模型原文
  2. 精选Apple Machine Learning Research论文AI评分:70/100

    GRPO超越英语:非英语和多语言环境下GRPO的大规模研究

    该研究针对当前强化学习(RLVR)研究以英语为中心的问题,对多种基础模型、训练语言和推理语言奖励进行了大规模多语言GRPO实证研究。发现用母语训练推理与英语训练差距很小,且存在跨语言迁移,但特定趋势高度依赖模型和语言,有时会导致其他语言能力严重退化。因此,非英语RLVR可带来广泛跨语言收益,但需广泛评估以检测语言特定退化。

    Bottom banner
    machinelearning.apple.com论文原文