数据约束下混合预训练的缩放定律
本文研究了在目标数据稀缺时,如何将目标数据与通用数据混合进行预训练。通过超过2000次语言模型训练实验,发现重复使用目标数据15-20次仍可提升性能,并提出了考虑重复效应的混合缩放定律,为数据受限下的预训练提供了实用的混合配置建议。

本文研究了在目标数据稀缺时,如何将目标数据与通用数据混合进行预训练。通过超过2000次语言模型训练实验,发现重复使用目标数据15-20次仍可提升性能,并提出了考虑重复效应的混合缩放定律,为数据受限下的预训练提供了实用的混合配置建议。

本文提出LINK方法,在预训练阶段对高资源语言(英语)数据进行词汇级替换,利用双语词典将随机词替换为低资源语言的翻译,以提升低资源语言的知识迁移效果。该方法无需额外训练或翻译系统,仅需近零成本的双语词典。在8种语言、5种模型规模上验证,下游任务性能显著提升,达到同等性能的训练速度最高可提升2倍。

该研究对LLM的类人行为进行了多维分析,涵盖思维情感表达、关系建立、拒绝请求等。通过LLM-as-a-judge和人工评估,分析了21,000次多轮对话(涉及GPT-4o、GPT-4.1-mini、Claude-Sonnet-4.6、Gemini-2.5-flash),发现类人行为普遍存在但随模型和用户因素变化。人工评估显示,自我参照和关系建立行为在LLM中比人类更不合适,而边界维护行为则更合适。系统提示可控制这些行为,但需谨慎评估以避免意外效果。研究为负责任的LLM设计提供了建议。

本文研究了在倒排索引上执行复杂布尔查询的理论极限。作者形式化了一种基于DAG的检索语言L_R,并证明其评估问题是P完全的。为解决该问题,他们提出了ComputePN算法,通过正负对偶表示和DAG记忆化,将评估时间严格限制在O(|Q|·|U_active|),避免了指数级展开和全量扫描的开销,为计算检索奠定了理论基础。

该研究探讨了智能体记忆的最佳剂量问题,发现不同能力的模型对记忆量的需求不同。强模型适合完整指南集,弱模型适合精选检索,饱和模型则无提升。实验表明,精选检索在准确性和成本上均优,如gpt-oss-120b在任务完成率上提升16.1个百分点,而token开销仅增加5%。

该研究针对当前强化学习(RLVR)研究以英语为中心的问题,对多种基础模型、训练语言和推理语言奖励进行了大规模多语言GRPO实证研究。发现用母语训练推理与英语训练差距很小,且存在跨语言迁移,但特定趋势高度依赖模型和语言,有时会导致其他语言能力严重退化。因此,非英语RLVR可带来广泛跨语言收益,但需广泛评估以检测语言特定退化。
