精选Apple Machine Learning Research论文
审视大语言模型中的类人行为:模型行为、用户因素与系统提示的多维分析
该研究对LLM的类人行为进行了多维分析,涵盖思维情感表达、关系建立、拒绝请求等。通过LLM-as-a-judge和人工评估,分析了21,000次多轮对话(涉及GPT-4o、GPT-4.1-mini、Claude-Sonnet-4.6、Gemini-2.5-flash),发现类人行为普遍存在但随模型和用户因素变化。人工评估显示,自我参照和关系建立行为在LLM中比人类更不合适,而边界维护行为则更合适。系统提示可控制这些行为,但需谨慎评估以避免意外效果。研究为负责任的LLM设计提供了建议。
大语言模型(LLMs)展现出广泛的人类化行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维持边界。尽管这些行为十分普遍,但研究者和实践者缺乏方法和实证洞察,无法就LLMs应在何时、以何种方式展现人类化行为做出明智决策。为填补这一空白,我们利用LLM-as-a-judge和人工评估,对这些行为的普遍性、潜在影响和可控性进行了多维度分析。通过对来自四个广泛使用的模型(gpt-4o、gpt-4.1-mini、claude-sonnet-4.6、gemini-2.5-flash)的21,000轮多轮对话进行分析,我们发现人类化行为普遍存在,但会因模型和用户因素(对话目标和用户画像)的不同而有所差异。在感知适当性方面,人工评估者认为,自我指涉和关系建立行为在LLMs中比在人类中更不适当,而边界维持行为在LLMs中比在人类中更适当。最后,我们表明系统提示可以控制这些行为,但需要仔细评估以避免意外效果。我们讨论了研究发现的启示,并为负责任的LLM设计和评估提供了建议。
相关阅读与更新。
评估IWSLT2023语音翻译任务:人工标注、自动指标与切分
人工评估是机器翻译系统开发中的关键组成部分,在文本翻译研究中已受到广泛关注。然而,关于语音翻译人工评估的先前研究很少,而语音翻译增加了诸如噪声数据和切分不匹配等额外挑战。我们迈出第一步来填补这一空白,对多个共享任务的结果进行了全面的人工评估,这些任务来自……
自动化机器翻译行为测试
NLP中的行为测试通过分析输入-输出行为来检验系统的语言能力,从而实现对系统的细粒度评估。遗憾的是,现有的机器翻译(MT)行为测试工作目前主要局限于手工构建的测试,覆盖的能力和语言范围有限。为解决这一局限,我们提出使用大语言模型(LLMs)来生成多样化的……
探索机器学习中的机遇。

我们的机器学习研究每天都在取得新突破。