精选Hugging Face Blog短讯
Falcon-Emirati:当大模型学习方言、文化与细微差别
标题暗示了针对阿联酋阿拉伯语方言及文化语境进行优化的大语言模型研究或发布,重点在于模型对特定区域语言和文化的适应能力。
- +3

阿拉伯语实际上是一个在同一个名称下生活的语言家族。现代标准阿拉伯语是你新闻或教科书中读到的内容,但它很少是人们实际交谈的方式。在阿联酋,日常对话、幽默、谈判和讲故事都使用阿联酋阿拉伯语,这是一种具有独特词汇、节奏以及紧密围绕其文化的海湾方言。阿联酋诗歌,尤其是纳巴提诗歌,以及谚语和短篇轶事,承载着无法通过逐字直译保留的意义。一个只懂现代标准阿拉伯语的模型可以翻译阿联酋句子的每一个单词,但仍然误解其真正含义。
这就是 Falcon-Emirati-7B 旨在填补的空白。它是基于 Falcon-H1-Arabic 构建的方言专用模型,旨在以母语者的方式理解和生成阿联酋阿拉伯语:包括词汇、语气及其背后的文化背景。
基于 Falcon-H1-Arabic 构建
我们并非从零开始。Falcon-Emirati-7B 建立在 Falcon-H1-Arabic 之上,这是我们的阿拉伯语模型系列,今年早些时候已为该语言设立了新的基准。Falcon-H1-Arabic 采用 Falcon-H1 混合架构:状态空间模型(Mamba)和 Transformer 注意力机制在每个块内并行运行,并在每个块的投影之前融合其输出。这种组合在长序列上提供了 Mamba 的线性时间效率,同时保持了注意力机制对长距离依赖关系的精确性,这对于像阿拉伯语这样形态丰富的语言至关重要。该系列涵盖三个规模(3B、7B 和 34B 参数),上下文窗口高达 128K 和 256K 个令牌,并且已经使用广泛混合的现代标准阿拉伯语和方言阿拉伯语(海湾、黎凡特、埃及、马格里布)以及英语和多语言数据进行了训练。
这为我们提供了一个强大的起点:一个已经广泛理解阿拉伯语、能很好地处理长上下文并内置了一些方言接触经验的模型。Falcon-Emirati-7B 在此基础上进一步专门针对阿联酋方言、词汇、语法以及通用阿拉伯语模型无论多么强大都无法自行获取的文化知识。
我们专门在 7B 变体上构建了 Falcon-Emirati-7B。这是该系列的甜蜜点:足够大以保留方言适应所需的细微差别,但又足够小,使得训练和推理保持实用。34B 模型可能会将质量再提升一点,但其训练和服务成本对于方言专用聊天模型来说并不合理;而 3B 模型则没有留下足够的余量来实现我们对文化和语言理解的深度要求。7B 在质量与训练及推理成本之间提供了最佳平衡。
为什么方言适应很难
将一个通用阿拉伯语模型转变为阿联酋方言专家听起来比最初构建基础模型的工作要小。事实并非如此。几件事使其真正困难:
- 阿联酋语主要是一种口语方言。它在网上的书面出现频率远低于现代标准阿拉伯语,甚至其他海湾和黎凡特方言,因此可供学习的原始文本并不多。
- 意义往往是非字面的。习语、谚语和诗歌引用依赖于共享的文化背景,而非表面词汇。
- 没有既定的操作手册。目前缺乏关于需要多少方言数据、如何将其与现代标准阿拉伯语和通用阿拉伯语混合,以及哪个训练阶段(继续预训练、监督微调或偏好优化)对掌握方言最为重要的详细记录。
最后一点塑造了我们的工作方式。构建 Falcon-Emirati-7B 的大部分工作归结为试错:测试不同的数据混合、训练阶段和监督策略,并利用人类判断和基准分数来确定什么真正推动了效果提升。
我们的数据处理方法
我们在 Falcon-H1-Arabic 预训练的基础上建立了一个专用的阿联酋数据管道,利用三种互补的来源。
- 地道的阿联酋方言网络数据
我们抓取并整理了源自阿联酋网站和论坛的内容,这些内容以方言原生撰写,而非从标准阿拉伯语(MSA)翻译或转写而来。这是我们获取“地面真值”的来源:即阿联酋人在网上实际如何书写和交谈、日常用语、口语表达,以及在真实使用中阿联酋方言与标准阿拉伯语之间自然交替的现象。
- 关于阿联酋文化与身份的标准阿拉伯语数据
除了方言文本外,我们还引入了专门针对阿联酋文化、遗产和语言的标准阿拉伯语材料:包括关于当地习俗、价值观、历史和社会规范的文章及参考资料,其中也涵盖了外界对阿联酋人的看法和刻板印象。这并非教模型用方言写作,而是让模型在涉及阿联酋话题时,知道自己在谈论什么——例如遗产、礼仪以及母语者心照不宣的文化背景。
- 由词汇表和风格规则指导的合成数据
仅靠真实的方言文本不足以覆盖聊天模型在日常处理中所需的话题范围。因此,我们生成了大量合成阿联酋方言数据以填补空白。我们并未任由生成模型即兴创作“海湾式”阿拉伯语,而是通过专为阿联酋词汇和语法构建的严格规则、词汇表和字典对其进行约束。正是这些护栏决定了合成输出是读起来地道如阿联酋本土,还是虽然语法正确但听起来别扭,令任何真正说该方言的人都能察觉。
寻找合适的适配配方
由于缺乏从标准阿拉伯语到方言适配的标准配方,我们将训练策略本身视为需要实验探索的对象。我们进行了消融实验,以确定应注入多少方言数据以及在训练的哪个阶段注入;如何在避免模型过度拟合合成模式的前提下,平衡真实抓取数据与合成数据的比例;以及究竟需要多少标准阿拉伯语文化语境才能使其扎根于文化之中,而非仅仅流于表面的流利。在每个步骤中,我们都依赖自动评分与母语者审查相结合的方法,因为仅凭自动指标无法充分捕捉自然度、语气或文化契合度,不足以让人单独信赖。
评估方法论
我们在整个训练过程中通过两种互补的方法来追踪进展:
母语者手动评估
阿联酋母语者直接审查模型的输出,不仅判断答案是否正确,还判断其是否“听起来对”:包括自然度、语气和文化适宜性。这些是基准分数无法告诉你,但母语者的耳朵能立即察觉的细节。
基于 Alyah 的自动评估
为了进行量化追踪,我们使用了 Alyah(الياه,“北极星”),这是一个我们和社区专门为评估阿拉伯语大语言模型的阿联酋方言能力而发布的基准测试。Alyah 是一个完全原生的多项选择基准测试,包含 1,173 个样本,由阿联酋母语者手动收集,涵盖从日常问候和礼仪到比喻性语言、遗产知识和阿联酋诗歌等多个类别:这些正是方言与文化最为重要,且通用阿拉伯语模型往往表现不佳的领域。有关 Alyah 构建细节和类别划分的完整信息请参阅我们的基准测试博客文章,基础模型系列的背景信息请参阅 Falcon-H1-Arabic 公告。
结果
Falcon-Emirati-7B 在 Alyah 上得分 84.83%,高于我们与之比较的所有其他阿拉伯语和多语言模型,包括几个规模比它大得多的模型。下图展示了它在 Alyah 排行榜上与一组具有代表性的领先指令微调模型的对比情况。

Alyah 准确率(%),指令微调模型。Falcon-H1-Arabic 系列模型未纳入此比较,因为 Falcon-Emirati-7B 是基于它们构建的。
结果告诉我们什么
从这一对比中可以明显看出两点。仅靠参数量大小并不能带来方言能力。这里一些最大的多语言模型得分远低于更小、更关注方言的模型,这说明阿联酋阿拉伯语能力必须经过专门训练,而不能作为规模扩大的副作用自然习得。表现最好的模型往往最初就是以阿拉伯语为母语或专注于阿拉伯语的,这与我们在消融实验中观察到的结果一致:通用阿拉伯语和方言覆盖是必要的起点,但要弥补其余差距,特别是 Alyah 中最难的部分(如诗歌、遗产知识以及语言与方言类别本身),仍需针对特定方言进行专门工作。
这也与 Alyah 基准测试发布后的更广泛情况相符:即使是很强的模型,一旦进入真正具有方言特征且嵌入文化的内容领域,也会出现明显的性能下降。这种差距不会随着模型变大而自动缩小,需要专门为该方言构建的数据和评估体系。
超越多项选择:LLM-as-Judge 评估
多项选择题准确率只能告诉你模型是否能在四个选项中识别出正确答案,并不能告诉你当用户直接与模型对话时,它是否会自主生成阿联酋阿拉伯语。因此,除了 Alyah 之外,我们还进行了第二项评估:使用相同的 1,173 道 Alyah 题目进行开放式生成,并由 LLM 裁判(Gemini 3.7 Flash)对五个模型进行评分:Falcon-Emirati-7B、ALLaM-7B-Instruct-preview、gemma-3-27b-it、Jais-2-8B-Chat 和 Fanar-2-27B-Instruct。这些模型是从 Alyah 排行榜中选出的最强竞争对手。
裁判从两个独立维度对每个答案进行评分:内容是否正确,以及答案是否确实以阿联酋方言而非现代标准阿拉伯语(MSA)返回。我们报告了两种分数:一种是部分得分(裁判的分级评估),另一种是更严格的通过/不通过版本,并统计了每个模型选择不回答而非作答的频率。

基于 1,173 道 Alyah 题目的 LLM 裁判正确性评分,开放式生成,裁判为 Gemini 3.7。

相同题目的 LLM 裁判方言保真度评分:答案是否真的以阿联酋方言返回,还是模型默认使用现代标准阿拉伯语?
Falcon-Emirati-7B 在正确性方面领先,但真正的差距体现在第二张图表中。在方言保真度方面,Falcon-Emirati-7B 的部分得分为 0.52,而 ALLaM 为 0.05,gemma-3-27b-it 为 0.03,Jais-2-8B-Chat 为 0.02,Fanar-2-27B-Instruct 几乎为 0.00。这不是微小的优势,在低端接近两个数量级的差距。在实际应用中,这意味着其他模型通常知道正确答案,但默认以现代标准阿拉伯语回答,即使被直接用阿联酋阿拉伯语提问也是如此。Falcon-Emirati-7B 是唯一一个能够可靠地用所问方言回应的模型。
Fanar-2-27B-Instruct 还因另一个原因脱颖而出:它的弃权率远高于其他任何模型,有 26.2% 的时间拒绝回答,而其他所有比较模型的弃权率均低于 5%。结合其 0.27(部分得分)的正确性评分——这是五个模型中最低的——这表明该模型不仅不愿意,而且缺乏参与阿联酋特定内容的能力,而不仅仅是使用了错误的语域进行回答。

按 Alyah 类别划分的方言保真度(部分得分)。Falcon-Emirati-7B 是唯一一个始终切换到阿联酋方言的模型;其他模型在几乎所有类别中都保持使用现代标准阿拉伯语。
将方言忠实度按类别拆解后,模式变得更加清晰。这一规律在 Alyah 的所有类别中均成立,从日常问候到诗歌创作皆如此,这表明模型并非仅针对少数几种问题类型习得了某种狭隘的技巧,而是当阿拉伯联合酋长国方言(Emirati)为预期语域时,模型默认采用的语域发生了普遍性转变。唯一在其他竞争模型中表现相对较好的“问候与日常表达”类别,也是阿联酋方言与现代标准阿拉伯语(MSA)重叠最多的类别,因此通用阿拉伯语模型在此处最容易偶然呈现出地道的口音。
逐类别成对比较
作为审视同一问题的第三种视角,我们进行了面对面的成对评判:对于 Alyah 中的每一个问题,裁判(Gemini 3.7 Flash)会同时看到 Falcon-Emirati-7B 的回答与一个竞争模型的回答,且不知晓两者对应关系,并被要求选出更好的一个。下方的雷达图展示了该模型在与三个竞争模型——Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct——进行面对面评判时,按类别划分的胜率。

按类别划分的成对胜率,Falcon-Emirati-7B 对阵 Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct,由 Gemini 3.7 进行面对面评判。
Falcon-Emirati-7B 在所有三个竞争对手面前赢得了大多数类别的胜利,并且在最依赖方言和文化流利度的类别中以巨大优势胜出。对阵 Jais-2-8B-Chat 时,差距最大的是“诗歌与创意表达”(0.69 比 0.31)和“语言与方言”(0.62 比 0.38)。对阵 ALLaM-7B-Instruct-preview 时,同样的两个类别再次显示出最宽的差距:“诗歌与创意表达”(0.66 比 0.34)和“语言与方言”(0.58 比 0.42)。对阵 Fanar-2-27B-Instruct 时,差距是这三组对抗中最宽的,且 Falcon-Emirati-7B 赢得了每一个类别,最高分出现在“诗歌与创意表达”(0.88 比 0.12)和“宗教与社会敏感性”(0.80 比 0.20)。
竞争模型唯一能保持竞争力的类别是“问候与日常表达”:Falcon-Emirati-7B 以微弱劣势输给 Jais-2-8B-Chat(0.46 比 0.54),并与 ALLaM-7B-Instruct-preview 打成平手(均为 0.50),尽管它仍明显胜过 Fanar-2-27B-Instruct(0.70 比 0.30)。这与我们在上述方言忠实度分解中看到的情况大体一致:问候是阿联酋方言与现代标准阿拉伯语重叠最多的类别,因此即使没有专门的方言训练,通用阿拉伯语模型也最容易在此处听起来像母语者。而在方言特征更为明显的地方,如诗歌、比喻性语言、遗产知识等,Falcon-Emirati-7B 的优势在我们测试过的所有竞争模型面前都清晰可见。
理解阿联酋文化
语言也关乎对话背后的文化理解。我们在 ArabCulture-Dialogue 基准测试的阿联酋部分评估了 Falcon-Emirati-7B,这是一个用于衡量阿拉伯语文化理解的基准。在其多项选择题任务中,模型需从三个选项中选出最具文化适宜性的回复。详见研究论文。
我们在相同的 283 个阿联酋场景上测试了所有四个模型,分别使用阿联酋阿拉伯语和现代标准阿拉伯语,并包含不同数量的地点信息。

阿联酋多项选择题任务的总体准确率,跨两种语言变体和所有地点设置取平均值。这些是我们的评估结果。
Falcon-Emirati-7B 得分 85.57%,在所测试的四个模型中最高,领先于 ALLaM-7B(83.39%)、Jais-2-8B(73.79%)和 Fanar-2-27B(71.50%)。这些结果凸显了其在识别阿联酋对话中文化适宜性回复方面的能力。
实战演示
数字只能讲述故事的一部分,因此下面是一个实时的交互式对比:五个真实的阿联酋提示词,由 Falcon-Emirati-7B 分别与 Fanar-2-27B-Instruct 和 ALLaM-7B-Instruct-preview 并行运行。滑动或使用箭头在不同提示词之间切换,并展开任何回答以阅读完整内容。
互动对比:Falcon-Emirati-7B、Fanar-2-27B-Instruct 与 ALLaM-7B-Instruct-preview 在五个阿联酋提示词上的表现,涵盖开斋节问候、本地历史、诗歌及文化遗产知识。输出内容为模型生成结果,可能存在错误;高亮部分仅用于标识我们的模型,不代表事实性评级。
尝试 Falcon-Emirati-7B
Falcon-Emirati-7B 已上线我们的聊天平台。🚀 立即体验:https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
负责任的人工智能与局限性
像任何语言模型一样,Falcon-Emirati-7B 可能会反映其训练数据中的偏见,并在某些情况下出现错误,尤其是在罕见表达、高度本地化的引用或我们数据较少的边缘案例方面。方言和文化细微差别在某些情境下具有主观性,即使是母语者也不总是对“正确”答案达成一致。我们建议在将其用于任何敏感、官方或高风险场景之前,针对您的具体用例对模型进行评估,并且我们真诚欢迎阿联酋社区提供反馈,以帮助我们改进模型和 Alyah 的未来发展。
致谢
我们要向 Mikhail Lubinets 和 Matthieu Berjon 致以诚挚的谢意,感谢他们为计算基础设施提供的持续支持;同时感谢 Jatin Mittal 帮助通过 Falcon Chat 应用使该模型易于访问。
引用
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}译文已达到本站中文翻译的字数上限,剩余内容请查看原文。