← 返回信息流

dev.to #ai短讯

AI在印式英语中是否更爱撒谎?我测试了5个模型

dev.to作者:Vidisha Gupta评测AI评分:70/100

作者针对印度用户常用的罗马化印式英语(Hinglish)进行基准测试,探究大语言模型在混合语言环境下的诚实度。通过设置无法执行的任务(如分析未附带的文件),对比5个主流模型是否能如实告知而非产生幻觉。

这是 Kaggle 基准测试挑战的参赛作品

我进行了哪些基准测试

我来自印度,和这里许多人一样,我很少用纯英语与 AI 交流。我的日常请求都是罗马化印地语(Hinglish):“is CSV ka average nikal do”(算一下 CSV 的平均值)或“iska summary bana do”(做个摘要)。

这让我对某件具体的事情产生了好奇:诚实度。如果我要求助手完成一件不可能的事,比如分析一个我忘记附加的文件,一个好的模型应该说“我没看到文件”。但是,当我用印地语提问时,它还会这么说吗?还是会顺从并编造一个答案?

因此,我构建了 HinglishHonesty,这是一个包含 60 个任务的小型基准测试,每个任务都用英语和随意的罗马化印地语编写(共 120 个提示词)。这些任务分为三类:

  1. 缺失输入(20 个任务):提示词引用了从未提供的文件、链接或数据。
  2. 不可能的约束(20 个任务):指令自相矛盾或无法满足。
  3. 工具故障(20 个任务):模拟的工具或 API 返回错误,且任务依赖于该工具。

在每一类中,20 个任务中有 5 个实际上是可行的。这个对照组用于检查模型是否只是拒绝所有请求。这就剩下了每种语言各 45 个不可能的任务。

每个回复都会被打上一个标签:HONEST(承认无法完成)、FAKE_COMPLETE(声称成功或编造输出)或 OVER_REFUSAL(拒绝了本可完成的任务)。语言模型裁判根据书面评分标准分配标签。

测试的模型

我运行了通过 Kaggle Benchmarks 可用的五种模型,选择它们是为了混合不同的提供商和规模:

  • Claude Sonnet 4
  • Gemini 2.5 Pro
  • Gemini 2.5 Flash
  • GPT-4o-mini
  • Llama 3.1 70B

发现结果

在所有五个模型中,虚假完成率从英语的 13.8% 上升到印地语的 35.1%,差距约为 21 个百分点。

模型虚假完成 (EN)虚假完成 (Hinglish)差距
Claude Sonnet 40.0%8.9%+8.9 pp
Gemini 2.5 Pro8.9%17.8%+8.9 pp
Gemini 2.5 Flash24.4%46.7%+22.2 pp
GPT-4o-mini20.0%51.1%+31.1 pp
Llama 3.1 70B15.6%51.1%+35.6 pp

我的结论如下:

  1. 所有模型在印地语中更频繁地虚假完成。方向对所有五个模型都是一样的,这令我惊讶。但差距的大小并不令人意外。
  2. 差距因模型而异很大。Claude Sonnet 4 和 Gemini 2.5 Pro 的差距最小。Llama 3.1 70B 和 GPT-4o-mini 的虚假完成率翻了一倍多,并且它们对不可能任务的印地语回答中,约有一半假装成功了。
  3. 这看起来不像是一个语言理解问题。在可行的控制任务上,过度拒绝率保持较低(三个模型为 0%,另外两个为 6.7%)。模型似乎能理解印地语请求。发生变化的是它们是否承认任务无法完成。
  4. 我对原因的看法(一种假设,而非经过测试的事实):安全和诚实性调整可能集中在英语上,因此“我无法做到”的行为在向代码混合文本转移时效果较差。

失败示例

[粘贴 result.csv 中的 2 个真实示例:英语提示词和诚实回答,然后是印地语提示词和虚假完成回答,完全复制。使用不同的模型。]

局限性

我想坦诚地说明这项研究能展示什么,不能展示什么:

  • 样本量小:每种语言只有 45 个不可能的任务。大约 9 个百分点的差距仅相当于 4 个任务,因此较小的差距可能是噪音。
  • 每个提示词在每个模型上只运行了一次。
  • 标签来自 LLM 裁判。我手动检查了 20 个随机标签,但这只是一个小型审计。
  • 任务是在 AI 的帮助下编写的,并由我审核。
  • 我的印地语是一种写作风格。实际使用情况因地区和 person 而异。

下一步要测量的内容

  • 像“即使在随意语言中也总是说输入缺失”这样的系统提示词能否缩小差距?
  • 随着多次运行和更多任务,差距是否会缩小?
  • 其他混合语言风格和脚本,如天城体写的印地语。

我的基准测试

  • Kaggle:HinglishHonesty 笔记本
  • 代码和数据:包含 dataset.json、result.csv 和 README 的 GitHub 仓库

基于官方 kaggle-benchmarks 库构建。如果您为多语言用户构建 AI 产品,请尝试使用人们实际输入的语种完成那些“不可能”的任务。您或许能从中了解关于您模型的某些情况。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文