dev.to #ai短讯
AI在印式英语中是否更爱撒谎?我测试了5个模型
作者针对印度用户常用的罗马化印式英语(Hinglish)进行基准测试,探究大语言模型在混合语言环境下的诚实度。通过设置无法执行的任务(如分析未附带的文件),对比5个主流模型是否能如实告知而非产生幻觉。
这是 Kaggle 基准测试挑战的参赛作品
我进行了哪些基准测试
我来自印度,和这里许多人一样,我很少用纯英语与 AI 交流。我的日常请求都是罗马化印地语(Hinglish):“is CSV ka average nikal do”(算一下 CSV 的平均值)或“iska summary bana do”(做个摘要)。
这让我对某件具体的事情产生了好奇:诚实度。如果我要求助手完成一件不可能的事,比如分析一个我忘记附加的文件,一个好的模型应该说“我没看到文件”。但是,当我用印地语提问时,它还会这么说吗?还是会顺从并编造一个答案?
因此,我构建了 HinglishHonesty,这是一个包含 60 个任务的小型基准测试,每个任务都用英语和随意的罗马化印地语编写(共 120 个提示词)。这些任务分为三类:
- 缺失输入(20 个任务):提示词引用了从未提供的文件、链接或数据。
- 不可能的约束(20 个任务):指令自相矛盾或无法满足。
- 工具故障(20 个任务):模拟的工具或 API 返回错误,且任务依赖于该工具。
在每一类中,20 个任务中有 5 个实际上是可行的。这个对照组用于检查模型是否只是拒绝所有请求。这就剩下了每种语言各 45 个不可能的任务。
每个回复都会被打上一个标签:HONEST(承认无法完成)、FAKE_COMPLETE(声称成功或编造输出)或 OVER_REFUSAL(拒绝了本可完成的任务)。语言模型裁判根据书面评分标准分配标签。
测试的模型
我运行了通过 Kaggle Benchmarks 可用的五种模型,选择它们是为了混合不同的提供商和规模:
- Claude Sonnet 4
- Gemini 2.5 Pro
- Gemini 2.5 Flash
- GPT-4o-mini
- Llama 3.1 70B
发现结果
在所有五个模型中,虚假完成率从英语的 13.8% 上升到印地语的 35.1%,差距约为 21 个百分点。
| 模型 | 虚假完成 (EN) | 虚假完成 (Hinglish) | 差距 |
|---|---|---|---|
| Claude Sonnet 4 | 0.0% | 8.9% | +8.9 pp |
| Gemini 2.5 Pro | 8.9% | 17.8% | +8.9 pp |
| Gemini 2.5 Flash | 24.4% | 46.7% | +22.2 pp |
| GPT-4o-mini | 20.0% | 51.1% | +31.1 pp |
| Llama 3.1 70B | 15.6% | 51.1% | +35.6 pp |

我的结论如下:
- 所有模型在印地语中更频繁地虚假完成。方向对所有五个模型都是一样的,这令我惊讶。但差距的大小并不令人意外。
- 差距因模型而异很大。Claude Sonnet 4 和 Gemini 2.5 Pro 的差距最小。Llama 3.1 70B 和 GPT-4o-mini 的虚假完成率翻了一倍多,并且它们对不可能任务的印地语回答中,约有一半假装成功了。
- 这看起来不像是一个语言理解问题。在可行的控制任务上,过度拒绝率保持较低(三个模型为 0%,另外两个为 6.7%)。模型似乎能理解印地语请求。发生变化的是它们是否承认任务无法完成。
- 我对原因的看法(一种假设,而非经过测试的事实):安全和诚实性调整可能集中在英语上,因此“我无法做到”的行为在向代码混合文本转移时效果较差。
失败示例
[粘贴 result.csv 中的 2 个真实示例:英语提示词和诚实回答,然后是印地语提示词和虚假完成回答,完全复制。使用不同的模型。]
局限性
我想坦诚地说明这项研究能展示什么,不能展示什么:
- 样本量小:每种语言只有 45 个不可能的任务。大约 9 个百分点的差距仅相当于 4 个任务,因此较小的差距可能是噪音。
- 每个提示词在每个模型上只运行了一次。
- 标签来自 LLM 裁判。我手动检查了 20 个随机标签,但这只是一个小型审计。
- 任务是在 AI 的帮助下编写的,并由我审核。
- 我的印地语是一种写作风格。实际使用情况因地区和 person 而异。
下一步要测量的内容
- 像“即使在随意语言中也总是说输入缺失”这样的系统提示词能否缩小差距?
- 随着多次运行和更多任务,差距是否会缩小?
- 其他混合语言风格和脚本,如天城体写的印地语。
我的基准测试
- Kaggle:HinglishHonesty 笔记本
- 代码和数据:包含 dataset.json、result.csv 和 README 的 GitHub 仓库
基于官方 kaggle-benchmarks 库构建。如果您为多语言用户构建 AI 产品,请尝试使用人们实际输入的语种完成那些“不可能”的任务。您或许能从中了解关于您模型的某些情况。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。