← 返回信息流

Gorden Sun推文

AI语音识别模型作弊被抓:依赖公开题库而非真正理解语音

评测模型AI评分:70/100

研究人员发现,多个顶尖AI语音识别模型在公开基准测试中作弊,通过记忆题库而非真正理解语音来获得高分。实验显示,这些模型会复制标准答案中的错误,甚至能根据环境噪音识别题库来源。更换新录音后,其性能大幅下降。涉及模型包括Cohere、Nvidia、IBM等,而Qwen3-ASR等模型未作弊。

译文

AI语音识别模型作弊被抓 行业里一直用几套固定的公开题库来考评 AI 的语音识别水平。这些测试里 AI 表现惊人,看着好像已经和人类耳朵一样灵敏了。研究人员深入测试后发现,不少得分最高的 AI 根本没有认真去听声音,只是认出了考题。 研究人员做了一个很有意思的实验。原版的公开题库里其实有一些粗心留下的错误,比如录音里明明清楚讲了“谢谢总统先生”,但官方标准答案里漏掉了“谢谢”。结果好几款排名靠前的 AI 听到这段录音时,竟然也主动把“谢谢”给抹掉了,只写出“总统先生”,甚至连标点符号的漏写习惯都跟标准答案一模一样。 为了进一步抓现行,研究人员又把录音里的关键数字给静音切掉。声音里完全没有这个数字,正常的听力无论如何也不可能凭空写出来。不可思议的是,好几个 AI 依然能把那个原本的数字准确默写在文本里。它们甚至能靠录音里细微的环境杂音,猜出这段录音出自哪一套题库,然后按那套题库喜欢的拼写习惯去答题。 只要研究人员换成全新的录音,或者换一个全新的声音去念同一句话,这些 AI 就没办法再“偷看答案”了,只能老老实实凭真本事去听。这时候,它们原先那种近乎完美的满分成绩就会大幅缩水。 作弊的模型有: CohereLabs/cohere-transcribe-03-2026 nvidia/canary-qwen-2.5b ibm-granite/granite-speech-4.1-2b microsoft/Phi-4-multimodal-instruct nvidia/parakeet-tdt-0.6b-v2 bosonai/higgs-audio-v3-8b-stt-v2 未作弊的模型: Qwen3-ASR 0.6B Voxtral Mini 3B Kimi Audio 7B Instruct Whisper Large v3 Moonshine Streaming Medium 原文:https://www.hume.ai/blog/measuring-benchmark-optimization-in-speech-recognition

Gorden Sun

@Gorden_Sun

AI语音识别模型作弊被抓 行业里一直用几套固定的公开题库来考评 AI 的语音识别水平。这些测试里 AI 表现惊人,看着好像已经和人类耳朵一样灵敏了。研究人员深入测试后发现,不少得分最高的 AI 根本没有认真去听声音,只是认出了考题。 研究人员做了一个很有意思的实验。原版的公开题库里其实有一些粗心留下的错误,比如录音里明明清楚讲了“谢谢总统先生”,但官方标准答案里漏掉了“谢谢”。结果好几款排名靠前的 AI 听到这段录音时,竟然也主动把“谢谢”给抹掉了,只写出“总统先生”,甚至连标点符号的漏写习惯都跟标准答案一模一样。 为了进一步抓现行,研究人员又把录音里的关键数字给静音切掉。声音里完全没有这个数字,正常的听力无论如何也不可能凭空写出来。不可思议的是,好几个 AI 依然能把那个原本的数字准确默写在文本里。它们甚至能靠录音里细微的环境杂音,猜出这段录音出自哪一套题库,然后按那套题库喜欢的拼写习惯去答题。 只要研究人员换成全新的录音,或者换一个全新的声音去念同一句话,这些 AI 就没办法再“偷看答案”了,只能老老实实凭真本事去听。这时候,它们原先那种近乎完美的满分成绩就会大幅缩水。 作弊的模型有: CohereLabs/cohere-transcribe-03-2026 nvidia/canary-qwen-2.5b ibm-granite/granite-speech-4.1-2b microsoft/Phi-4-multimodal-instruct nvidia/parakeet-tdt-0.6b-v2 bosonai/higgs-audio-v3-8b-stt-v2 未作弊的模型: Qwen3-ASR 0.6B Voxtral Mini 3B Kimi Audio 7B Instruct Whisper Large v3 Moonshine Streaming Medium 原文:https://www.hume.ai/blog/measuring-benchmark-optimization-in-speech-recognition

阅读原文