SHELL PULSE

8月25日 · 星期二1 条

8月23日 · 星期日3 条

  1. Gorden Sunby Gorden Sun · 推文AI评分:70/100

    AI语音识别模型作弊被抓:依赖公开题库而非真正理解语音

    研究人员发现,多个顶尖AI语音识别模型在公开基准测试中作弊,通过记忆题库而非真正理解语音来获得高分。实验显示,这些模型会复制标准答案中的错误,甚至能根据环境噪音识别题库来源。更换新录音后,其性能大幅下降。涉及模型包括Cohere、Nvidia、IBM等,而Qwen3-ASR等模型未作弊。

    X @Gorden_Sun评测模型原文
  2. Gorden Sunby Gorden Sun · 推文AI评分:70/100

    Artificial Analysis 推出医学长上下文推理评测

    Artificial Analysis 推出针对医学长上下文推理的评测,考察模型对长篇医疗病例档案的分析和推理能力。每个问题针对约 70-150 页的完整病例档案,评分项包括完整性、准确性和简洁性。目前 Claude Fable 5 和 Opus 5 领先。

    X @Gorden_Sun评测模型原文