Reddit r/artificial短讯中文原文2024年BABA-is-AI测试:多模态大模型在规则组合泛化上表现不佳2 天前reddit.com作者:/u/moschles评测论文AI评分:70/100一篇提交至ICML的论文测试了GPT-4o、Gemini-1.5-Pro和Gemini-1.5-Flash等主流多模态大语言模型,发现它们在需要操纵和组合游戏规则的泛化任务中失败严重。该研究揭示了当前SOTA模型在复杂逻辑推理方面的局限性。阅读原文