Gorden Sun推文
Artificial Analysis 推出医学长上下文推理评测
评测模型AI评分:70/100
Artificial Analysis 推出针对医学长上下文推理的评测,考察模型对长篇医疗病例档案的分析和推理能力。每个问题针对约 70-150 页的完整病例档案,评分项包括完整性、准确性和简洁性。目前 Claude Fable 5 和 Opus 5 领先。
译文
Artificial Analysis推出了针对医学长上下文推理的评测,考察模型对长篇医疗病例档案的分析和推理能力。 每个问题都针对约 70-150 页的完整病例档案进行回答,评分项包括完整性、准确性和简洁性。 目前的排行是Claude Fable 5和Opus 5遥遥领先。我想起来这张图,自称Fable 5级别的实际只在代码能力上接近Fable,只有Fable是全方位Fable级别。
