← 返回信息流

精选Hugging Face Blog新闻

英国AI研究所与EvalEval如何使基准测试结果可复现

huggingface.co评测AI评分:70/100

英国人工智能研究所(AISI)与评估平台EvalEval合作,致力于解决AI模型基准测试中的结果不可复现问题。该举措旨在通过标准化流程和透明化数据,确保不同机构发布的性能评测具有可比性和可信度,为行业建立统一的评估标准。

AISI 和 EvalEval 此前已在与 NeurIPS 2025 同期举办的联合研讨会中开始了合作研究,研究所的反馈有助于塑造“Every Eval Ever”(EEE)模式。这一合作的新阶段旨在将共享的基础设施付诸实践。

为何可复现的评估报告至关重要

随着人工智能部署的加速,评估正成为关于模型和系统性能的重要证据来源。然而,结果往往以多种格式、平台和渠道发布,且通常缺乏足够的信息以供复现。重新运行这些评估本身可能成本高昂到令人望而却步。

EvalEval 的使命是通过共享的报告模式 Every Eval Ever 以及开放平台 Evaluation Cards,改善这一生态系统,将评估结果及解释所需的信息整合为统一结构。

这自然建立在 AISI 的工作基础之上:通过 OptStop 提高评估效率,通过 HiBayES 增强统计严谨性,并在包括转录分析和能力提取在内的领域实现标准化。AISI 和 EvalEval 共同努力,旨在诊断评估报告中的差距,并构建共享基础设施以弥补这些不足。

AISI 分享的内容

转录级别的透明度不仅对可复现性至关重要,也对分析和诊断具有重要意义。在合作的新阶段,AISI 将在适当情况下通过 Evaluation Cards 公开已报告的评估方法和发现。此次发布包括论文主要实验中五个基准测试的验证结果、上下文及配置信息:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

这些结果涵盖了六个前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。发布内容还包括来自两项相关网络评估——Cyber CTFs 和 The Last Ones——的结果,这些评估使用了不同的、部分重叠的模型集。这些数据伴随 AISI 的论文《How Inference Compute Shapes Frontier LLM Evaluation》一同发布,该论文研究了基准表现如何依赖于推理计算量和评估协议。

«IMG0»

在公开发布带有设置信息的结果时,研究人员和实践者可以更仔细地审视单个研究,并在更广泛的生态系统中比较发现。在其他报告缺乏这些细节的地方,像 AISI 这样的发布提供了经过验证的参考点,用于在上下文中解读评估——例如,帮助研究人员理解设置选择如何影响报告的性能。随着更多评估者采用 EEE,此类开放比较可以支持更广泛、更可靠的元研究。

«IMG1»

我们对这一采纳举措感到兴奋,并期待与 AISI 及其他 AI 评估组织进一步标准化和共享评估成果。

为共同使命贡献力量

  • 模型开发者:报告经过验证的评估结果。
  • 评估开发者:使用 Every Eval Ever 模式报告基准和运行数据。
  • 评估、治理和政策研究人员:按基准或模型浏览 Evaluation Cards,或使用它来考察整体评估报告状况。

关于 EvalEval 联盟

EvalEval 联盟是一个研究社区,致力于开发基于科学依据的研究成果和稳健的部署基础设施,以完善评估生态系统。其目标是提升评估科学水平,解决在记录评估适用性和效用方面缺乏共识的问题,并扩大对科学研究和政策分析至关重要的影响范围的覆盖。

该联盟的旗舰项目包括“Every Eval Ever”,这是一个用于评估结果的共享模式和存储库;以及“Evaluation Cards”,它将基准测试元数据、评估运行数据和模型元数据整合为可解释的记录。这些项目共同使得人们更容易理解,看似相似的分数实际上是在具有实质差异的条件下产生的。

关于英国人工智能安全研究所(UK AISI)

英国人工智能安全研究所是英国政府科学与技术创新部下属的一个研究机构。其使命是为政府提供关于先进人工智能所带来风险的科学认知。AISI 开展研究并构建基础设施,以理解先进人工智能的能力与影响,开发并测试缓解措施,并为政策制定提供信息支持。

延伸阅读

  • How Inference Compute Shapes Frontier LLM Evaluation
  • HiBayES: Improving LLM evaluation with hierarchical Bayesian modelling
  • HiBayES paper
  • OptStop paper
  • Every Eval Ever
  • Evaluation Cards

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文