← 返回信息流

热点精选Microsoft Research新闻

微软扩大Skala访问范围,加速预测性DFT进程

microsoft.com作者:Sebastian Ehlert, Stefano Battaglia, Thijs Vogels, Jan Hermann, Jens Wehner, Giulia Luise, Klaas Giesbertz, Chin-Wei Hu…模型开源AI评分:70/100

微软研究院发布Skala 1.1,这是其深度学习交换关联泛函的更新版本,训练数据量增加2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala现已集成到CP2K,并正在整合到Psi4、FHI-aims、ORCA和VASP中,使更多计算化学社区能够使用。同时,微软推出了实时基准测试,以跟踪Skala后续版本的性能,推动计算化学向预测性和可及性发展。

Schematic of the Skala architecture, showing how meta-GGA electronic features are transformed through point-wise proces…
Schematic of the Skala architecture, showing how meta-GGA electronic features are transformed through point-wise proces…

一览

  • Skala 1.1 展示了微软研究院深度学习 DFT 方法持续改进的特性:其训练数据量比上一代多 2.5 倍,在关键分子模拟挑战(包括热化学、反应动力学和分子结构预测)中均实现了显著更高的精度。
  • Skala 现已可在 CP2K 中使用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP 中,使下一代 DFT 精度更贴近每天依赖这些代码的科研群体。
  • 微软研究院还推出了一个动态基准测试,用于追踪不断优化迭代的 Skala 版本的计算性能,帮助社区衡量并加速向更高精度和效率迈进。
  • 这些进展共同标志着我们朝着计算化学模拟既具备预测能力、又能融入所有相关科学与工业工作流的未来又迈出了一座里程碑。

将密度泛函理论(DFT)提升到预测性精度是一个持续的过程,而非一次性的突破。自推出 Skala——我们的深度学习交换关联泛函——以来,我们一直在两条互补的战线上持续推进:提高精度,以及扩大其在计算化学生态系统中的可及性。

Figure 1: Accuracy of Skala-1.1 for thermochemistry, kinetics, and non-covalent interactions. At the computational cost
Figure 1: Accuracy of Skala-1.1 for thermochemistry, kinetics, and non-covalent interactions. At the computational cost

在精度方面,Skala-1.1 的发布首次展示了 Skala 所依托的持续改进范式。该更新模型比 Skala 首个公开版本多训练了 2.5 倍的数据,在分子模拟的关键挑战中表现出显著提升的性能,包括主族热化学、反应动力学和分子结构预测。

但仅有精度是不够的。DFT 是涵盖化学、材料科学、催化、能源技术和药物发现等广泛科学与工业工作流的计算引擎。要产生实际影响,先进的泛函必须在科学家已经开展计算的地方可用。这正是我们通过与领先电子结构软件开发者合作来扩展 Skala 生态系统的原因。

今天,我们宣布 Skala 现已可在 CP2K 中使用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP 中,使下一代 DFT 精度更贴近每天依赖这些代码的科研群体。在这些集成工作之外,我们还推出了一个动态基准测试,用于追踪不断优化迭代的 Skala 版本的计算性能。通过为跨软件包和硬件平台的实现提供透明且持续更新的参考,这一资源将帮助社区衡量并加速向更高精度和效率迈进。

这些进展共同标志着我们朝着计算化学模拟既具备预测能力、又能融入更广泛的科学与工业工作流的未来又迈出了一座里程碑。

想了解更多关于 Skala 的信息,以及为什么 DFT 在计算机模拟发现中扮演如此重要的角色?请阅读我们的第一篇博客文章。

Skala 作为一种持续改进的泛函

与传统的“泛函动物园”模式(新泛函不断累积而不取代旧泛函)不同,Skala 遵循不同的理念:每个版本都旨在取代前一个版本。随着新数据、新模型架构和新训练策略的出现,模型不断改进,同时保持相同的实际计算成本。

Skala-1.1 是这一方法的最新体现。它在 GMTKN55 上实现了 2.8 kcal/mol 的加权平均误差。GMTKN55 是一个广泛使用的基准测试套件,包含 55 类化学问题,涵盖热化学、反应势垒和非共价相互作用。这一精度水平超越了当今领先的全局(范围分离)杂化泛函,同时保留了半局域泛函的效率。除能量之外,Skala-1.1 还提供了高精度的电子密度、偶极矩和分子几何结构。

这些进展得益于微软研究院高精度化学数据集的大规模扩展。该数据集是我们使用昂贵的波函数方法生成的高精度量子化学参考数据的大型集合。对于 Skala-1.1,我们新增了包括电子亲和势和非共价团簇在内的新类别,既增加了训练数据的规模,更重要的是增加了其多样性。这种数据驱动的方法使 Skala 能够随着每一代版本系统性地改进,使我们更接近一个真正可扩展且具有预测能力的 DFT 框架。

在科学家工作的地方可用

要充分释放Skala不断演进的DFT方法的潜力,我们需要专门的基础设施,使新版本能够快速无缝地集成到工业界和学术界科学家使用的主流软件包中。反过来,这也将建立起加速Skala持续开发所必需的快速反馈循环。

我们最初通过开源社区版本(在新标签页中打开)发布了Skala,该版本基于(GPU4)PySCF(在新标签页中打开)构建,并与ASE(在新标签页中打开)集成。这使得研究人员能够以极少的精力评估和应用Skala,同时受益于高度优化的CPU和GPU性能。

但没有任何单一软件包能够满足所有应用或研究群体的需求。计算化学和材料科学依赖于丰富的电子结构代码生态系统,每个代码都经过数十年的发展,以应对特定的科学和工业挑战。因此,将Skala引入这一更广泛的生态系统一直是过去一年的工作重点。我们很幸运能够建立在DFT社区创造的卓越基础之上,并感谢众多研究人员和开发人员帮助Skala融入科学家日常使用的软件平台。

从社区发布到原生集成

Skala已成功集成到开源CP2K(在新标签页中打开)软件包中,这是与Thomas D. Kühne教授团队在先进系统理解中心(CASUS)(在新标签页中打开)合作完成的。经过25年以上的发展,CP2K是DFT模拟的强大工具,尤其擅长大规模体系和长时间尺度分子动力学,同时也提供丰富的高精度电子结构方法。Skala拓展了CP2K的能力边界,在DFT精度上实现了阶跃式提升,同时保持了大规模模拟所需的计算效率。我们期待看到CP2K的规模和多功能性与Skala不断提升的精度相结合,在未来几年催生新的科学应用和发现。

更多集成工作正在进行中。我们正与Psi4(在新标签页中打开)活跃的开发者社区合作,积极将Skala集成到这一开源软件包中,Psi4是分子电子结构研究的重要平台。结合基于PySCF的Skala社区版,Skala将可在三个广泛使用的开源量子化学软件包中使用。

在开源软件之外,我们还在与FHI-aims(在新标签页中打开)、ORCA(在新标签页中打开)和VASP(在新标签页中打开)的领先开发者密切合作,目标是让Skala在计算化学和材料科学使用的主要软件平台上得到广泛应用。

跨实现验证精度:以CP2K为案例

彻底的测试对任何新实现都至关重要。我们希望确保Skala在不同代码和计算设置下都能提供一致的精度。我们与CP2K团队共同开发了一套全面的集成测试套件,以验证Skala能够产生数值正确且可靠的结果。我们特别感谢CASUS团队,他们在计算方法数值验证方面的深厚专业知识对设计和验证该测试框架起到了关键作用。

Figure 2: Signed errors relative to high-accuracy reference values for a representative subset of GMTKN55, comparing the
Figure 2: Signed errors relative to high-accuracy reference values for a representative subset of GMTKN55, comparing the

关于Skala在CP2K中的实现、验证策略和测试基础设施的详细讨论,请参阅我们与CASUS团队的联合论文:“Molecular Implementation of the Machine-Learned Skala Exchange-Correlation Functional in CP2K through GauXC.”

Skala的持续性能报告

精度和广泛可用性只有在Skala同样具备高速性能时才能转化为科学影响力。目前,Skala在CPU(对于超过20-30个原子的分子,开销消失)和GPU上均可提供与半局域meta-GGA相当的性能,我们致力于在将其集成到电子结构软件生态系统的过程中保持这一效率。

但性能并非固定不变的属性。Skala的新版本发布、GauXC等库的改进以及硬件特定优化都在持续提升效率,并揭示进一步优化的新机会。捕捉这些进展需要的不只是一次基准测试快照。

为了提供透明且最新的Skala性能视图,我们发布了一个基准测试框架以及一份持续更新的性能报告(在新标签页中打开),该报告将随着新优化的推出而不断更新。该报告跟踪了多种任务和硬件平台上的性能表现,而基准测试框架则使软件包开发者能够对其Skala实现进行基准测试、验证和改进。

Figure 3: Computational cost of Skala on GPU and CPU, compared with a popular metaGGA functional (r2SCAN) and two hybrid
Figure 3: Computational cost of Skala on GPU and CPU, compared with a popular metaGGA functional (r2SCAN) and two hybrid

致谢

Skala是人工智能for Science领域真正协作努力的成果,我们感谢我们的工程、项目管理和业务运营团队,是他们的付出让这项工作成为可能。我们也感谢MSR Accelerator在推进数据生成工作和加速软件集成方面的合作,这些努力帮助将Skala带给更广泛的科学社区。

阅读原文