← 返回信息流

dev.to #ai短讯

模型排行榜不够,我们引入了账本机制

dev.to作者:fwdslsh评测AI评分:70/100

针对本地模型对比中因硬件、运行环境和测试套件不同导致结果混乱的问题,提出引入“模型账本”(Model Ledger)概念。该机制将实验室结果整合为统一表格,涵盖129行数据,包含5种硬件配置下的45项独立评估,并标记重复和未完成的运行记录,旨在提供更透明、可追溯的基准测试数据。

当结果来自不同的机器、运行环境和测试套件时,对比本地模型会变得令人困惑。一个完成了两个案例的运行可能显示出较高的质量分数,但它并未说明模型如何处理其余的工作负载。

模型账本将实验室结果整合到一张表格中:涵盖五种硬件配置共 129 行数据,其中包括 45 个独特的已完成评估。两个完全重复的工件被标记为重复项。剩余的行包括未完成的运行、诊断信息、仅报告的结果以及服务测试,以便你在进行比较之前将它们区分开来。

比较相同的工作负载

例如,Qwen3.8-27B Q2_K_XL 在两套双路 RTX 4060 Ti 系统上均完成了相同的 123 案例套件,质量分数均为 91.837%。Xeon 运行的中位解码速率为每秒 40.23 个令牌;Ryzen 运行的中位解码速率为每秒 47.31 个令牌。对于这些运行,在记录的质量相同的情况下,Ryzen 系统的解码速度大约快了 17.6%。

这些系统在内存和存储方面也存在差异。Xeon 工作站拥有 256 GB DDR4 内存和基于 HDD 的工作存储,而 Ryzen 构建则配备了 32 GB DDR5 内存和 NVMe 存储。账本保留了运行时的设置和每次运行的 GPU 分配情况,以便可以结合速率检查这些细节。

在 Ryzen 系统上,Qwen3.5-9B Q4_K_M 记录了 84.626% 的质量分数,中位解码速率为每秒 46.62 个令牌,中位预填充(prefill)速率为每秒 2,054.72 个令牌。其解码速率接近 27B 运行的 47.31,但质量分数和预填充速率存在差异。如果仅关注解码速率,就会忽略这些差异。

探索账本

打开全宽交互式账本,首先选择一个评估套件和已完成的运行。然后按系统、模型系列或 GPU 分配进行筛选。这能确保比较专注于相同的工作负载,而不是将完整评估与简短探测混合在一起。

点击列标题进行排序。打开行的详细信息以检查其设置、性能分布和分组结果。CSV 和 JSON 导出文件包含筛选后的行,因此你可以将相同的比较带入其他工具中。

阅读测量数据

  • 套件:public123 是固定的 123 案例 AKM 评估套件。frozen24 是一个独立的 24 项结构和来源引用 grounding 套件。请在同一套件内比较质量分数。
  • 分数:Success(成功)统计成功的记录案例数。Quality(质量)是有效检查项除以可能的检查项。Strict(严格)统计通过所有公开套件检查的案例;结构得分单独衡量。仅凭 Success 无法确立语义准确性。
  • 速度:Prefill(预填充)处理输入提示;Decode(解码)生成响应。记录的速率是来自服务器测量的请求级中位数,而非聚合吞吐量或并发用户容量。
  • 时间:延迟(Latency)和首字时间(TTFT)衡量请求的不同部分。大多数行没有记录的 TTFT。破折号表示未记录,而非零。
  • 运行状态:简短的探测或服务冒烟测试检查的行为范围比完整的评估更窄。使用状态过滤器将这些结果分开。
  • GPU 分配:机器清单显示已安装的 GPU。行级别的分配显示该运行使用了哪些 GPU。

在得出结论之前,请检查详细信息视图中的样本数量和缺失的测量值。缺失的重试次数并不意味着零次重试,而仅报告的行并不具备与恢复的结果文件相同的证据效力。

五种配置

这些是基准测试中记录的硬件配置。表格列出了已安装的内存;可下载的数据也保留了操作系统报告的内存信息(如有)。

配置CPU已安装内存已安装加速器
Xeon 工作站Xeon Gold 6242R256 GB DDR42 × RTX 4060 Ti,各 16 GB
Ryzen 工作站Ryzen 5 9600X32 GB DDR52 × RTX 4060 Ti,各 16 GB
B70 工作站Core i5-11600K128 GB DDR4Arc Pro B70,32 GB
A770 工作站Core i5-12600K32 GB DDR4-3200Arc A770,16 GB
5090 工作站Core Ultra 9 285K64 GB;内存类型未记录RTX 5090,32 GB

检查您自己的设置

账本使用随页面提供的 JSON 文件在您的浏览器中运行。它不需要账户、模型端点或对实验室网络的访问权限。即使没有 JavaScript,您也可以下载完整的快照。

测量数据未经重新评分直接复制而来。快照保留了所有 129 个行 ID、重复关系、数值结果、分组摘要以及记录的性能分布。

私有路径、服务地址、原始提示词和响应,以及每个案例的原始记录已被省略。系统标签描述的是硬件而非私有主机名。JSON 包含源账本的 SHA-256 哈希值和编译时间,以便您识别正在比较的快照。

要测试其他模型或服务配置,请使用 AKM Model Eval。其公共测试语料库、运行器和评分逻辑以及复现说明可在代码仓库中找到。首先验证语料库,然后针对每种配置使用不同的标签运行并评分所选案例。

文章和数据集位于网站代码仓库中。“本网站是如何构建的”一文解释了发布流程。

在比较结果时使用相同的套件修订版本,并确保所选案例已完成后再将分数视为最终结果。这为您提供了一种可重复的方法来比较您自己的设置所交付的质量和速度。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文