← 返回信息流

MarkTechPost短讯

Nace AI 开源 Drex 1.5:一款评分而非生成文本的 9B 决策模型

marktechpost.com作者:Asif Razzaq模型AI评分:70/100

Nace.AI 开源了 Drex 1.5,这是一款 90 亿参数的决策模型。该模型在一次前向传播中为每个选项返回概率,在 Decision Index 0.3.1 基准上得分 58.08,支持 128K 上下文窗口。

  • 编辑精选
  • 智能体 AI
  • 人工智能
  • AI 基础设施
  • 技术
  • AI 速览
  • 应用
  • 语言模型
  • 决策模型
  • 面向开发者
  • Harness
  • 新版本发布
  • 开源
  • 科技新闻
  • Python
  • 小型语言模型
  • 软件工程
  • 员工

Nace.AI 已开源 Drex 1.5,这是一款面向智能体和后端工作流的 90 亿参数决策模型。Drex 1.5 决策模型不生成文本。它读取状态和类型化的问题,然后为每个选项返回一个概率值。Nace 报告称其在公共 Decision Index 0.3.1 上得分 58.08,这是在 100 亿参数以下模型中的最高分。权重已托管在 Hugging Face 上,OpenRouter 上也提供了托管版本。

TL;DR(摘要)

  • 规模:89.5 亿参数(稠密),bf16 权重约 18 GB。上下文默认支持 16,384 个 token,最高可达 131,072 个。
  • 运行环境:1 块 CUDA GPU(bf16 精度,已在 24 GB A10G 上测试)。Q8_0 GGUF 格式(约 9.5 GB)可在 Apple Silicon 和 CPU 上运行。
  • 性能:在公共 Decision Index 0.3.1 上得分为 58.08,处于 Jev 1.13.0(57.96)的并列分数区间内。
  • 最佳表现:在 32K 至 128K token 的文档上准确率达到 93.4%。
  • 最差表现:在 ACOS 方面情感分析任务中,每条评论的 F1 分数仅为 7.4%,而 Jev 为 29.5%。
  • 总结:最佳之处:在单块 GPU 上拥有与闭源模型相匹敌的开放权重。最差之处:在广泛知识和细粒度情感分析方面表现较弱。

什么是 Drex 1.5?

Drex 1.5 是 Nace.AI 推出的一款决策模型,它通过一次前向传播对固定的一组选项进行评分。你发送一个状态(文本或 JSON)以及命名的问题。它支持三种问题类型:选择、noul(是/否)和有序评分。不进行 token 采样,因此温度(temperature)和 top_p 参数不适用。该模型只能回答你提供的选项。

它提供 POST /v1/systemone API。这与 TypeSafe 的闭源模型 Jev 使用的请求格式相同,Jev 开启了这一类别。Nace 表示,现有 Jev 客户端只需更改几个环境变量即可使用。

Drex 1.5 是如何工作的?

其骨干网络是 MiMo-V2.6-Distill-Qwen-9B,这是一个经过蒸馏的 Qwen 3.5 9B 模型。它具有 32 层,采用混合注意力机制:每层全注意力层对应 3 层线性注意力层。一个独立的指针头(head.pt)根据骨干网络的隐藏状态对每个选项进行评分。

每个问题都会对状态及该问题进行一次遍历。在 llama.cpp 中,状态仅编码一次并在多个问题间共享。Nace 的 Drex 页面指出,该模型是在索引基准测试的官方训练集上训练的。评估仅在保留测试集上进行。

Drex 1.5 在基准测试中的表现如何?

在公共 Decision Index 0.3.1(包含 37 个基准测试,经机会校正)上,模型卡片报告如下:

  • Drex 1.5:58.08
  • Jev 1.13.0:57.96
  • Bespoke Nimble 9B v3:57.19
  • Cloudflare clef-flash:56.15

Drex 1.5、Jev 和 Nimble 均处于榜单 0.9 分的并列区间内。在 37 个基准测试中,Drex 有 20 个领先于 Jev。Drex 的分数来自 Nace 使用官方工具包自行运行的结果。其各项指标得分在“工具”(Tools)方面最强(75.0),在“知识与推理”(Knowledge and Reasoning)方面最弱(44.6)。Nace 发布的图表使用的是较旧的 Decision Index 0.2.1,其中 Drex 得分为 58.28,Jev 为 57.91。

在 JevBench(231 个公开项目)上,Drex 得分为 86.2%,而 Jev 为 87.0%。两者在困难项目上的得分均为 73.9%。在 8 款 OpenSpiel 游戏的直接对抗中,Drex 取得了 122 胜、47 平、87 负的成绩,胜率为 56.8%。

长文档是其明显的优势领域:

  • 8K 至 32K token:准确率 89.5%,中位耗时 0.65 秒
  • 32K 至 128K token:准确率 93.4%,中位耗时 2.0 秒

若将相同的请求截断至 8K token,准确率将分别降至 76.5% 和 78%。

开发者如何运行 Drex 1.5?

  • Python(Kev 运行时):在 CUDA GPU 上运行 inference.py 和 serve.py。
  • llama.cpp:Nace 分支版本,提供 bf16 或 Q8_0 格式的 GGUF 文件,支持 CUDA、Metal 或 CPU。
  • Ollama:Nace 分支版本,增加了决策能力。
  • 托管服务:OpenRouter 列出每百万输入 token 收费 $0.04,输出免费,由 DeepInfra 提供服务。Nace 也运行自己的 Console API。

Nace 在 AWS g5.2xlarge(24 GB A10G)上测试了 bf16 和 Q8_0 格式,得到了完全相同的答案。Q8_0 GGUF 格式在 Apple M5 Pro 上的 Metal 和 CPU 环境下也匹配一致。

Drex 智能体技能将该模型接入 Claude Code、Codex、Cursor、OpenCode、Hermes Agent、Gemini CLI 和 GitHub Copilot。Nace 的发布帖还为云用户提供了 25 美元的注册奖励。

Drex 1.5 与其他决策模型相比如何?

Decision Index 0.3.1 中的行数据来自 Drex 1.5 模型卡,其中引用了 Jev 和 Nimble 的公共排行榜。Nimble 的 0.2.1 分数来自其自身的模型卡。

存在哪些局限性?

Drex 1.5 是一个决策层,而非通用模型。它无法生成文本、代码或解释。知识密集型测试是其弱点:在 GPQA Diamond 上得分为 45.4%,而 Jev 为 78.6%;在 MMLU-Pro 上得分为 58.7%,而 Jev 为 82.7%。

在索引基准的训练集上进行训练有助于提升其在熟悉决策类型上的表现。在新领域的结果可能会有所不同。通过 Ollama 和 llama.cpp 进行本地部署需要使用 Nace 的分叉版本,而非主线构建版。权重采用带有使用限制的 RAIL-M 许可证,因此在商业使用前请查阅相关条款。

关键要点

  • Drex 1.5 是一个 9B 开源决策模型,可在一次传递中评估选项。
  • 它在 Decision Index 0.3.1 上得分 58.08,与闭源模型 Jev 1.13.0 持平。
  • 长文档准确率在 32K 至 128K token 范围内达到 93.4%。
  • 它可在单 GPU 上运行,或以 9.5 GB Q8_0 GGUF 格式在 Mac 上运行。
  • 弱点:GPQA Diamond(45.4%)和 ACOS 情感分析(7.4%)。

Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一名富有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的举措是推出人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深度报道而闻名,内容既技术严谨又易于被广泛受众理解。该平台月浏览量超过 200 万次,彰显了其在受众中的受欢迎程度。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文