← 返回信息流

热点MarkTechPost产品

微软发布 Microsoft-Decision-1:基于 Qwen3.5-9B 的决策评分模型

marktechpost.com作者:Asif Razzaq产品AI评分:70/100

微软推出 Microsoft-Decision-1,这是一个用于路由、分类、验证和智能体控制的决策模型。该模型基于阿里 Qwen3.5-9B 进行后训练,不生成文本,而是为每个固定选项返回校准后的概率值。目前已在 Microsoft Foundry 和 OpenRouter 上线可用。

  • 编辑精选
  • 智能体 AI
  • 技术
  • AI 短片
  • 人工智能
  • 应用
  • 语言模型
  • 决策模型
  • 面向开发者
  • 大语言模型
  • 机器学习
  • 新发布
  • 科技新闻
  • Python
  • 软件工程
  • 员工专栏

微软发布了 Microsoft-Decision-1,这是一个用于路由、分类、验证和智能体控制的决策模型。Microsoft-Decision-1 是一个决策评分模型,它为每个固定的答案选项返回校准后的概率,而不是生成文本。该模型基于阿里巴巴的 Qwen3.5-9B 进行后训练,目前已在 Microsoft Foundry 和 OpenRouter 上提供使用。

TL;DR(太长不看)

  • 规模:基于 Qwen3.5-9B 构建;确切参数量未披露。上下文窗口为 32,768 个 token。
  • 运行环境:仅限托管 API(通过 Azure 在 Microsoft Foundry 和 OpenRouter 上)。无开源权重,无量化变体,硬件信息未披露。
  • 性能:在微软的 36 项基准测试对比中,平均准确率最高,p50 延迟为 85 毫秒。
  • 最佳表现:在 36 项基准测试中平均准确率为 83.5%,领先于 Quyet-1.0-Large 的 81.9%。
  • 最差表现:校准度为 92.2,仅次于 Quyet-1.0-Large 的 93.1。仅支持文本输出,不提供解释。
  • 总结:最大优点:快速、廉价且校准良好的决策,每百万输入 token 成本为 0.042 美元,输出免费。最大缺点:权重封闭,且所有基准测试均由厂商自行运行。

什么是决策模型?

决策模型读取输入并对一组封闭的选项进行评分。它不撰写散文。微软将决策模型定义为一种新的 AI 类别,专为软件能够立即执行的输出而构建。

Microsoft-Decision-1 如何工作?

微软对 Qwen3.5-9B 进行了后训练,以实现单次通过的决策评分。给定情境、问题和固定选项,它能在一次调用中返回每个选项的概率。微软计划未来版本将基于 MAI 和 OpenAI 模型重新构建基础。

  • 是/否、多项选择、评级、分类和评分标准问题
  • 对 AI 响应和拟议智能体行动进行评分
  • 针对提供的证据进行事实核查
  • 明确的弃权选项,如“无法判断”

训练使用了微软开放数据流程下的公共数据集以及合成数据。输出格式为 JSON。OpenRouter 指出,权重会持续更新,但 API 接口保持不变。

它的速度和准确性如何?

微软在 36 项基准测试中对 9 个系统进行了比较,共涉及 147,137 个问题。这些基准测试在训练过程中保持盲测状态。Microsoft-Decision-1 以 83.5% 的平均准确率位居榜首。

其 p50 延迟为 85 毫秒,p95 延迟为 125 毫秒。这比 Quyet-1.0-Large 快 4.5 倍,比耗时 3.01 秒的 GPT-6 Sol 快 35 倍。

微软还测试了模型的鲁棒性。它对每个请求进行了 8 种方式的扰动,包括改写和选项重排。模型平均在 1.3% 的扰动情况下改变了决策。当选项被改写、反转或重排时,决策翻转次数为零。

在安全性方面,微软在 11 项基准测试中运行了 5,250 个请求。这些测试涵盖了有害内容、越狱攻击和提示注入。微软报告称,模型在保持高实用性的同时正确拒绝了恶意请求,但未公布具体分数。

微软报告的内部结果

  • Xbox Research:对 10,000 多条反馈项目进行了排序,速度比 GPT-6 Sol 快 14 倍,成本降低 200 倍。
  • Copilot 质量控制:与 GPT5.6 Luna 相当,速度快 100 倍。
  • Microsoft Discovery:一致性比 LLM 评分高出 46 倍,速度是其 3 倍。

它与其他决策模型相比如何?

准确率、校准度和延迟行数据来自微软的图表。竞争对手的延迟数据使用的是 JevBench v1.6.1 的调整后中位数。

延迟比较是否公平?

并不完全如此。微软通过 Foundry 测量了其自身模型的性能。竞争对手的数据使用的是 JevBench 的调整后中位数,而非原始计时数据。

H2O.ai 的模型卡片对此提出了异议。该卡片指出,JevBench 的调整后的数据将测量的时间翻倍并增加了 0.15 秒。H2O 表示其模型的中位数测量值为 29 毫秒,而非 210 毫秒。Microsoft-Decision-1 并未出现在 JevBench 榜单上。在该榜单的官方综合排名中,H2O-Lightning-4B 以 72.5 分位列第一。

开发者如何部署它?

开发者可以通过 Microsoft Foundry 将其作为一般可用的“Direct from Azure”模型进行调用。在 OpenRouter 上,它运行于 Decisions API,而非聊天端点。聊天补全 SDK 将无法使用。

定价为每百万输入令牌 0.042 美元,输出免费。OpenAI 的 Luna 决策端点收费为每百万输入令牌 0.10 美元。

存在哪些限制?

  • 不用于文本生成、开放式问答、聊天、翻译或摘要。
  • 仅限文本。不支持图像、音频或视频。
  • 输出中不包含解释或理由。
  • 不用于信贷、就业、住房、医疗保健或法律权利方面的单一自动化决策。
  • 应用程序必须定义选项、阈值、升级路径和人工监督。

关键要点

  • Microsoft-Decision-1 对固定选项进行评分,提供校准后的概率,而非生成文本。
  • 基于 Qwen3.5-9B 进行后训练,拥有 32,768 个令牌上下文窗口。
  • 在微软的 36 项基准测试对比中领先,准确率达到 83.5%,p50 延迟为 85 毫秒。
  • 成本为每百万输入令牌 0.042 美元;输出令牌免费。
  • 延迟比较存在争议;独立的 JevBench 结果仍在等待中。

Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一名富有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的举措是推出了一个名为 Marktechpost 的人工智能媒体平台,该平台以其深入报道机器学习与深度学习新闻而脱颖而出,内容既具备技术严谨性,又易于广大受众理解。该平台月浏览量超过 200 万次,彰显了其在受众中的受欢迎程度。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文