热点MarkTechPost产品
微软发布 Microsoft-Decision-1:基于 Qwen3.5-9B 的决策评分模型
微软推出 Microsoft-Decision-1,这是一个用于路由、分类、验证和智能体控制的决策模型。该模型基于阿里 Qwen3.5-9B 进行后训练,不生成文本,而是为每个固定选项返回校准后的概率值。目前已在 Microsoft Foundry 和 OpenRouter 上线可用。
- 编辑精选
- 智能体 AI
- 技术
- AI 短片
- 人工智能
- 应用
- 语言模型
- 决策模型
- 面向开发者
- 大语言模型
- 机器学习
- 新发布
- 科技新闻
- Python
- 软件工程
- 员工专栏
微软发布了 Microsoft-Decision-1,这是一个用于路由、分类、验证和智能体控制的决策模型。Microsoft-Decision-1 是一个决策评分模型,它为每个固定的答案选项返回校准后的概率,而不是生成文本。该模型基于阿里巴巴的 Qwen3.5-9B 进行后训练,目前已在 Microsoft Foundry 和 OpenRouter 上提供使用。
TL;DR(太长不看)
- 规模:基于 Qwen3.5-9B 构建;确切参数量未披露。上下文窗口为 32,768 个 token。
- 运行环境:仅限托管 API(通过 Azure 在 Microsoft Foundry 和 OpenRouter 上)。无开源权重,无量化变体,硬件信息未披露。
- 性能:在微软的 36 项基准测试对比中,平均准确率最高,p50 延迟为 85 毫秒。
- 最佳表现:在 36 项基准测试中平均准确率为 83.5%,领先于 Quyet-1.0-Large 的 81.9%。
- 最差表现:校准度为 92.2,仅次于 Quyet-1.0-Large 的 93.1。仅支持文本输出,不提供解释。
- 总结:最大优点:快速、廉价且校准良好的决策,每百万输入 token 成本为 0.042 美元,输出免费。最大缺点:权重封闭,且所有基准测试均由厂商自行运行。
什么是决策模型?
决策模型读取输入并对一组封闭的选项进行评分。它不撰写散文。微软将决策模型定义为一种新的 AI 类别,专为软件能够立即执行的输出而构建。
Microsoft-Decision-1 如何工作?
微软对 Qwen3.5-9B 进行了后训练,以实现单次通过的决策评分。给定情境、问题和固定选项,它能在一次调用中返回每个选项的概率。微软计划未来版本将基于 MAI 和 OpenAI 模型重新构建基础。
- 是/否、多项选择、评级、分类和评分标准问题
- 对 AI 响应和拟议智能体行动进行评分
- 针对提供的证据进行事实核查
- 明确的弃权选项,如“无法判断”
训练使用了微软开放数据流程下的公共数据集以及合成数据。输出格式为 JSON。OpenRouter 指出,权重会持续更新,但 API 接口保持不变。

它的速度和准确性如何?
微软在 36 项基准测试中对 9 个系统进行了比较,共涉及 147,137 个问题。这些基准测试在训练过程中保持盲测状态。Microsoft-Decision-1 以 83.5% 的平均准确率位居榜首。
其 p50 延迟为 85 毫秒,p95 延迟为 125 毫秒。这比 Quyet-1.0-Large 快 4.5 倍,比耗时 3.01 秒的 GPT-6 Sol 快 35 倍。
微软还测试了模型的鲁棒性。它对每个请求进行了 8 种方式的扰动,包括改写和选项重排。模型平均在 1.3% 的扰动情况下改变了决策。当选项被改写、反转或重排时,决策翻转次数为零。
在安全性方面,微软在 11 项基准测试中运行了 5,250 个请求。这些测试涵盖了有害内容、越狱攻击和提示注入。微软报告称,模型在保持高实用性的同时正确拒绝了恶意请求,但未公布具体分数。
微软报告的内部结果
- Xbox Research:对 10,000 多条反馈项目进行了排序,速度比 GPT-6 Sol 快 14 倍,成本降低 200 倍。
- Copilot 质量控制:与 GPT5.6 Luna 相当,速度快 100 倍。
- Microsoft Discovery:一致性比 LLM 评分高出 46 倍,速度是其 3 倍。
它与其他决策模型相比如何?
准确率、校准度和延迟行数据来自微软的图表。竞争对手的延迟数据使用的是 JevBench v1.6.1 的调整后中位数。
延迟比较是否公平?
并不完全如此。微软通过 Foundry 测量了其自身模型的性能。竞争对手的数据使用的是 JevBench 的调整后中位数,而非原始计时数据。
H2O.ai 的模型卡片对此提出了异议。该卡片指出,JevBench 的调整后的数据将测量的时间翻倍并增加了 0.15 秒。H2O 表示其模型的中位数测量值为 29 毫秒,而非 210 毫秒。Microsoft-Decision-1 并未出现在 JevBench 榜单上。在该榜单的官方综合排名中,H2O-Lightning-4B 以 72.5 分位列第一。
开发者如何部署它?
开发者可以通过 Microsoft Foundry 将其作为一般可用的“Direct from Azure”模型进行调用。在 OpenRouter 上,它运行于 Decisions API,而非聊天端点。聊天补全 SDK 将无法使用。
定价为每百万输入令牌 0.042 美元,输出免费。OpenAI 的 Luna 决策端点收费为每百万输入令牌 0.10 美元。
存在哪些限制?
- 不用于文本生成、开放式问答、聊天、翻译或摘要。
- 仅限文本。不支持图像、音频或视频。
- 输出中不包含解释或理由。
- 不用于信贷、就业、住房、医疗保健或法律权利方面的单一自动化决策。
- 应用程序必须定义选项、阈值、升级路径和人工监督。
关键要点
- Microsoft-Decision-1 对固定选项进行评分,提供校准后的概率,而非生成文本。
- 基于 Qwen3.5-9B 进行后训练,拥有 32,768 个令牌上下文窗口。
- 在微软的 36 项基准测试对比中领先,准确率达到 83.5%,p50 延迟为 85 毫秒。
- 成本为每百万输入令牌 0.042 美元;输出令牌免费。
- 延迟比较存在争议;独立的 JevBench 结果仍在等待中。
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一名富有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的举措是推出了一个名为 Marktechpost 的人工智能媒体平台,该平台以其深入报道机器学习与深度学习新闻而脱颖而出,内容既具备技术严谨性,又易于广大受众理解。该平台月浏览量超过 200 万次,彰显了其在受众中的受欢迎程度。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。