推理实测活动:同一模型在不同端点表现差异显著
在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


作者对 Qwen3.8-27B 在 MathArena/aime_2026 数据集上进行了 BF16 与 FP8 权重的对比评测,测试了 medium 和 xhigh 两种推理强度。结果显示,FP8 xhigh 表现优于 BF16 medium,与 BF16 xhigh 相当但速度更快。在问题 7 上,两种 xhigh 配置均因生成 token 达到上限而未给出答案。最终得分:BF16 medium 28/30,BF16 xhigh 29/30,FP8 medium 未提及,FP8 xhigh 29/30。
Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

NVIDIA cuOpt 在 Hans Mittelmann 基准测试的三个优化问题类别中被评为最快的开源求解器。


Databricks 举办了首届 Grounded Reasoning Cup,邀请 11 支学术团队在全新基准 OfficeQA Pro V2 上实时测试 AI 智能体。结果显示,基线前沿模型平均准确率不足 30%,而斯坦福团队通过端到端优化达到 63.3%。比赛凸显了泛化挑战,并指出企业级推理仍有很大提升空间。


Qwen 3.8 27B 在 Artificial Analysis 智能指数中得分 52,与 GPT-5.6 Luna(最大)持平,仅比 GLM-5.2(最大)和 DeepSeek V4 Pro 0813(最大)低一分。该模型以 27B 参数达到与更大模型相当的性能,展现了极高的效率。