推理实测活动:同一模型在不同端点表现差异显著
在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


作者对 Qwen3.8-27B 在 MathArena/aime_2026 数据集上进行了 BF16 与 FP8 权重的对比评测,测试了 medium 和 xhigh 两种推理强度。结果显示,FP8 xhigh 表现优于 BF16 medium,与 BF16 xhigh 相当但速度更快。在问题 7 上,两种 xhigh 配置均因生成 token 达到上限而未给出答案。最终得分:BF16 medium 28/30,BF16 xhigh 29/30,FP8 medium 未提及,FP8 xhigh 29/30。
Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

NVIDIA cuOpt 在 Hans Mittelmann 基准测试的三个优化问题类别中被评为最快的开源求解器。

