SHELL PULSE

8月21日 · 星期五3

  1. Artificial Analysisby Artificial Analysis · 推文AI评分:50/100

    推理实测活动:同一模型在不同端点表现差异显著

    在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。

    X @ArtificialAnlys评测行业原文
  2. Reddit r/LocalLLaMAby /u/No_Run8812 · 短讯AI评分:70/100

    Qwen3.8-27B 在 AIME 2026 上 FP8 量化与 BF16 对比评测

    作者对 Qwen3.8-27B 在 MathArena/aime_2026 数据集上进行了 BF16 与 FP8 权重的对比评测,测试了 medium 和 xhigh 两种推理强度。结果显示,FP8 xhigh 表现优于 BF16 medium,与 BF16 xhigh 相当但速度更快。在问题 7 上,两种 xhigh 配置均因生成 token 达到上限而未给出答案。最终得分:BF16 medium 28/30,BF16 xhigh 29/30,FP8 medium 未提及,FP8 xhigh 29/30。

    reddit.com评测模型原文
  3. Meta AIby Meta AI · 推文AI评分:70/100

    Meta 预览 WildArtifactBench 评估框架

    Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

    X @AIatMeta评测模型原文