SHELL PULSE

8月21日 · 星期五2

  1. Artificial Analysisby Artificial Analysis · 推文AI评分:50/100

    推理实测活动:同一模型在不同端点表现差异显著

    在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。

    X @ArtificialAnlys评测行业原文
  2. Meta AIby Meta AI · 推文AI评分:70/100

    Meta 预览 WildArtifactBench 评估框架

    Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

    X @AIatMeta评测模型原文