SHELL PULSE

10月5日 · 星期一1 条

  1. 精选GitHub Blogby Michelle Zhou · 产品AI评分:70/100

    ReviewBench:面向 AI 代码审查的开放基准测试

    GitHub 发布 ReviewBench,这是一个针对 AI 代码审查智能体的开放基准测试。该基准基于具有代表性的 GitHub Pull Requests、多源真实标签、校准评估以及生产环境对齐指标构建,旨在客观衡量 AI 在代码审查场景下的实际表现与能力。

    Michelle Zhou
    github.blog评测原文

9月30日 · 星期三1 条

9月25日 · 星期五1 条

  1. 精选Stanford HAI新闻AI评分:70/100

    斯坦福研究指出:当前AI评测基准可能名不副实

    斯坦福大学研究人员发表新研究,质疑主流AI评测基准的有效性。研究发现,许多声称测量偏见或推理能力的基准测试实际上并未达到预期目标,甚至出现相互矛盾的结果。例如,某偏见测试可能仅反映模型的阅读理解能力而非真实偏见。研究呼吁业界采用更严谨的科学方法重新评估AI性能。

    hai.stanford.edu评测论文原文

9月24日 · 星期四1 条

9月23日 · 星期三1 条

9月22日 · 星期二1 条

  1. 精选Hugging Face Blog新闻AI评分:70/100

    英国AI研究所与EvalEval如何使基准测试结果可复现

    英国人工智能研究所(AISI)与评估平台EvalEval合作,致力于解决AI模型基准测试中的结果不可复现问题。该举措旨在通过标准化流程和透明化数据,确保不同机构发布的性能评测具有可比性和可信度,为行业建立统一的评估标准。

    huggingface.co评测原文

9月19日 · 星期六1 条

9月10日 · 星期四1 条

  1. 精选AWS AI Blogby Surafel Lakew · 新闻AI评分:70/100

    面向多轮对话的智能体评估指标 AEM

    作者提出 Agent Evaluation Metric(AEM),一种可分解的逐轮评估方法,用于衡量多轮智能体的质量。多轮智能体的失败模式是单轮评估无法捕捉的:早期某一轮的错误会污染后续所有轮次。AEM 首个维度为正确性,可定位导致失败的具体轮次,并将其与被动继承错误的后续轮次区分开。

    One early error in turn 2 cascades through turns 3 to 5, while turn-level evaluation isolates the single root causeA top-level correctness score breaking into named sub-metrics that are measured independently and recombined, extensibl…
    aws.amazon.com评测论文原文

8月28日 · 星期五1 条

8月27日 · 星期四1 条

  1. 精选Google DeepMind Blog新闻AI评分:70/100

    全球首次双盲AI评估试点启动

    某机构启动了全球首个双盲AI评估试点,旨在通过隐藏模型身份减少评估偏差,提升AI性能比较的客观性。此举有望为AI评测设立新标准,影响行业评估方法。

    A translucent blue-green cube with keyholes and a padlock symbol, with glowing yellow and green light beams passing thr…
    deepmind.google评测行业原文

8月24日 · 星期一1 条

  1. 精选SemiAnalysisby Cam Quilici · 新闻AI评分:70/100

    AgentX 发布 InferenceXv3:智能体推理中的 CUDA 护城河是否稳固?

    AgentX 团队发布了 InferenceXv3,一个面向智能体推理的基准测试,并开源了价值 300 万美元的数据集。该基准支持超过 100 万上下文长度、多轮对话和子智能体,KVCache 命中率超过 95%。测试覆盖 GB300 NVL72、MI355、B200 等硬件,旨在评估 CUDA 生态在智能体推理中的优势是否依然存在。

    newsletter.semianalysis.com评测开源原文

8月18日 · 星期二1 条

  1. 精选Simon Willison新闻AI评分:70/100

    Qwen 3.8 27B 在 Artificial Analysis 智能指数中得分 52

    Qwen 3.8 27B 在 Artificial Analysis 智能指数中得分 52,与 GPT-5.6 Luna(最大)持平,仅比 GLM-5.2(最大)和 DeepSeek V4 Pro 0813(最大)低一分。该模型以 27B 参数达到与更大模型相当的性能,展现了极高的效率。

    simonwillison.net评测模型原文