SHELL PULSE

10月7日 · 星期三1 条

  1. 精选UK AI Security Institute产品AI评分:70/100

    Transect:让大规模智能体评估更易理解

    AISI 联合 Meridian Labs 发布开源 Python 包 Transect,基于 Inspect Scout 构建。该工具将复杂的智能体评估转录转化为交互式报告,帮助审查者直观追踪评估过程、分析信号(如 Token 消耗)并定位关键转录片段,解决传统评估分数无法反映智能体策略和调试过程的痛点。

    Figure 1. An illustration of the Transect report. Activity labels and token information share the same turn axis. In theFigure 2. Recorded activity and shared-file access in one research run. Upper bars span each conversation or task's firs
    aisi.gov.uk开源产品原文

10月1日 · 星期四1 条

9月29日 · 星期二1 条

  1. 精选GitHub Blogby Kevin Stubbings · 短讯AI评分:70/100

    我们如何利用开源 AI 安全代理发现 24 个 Android 漏洞

    GitHub Blog 发布文章,介绍其开源 AI 安全代理在 Android 应用中发现的 24 个漏洞。内容涵盖针对该任务的特定 AI 工作流、发现的严重 Android Bug 详情,以及如何让用户在自己的应用中运行该开源代理。

    github.blog开源产品原文

9月17日 · 星期四1 条

  1. 精选AWS AI Blogby Michael Hsieh · 新闻AI评分:70/100

    用开源智能体技能提升医疗与生命科学领域的 AI 推理能力

    针对基础模型智能体在医疗与生命科学(HCLS)决策中常引用正确指南却错误应用的问题,作者开源了覆盖 11 个 HCLS 领域的 38 个智能体技能,并给出安装步骤、三个实际用例,以及基于 410 条提示词的评测,显示胜率达 70%–86%。

    Table of the eight domain specialist agents in the Kiro CLI multi-agent architecture and the skills assigned to each
    aws.amazon.com开源产品原文

9月16日 · 星期三1 条

  1. 精选Hugging Face Blog新闻AI评分:70/100

    智能体评测新指标:一致性差距揭示可靠性问题

    研究指出主流智能体评测只报告平均成功率(Mean@k),掩盖了可靠性问题。在 AppWorld 上,GPT-4.1 驱动的 ReAct 智能体平均成功率 77.4%,但五次重复全部成功的任务仅占 53.0%,一致性差距达 24.4 个百分点,困难任务上更达 30 点。作者提出 Consistency Analyzer,通过重采样轨迹定位易翻转的决策点,并生成一致性指南,将差距从 24.4pp 降至 12.0pp,且不损失平均准确率。

    Mean@5 vs. Pass^5 by task difficulty, GPT-4.1 on AppWorld test_normal, with the consistency gap called out in redconsistency-guideline-pipeline
    huggingface.co开源教程模型原文

9月10日 · 星期四1 条

  1. 精选Together AI新闻AI评分:70/100

    ThunderKittens 移植到 NVIDIA Vera Rubin NVL72

    ThunderKittens 团队将其内核库移植到 NVIDIA Vera Rubin NVL72,并围绕新硬件重写 NVFP4 GEMM,性能从 roofline 的 42% 提升到超过 22 PFLOPS,与 cuBLAS 和 CuTe DSL 相当。文章还介绍了 ISA 的变化及适配方式。

    Astronomer Kittens. So cute!Bar chart “NVFP4 GEMMs on HGX B200”: TFLOPS by matrix size for ThunderKittens, cuBLASLt, and CuTeDSL.
    together.ai开源评测原文

9月1日 · 星期二1 条

  1. 精选Hugging Face Blog新闻AI评分:70/100

    Hugging Face 发布 200 多个 WebGPU 内核,加速本地 AI 推理

    Hugging Face 推出了 @huggingface/kernels 库,包含 200 多个 WebGPU 内核,旨在提升浏览器端 AI 推理性能。该库为开发者提供了优化的计算内核,可加速本地模型运行,减少延迟,推动端侧 AI 应用发展。

    The ai.onnx.Add repository packages its manifest, correctness and benchmark cases, and WGSL shader templates together.All 207 WebGPU kernels on the Hub's Kernels page, filtered by platform.
    huggingface.co开源产品原文

8月27日 · 星期四1 条

  1. 精选UK AI Security Institute新闻AI评分:70/100

    最优停止:在评估计算上花在刀刃上

    英国AI安全研究所(AISI)开发并开源了Python包optstop,用于在模型评估中动态停止计算,当性能估计足够精确时提前终止,从而节省57%至97%的计算资源。该方法解决了固定预算评估低估智能体能力的问题,提高了评估效率。

    Figure 1. Additional trials initially reduce uncertainty quickly, but eventually add cost with little further gain in prFigure 2. Full-run and stopped-run performance across all 9 settings (points, with task-level 95% confidence intervals),
    aisi.gov.uk开源教程原文

8月19日 · 星期三1 条

  1. 精选Simon Willison新闻AI评分:70/100

    Mojo 编程语言现已开源

    Mojo 编程语言于 2023 年 5 月承诺开源,上周发布 1.0 版本后,本周兑现承诺,将编译器和工具链以 Apache 2 许可证开源。Mojo 最初目标是成为 Python 的超集,但 2025 年 8 月调整方向,不再强求完全兼容 Python,而是专注于 GPU 编程,利用 AI 辅助编码工具帮助迁移。

    simonwillison.net开源行业原文