Transect:让大规模智能体评估更易理解
AISI 联合 Meridian Labs 发布开源 Python 包 Transect,基于 Inspect Scout 构建。该工具将复杂的智能体评估转录转化为交互式报告,帮助审查者直观追踪评估过程、分析信号(如 Token 消耗)并定位关键转录片段,解决传统评估分数无法反映智能体策略和调试过程的痛点。


AISI 联合 Meridian Labs 发布开源 Python 包 Transect,基于 Inspect Scout 构建。该工具将复杂的智能体评估转录转化为交互式报告,帮助审查者直观追踪评估过程、分析信号(如 Token 消耗)并定位关键转录片段,解决传统评估分数无法反映智能体策略和调试过程的痛点。


EleutherAI 发布 Olmo-core 3,旨在为大型混合专家(MoE)模型提供开源、可扩展的训练基础设施。


GitHub Blog 发布文章,介绍其开源 AI 安全代理在 Android 应用中发现的 24 个漏洞。内容涵盖针对该任务的特定 AI 工作流、发现的严重 Android Bug 详情,以及如何让用户在自己的应用中运行该开源代理。
针对基础模型智能体在医疗与生命科学(HCLS)决策中常引用正确指南却错误应用的问题,作者开源了覆盖 11 个 HCLS 领域的 38 个智能体技能,并给出安装步骤、三个实际用例,以及基于 410 条提示词的评测,显示胜率达 70%–86%。

研究指出主流智能体评测只报告平均成功率(Mean@k),掩盖了可靠性问题。在 AppWorld 上,GPT-4.1 驱动的 ReAct 智能体平均成功率 77.4%,但五次重复全部成功的任务仅占 53.0%,一致性差距达 24.4 个百分点,困难任务上更达 30 点。作者提出 Consistency Analyzer,通过重采样轨迹定位易翻转的决策点,并生成一致性指南,将差距从 24.4pp 降至 12.0pp,且不损失平均准确率。


ThunderKittens 团队将其内核库移植到 NVIDIA Vera Rubin NVL72,并围绕新硬件重写 NVFP4 GEMM,性能从 roofline 的 42% 提升到超过 22 PFLOPS,与 cuBLAS 和 CuTe DSL 相当。文章还介绍了 ISA 的变化及适配方式。


Hugging Face 推出了 @huggingface/kernels 库,包含 200 多个 WebGPU 内核,旨在提升浏览器端 AI 推理性能。该库为开发者提供了优化的计算内核,可加速本地模型运行,减少延迟,推动端侧 AI 应用发展。


英国AI安全研究所(AISI)开发并开源了Python包optstop,用于在模型评估中动态停止计算,当性能估计足够精确时提前终止,从而节省57%至97%的计算资源。该方法解决了固定预算评估低估智能体能力的问题,提高了评估效率。


Mojo 编程语言于 2023 年 5 月承诺开源,上周发布 1.0 版本后,本周兑现承诺,将编译器和工具链以 Apache 2 许可证开源。Mojo 最初目标是成为 Python 的超集,但 2025 年 8 月调整方向,不再强求完全兼容 Python,而是专注于 GPU 编程,利用 AI 辅助编码工具帮助迁移。