← 返回信息流

精选Semiconductor Engineering论文

面向高吞吐 LLM 推理的高带宽闪存(HBF)研究

semiengineering.com作者:Technical Paper Link论文AI评分:70/100

加州大学伯克利分校与 FuriosaAI 合作发表技术论文,提出利用高带宽闪存(HBF)解决大语言模型推理中的内存瓶颈。随着模型规模扩大和上下文变长,传统内存容量和带宽成为性能制约因素。该研究通过表征 HBF 特性,旨在优化模型权重存储与 KV Cache 管理,从而提升 LLM 服务吞吐量,特别针对 Agentic 工作负载进行优化。

加州大学伯克利分校与 FuriosaAI 的研究人员发表了一篇题为《表征用于大语言模型服务的高带宽闪存》的技术论文。

摘要:“大语言模型(LLM)服务需要大量内存来存储模型权重和 KV 缓存。随着模型规模增大和上下文变长,内存容量和带宽日益成为服务性能瓶颈。智能体工作负载通过不断增长的上下文中的重复交互加剧了这一压力,使得保留 KV 状态以供复用变得愈发重要。高带宽闪存(HBF)为扩展大语言模型服务的加速器内存容量提供了一种途径,但其访问成本和有限的写入耐久性使其应用变得复杂。我们针对高吞吐量的智能体服务场景,从系统设计和调度策略两个维度评估了 HBF 的应用,以探究额外容量何时能提升服务性能和能效。我们提出了一种 HBM-HBF-主机分层存储系统以及缓冲式缓存感知调度机制,并利用跟踪驱动仿真分析了它们对性能、能耗及 HBF 写入寿命的影响。在评估的工作负载中,配备最快 HBF 的系统相比仅使用 HBM 的系统,完成时间缩短了 36.1%-87.0%。建模显示的节能幅度可达 55.8%,尽管在某些轻量级工作负载下 HBF 会增加能耗。在评估的配置中,缓冲式缓存感知调度将预估的 HBF 写入寿命从 4.77 年延长至 14.82 年。这些结果证明了协调数据放置与调度对于提升服务效率并维持实际可行的 HBF 写入寿命的重要性。”

在此处查阅技术论文。2026 年 9 月。

Yu, Zack, Chloe Wong, Coleman Hooper, Minjae Lee, Wonjun Kang, Youngjin Cho, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami. “Characterizing High Bandwidth Flash for LLM Serving.” arXiv preprint arXiv:2609.39131 (September 2026). https://doi.org/10.48550/arXiv.2609.39131

阅读原文