← 返回信息流

精选Semiconductor Engineering短讯

边缘 AI 设计的隐藏挑战

semiengineering.com作者:Ann Mutschler模型AI评分:70/100

随着模型迭代速度超越芯片周期,芯片架构师必须在灵活计算、数据移动和纵深防御安全之间取得平衡。

关键要点:

  • 成功的边缘 AI 设计需要优先考虑长期的架构适应性、内存带宽和系统级效率,而非单纯的峰值 NPU TOPS。
  • 快速演进的 AI 模型与漫长的硅片开发周期之间的不匹配,使得硬件软件协同设计和异构计算变得日益重要。
  • 必须从一开始就在硬件中构建安全性,以防范软件供应链风险、数据泄露以及静默感知故障注入。

边缘计算的快速扩张正迫使芯片架构师和设计团队重新思考如何将 AI 融入垂直市场应用。根本挑战在于时间线的错配,因为工程团队必须针对 AI 模型、工作负载和部署需求进行设计,而这些因素在硅片决策锁定后不可避免地会发生转变。

此外,现实世界中的边缘性能很少取决于峰值 NPU TOPS。更多时候,它取决于内存带宽、延迟、功耗预算、安全性和数据移动。为了跟上不断演进的模型,架构师们 heavily 依赖灵活性——拥抱异构计算、可编程数据路径、可扩展内存、安全现场更新以及紧密的硬件软件协同设计。

但仅有灵活性是不够的。AI 在模型、数据、密钥、固件和推理管道方面引入了广泛的攻击向量,因此必须在第一天就将强大的安全性纳入硬件架构。同时,跨运行环境和框架的工具链碎片化使得硬件感知优化与原始计算能力同样重要。

这种结构性转变正在重新定义标准组件的边界。

“CPU 正变得越来越像 GPU,因为它们试图执行越来越多的并行处理,” Imagination Technologies 产品管理高级总监 Rob Fisher 表示。“NPU 也正变得越来越像 GPU,因为它们试图变得更加灵活,而交汇点在于 CPU、NPU 和 GPU 处于中间位置。我们发现越来越多的客户试图为未来对冲风险,而不是试图榨取今天性能的每一滴潜力。这意味着我们不再仅仅关注一个可以插入并只做类似 GPU 事情的标准 GPU。这对整个 SoC 产生了系统级影响。”

当将 AI 作为产品功能来设计边缘应用时,芯片架构师和设计团队有许多考量因素。硬件选择推动了更广泛的架构决策,但挑战远远超出了 NPU TOPS。

“AI 模型的性能取决于内存、延迟、功耗和安全的架构细节,”英飞凌物联网、计算与无线业务部门副总裁兼 PSOC 边缘 MCU 及边缘 AI 解决方案负责人 Eduardo Montanez 说。这就是为什么该公司的边缘微控制器包括内存可扩展性、低延迟架构和能源效率,以支持边缘电池供电的应用。它们还包括旨在保护数据和软件 IP 的安全功能。

边缘的 AI 应用已经给芯片架构师和设计团队带来挑战,使他们必须跟上模型和工作负载的快速变化。

“随着新网络不断涌现,任何解决方案都需要具备可编程性,以适应新网络、不断变化的激活函数和相应的数据类型,”Cadence 产品营销集团总监 George Wall 表示。“与此同时,还必须满足严格的性能要求。”

这使得硬件软件协同设计变得日益重要。“AI 模型、NPU、内存层次结构以及量化、剪枝和蒸馏等优化技术必须进行联合优化,以实现高效部署,”西门子 EDA 生成式 AI 集团产品经理 Niranjan Sitapure 指出。

整个管道也必须进行优化,因为成功取决于传感器摄取、数据预处理、推理、后处理以及持续的模型生命周期管理。

理想情况下,芯片架构师和设计团队应该对边缘应用的功能有详细的了解,包括其将使用的模型、所需的性能、可用内存以及功耗约束,以便他们能够设计出具有最佳 PPA(性能、功耗和面积)的芯片。

“不幸的是,现实并非如此。”Rambus 公司 Silicon IP 部门营销副总裁 Paul Karazuba 表示。“即使经过压缩,芯片设计周期也会比包含该芯片的任何产品发布早一年或更久。在此期间,合理地假设边缘应用会不断演进,包括底层模型的变更,以及可能变化的可用内存和功耗。这种应用的演进迫使芯片设计师集中精力打造能够适应变化需求的芯片,包括但不限于专注于高效且安全地移动数据。”

对于其他人来说,AI 加速并不是最大的挑战。限制芯片性能和效率的因素可能取决于应用程序的其他部分。

“但架构师和设计师并不为此而设计。他们专注于神经网络加速,声称非常高的理论 TOPS(每秒万亿次操作)数值,而没有任何实际应用程序能接近这一水平。”Efficient Computer 的首席技术官兼联合创始人 Graham Gobieski 说。“事实上,在许多真实的工作负载中(例如传感器融合、自动驾驶),应用程序的大部分仍然运行在 SoC 上现有的任何通用但效率极低的核心上。实现智能应用的真正机会不在于更快的 NPU,而在于使应用程序其余 80% 的部分与 AI 部分一样高效。”

除了效率之外,边缘 AI 应用还带来了众多的设计挑战。

核心设计挑战:性能不仅仅取决于所用可编程处理器的计算能力。“例如,内存带宽必须足够大,以确保为计算单元持续提供数据,并且这些数据需要位于处理器易于访问的位置,”Cadence 的 Wall 解释道。“否则,计算元素基本上会处于未充分利用的状态。确定工作负载需求很困难,因为芯片设计师不一定能洞察消费者在 3 到 5 年后将运行的网络。”

由于边缘 AI 本质上是一个受约束驱动的设计问题,这一挑战变得更加复杂。“你面临着严格的功耗预算、有限的内存、混合的传感器输入以及用户能立即感受到的延迟期望。架构必须在变得智能之前先具备效率,”Rambus 的 Karazuba 说道。

随着 AI 模型快速演进,系统架构需要具备针对大型数据集和 AI 模型的内存可扩展性,同时还需要足够的内存来支持设计中非 AI 部分的运行。

“此外,设计必须允许端到端的安全配置和部署,从而在不损害宝贵数据和软件 IP 的情况下进行现场更新,”Infineon 的 Montanez 指出。

在 DRAM 和计算引擎之间移动模型权重和激活值所消耗的功率可能超过 AI 计算本身。“AI 模型的演进速度快于硅开发周期。新的架构、算子和生成式 AI 工作负载不断涌现,给硬件平台带来保持适应性的压力,”Siemens 的 Sitapure 说。“对于关键/高风险应用,如 ADAS(高级驾驶辅助系统)、工业自动化和机器人技术,边缘系统需要可预测的延迟、高可靠性以及在连接受限情况下的运行能力。”

尽管数据移动可能主导性能和效率,但其他挑战可能会被忽视。“第一个很简单但也很有挑战性,”Efficient Computer 的 Gobieski 说。“智能必须适配到设备上。这意味着在运行任何应用程序代码之前,大量的工程工作都用于将神经网络压缩到设备内存中。第二个挑战有一个看似标准的答案,但却适得其反。将应用程序拆分到 NPU、CPU 和 DSP 上似乎是在发挥每个模块的优势,但它需要多种不同的工具链,从而增加了开发复杂性,并且会消耗在它们之间移动数据所节省下来的资源。”

硬件团队还面临着不可妥协的物理约束,尤其是严格的低功耗预算。Cadence 旗下公司 Secure-IC 的联合创始人兼首席技术官 Sylvain Guilley 指出,散热限制和电池约束规定了计算效率,同时任务关键型和安全性关键的边缘部署也对可靠性提出了苛刻要求。“解决这些核心挑战需要超越专有的、孤立的技术手段,转向更广泛的行业范围内对架构标准的统一。为了建立边缘硬件的标准开放框架规范,Cadence 正在一个新的 OCP FCSA 子项目工作流中着手解决这一问题。”

从开始就注重安全:希望为边缘设备添加 AI 的电子开发人员应从系统设计之初就整合几种安全技术。

起点是一个安全的平台,其次是安全的应用程序。“一个安全的平台是基础,”Synopsys 负责安全解决方案的产品管理高级总监 Dana Neustadter 说。“它奠定了基础,但并不会自动使应用程序——或 AI 的输出——变得可信。开发人员仍必须在应用层处理授权、数据保护、输出验证、连接服务安全和组件保证等问题。假设 AI 平台已经提供了信任根、安全启动、证明、加密通信和可信执行环境。这奠定了坚实的基础,但并不会自动使应用程序——或 AI 的输出——变得可信。”

在应用层,Neustadter 表示开发人员必须解决额外的控制措施,包括:

  • 授权:确保只有经过批准的用户和服务才能执行敏感操作。
  • 数据保护:在其整个生命周期中适当处理敏感信息。
  • 输出验证:在 AI 结果驱动决策或物理动作之前进行检查。
  • API 和云安全:保护连接的服务,尽管边缘部署更加强调设备本身。
  • 模型和组件保证:在部署前验证模型、AI 引擎、插件和其他第三方组件。

一个常见的误解是,只要 AI 在安全平台上运行,其结果就必须是可信的。考虑一台移动机器人,其模型报告走廊是空的。如果软件在不进行进一步检查的情况下接受该结果,机器人可能会移动并与意想不到的障碍物发生碰撞。“AI 为决策提供输入。它不应成为最终决策的唯一依据,”Neustadter 解释道。“应用程序应评估模型的置信度分数,并在授权行动之前完成额外的检查。它还应在设备采取行动之前应用相关的规则和安全策略,并确认环境。”

建立弹性平台也不能保证隐私。安全的硬件无法弥补不安全的应用层数据处理。例如,商场里的智能摄像头可能会分析顾客行为。即使设备是安全的,将这些分析存储在未加密的数据库中也可能让攻击者访问私人客户信息。

“安全硬件无法弥补应用层数据处理不安全的问题。开发人员应在数据的全生命周期中对敏感数据进行加密并强制执行访问控制。他们还应仅在必要时保留数据,并将数据的使用限制在授权的人员和服务范围内,”她说。

模型也应通过类似于安全启动的控制机制进行身份验证。在加载模型之前,系统应验证其身份、完整性、签名和来源。这也是为什么强大的信任根至关重要。Neustadter 解释说:“模型的机密性和访问控制也应纳入系统的密钥管理策略中。”

边缘 AI 系统可能需要额外的密钥。例如,第三方模型提供商可能希望防止设备所有者或其他方未经授权访问模型。因此,模型机密性和访问控制成为整体密钥管理策略的一部分。

所有模型和组件都可能引入软件供应链风险。开发人员通常依赖开源模型、AI 引擎、插件和其他外部组件。包含隐藏后门(backdoor)的模型可能会生成错误或有恶意的输出,如果系统将该模型视为可信,即使有安全硬件,它仍可能被执行。

“如果系统接受受损模型为可信,安全硬件仍会执行该模型。为了降低风险,开发人员因此应验证来源和完整性,验证供应商,使用受信任的代码仓库,并维护软件物料清单,”Neustadter 补充道。

Cadence 的 Guilley 表示,在设计边缘应用程序的安全性并减轻由 AI 引入的攻击面时,工程领导层应尽早让高层产品管理团队参与进来。这使得开发人员能够进行风险分析,并确定在硬件接口和软件层面上何处需要缓解措施。

他指出:“这种早期的架构基础直接影响了设备在网络弹性方面的整体战略。”[“尽早建立这一基础]使我们能够将网络安全视为一种投资而非成本,从而使后续运营能够安全地全天候展开,并将事件从紧急状况转化为业务连续性计划的一部分。”

当设计必须符合网络安全、AI 和数据隐私法规的复杂网络物理系统时,这种统一的安全与治理框架变得尤为重要。

Guilley 说:“设计团队必须不断应对严格的监管边界,特别是围绕欧盟《网络弹性法案》(Cyber Resilience Act)、关于捕获个人身份信息中的个人数据的法定要求,以及在更广泛的欧盟《人工智能法案》(EU AI Act)下执行的总体法定指令。”

信任根以及安全代码与非安全代码之间的隔离也很重要。Infineon 的 Montanez 说:“拥有一个管理代码身份验证的引导加载程序至关重要。”“随着 AI 向边缘迁移,大多数产品仍然采用与云结合的混合方法,允许进行 OTA 或其他通信。因此,边缘 AI 应用可能需要对连接链路增加额外的安全性。”

从大局来看,安全必须以硬件为基础,从安全启动和可信固件到受保护的密钥、内存和模型资产。由于模型、输入和输出都可能具有显著的经济价值,AI 提高了风险等级。

Karazuba 指出:“人们应该考虑到,经济价值不仅仅在于模型本身或模型内部的数据,还在于第三方篡改这些数据所带来的财务和法律影响。”

他说:“将 AI 引入边缘设备增加了以往非 AI 版本中通常不具备的功能和能力。鉴于安全漏洞带来的经济和法律影响的增加,设备制造商必须以更强的安全配置来设计支持 AI 的边缘设备。”

加密是另一个关键要素,西门子 Sitapure 表示。模型权重、训练数据和推理管道都应进行加密,并防止被篡改、提取和未经授权的访问。

最重要的是,安全不能被视为事后考虑的事项。“恶意行为者可能会尝试破解底层模型权重,并插入自己的模型以破坏子系统运行或利用系统中的其他安全漏洞,” Cadence 的 Wall 说。“幸运的是,方法范围从本地加密/解密引擎到专用的安全岛。”

更广泛地说,边缘 AI 中最危险的故障不是崩溃,而是一个仍在运行的系统,它默默地相信错误的状态。实时决策越来越依赖于设备端推理的完整性,因为边缘 AI 部署在依赖 NPU、GPU 和 TPU 以获得性能和效率的摄像头、机器人、车辆和工业系统中,但这些系统通常并未设计为确保在故障条件下的推理完整性。

在最近的一份白皮书中,Keysight 的安全研究人员展示了用于故障注入和测量的实验框图和物理设置,表明精确计时的故障注入(FI)可以在不修改固件、模型权重、软件配置或输入数据的情况下,破坏生产级边缘 AI 管道的输出。在运行 YOLOv5s_ReLU 的商业 Rockchip RK3568 平台上,大多数故障没有可观察到的影响,或者仅改变了置信度分数,但较小比例的故障导致了漏检、幻影对象以及罕见的具有高置信度的误分类,同时系统继续正常运行。这种影响可能超出单个推理错误。当受损的检测器输出反馈给下游跟踪系统时,即使是短暂或低概率的错误也可能被过滤为瞬态噪声,锁定为持久的跟踪对象,或被放大为更密集且持续时间更长的虚假系统状态。

在观察到的序列中,重复且有界的故障将瞬态检测器错误转化为持续的虚假感知,这些感知超出了原始故障窗口。一旦表现为系统状态,这些错误会影响警报、自动化逻辑和操作员决策,而平台看起来依然健康,这对产品团队具有深远影响。在此,传统的韧性指标,如正常运行时间或故障恢复,对于 AI 驱动的系统来说可能不足够。韧性还必须包括推理完整性,以及防止受损输出成为可信系统状态的能力。

与此同时,在某些应用中,计算的去中心化提供了一种基础性的安全优势,减少了敏感信息离开设备的数量。“在设备上运行推理意味着敏感数据从不传输,因此没有可供拦截的通信通道,去中心化处理意味着没有集中存储敏感数据的仓库可供入侵,” Efficient Computer 的 Gobieski 说。“一次妥协只会损失一台设备,而不是整个车队。模型本身确实存在关于其暴露内容的常规担忧,但这些担忧远小于通过将数据保留在设备上所消除的那些担忧。”

结论 驾驭边缘 AI 格局需要工程团队转变思维模式。成功不再仅仅取决于最大化理论峰值计算能力,而在于平衡硅片寿命与快速软件演进。通过从一开始就优先考虑灵活架构、软硬件协同设计和纵深防御安全,芯片设计师可以构建能够适应任何新兴 AI 工作负载的韧性平台——即使芯片架构已经确定。

相关阅读 AI 正在重写 IP 手册 随着半导体生态系统转向 AI,它正在改变 IP 的创建、验证、管理和销售方式。

安全认证即将成为芯片的必选项——但标准可能还不够。随着人工智能、后量子密码学、芯粒和定制硅的普及,攻击面不断扩大,半导体安全正从孤立的防护措施转向全栈验证。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文