← 返回信息流

dev.to #ai新闻

AWS 推出无代码 Serverless AI Runtime,专注算力部署

dev.to作者:TechPulse产品AI评分:70/100

AWS 在 re:Invent 大会上正式发布 Serverless AI Runtime。该服务允许开发者无需配置服务器即可按需运行机器学习推理工作负载,旨在消除企业集成 AI 时的基础设施瓶颈,实现真正的无代码部署体验。

亚马逊云科技(AWS)正式推出了全新的 Serverless AI Runtime,这是其云计算服务的一项重大更新,旨在消除部署机器学习模型时对专用基础设施的需求。该功能于 2024 年 11 月底在 re:Invent 大会上宣布,允许开发人员按需运行推理工作负载而无需预置服务器,标志着企业在整合 AI 方式上的重大转变。

消除基础设施瓶颈

多年来,在生产环境中部署 AI 模型一直是一项后勤噩梦。工程师必须管理 Kubernetes 集群、处理自动扩缩容,并为闲置资源付费——这往往导致云账单膨胀。新的 AWS Serverless AI Runtime 通过提供一个托管环境来解决这一问题,用户只需上传模型工件(如 ONNX 或 PyTorch 格式)并定义输入/输出模式。该服务仅在活动推理请求期间自动分配必要的 GPU 或 CPU 资源。

“我们发现 60% 的客户在扩展 AI 工作负载的操作开销方面遇到困难,”AWS 人工智能副总裁 Swami Sivasubramanian 表示,“此次更新消除了猜测。您专注于模型,我们负责计算,确保您只为 AI 实际工作的毫秒数付费。”

行业影响与成本考量

这对科技行业的影响深远,尤其是对初创企业和中型公司而言。通过消除维护 AI 基础设施的固定成本,复杂 AI 应用的入门门槛显著降低。早期测试者报告称,与传统基于 EC2 的部署相比,重度推理工作负载的月度云支出减少了 40-60%。

此举也加剧了云市场的竞争。虽然 Azure 和 Google Cloud 也有类似的无服务器产品,但 AWS 与其现有数据服务和安全控制生态系统的深度整合赋予了它独特的优势。Gartner 的分析人士指出,这一功能可能会加速生成式 AI 在传统行业(如金融和医疗)中的采用,这些行业对延迟和成本敏感度极高。

技术细节与可用性

该服务支持广泛的模型架构,包括高达 700 亿参数的大型语言模型(LLM)。它与 AWS Lambda 和 Step Functions 无缝集成,允许构建复杂的、事件驱动的工作流。定价基于按请求计费模式,并为小规模原型开发提供免费层级。该服务目前在美国东部(北弗吉尼亚)和欧盟(法兰克福)地区全面可用,并计划在下个季度扩展到亚太地区。

开发人员可以通过 AWS Console 或 CLI 立即开始测试该功能。此次发布还包括用于 Python 和 Java 的新 SDK,简化了模型打包和部署的过程。安全仍然是重中之重,提供传输中和静态数据的端到端加密,并符合 SOC 2 和 HIPAA 标准。

展望未来

随着 AWS 进一步深入无服务器 AI 领域,我们预计将看到利用这一新运行时的第三方工具迅速创新。初创企业可能会调整其商业模式,在此低成本基础之上构建专门的 AI 应用,从而可能颠覆现有的 SaaS 提供商。对于开发人员来说,管理 AI 基础设施的时代即将结束,取而代之的是纯粹关注模型性能和应用程序逻辑。此次更新巩固了 AWS 在云计算创新领域的领导地位,为整个行业树立了新的标杆。

阅读原文