精选AWS AI Blog新闻
AWS向量解决方案:在数据所在之处构建智能体AI
AWS推出向量搜索解决方案,将向量能力集成到现有数据库和存储服务中,无需迁移数据。该方案覆盖六种服务,提供决策模型,支持RAG、语义搜索、混合搜索等智能体AI用例,并强调在数据所在处添加向量,以降低成本、提升性能。
Agentic AI正在改变你的工作方式,而向量搜索为检索层提供动力,使智能体能够基于真实数据做到准确、贴合语境且有据可依。智能体在多步骤工作流中进行规划、推理和行动,因此快速、精准地访问你所在组织的知识库至关重要。
这些知识已经存在于数据库、对象存储、搜索引擎以及非结构化来源(如PDF、录制的视频通话和你的团队日常使用的系统)之中。AWS向量解决方案将智能搜索和检索能力带到你的数据所在之处,帮助智能体找到并使用正确的上下文,而无需你迁移或复制数据。
对于没有现有数据存储适用的全新工作负载,我们提供了涵盖六种专用解决方案的清晰决策模型,让你能够为Agentic AI和分析工作负载选择正确的向量解决方案。
为什么向量至关重要,以及Agentic AI的主要用例
向量是AI的语言。它们连接了前沿模型与数十年来积累的分散组织知识。通过将数据表示为高维向量,应用程序可以理解语义含义,识别文本、图像、音频和视频之间的关系,并在会话之间保持上下文。无论你处理的是产品描述、安全日志还是媒体库,向量都能将所有内容转换为一个共享的数学空间,使你能够跨模态进行比较和搜索。
- 检索增强生成(RAG)和知识库通过运行时检索到的可信数据为前沿模型的响应提供依据,提高准确性、减少幻觉,并生成与组织知识一致的响应。
- 语义搜索基于含义和意图而非精确关键词匹配来检索信息,使用户即使使用不同术语也能发现相关内容。
- 混合搜索将词法搜索与语义搜索相结合,在结构化和非结构化数据上提供全面结果。
- GraphRAG将语义搜索与知识图谱相结合,为需要多步推理的企业场景提供准确、上下文丰富且可追溯的响应。
- 知识图谱通过显式关系连接实体(如人员、产品、文档和概念),支持更智能的搜索、发现和AI驱动的推理。
- 实时推荐系统通过零售、媒体和娱乐领域的向量相似性,识别符合用户兴趣的产品、内容或体验,实现个性化推荐。
- 异常和欺诈检测识别高维数据中的异常模式,支持更早发现威胁、网络安全问题或设备故障。
- 多模态内容发现基于语义含义而非文件类型或元数据,使用单一查询跨文本、图像、音频和视频进行搜索。
好消息是,对于大多数这些用例,你不需要新的数据库。借助AWS,你可以在数据所在之处获得向量能力,涵盖你已熟悉并使用的服务和数据库,无需数据迁移。
下图展示了AWS向量能力的广度以及Agentic AI的主要用例。

首要原则:在数据所在之处添加向量
这是指导我们整体方法的准则。如果你已经拥有AWS数据存储,就在该数据存储中添加向量搜索。除非有令人信服的理由,否则不要引入新服务。向量与源数据保持在一起,消除了跨服务跳转,并将向量搜索与原生查询能力相结合。
当你使用现有数据存储时,你消除了学习新编程工具、API、SDK等的曲线。你也可以确信现有数据存储满足你的需求。例如,你的数据库在生产环境中已验证了可扩展性、可用性和性能,现在将继续通过向量搜索提供这些能力。最后,当你的向量和数据存储在同一位置时,应用程序运行更快。无需担心数据同步或数据移动。通过基于已有投资进行构建,你还能实现成本节约。
如果你的数据已经存在于Amazon OpenSearch Service、Amazon Simple Storage Service(Amazon S3)、Amazon Aurora PostgreSQL、Amazon DynamoDB、Amazon ElastiCache for Valkey或Amazon Neptune中,就在数据所在之处添加向量。正确的向量搜索解决方案跟随数据,而不是反过来。
对于新工作负载,请确定你的主要需求:延迟、成本或访问模式,并选择针对该需求优化的引擎。许多工作负载需要在搜索、规模和Agentic AI集成之间取得平衡。对于这些情况,默认选择Amazon OpenSearch Service,它在一个系统中结合了词法搜索、向量搜索、混合搜索和Agentic搜索,具备高吞吐量、低延迟和大规模相关结果。
以下决策模型可帮助您根据工作负载需求选择合适的向量解决方案。

Amazon OpenSearch Service:新工作负载的默认选择
Amazon OpenSearch Service 是一种托管检索引擎,将词汇搜索、向量搜索和混合搜索整合于单一系统中,具备高吞吐量、低延迟和大规模下的相关结果。它支持多种索引策略、向量量化和元数据过滤,可从简单的 RAG 应用扩展至先进的多信号检索。基于机器学习(ML)的自动优化可自动选择正确配置,免去手动调优。GPU 加速索引可将海量数据集的索引速度提升至原来的 10 倍,而成本仅为原来的四分之一,同时 UltraWarm 和 Writable Warm 存储层可降低不常访问数据的存储成本。
建议将 OpenSearch Service 作为新工作负载的默认选择,因为大多数新工作负载并不存在单一的主导需求。它们需要在搜索、规模和 agentic AI 集成之间取得平衡。OpenSearch Service 在延迟、向量规模、每秒查询数(QPS)、成本效率、混合搜索和易用性方面提供了最大的灵活性。它覆盖了最广泛的用例,包括 RAG、异常检测、多模态内容发现,以及任何需要混合搜索的工作负载。它支持数十亿级向量规模,可处理数千 QPS,服务超过 10 万月活跃客户,每月处理超过 10 万亿次请求。
下一代 Amazon OpenSearch Serverless 专为 agentic AI 和动态工作负载而构建。其自动扩缩速度比上一代快 20 倍,可在数秒内完成配置,并能从零扩展到每秒数千次请求。空闲时还可缩回至零,与按峰值容量配置相比,可节省高达 60% 的成本。您只需为实际消耗的容量付费。如果您的 agent 未在运行,则无需支付任何费用。
Adobe 采用 OpenSearch Service 将其 Acrobat AI Assistant 扩展至服务数亿用户。这是一个对话式生成式 AI 引擎,直接集成到 Adobe 的文档生态系统中。
Amazon S3 Vectors:任意规模下的成本优化向量存储
Amazon S3 Vectors 是 Amazon S3 的一项功能,也是首个原生支持存储和查询向量的云对象存储。它将 S3 的成本结构、规模和简洁性引入向量存储,与专用向量数据库相比,上传、存储和查询向量的成本可降低高达 90%。这使得构建和维护十亿级向量索引在经济上切实可行,可增强 AI agent 的记忆、上下文以及跨 Amazon S3 中存储内容的语义搜索,且无需管理任何基础设施。
自 S3 Vectors 正式发布以来,客户平均每天执行数千万次查询,较预览期间增长超过 5 倍。近期两项增强改进了查询体验和定价。首先,S3 Vectors 现在支持每次查询最多返回 10,000 条搜索结果,提升了 100 倍,这对于应用重排序、聚合或去重以生成更相关结果集的多阶段检索管道尤为有价值。其次,针对包含超过 1,000 万个向量的向量索引,查询费用现在最高可降低 80%,大幅降低了在大规模 AI、RAG 和语义搜索工作负载中运行相似性搜索的成本。
当您需要经济高效的向量存储,并对大型向量数据集进行低频查询时,可选择 Amazon S3 Vectors,它支持简单的向量搜索和元数据过滤。当延迟可接受约 100 毫秒或更高时,或对于中等 QPS 下快速增长的数据集,也推荐使用该服务。每个向量索引最多支持 20 亿个向量,采用按查询付费的定价模式,因此您只需为存储的向量付费,而查询成本仅在搜索时产生。常见用例包括数据湖上的语义搜索、基于 RAG 的知识检索、大规模向量存储和批量检索。客户还可通过 S3 API 直接操作向量和索引。
BMW Group 将 S3 Vectors 作为其混合搜索解决方案的构建模块,该方案由基于 Amazon Bedrock AgentCore 构建的智能搜索 agent 驱动。工程师可以用自然语言查询 20 PB 的数据,将 S3 Vectors 用于语义相似性搜索,Amazon Athena 用于 SQL 查询。
Amazon DynamoDB:任意规模下的毫秒级向量搜索
Amazon DynamoDB是一种无服务器、全托管的分布式NoSQL数据库,在任何规模下都能提供个位数毫秒级的性能。DynamoDB的向量搜索在超过99%的召回率下实现个位数毫秒级延迟,专为任意规模设计,甚至可支持数万亿个向量。它完全无服务器化,无需预置、修补或管理服务器,也无需安装、维护或运维任何软件。您所喜爱的DynamoDB零基础设施管理体验——包括无版本、无维护窗口、无停机维护——同样适用于向量搜索。DynamoDB中的向量搜索引入了一种新的索引,您可以在存储向量嵌入的属性上创建该索引。它支持最多4,096维,支持欧几里得距离、余弦相似度和点积距离函数,并支持内联过滤。DynamoDB向量搜索可与DynamoDB全局表配合使用,同时支持多区域最终一致性和强一致性。
DynamoDB服务超过一百万个客户。客户目前已经在使用DynamoDB处理代理型工作负载,例如在对话期间保存会话上下文,以及跨多步骤任务跟踪状态。借助向量搜索,DynamoDB可以支持代理型应用中长期记忆的语义检索。其他用例包括RAG、多模态相似性搜索和推荐引擎。而且您可以在一个无服务器数据库中完成所有这些操作,无需单独维护向量存储和数据同步,也无需学习新的API。
当您的运营数据已经存储在DynamoDB中,或者您需要在零基础设施管理的情况下实现任意规模的个位数毫秒级向量搜索时,请选择DynamoDB向量搜索。
Globant是一家数字化原生公司,为全球企业构建AI驱动的产品和数字化转型解决方案。
“我们已经在DynamoDB上构建客户解决方案,因此在同一个数据库中原生支持向量搜索极具价值——无需将数据复制到单独的向量存储中,也无需管理第二个系统。它完全无服务器化,几乎可以在任何规模下自动扩展,因此我们只需为每个客户的使用量付费,而且它能提供面向用户的AI体验所要求的实时、低延迟搜索。它让我们的工程师能够专注于构建AI应用,而不是管理基础设施。”
Amazon ElastiCache for Valkey:用于语义缓存的微秒级延迟
Amazon ElastiCache是一项无服务器、全托管的缓存服务,提供微秒级延迟性能,完全兼容Valkey、Memcached和Redis OSS。
借助ElastiCache for Valkey,您可以通过实现记忆机制,将跨会话的对话历史呈现给大语言模型(LLM),从而构建更具个性化、更具上下文感知能力的响应。类似于缓存减少数据库成本并提升应用性能的方式,语义缓存通过为语义相似的提示词提供缓存响应,降低了使用LLM的成本和延迟。您还可以使用向量搜索为大规模数据集上的RAG提供支持,通过用真实世界数据为输出提供依据,提升响应相关性并减少幻觉。
当工作负载有微秒级延迟要求时,请选择ElastiCache for Valkey。这包括实时推荐引擎、基于会话的个性化、延迟敏感的RAG管道和语义缓存。它支持多达10亿个向量,实现微秒级延迟的向量搜索。
Sanoma使用ElastiCache for Valkey将人工审核员的决策转化为向量,实时为未来的AI审核调用提供参考,无需重新训练。目前,30%的评论会与过去的决策进行匹配,其中6.5%因此获得了不同且更准确的结果。
Amazon Neptune:用于GraphRAG
Amazon Neptune是一项无服务器图数据库服务,适用于连接数据并提升AI准确性。
当您的工作负载涉及高度连接的数据或多跳推理时,Amazon Neptune通过将图遍历与向量相似性结合在单个查询中,独特地解决了这一问题。
Neptune提供低延迟向量搜索,支持20至30亿向量的容量,并内置多跳推理和可追溯性。最后一点至关重要。受监管行业必须展示返回某个结果的原因,而不仅仅是返回了什么。这种透明度使Neptune在合规、风险和安全工作负载中不可或缺。
当工作负载需要在单个查询中结合图遍历与向量相似性时,请选择Neptune。借助Neptune,您可以遍历连接(例如,“哪些团队拥有受此警报影响的服务?”),并在单个查询中将这种关系上下文与向量相似性结合起来。我们的许多客户将Neptune用于需要知识图谱的工作负载,例如金融和合规风险、药物研究、药物发现和安全情报。
德勤使用Amazon Neptune与AWS GraphRAG Toolkit,构建了一个将基于图的知识检索与生成式AI相结合的安全情报中心。通过GraphRAG将策略解读、运营执行和实时指标连接起来,德勤能够提供基于及时组织背景的预测性安全指导。
Amazon Aurora PostgreSQL:SQL原生向量搜索
Amazon Aurora为PostgreSQL提供全球规模的高性能和高可用性。您可以启用pgvector扩展,并使用优化读取来实现高性能向量搜索。
带有pgvector 0.8.0的Amazon Aurora PostgreSQL实现了9倍更快的索引构建和100倍更相关的过滤结果。这是一次重大飞跃。它在单一引擎中将向量搜索与完整的SQL查询能力(包括连接、聚合、WHERE子句和ACID事务)相结合。
当您的源数据已存在于Aurora中时,请选择Aurora。当您希望使用SQL,或需要将向量和关系型工作负载整合到单一数据库中时,也推荐使用Aurora。它提供低延迟,支持数千亿个向量,非常适合多租户软件即服务(SaaS)应用、智能体记忆存储以及带有结构化数据上下文的RAG。
LeadSquared是一个服务于BFSI、医疗保健和教育等行业的SaaS CRM平台,他们使用Aurora PostgreSQL与pgvector以及Amazon Bedrock构建了RAG解决方案。通过使用Aurora同时处理向量嵌入和关键运营数据,他们加速了聊天机器人的部署。
结合多种解决方案应对复杂架构
某些用例受益于多种向量服务的组合。您可能有一个工作负载最适合采用结合了Amazon ElastiCache for Valkey(用于语义缓存)、Amazon OpenSearch Service(用于混合搜索)和Amazon S3 Vectors(用于持久化向量存储)的架构。这种组合使您能够从零扩展到数万亿个向量,同时在热、温、冷层之间优化延迟和成本。
- 性能与规模:延迟特征、向量容量、QPS要求以及用于准确性的算法调优。
- 成本与运营:成本与延迟的权衡、分层需求、运营模式偏好(Serverless或预置容量)以及现有团队的专业知识。
- 搜索能力:混合搜索、SQL支持、复杂元数据过滤、全文搜索和多向量搜索。
下表可帮助您选择合适的向量引擎,以便针对延迟、成本或访问模式需求进行优化。
| 服务 | 延迟(P95) | 向量容量 | QPS | 关键差异化优势 |
|---|---|---|---|---|
| Amazon OpenSearch Service | 10–100毫秒 | 数千亿 | 数千 | 词汇、语义、混合和智能体搜索。功能集最广泛,包括Serverless选项。 |
| Amazon S3 Vectors | > 100毫秒 | 数十亿 | 每索引数百以下 | 按查询付费,对于低频查询成本最低 |
| Amazon DynamoDB | < 10毫秒 | 数万亿 | 几乎无限(每个向量索引分区数千) | 任何规模下均为个位数毫秒级延迟的向量搜索 |
| Amazon ElastiCache for Valkey | < 10毫秒 | 超过10亿向量 | 数千 | 微秒级延迟,语义缓存 |
| Amazon Aurora PostgreSQL | 10–100毫秒 | 数千亿 | 数千 | SQL原生关系型+向量 |
| Amazon Neptune | 10–100毫秒 | 20–30亿向量 | 数百到数千 | 图遍历+向量(GraphRAG) |
开始使用
立即开始使用AWS向量解决方案,用于语义搜索、自管理知识库和RAG。首先在您数据当前所在的位置添加向量解决方案。对于新的工作负载,请使用决策模型根据您的延迟和规模需求选择向量解决方案;如果不确定,默认选择Amazon OpenSearch Service。如果您对完全托管的知识库和RAG解决方案感兴趣,请阅读这篇关于Amazon Bedrock Knowledge Bases的文章。
欢迎参加我们的网络研讨会“AWS向量解决方案概述:在数据所在之处为智能体AI提供智能”,详细了解如何选择合适的向量引擎以及我们产品组合的最新更新。请联系您的AWS客户团队,参加动手实践研讨会或概念验证。
关于作者