← 返回信息流

热点精选AWS AI Blog新闻

Amazon Bedrock 推出 OpenAI GPT-5.6 模型的跨区域推理

aws.amazon.com作者:Melanie Li产品行业AI评分:70/100

Amazon Bedrock 现已在超过 25 个 AWS 区域提供 OpenAI GPT-5.6 模型(Sol、Terra、Luna),并支持跨区域推理。通过地理和全局推理配置文件,请求可路由至其他区域以提升吞吐量和性能,同时满足数据驻留要求。开发者可通过 OpenAI 和 Converse API 调用,并配置 IAM、配额和监控。

本文与OpenAI的Chris Dickens共同撰写。

Amazon Bedrock现已在超过25个AWS区域提供OpenAI GPT-5.6模型,并支持跨区域推理。三个GPT-5.6变体支持跨区域推理:Sol、Terra和Luna,每个变体在能力和成本之间进行了不同的平衡调整。

Amazon Bedrock中的跨区域推理(CRIS)通过推理配置文件(inference profiles)工作,这些配置文件定义了一个模型以及Amazon Bedrock可以将请求路由到的AWS区域。您从源区域调用该配置文件,Amazon Bedrock会将请求路由到目标区域,并使用该区域的计算资源进行处理。CRIS主要是一种容量机制。通过允许请求利用更广泛的计算资源池,而不是局限于单个区域的可用容量,它可以提高吞吐量,并有助于在负载下保持一致的性能。地理推理配置文件(geographic inference profile)在单个地理区域内路由请求,因此您可以在保持数据在该地理区域内处理的同时进行扩展。对于GPT-5.6,此次发布引入了美国地理(US cross-Region inference)和全球CRIS。全球推理配置文件(global inference profile)根据实时容量,将请求路由到部署该模型的所有支持的AWS商业区域,使您能够广泛访问Amazon Bedrock的容量。

在本文中,我们将概述Amazon Bedrock上的GPT-5.6模型,介绍地理和全球跨区域推理如何为这些模型工作,以及如何从Amazon Bedrock控制台和代码中通过OpenAI Responses API、OpenAI Chat Completions API和Amazon Bedrock Converse API调用它们。

Amazon Bedrock上的GPT-5.6

Amazon Bedrock上的GPT-5.6系列包括通用型和专业网络安全型变体。本文涵盖支持跨区域推理的三个通用型变体:Sol、Terra和Luna。这三个变体都接受文本和图像输入并返回文本,拥有100万token的上下文窗口,并支持推理模式、服务器端工具调用和提示缓存。您可以通过OpenAI Responses API、OpenAI Chat Completions API和Amazon Bedrock Converse API调用它们。流式传输通过Responses和Chat Completions API(stream=True)以及ConverseStream提供支持。

Amazon Bedrock推理配置文件是您传递的逻辑标识符,而不是原始模型ID。

  • 地理推理配置文件(以地理代码为前缀,例如us.,如us.openai.gpt-5.6-terra)将推理处理保留在其预定义地理区域的区域内。请求通过您的源区域进入,并且只能路由到该地理区域内的目标区域,因此有数据驻留要求的工作负载可以在区域内跨区域扩展,同时保持在边界之内。
  • 全球推理配置文件(以global.为前缀,如global.openai.gpt-5.6-terra)可以根据实时容量,将请求路由到部署该模型的任何支持的商业AWS区域。它提供了最广泛的容量池,是您的工作负载没有地理处理要求时的正确选择。

无论哪个后端区域处理了请求,计费和配额消耗都会计入您的账户,因此仍然适用单一的支出和吞吐量视图。通过全球CRIS处理的数据可能会跨越该模型合格集中的区域。如果您的工作负载有数据驻留要求,限制处理必须在特定地理区域内进行,请使用该地理区域的地理配置文件(例如us.openai.gpt-5.6-terra)或直接调用单个区域,而不是使用全球配置文件。Amazon Bedrock跨区域推理文档列出了每个模型的全球和地理配置文件集中包含哪些区域。

下表列出了您可以调用GPT-5.6推理配置文件的源区域以及可以处理您请求的目标区域。相同的路由适用于所有三个变体:Sol、Terra和Luna。

美国跨区域推理配置文件(us.openai.gpt-5.6-sol / -terra / -luna)

源区域目标区域
美国东部(弗吉尼亚北部)us-east-1美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2
美国西部(俄勒冈)us-west-2美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2
美国东部(俄亥俄)us-east-2美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2
美国西部(加利福尼亚北部)us-west-1美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2、美国西部(加利福尼亚北部)us-west-1
加拿大(中部)ca-central-1美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2、加拿大(中部)ca-central-1
加拿大西部(卡尔加里)ca-west-1美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2、加拿大西部(卡尔加里)ca-west-1

全球跨区域推理配置文件(global.openai.gpt-5.6-sol / -terra / -luna)

源区域目标区域
美国:美国东部(弗吉尼亚北部)us-east-1、美国东部(俄亥俄)us-east-2、美国西部(俄勒冈)us-west-2、美国西部(加利福尼亚北部)us-west-1 加拿大:加拿大(中部)ca-central-1 欧洲:欧洲(斯德哥尔摩)eu-north-1、欧洲(巴黎)eu-west-3、欧洲(爱尔兰)eu-west-1、欧洲(法兰克福)eu-central-1、欧洲(西班牙)eu-south-2、欧洲(米兰)eu-south-1、欧洲(伦敦)eu-west-2、欧洲(苏黎世)eu-central-2 亚太地区:亚太地区(墨尔本)ap-southeast-4、亚太地区(悉尼)ap-southeast-2、亚太地区(东京)ap-northeast-1、亚太地区(大阪)ap-northeast-3、亚太地区(首尔)ap-northeast-2、亚太地区(孟买)ap-south-1、亚太地区(海得拉巴)ap-south-2、亚太地区(新加坡)ap-southeast-1、亚太地区(雅加达)ap-southeast-3、亚太地区(泰国)ap-southeast-7、亚太地区(马来西亚)ap-southeast-5、亚太地区(台北)ap-east-2 中东:中东(阿联酋)me-central-1、以色列(特拉维夫)il-central-1 南美洲:南美洲(圣保罗)sa-east-1路由至全球受支持的AWS商业区域

在Amazon Bedrock控制台中试用GPT-5.6

试用GPT-5.6最快的方式是使用Amazon Bedrock控制台中的文本游乐场,无需编写代码或配置SDK。您可以发送提示词、调整推理参数,并在不同变体之间切换,以便在集成API之前了解每个模型。模型选择器会同时列出地理区域和全局跨区域推理配置文件,因此您可以在编写代码之前测试任一跨区域推理选项。在上面的截图中,源区域为美国东部(弗吉尼亚北部)。模型选择器中的US条目是地理区域推理配置文件,Global条目是全局推理配置文件。

  1. 在模型可用的区域(如美国东部(弗吉尼亚北部))打开Amazon Bedrock控制台。
  2. 在导航窗格中,在Test下选择Playground。
  3. 在页面中间选择Select model。
  4. 搜索OpenAI GPT-5.6 Sol,选择US OpenAI GPT-5.6 Sol或Global OpenAI GPT-5.6 Sol,然后选择Apply。
  5. 输入提示词并选择Run以生成响应。
Amazon Bedrock console model selector listing the US and Global OpenAI GPT-5.6 Sol inference profiles
Amazon Bedrock console model selector listing the US and Global OpenAI GPT-5.6 Sol inference profiles

图1:在Amazon Bedrock控制台模型选择器中选择US或Global GPT-5.6推理配置文件

API入门

GPT-5.6在Amazon Bedrock上原生支持OpenAI Responses API格式。如果您的应用程序已经在调用OpenAI模型,您可以将现有的OpenAI SDK客户端指向Amazon Bedrock的OpenAI兼容端点。然后将推理配置文件ID(全局或地理区域)替换为模型参数。在身份验证方面,Amazon Bedrock接受标准AWS凭证或Amazon Bedrock API密钥。API密钥路径最直接适配OpenAI SDK,SDK会将其作为Bearer令牌传递。对于生产环境,请使用aws-bedrock-token-generator包以编程方式生成短期API密钥,该包会从您现有的AWS凭证中派生Bearer令牌(长期密钥仅建议用于探索测试)。

from aws_bedrock_token_generator import provide_token
from openai import OpenAI
region = "us-east-1"
# 将OpenAI SDK指向您所在区域的Amazon Bedrock OpenAI兼容端点。provide_token()会从您当前的AWS凭证生成短期Amazon Bedrock API密钥(最长有效12小时),因此无需存储静态密钥。
client = OpenAI(
    base_url= f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
    api_key=provide_token(region=region),
)

# 使用GPT-5.6 Terra的全局推理配置文件ID。
model_id = "global.openai.gpt-5.6-terra"
response = client.responses.create(
    model=model_id,
    input="用两句话总结水平扩展和垂直扩展之间的区别。",
     max_output_tokens=512,
)

print(response.output_text)

有关受支持参数的完整列表,请参阅Amazon Bedrock用户指南中的OpenAI GPT模型参数页面。同一个客户端也适用于Chat Completions API,如果您的应用程序已经在使用这种格式,这会非常有用。

response = client.chat.completions.create(
     # 对于US地理区域CRIS,请使用"us.openai.gpt-5.6-terra"。
     # 其他变体:gpt-5.6-sol、gpt-5.6-luna
     model="global.openai.gpt-5.6-terra",
     messages=[
         {
             "role": "user",
             "content": "用一句话说明Amazon Bedrock中的跨区域推理是什么?",
         }
     ],
     max_completion_tokens=2000,
     reasoning_effort="low",
 )

print(response.choices[0].message.content)

如果您不是通过OpenAI SDK,而是直接调用Amazon Bedrock,请使用Amazon Bedrock Converse API,它为您提供与其他Bedrock模型相同的请求格式:

安全与合规

跨区域推理使用与直接区域内调用相同的 Amazon Bedrock 安全模型。请求使用您的 AWS Identity and Access Management(IAM)凭证进行身份验证,IAM 策略控制角色可以调用哪些推理配置文件。Amazon Bedrock 在芯片层面强制执行零运维人员访问(ZOA)安全模型,因此任何 AWS 运维人员都无法访问您的提示词或补全内容。每次模型调用都在您的 IAM 策略下运行,可以通过 VPC 终端节点从您的虚拟私有云(VPC)私密访问,并记录在 AWS CloudTrail 中。数据边界策略有助于防止跨账户和网络边界的数据外泄。

对于某些模型(包括 GPT-5.6),被 Amazon Bedrock 自动滥用检测分类器标记的内容会保留最多 30 天,用于离线滥用检测。要了解此政策适用于哪些模型及其工作原理,请参阅 Amazon Bedrock 用户指南中的滥用检测。要了解更多关于 Bedrock 数据保留配置的信息,请参阅 Amazon Bedrock 数据保留文档。有关每个配置文件路由集中各区域的权威列表,请参阅 Amazon Bedrock 跨区域推理支持页面。

跨区域推理请求会出现在您源区域的 AWS CloudTrail 中,additionalEventData.inferenceRegion 字段记录处理每个请求的区域。如果您启用了模型调用日志记录,请求和响应负载将传送到同一账户和区域中的 Amazon Simple Storage Service(Amazon S3)或 Amazon CloudWatch Logs。

为跨区域推理设置 IAM 权限

要允许某个角色通过推理配置文件调用 GPT-5.6,请授予该角色对推理配置文件以及配置文件可路由到的每个区域中基础模型的访问权限。您可以使用托管策略 AmazonBedrockLimitedAccess 或创建自己的策略。

对于地理推理配置文件,策略包含三个语句。第一个语句授予对源区域中地理推理配置文件和默认项目的访问权限。第二个语句授予对源区域以及该地理区域内每个目标区域中基础模型的访问权限,并附带一个条件,将该访问权限限制为仅限通过该配置文件发出的请求。第三个语句授予 OpenAI 兼容 API 使用的 bearer 令牌身份验证权限。

{ 
  "Version": "2012-10-17", 
  "Statement": [ 
    { 
      "Sid": "GrantGeoCrisProfileAndProjectAccess", 
      "Effect": "Allow", 
      "Action": ["bedrock:InvokeModel"], 
      "Resource": [ 
        "arn:aws:bedrock:<SOURCE REGION>:<ACCOUNT>:inference-profile/us.openai.gpt-5.6-terra", 
        "arn:aws:bedrock:<SOURCE REGION>:<ACCOUNT>:project/default" 
      ] 
    }, 
    { 
      "Sid": "GrantGeoCrisDestinationModelAccess", 
      "Effect": "Allow", 
      "Action": ["bedrock:InvokeModel"], 
      "Resource": [ 
        "arn:aws:bedrock:us-east-1::foundation-model/openai.gpt-5.6-terra", 
        "arn:aws:bedrock:us-east-2::foundation-model/openai.gpt-5.6-terra", 
        "arn:aws:bedrock:us-west-2::foundation-model/openai.gpt-5.6-terra" 
      ], 
      "Condition": { 
        "StringLike": { 
          "bedrock:InferenceProfileArn": "arn:aws:bedrock:<SOURCE REGION>:<ACCOUNT>:inference-profile/us.openai.gpt-5.6-terra" 
        } 
      } 
    }, 
    { 
      "Sid": "AllowBearerTokenAuth", 
      "Effect": "Allow", 
      "Action": ["bedrock:CallWithBearerToken"], 
      "Resource": "*" 
    } 
  ] 
} 

全局推理配置文件使用四部分策略。第一个语句授予对源区域中全局推理配置文件和默认项目的访问权限。第二个语句授予对源区域中基础模型的访问权限。第三个语句通过不区分区域的全局 ARN 授予对基础模型的访问权限,这正是实现跨区域路由的关键。第四个语句授予 OpenAI 兼容 API 使用的 bearer 令牌身份验证权限。

{ 
 "Version": "2012-10-17", 
 "Statement": [ 
   { 
     "Sid": "GrantGlobalCrisProfileAndProjectAccess", 
     "Effect": "Allow", 
     "Action": ["bedrock:InvokeModel"], 
     "Resource": [ 
       "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.openai.gpt-5.6-terra", 
       "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:project/default" 
     ], 
     "Condition": { 
       "StringEquals": { "aws:RequestedRegion": "<REQUESTING REGION>" } 
     } 
   }, 
   { 
     "Sid": "GrantGlobalCrisInRegionModelAccess", 
     "Effect": "Allow", 
     "Action": ["bedrock:InvokeModel"], 
     "Resource": ["arn:aws:bedrock:<REQUESTING REGION>::foundation-model/openai.gpt-5.6-terra"], 
     "Condition": { 
       "StringEquals": { 
         "aws:RequestedRegion": "<REQUESTING REGION>", 
         "bedrock:InferenceProfileArn": "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.openai.gpt-5.6-terra" 
       } 
     } 
   }, 
   { 
     "Sid": "GrantGlobalCrisGlobalModelAccess", 
     "Effect": "Allow", 
     "Action": ["bedrock:InvokeModel"], 
     "Resource": ["arn:aws:bedrock:::foundation-model/openai.gpt-5.6-terra"], 
     "Condition": { 
       "StringEquals": { 
         "aws:RequestedRegion": "unspecified", 
         "bedrock:InferenceProfileArn": "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.openai.gpt-5.6-terra" 
       } 
     } 
   }, 
   { 
     "Sid": "AllowBearerTokenAuth", 
     "Effect": "Allow", 
     "Action": ["bedrock:CallWithBearerToken"], 
     "Resource": "*" 
   } 
 ] 
}

这些策略授予对 project/default 资源的 bedrock:CallWithBearerTokenbedrock:InvokeModel 权限,OpenAI Responses 和 Chat Completions API 使用这些权限通过 Amazon Bedrock API 密钥进行身份验证并运行推理。如果您使用流式 Converse API (ConverseStream),请将 bedrock:InvokeModelWithResponseStream 添加到推理配置文件和基础模型语句中。

这些语句协同工作,因此移除其中一个语句将拒绝该角色对该配置文件的跨区域访问,这也为您提供了一种简洁的方法,可以为特定角色关闭任一功能。或者,您可以附加一个显式拒绝,针对 global.us. 推理配置文件。

全局跨区域推理的服务控制策略注意事项

如果您的组织使用区域限制性服务控制策略 (SCP),全局 CRIS 请求会将 aws:RequestedRegion 设置为 unspecified,而不是特定的区域名称。地理 CRIS 请求会根据配置文件中的每个目标区域进行评估。推荐的方法是使用 bedrock:InferenceProfileArn 条件来豁免跨区域推理,而不是扩大您的区域允许列表。Amazon Bedrock 在授权基础模型时会设置该条件键,因此您可以在保持其他所有服务的允许列表严格的同时,允许 CRIS 路由。您的源区域仍必须在允许列表中。如果您不希望使用该条件,您也可以将目标区域和 unspecified 添加到您的允许列表中,但这会将这些区域开放给所有服务,而不仅仅是 Amazon Bedrock。有关即用型 SCP 和分步指南,请参阅 Bedrock CRIS 区域控制 SCP 示例。

以下 SCP 拒绝在您批准的区域(示例中显示为悉尼和弗吉尼亚北部)之外进行 Amazon Bedrock 推理,并豁免 GPT-5.6 使用的 us.global. 推理配置文件。第一条语句确保对所有其他服务强制执行区域允许列表,因此请将您组织使用的全局服务包含在其 NotAction 列表中。

{
  "Version": "2012-10-17",
  "Statement": [
    {
      "Sid": "DenyOutsideApprovedRegionsExceptBedrockInvoke",
      "Effect": "Deny",
      "NotAction": [
        "iam:*", "sts:*", "organizations:*", "account:*",
        "route53:*", "cloudfront:*", "waf:*", "wafv2:*", "shield:*",
        "support:*", "trustedadvisor:*", "health:*",
        "budgets:*", "ce:*", "cur:*", "tax:*", "billing:*",
        "bedrock:Invoke*"
      ],
      "Resource": "*",
      "Condition": {
        "StringNotEquals": { "aws:RequestedRegion": ["ap-southeast-2", "us-east-1"] }
      }
    },
    {
      "Sid": "DenyBedrockInferenceOutsideApprovedRegionsUnlessCris",
      "Effect": "Deny",
      "Action": [
        "bedrock:Invoke*"
      ],
      "Resource": "*",
      "Condition": {
        "StringNotEquals": { "aws:RequestedRegion": ["ap-southeast-2", "us-east-1"] },
        "ArnNotLike": {
          "bedrock:InferenceProfileArn": [
            "arn:aws:bedrock:*:*:inference-profile/us.*",
            "arn:aws:bedrock:*:*:inference-profile/global.*"
          ]
        }
      }
    }
  ]
}

对于这两种配置文件类型,必须为账户和区域启用模型访问权限。有关完整检查清单,请参阅推理配置文件的先决条件。

使用提示词缓存 `` 所有三种 GPT-5.6 变体都支持 bedrock-runtime 端点上的提示缓存。当您的请求共享一个较长的提示前缀(例如系统提示或一组少样本示例)时,Amazon Bedrock 会缓存该前缀。后续请求会复用缓存的前缀,而无需重新处理。这降低了缓存部分的输入成本和延迟。 GPT-5.6 在 Amazon Bedrock 上支持两种缓存模式。隐式缓存是默认模式:服务会在最新的用户或工具消息处放置一个缓存断点,这适用于通过追加消息而增长的多轮对话。如果您的请求共享一个稳定的前缀,后跟每次请求都会变化的内容,您可以改为使用显式缓存断点来标记稳定内容的结尾。在两种模式下,都请传入可选的 prompt_cache_key 参数,以便具有相同前缀的请求被路由到同一缓存。两种模式都适用于地理和全局推理配置文件。每个缓存断点需要至少 1,024 个 token 的提示前缀。有关更多信息,请参阅提示缓存以实现更快的模型推理。 提示缓存也会影响配额使用量。缓存读取 token 不计入您的 TPM 配额,因此复用缓存前缀的请求消耗的配额更少。下一节将介绍配额的计算方式。以下示例使用入门部分中的客户端和 model_id 演示了显式提示缓存: ``python

# support_policy_manual 是跨请求共享的较长且稳定的前缀。 # 断点标记了稳定内容的结尾;其后的用户问题 # 在每次请求时都会变化,而不会使缓存的前缀失效。 completion = client.chat.completions.create( model=model_id, messages=[ { "role": "system", "content": [ { "type": "text", "text": support_policy_manual, "prompt_cache_breakpoint": {"mode": "explicit"}, } ], }, {"role": "user", "content": "一位客户想要为损坏的笔记本电脑退款。我必须首先核实什么?"}, ], max_completion_tokens=300, prompt_cache_key="support-policy-v1", ) `` 要确认缓存是否正常工作,请检查每个响应的 usage 对象。 ``python

details = completion.usage.prompt_tokens_details print("Cached tokens:", details.cached_tokens) print("Written tokens:", details.cache_write_tokens) `` 配额管理 GPT-5.6 的按需配额以每分钟 token 数(TPM)进行管理,并附加到您所调用的推理配置文件上:同一模型的地理配置文件和全局配置文件具有独立的配额分配,因此在它们之间切换会改变您所使用的配额池。要查看您当前的配额分配或请求增加配额,请在 AWS Service Quotas 控制台中,从您的应用程序调用 Amazon Bedrock 的区域搜索 GPT-5.6 模型推理配额。 在确定配额增加请求的大小时,请考虑消耗速率:即输入和输出 token 转换为限流系统 token 配额使用量的速率。输入 token 按 1:1 的比例计入配额,而输出 token 可能以更高的倍数消耗配额。对于 GPT-5.6 模型,输出 token 的消耗速率为 10 倍,这意味着一个输出 token 会消耗 TPM 配额中的 10 个 token,因此输出密集型工作负载消耗配额的速度远高于原始 token 数量所显示的水平。每个请求的计算方式为: ``text

输入 token 数 + 缓存写入输入 token 数 +(输出 token 数 x 消耗速率) ``` 例如,一个具有 2,000 个输入 token 和 1,000 个输出 token 的请求会从您的配额中消耗 12,000 个 token。缓存读取 token 不包含在此计算中,这正是提示缓存(上一节)对配额管理和成本控制有效的原因。有关各模型当前的消耗速率,请参阅 Amazon Bedrock 配额页面。以下三种做法有助于您避免意外情况: - 在部署前请求增加配额。如果您预计使用量会很高,请在启动前通过 Service Quotas 控制台请求增加配额,而不是在生产环境中对限流做出被动反应。 - 监控利用率。Amazon CloudWatch 会按推理配置文件实时发布配额利用率指标,因此您可以在使用量接近阈值时设置告警,并跟踪历史模式以规划未来的配额增加。 - 在将工作负载投入生产之前,使用真实流量(包括峰值模式和生产规模的提示)进行负载测试,并根据您实际将使用的配置文件类型进行验证,因为地理和全局配额是分开的。 监控与日志记录 由于 GPT-5.6 请求通过 Bedrock Runtime API 运行,因此通过地理或全局推理配置文件发出的请求会以与按需请求相同的方式出现在 Amazon Bedrock 模型调用日志中,推理配置文件 ARN 会与请求和响应负载一起记录(取决于您的日志记录配置)。您可以将调用日志投递到 Amazon S3 或 Amazon CloudWatch Logs。无论您使用哪种配置文件类型,调用日志和指标都会记录在您的源区域中,因此即使请求在其他地方处理,您的可观测性也保持在一处。 涵盖调用次数、Token 数量、延迟、限流和错误的 Amazon CloudWatch 指标按每个推理配置文件发布。由于地理配置文件和全局配置文件是不同的资源,因此它们的指标会分别报告。每次请求的延迟会因请求落入的目标区域而有所不同,因此如果您当前的仪表板按区域细分指标,请考虑增加一个按推理配置文件 ID 聚合的视图,因为您的应用程序代码和配额消耗都与该 ID 相关联。使用量也会在 AWS Cost Explorer 和 AWS Cost and Usage Report 中逐项列出,因此您可以像对 Bedrock 其他工作负载一样,按模型和配置文件归属 GPT-5.6 的费用。 结论 GPT-5.6 为 Amazon Bedrock 带来了三个 OpenAI 模型变体。借助此次发布,您可以通过两种跨区域推理配置文件调用其中每一个模型。当推理处理需要保持在地理区域内(在其内部的各个区域之间扩展)时,您可以使用地理配置文件;当您希望在受支持的商业 AWS 区域中获得最广泛的容量池时,您可以使用全局配置文件。无论哪种方式,您的应用程序都通过一个配置文件 ID 与一个端点通信,日志、配额和计费都保留在您的源区域中。这些模型支持 OpenAI Chat Completions API 和 Responses API(包括流式传输),以及 Amazon Bedrock Converse API。 要开始使用,请打开 Amazon Bedrock 控制台,通过推理配置文件向 GPT-5.6 Sol、Terra 或 Luna 发送测试提示,或通过 Responses API 以编程方式调用这些模型。在确定生产工作负载规模之前,请查看 Amazon Bedrock 定价页面以了解当前的 GPT-5.6 费率。如果您的应用程序需要长上下文(100 万 Token)处理,请查看 Amazon Bedrock 按区域模型支持页面以了解区域可用性。 关于作者

阅读原文