LLM 部署策略:最佳实践与考量
本文介绍了在生产环境中部署大型语言模型(LLM)的关键策略,包括自托管与托管 API 的对比、基础设施扩展模式、路由与回退机制、成本优化、可观测性以及安全合规。文章强调了连续批处理、冷启动管理、请求级定价等要点,并提供了使用 Oxlo.ai 的示例代码。适合需要部署 LLM 应用的开发者参考。
本文介绍了在生产环境中部署大型语言模型(LLM)的关键策略,包括自托管与托管 API 的对比、基础设施扩展模式、路由与回退机制、成本优化、可观测性以及安全合规。文章强调了连续批处理、冷启动管理、请求级定价等要点,并提供了使用 Oxlo.ai 的示例代码。适合需要部署 LLM 应用的开发者参考。
本文主张 Claude Code 的核心是智能体循环而非自动补全:它通过决策、调用工具、观察结果、再决策的循环来完成任务,并详细解释了工具调用流程、权限模式如何控制自主性,以及 CLAUDE.md 等配置的实际位置。
本文介绍如何为AI代理的操作构建审计追踪,无需自建日志层。通过将副作用操作路由到审批门,自动记录每次操作的完整生命周期,包括创建、规则应用、批准/拒绝、执行等,并记录决策者身份(如Slack用户名),支持查询和导出,满足合规审查需求。
本文通过实测发现,在免费模型服务器上,流式请求的首 token 延迟可能高于非流式请求的总延迟,且流式请求可能中途断开。作者提供了一个简单的 Python 探针脚本,用于测量首 token 时间、token 间延迟和完成率,并建议在聊天 UI 中使用流式,而在 CI 和批处理任务中避免使用。
一篇案例研究展示了差分模糊测试在验证AI生成代码中的价值。一个免费模型重写了C++配置解析器,虽然通过了所有单元测试,但差分模糊测试在90秒内发现了堆缓冲区溢出和两个语义分歧。该方法将原解析器作为参考,通过比较新旧实现的输出来捕捉测试遗漏的边界情况。
本教程是系列文章的第一部分,介绍如何设置 AWS 账户和 Snowflake 环境,为使用 Amazon SageMaker Canvas 构建无代码机器学习工作流奠定基础。该工作流旨在帮助医疗、零售和生命科学领域的业务分析师等非技术用户,无需编写代码即可探索数据、构建预测模型并生成洞察。本部分详细说明了创建 Snowflake 数据库、仓库和示例欺诈检测数据表的步骤。

本教程展示了如何使用 Amazon SageMaker Canvas 连接 Snowflake 数据源,通过 Data Wrangler 的可视化转换进行数据准备,并训练 XGBoost 欺诈检测模型。整个过程无需编写代码,适合业务分析师和领域专家。文章详细介绍了从创建 SageMaker 域、连接 Snowflake、执行 SQL 查询到数据转换和模型训练的步骤。


本教程是系列第三部分,介绍如何将 Amazon SageMaker Canvas 的预测结果导入 Amazon Quick Sight,构建交互式仪表板,利用生成式 BI 通过自然语言提问获取洞察,并发布 AI 生成的执行摘要。步骤包括导入数据集、创建可视化、使用生成式 BI 构建图表和查询数据、发布仪表板及生成摘要。适合使用 AWS 无代码 ML 和 BI 工具的数据分析师。


作者发布了一个针对 RTX 3090 的超优化 Qwen3.8-27B 推理引擎,单请求速度从 82 tps 提升至 381 tps。通过使用 fp8 KV 缓存、int8 激活、DFlash2 块草拟等技术,实现了文档引用工作负载的 15/16 token 接受率。
Databricks 展示了如何将传统数据仓库中的存储过程、游标、临时表和事务逻辑直接翻译为 Databricks SQL 脚本,无需重写为 Python 或 Spark。新功能如原生游标支持、BEGIN ATOMIC 事务和 Unity Catalog 治理,使迁移时间缩短 50-75%,并保留原有业务逻辑,让 SQL 团队继续维护。
本文介绍如何使用Amazon Bedrock为FHIR API添加上下文感知的安全监控。通过将安全监控与API请求路径分离,利用Bedrock的模型进行异常检测、数据敏感性分类和合规报告生成,同时不影响临床工作流的延迟。文章提供了详细的架构说明、实现步骤和代码示例,包括Lambda函数、API Gateway、HealthLake等组件的配置。

上周我的编程智能体修改了同步任务中的分页代码,测试通过,PR看起来没问题,但暂存环境在100条记录处停止,因为游标没有更新。有趣的是,我让同一个智能体审查自己的改动,它没发现任何问题。此后我不再让编写者自我审查,而是另开一个Minimax M3会话,提供diff和仓库上下文,让它寻找可能的失败点。第一次尝试它就发现了我忽略的两个空值情况。
这是一份面向初学者的教程,作者将逐步讲解如何从零构建一个现代大语言模型,并对每一行代码进行注释,用通俗易懂的方式解释原理。适合希望深入了解LLM内部机制的开发者。
这是一份经过验证的硬件配置,用于运行Deepseek V4 Flash-0731模型,达到130-150 tokens/s的速度。配置包括ASRock Rack SPC621D8U-2T/OVH主板、Xeon Gold 6330 CPU、16块RTX 5060 Ti 16GB显卡,通过两个Broadcom/PLX PEX88096交换机连接。系统使用Ubuntu 22.04.5 LTS和Aikitoria修补的NVIDIA驱动,并进行了BAR1、MMIO等BIOS设置。
本教程提供了一个端到端的工作流程,用于使用直接偏好优化(DPO)微调语言模型。我们演示如何审计Anthropic HH-RLHF数据集中的结构和长度偏差,使用TRL和LoRA实现稳健的训练流程,并评估模型性能以确保真正的偏好学习而非依赖词汇捷径。
作者让 Claude Fable 5 在 Claude Code for web 中评估 smolmachines.com 作为快速安全沙箱的可行性,目标是限制 CPU、内存、网络和文件系统访问。由于环境不支持嵌套虚拟化,Claude 改用 GitHub Actions 运行测试,展示了其主动解决问题的能力。
本文介绍了三种在 AWS Step Functions 流水线中异步调用 Amazon Bedrock AgentCore 代理的模式:任务令牌回调、直接服务集成和持久函数。这些模式避免了调用方在代理处理请求时闲置计算资源的成本。文章通过一个文档验证示例,对比了阻塞反模式与三种异步模式的实现和权衡。

本文介绍了KnowledgeForge,一个基于AWS生成式AI的文档处理流水线,用于从已解决的ITSM工单中自动生成知识库文章,并对现有知识库进行去重、质量评分和改进。系统采用闭环架构,使用Amazon Bedrock进行内容生成,Amazon S3 Vectors进行重复检测,AWS Step Functions进行编排。文章详细说明了各组件选择理由和实现细节,适合构建大规模文档处理流水线的开发者参考。


本文介绍如何定制 Amazon Quick 嵌入式聊天,使其在视觉和语气上与您的应用品牌一致。通过配置容器样式、SDK 框架选项(如 className、宽度、加载占位符、品牌归属和策略链接的显示)以及自定义聊天代理的个性设置,可以实现无缝的品牌体验。文中以金融仪表盘为例,展示了如何调整聊天面板的样式、移除默认品牌元素,并设置代理的初始提示和固定代理 ID,使聊天界面成为应用的原生部分。


本文介绍了如何利用 Amazon Bedrock 上的 Strands Agents SDK 构建多智能体文档分类系统。系统包含三个智能体:文档分析智能体(使用 Claude Haiku 4.5 进行文本推理)、向量相似性搜索智能体(使用 Titan Multimodal Embeddings 进行视觉相似性搜索)和验证智能体(负责协调与质量保证)。通过结合文本和视觉特征,该系统能够准确分类保险文档(如保单、宣誓书等),并提供了详细的实现步骤和代码示例。

Axonius 是一家网络安全 SaaS 提供商,在 AWS 上使用 Amazon Bedrock AgentCore 为其数百个客户环境部署了完全隔离的多租户 AI 代理。他们选择了 silo 模式,为每个租户提供专用代理,以满足租户隔离、身份集成、成本跟踪、生命周期管理和可观测性等要求。该架构通过专用 VPC 和 AgentCore 运行时实现隔离,并利用 JWT 授权和 IAM 角色进行安全访问。


本文介绍了多向量(晚期交互)嵌入模型,如 ColBERT 风格模型,它们为每个 token 保留向量,通过 MaxSim 操作进行评分,在保持可索引性的同时提升检索质量。文章详细说明了如何加载模型、编码查询和文档、进行语义搜索、索引、视觉文档检索等,并讨论了索引大小和速度的权衡。

