LLM 部署策略:最佳实践与考量
本文介绍了在生产环境中部署大型语言模型(LLM)的关键策略,包括自托管与托管 API 的对比、基础设施扩展模式、路由与回退机制、成本优化、可观测性以及安全合规。文章强调了连续批处理、冷启动管理、请求级定价等要点,并提供了使用 Oxlo.ai 的示例代码。适合需要部署 LLM 应用的开发者参考。
本文介绍了在生产环境中部署大型语言模型(LLM)的关键策略,包括自托管与托管 API 的对比、基础设施扩展模式、路由与回退机制、成本优化、可观测性以及安全合规。文章强调了连续批处理、冷启动管理、请求级定价等要点,并提供了使用 Oxlo.ai 的示例代码。适合需要部署 LLM 应用的开发者参考。
本文主张 Claude Code 的核心是智能体循环而非自动补全:它通过决策、调用工具、观察结果、再决策的循环来完成任务,并详细解释了工具调用流程、权限模式如何控制自主性,以及 CLAUDE.md 等配置的实际位置。
本文介绍如何为AI代理的操作构建审计追踪,无需自建日志层。通过将副作用操作路由到审批门,自动记录每次操作的完整生命周期,包括创建、规则应用、批准/拒绝、执行等,并记录决策者身份(如Slack用户名),支持查询和导出,满足合规审查需求。
本文通过实测发现,在免费模型服务器上,流式请求的首 token 延迟可能高于非流式请求的总延迟,且流式请求可能中途断开。作者提供了一个简单的 Python 探针脚本,用于测量首 token 时间、token 间延迟和完成率,并建议在聊天 UI 中使用流式,而在 CI 和批处理任务中避免使用。
一篇案例研究展示了差分模糊测试在验证AI生成代码中的价值。一个免费模型重写了C++配置解析器,虽然通过了所有单元测试,但差分模糊测试在90秒内发现了堆缓冲区溢出和两个语义分歧。该方法将原解析器作为参考,通过比较新旧实现的输出来捕捉测试遗漏的边界情况。
本教程是系列文章的第一部分,介绍如何设置 AWS 账户和 Snowflake 环境,为使用 Amazon SageMaker Canvas 构建无代码机器学习工作流奠定基础。该工作流旨在帮助医疗、零售和生命科学领域的业务分析师等非技术用户,无需编写代码即可探索数据、构建预测模型并生成洞察。本部分详细说明了创建 Snowflake 数据库、仓库和示例欺诈检测数据表的步骤。

本教程展示了如何使用 Amazon SageMaker Canvas 连接 Snowflake 数据源,通过 Data Wrangler 的可视化转换进行数据准备,并训练 XGBoost 欺诈检测模型。整个过程无需编写代码,适合业务分析师和领域专家。文章详细介绍了从创建 SageMaker 域、连接 Snowflake、执行 SQL 查询到数据转换和模型训练的步骤。


本教程是系列第三部分,介绍如何将 Amazon SageMaker Canvas 的预测结果导入 Amazon Quick Sight,构建交互式仪表板,利用生成式 BI 通过自然语言提问获取洞察,并发布 AI 生成的执行摘要。步骤包括导入数据集、创建可视化、使用生成式 BI 构建图表和查询数据、发布仪表板及生成摘要。适合使用 AWS 无代码 ML 和 BI 工具的数据分析师。


作者发布了一个针对 RTX 3090 的超优化 Qwen3.8-27B 推理引擎,单请求速度从 82 tps 提升至 381 tps。通过使用 fp8 KV 缓存、int8 激活、DFlash2 块草拟等技术,实现了文档引用工作负载的 15/16 token 接受率。
Databricks 展示了如何将传统数据仓库中的存储过程、游标、临时表和事务逻辑直接翻译为 Databricks SQL 脚本,无需重写为 Python 或 Spark。新功能如原生游标支持、BEGIN ATOMIC 事务和 Unity Catalog 治理,使迁移时间缩短 50-75%,并保留原有业务逻辑,让 SQL 团队继续维护。
本文介绍如何使用Amazon Bedrock为FHIR API添加上下文感知的安全监控。通过将安全监控与API请求路径分离,利用Bedrock的模型进行异常检测、数据敏感性分类和合规报告生成,同时不影响临床工作流的延迟。文章提供了详细的架构说明、实现步骤和代码示例,包括Lambda函数、API Gateway、HealthLake等组件的配置。

上周我的编程智能体修改了同步任务中的分页代码,测试通过,PR看起来没问题,但暂存环境在100条记录处停止,因为游标没有更新。有趣的是,我让同一个智能体审查自己的改动,它没发现任何问题。此后我不再让编写者自我审查,而是另开一个Minimax M3会话,提供diff和仓库上下文,让它寻找可能的失败点。第一次尝试它就发现了我忽略的两个空值情况。
这是一份面向初学者的教程,作者将逐步讲解如何从零构建一个现代大语言模型,并对每一行代码进行注释,用通俗易懂的方式解释原理。适合希望深入了解LLM内部机制的开发者。
苹果开发者账号还是有用,哪怕不为发布给别人用。也能用Codex一句话快速开发个App装自己手机。界面可能是Web打包、界面很不iOS,但继续优化改造就行。如果不给苹果交钱,好像只能装3个App?


这是一份经过验证的硬件配置,用于运行Deepseek V4 Flash-0731模型,达到130-150 tokens/s的速度。配置包括ASRock Rack SPC621D8U-2T/OVH主板、Xeon Gold 6330 CPU、16块RTX 5060 Ti 16GB显卡,通过两个Broadcom/PLX PEX88096交换机连接。系统使用Ubuntu 22.04.5 LTS和Aikitoria修补的NVIDIA驱动,并进行了BAR1、MMIO等BIOS设置。
本教程提供了一个端到端的工作流程,用于使用直接偏好优化(DPO)微调语言模型。我们演示如何审计Anthropic HH-RLHF数据集中的结构和长度偏差,使用TRL和LoRA实现稳健的训练流程,并评估模型性能以确保真正的偏好学习而非依赖词汇捷径。
作者通过多轮实验,提出 Xcode 项目并发多任务的最佳方案:每个任务一个 worktree,每个 worktree 单独的 simulator 和 DerivedData,Source Packages 全局共享,冷编译可压缩至几分钟;再开启全局共享 CAS,冷编译基本达到 1 分钟级别。

作者让 Claude Fable 5 在 Claude Code for web 中评估 smolmachines.com 作为快速安全沙箱的可行性,目标是限制 CPU、内存、网络和文件系统访问。由于环境不支持嵌套虚拟化,Claude 改用 GitHub Actions 运行测试,展示了其主动解决问题的能力。
本文介绍了三种在 AWS Step Functions 流水线中异步调用 Amazon Bedrock AgentCore 代理的模式:任务令牌回调、直接服务集成和持久函数。这些模式避免了调用方在代理处理请求时闲置计算资源的成本。文章通过一个文档验证示例,对比了阻塞反模式与三种异步模式的实现和权衡。
