← 返回信息流

精选LangChain观点

智能体工程:AI智能体群如何重新定义软件工程

langchain.com观点教程AI评分:70/100

本文提出智能体工程(Agentic Engineering)概念,主张通过多智能体系统模拟真实工程团队,而非仅加速编码。作者基于LangGraph等工具构建参考架构,包含Worker Agents和Leader Agents,实现跨团队工作流编排、长期记忆和全局可观测性。试点显示调试时间减少93%,开发流程执行时间减少65%。作者认为智能体工程是控制平面,与Codex等编码智能体互补,后者可作为Worker Agents的推理引擎。

.png)

核心要点

  • 什么是智能体工程?智能体工程是一种多智能体协调模型,其中AI智能体充当数字团队成员——每个智能体都有明确的角色、共享记忆和统一的可观测层——推动软件走完整个交付流水线,而不仅仅是更快地生成代码。
  • 多智能体系统在软件交付中能产生什么成果?在一项涵盖20多个调试工作流的试点中,与历史基线相比,协调式智能体执行将定位根因的时间缩短了93%,单月在512次会话中节省了超过200个工程工时。开发工作流的执行时间缩短了65%,最大的收益来自压缩下游测试环节——而非代码生成。
  • 智能体工程与Codex或Claude等AI编程智能体有何不同?AI编程智能体擅长在单次用户驱动的会话中将意图转化为代码。智能体工程则在更高的抽象层级上运作:它是一个控制平面,负责编排跨团队工作流、维护跨智能体的长期记忆,并管理整个软件交付生命周期中的状态与可追溯性。两者并不相互竞争——像Codex这样的编程智能体可以作为推理和代码生成引擎,运行在工人智能体内部。

本文为客座文章,作者为Renuka Kumar博士(Cisco首席软件工程师/总监)与Prashanth Ramagopal(Cisco工程高级总监)。本博客所表达的观点均为作者个人意见,不代表Cisco立场。

软件开发已进入一个新阶段——在这个阶段中,智能体不再作为孤立的工具运作,而是作为协调的实体,映射真实世界的团队。随着AI采用的加速,焦点已从“什么是可能的”转向“什么在实践中有效”。软件工程的每一个阶段——需求、设计、开发、安全、测试、部署和运维——至少都适合部分自动化,当智能体跨职能协作时,甚至可能支持完整的端到端编排。这样一来,目标就从“我们如何更快地编写代码?”转变为“我们如何更快、更安全地让软件走完整个系统?”通过多个智能体框架的实验,我们识别出了能够带来真实、可衡量影响的实用模式。

本博客描述了一个智能体工程系统,旨在从任务级执行过渡到系统级协作。我们提出了一个参考架构,以及一个使用LangChain工具套件(包括LangSmith和LangGraph)实现的多智能体协调框架的试点评估。这个系统不是“更好的编程AI”,也不是“更好的任务助手”。该架构旨在作为多智能体协调的控制平面,聚焦于端到端的软件交付。

智能体工程:镜像真实世界的工程实践

“最大的阶跃式变化不仅仅来自更好的工具,更来自能够镜像真实世界团队的系统。”

智能体工程的核心是一个协作式智能体系统,旨在镜像工程团队如何规划、执行和交付软件。该框架不将AI视为一组孤立的助手,而是将智能体建模为团队成员——每个智能体都有明确的职责、共享的上下文和问责机制——通过一个轻量但强大的领导层进行协调。

  • 执行长期运行的工作流
  • 保留可在团队之间共享的智能体记忆
  • 将不同类型的工作流串联起来,使其能够跨越团队边界流动
  • 促进知识共享,帮助新团队成员快速上手智能体工作流
  • 对以智能体方式执行的工作流提供全局可观测性,以实现可追溯性和审计能力

架构

在高层面上,该系统是一个松耦合的智能体系统,每个智能体既可以作为独立实体运作,也可以作为智能体群体中的一员运作。我们的系统由两个互补角色组成,可根据规模进行适配:

  1. 工人智能体——这些智能体充当工程团队中个人贡献者的数字对应物。它们在明确定义的边界内自主运作,基于工程意图(如开发、测试、调试或运维)来规划并执行任务。根据团队的成熟度和复杂度,部署可能涉及单个工人智能体,也可能涉及一个动态协调的工人智能体群体。
  • 使用推理模型解读用户意图,并将其转化为可执行的计划。
  • 从记录系统(如源代码仓库、问题追踪器和内部知识库,如日志)中收集所需上下文。
  • 通过工具、编码代理或自定义/子代理执行工作流。
  • 验证结果以确保正确性和完整性。
  • 向领导层报告计划、行动和结果,以确保透明度、问责制和可追溯性。

工作代理(Worker Agents)有意采用松散耦合的设计,使其能够水平扩展、适应新工作流,并在必要时将任务委派给群体中的其他代理。

  1. 领导代理(Leader Agent)——这些代理充当项目负责人的数字对应物。它们协调、治理,并为整个代理群体提供共享能力和可见性。领导代理提供:
  • 共享的提示词和工作流库,标准化最佳实践,并大幅降低上手门槛。
  • 通用工具网关,以一致且安全的方式向工作代理开放经批准的能力。
  • 群体的长期记忆,支持随时间推移的学习和持续改进。
  • 对代理活动、决策和结果的全局可观测性,提供对系统行为和性能的洞察。
  • 编排能力,决定代理何时以及如何行动,而不仅仅是它们产生什么结果。
  • 通过将执行与协调分离,该框架在边缘保持自主性的同时,在规模上保持一致性。

下图展示了代理工程系统的参考架构。我们所有的工作代理都通过A2A协议进行通信。然而,工作代理也可以通过MCP包装器与不支持A2A的代理进行交互。与系统交互的工程师通过他们偏好的界面(如IDE或CLI)表达意图,或通过GitHub或Jira操作触发外部事件。在该系统中,工作流可根据团队的生产力需求进行定制。

.png)

在评估了多个代理框架后,我们选择了LangChain的框架用于本研究,基于它们如何映射到代理工程的生产需求。它是一种用于有状态、协作和可治理代理系统的执行模型,使其适合编排反映真实工程团队的AI系统。我们使用LangMem抽象来存储长期状态,并使用LangSmith记录执行轨迹,实现端到端的可追溯性、遥测以及代理工作流和结果的系统级视图。

宏观架构视图

以下是这些代理系统如何跨越团队边界的参考图。领导代理可以与其他团队的领导协作。例如,来自产品管理团队的产品需求可以由工程团队领导路由到正确的工作代理(群体)进行规划和需求提取。

基于LangChain的参考技术实现

该实现整合并评估了LangChain框架套件提供的三个核心抽象——LangGraph(用于可控的代理编排)、LangSmith(用于代理可观测性和评估)以及LangMem(一个帮助代理通过长期记忆学习和改进的库)。LangGraph的核心抽象——一个有状态节点的图——使得能够基于代理生成的计划构建自定义工作流。评估聚焦于以下技术特征,以将代理工程从实验环境转变为稳定、生产就绪的运营模式:

  • 状态管理和检查点能力,可在步骤、代理和重试之间持久化。
  • 审计跟踪的提供,以追踪谁在何时、为何做出了什么决定,支持事后分析和持续改进。
  • 与外部记录系统和MCP风格工具网关的接口兼容性。
  • 确定性执行模型,确保代理执行经授权的操作,以降低运营风险。
  • 跨不同代理通信协议以及与使用其他框架构建的代理的互操作性。

使用LangGraph辅助的代理执行

我们探索了多个涉及智能体间通信的场景,例如跨团队调试技术问题,以及利用Codex或Claude等AI编程智能体与工作智能体协作进行开发。我们在下图中详细描述了后一种场景的示例。该图展示了AI编程智能体与承载自主逻辑的工作智能体之间的交互。工作智能体内部的自主逻辑遵循一个适用于大多数智能体工作流的四阶段逻辑推进过程。此用例展示了如何利用工作智能体检索超出源代码范围的上下文、通知其他智能体,以及追踪智能体活动轨迹。

  • 意图分析:在IDE中以自然语言输入工程意图后,请求被发送至工作智能体。在此用例中,智能体的工作流使用LangGraph进行编排,以分析意图并通过MCP工具检索相关上下文。
  • 规划与通知:上下文建立后,智能体生成结构化的多步骤计划(图中的步骤1至步骤N)。该计划通过通信渠道(如Slack、Teams或Webex)通知工程师。
  • 执行与跟踪:随后,计划与IDE中的AI编程智能体协作,逐步执行。智能体利用LangGraph的检查点机制和状态跟踪功能来追踪执行状态。
  • 验证与收尾:在最后一步,执行完成后,工作智能体通过验证已执行的计划与内存中检查点记录的执行状态是否一致来闭环。结果以通知形式发送至工程师的通信渠道,并作为长期状态保存于LangMem中。

鉴于AI编程智能体不支持原生的A2A(智能体间通信)能力,我们构建了一个MCP适配器工具,用于将请求从AI编程智能体路由至工作智能体。这种方法使系统与具体IDE无关。

.png)

试点研究的发现与观察

为评估智能体工程的实际影响,我们将该框架应用于真实的开发、测试和调试工作流。我们并未优化单个任务,而是衡量智能体协作时在不损失质量的前提下吞吐量的提升,并选择了需要至少两个智能体协调配合的工作流。为建立开发和调试工作流的基线,我们举办了一次训练营,工程团队集中梳理了用例清单,并依据历史数据计算了在不使用智能体的情况下完成这些工作流所需的时间。我们给出的数据偏保守,实际收益可能更大。

我们评估了多个涉及跨团队分诊和根因分析的调试工作流,并由质量工程团队进行独立质量评估。以根因定位时间为主要指标,对20多个工作流的试点显示,相比历史调试时间总体缩短了93%。多个跨团队调查在协调智能体执行下不到五分钟即完成,独立质量工程评估确认质量无显著损失。在一个月内由70位独立用户产生的总计512次调试会话中,我们通过跨协作智能体工作流计算节省了超过200个人工时。

对于以开发为重点的工作流,该配置将基于IDE的AI编程智能体与我们的工作智能体配对。虽然并非必需,但此方案的一个关键优势在于系统能够从后端服务检索项目特定上下文,从而实现更明智的代码生成和测试计划生成。我们还测试了将规划职责转移至工作智能体,同时在LangMem中维护长期状态,使先前的工作流可被索引和复用。这显著降低了重复任务的上手开销。

在15多个开发工作流中,即使计入工作智能体的参与,我们观察到执行时间相比历史基线缩短了超过65%。重要的是,主要收益并不仅限于更快的代码生成——这已是AI编程智能体的强项——而是通过协调智能体执行,压缩了PR合并后功能测试的下游工作流。PR审查流程本身反而成为人机协同引入的瓶颈。

该系统与AI编程智能体的区别

Codex和Claude等AI编程智能体提供了若干增强软件开发的新能力。然而,这些智能体与本文所述智能体工程系统在抽象层级上有着根本性的不同。

Codex 级别的模型通常嵌入在 Worker Agent 中,或作为工作流中的推理或代码生成引擎组件。虽然 AI 编程智能体擅长在代码库语境中将意图转化为代码、进行重构、解释或调试,但它们运行在受限的用户驱动交互循环中,在编排跨团队工作流方面的能力有限。相比之下,本文介绍的智能体工程系统被明确设计为像一个松耦合的工程团队,能够跨越开发者和团队边界运作。

AI 编程智能体及其子智能体在并行执行功能方面表现出色。本文介绍的系统是一个显式的控制平面,用于编排端到端的智能体工程,以加速软件在软件工程流水线中的流转,为此我们利用了 LangChain 的框架。

结论

智能体工程代表了软件构建方式的根本性转变,它围绕行为类似真实工程团队的 AI 系统重新组织工作,并充分利用这些系统的优势。综合来看,我们的研究表明,智能体工程的主要影响并非渐进式的任务加速,而是软件在组织中流转方式的结构性转变——压缩协调开销、减少跨团队延迟、共享上下文,并重新定义人类注意力最具价值的环节。LangGraph 等框架将协作、记忆和可观测性视为一等公民,使这种运作模式切实可行。智能体工程框架的优势在于,工程师只需极少的设置即可轻松接入软件交付流水线。一旦智能体配置完成,多个团队即可利用 worker agent 从内部和外部工具中获取上下文。其结果不是更快的代码生成,而是一种更具弹性、可扩展性更强、从根本上不同的软件交付方式。

了解你的智能体真正在做什么

LangSmith,我们的智能体工程平台,帮助开发者调试每一个智能体决策、评估变更,并一键部署。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文