精选LangChain新闻
Podium 借助 LangSmith 优化智能体行为,工程干预减少 90%
Podium 在 AI 员工智能体的开发生命周期中使用 LangSmith 进行数据集管理和微调,将智能体 F1 响应质量提升至 98%,同时将工程干预需求减少了 90%。

关于 Podium
Podium 是一个帮助小型企业通过电话、短信、电子邮件和社交媒体快速与客户建立联系的沟通平台。小型企业通常与客户有高频率的互动——比如汽车经销商、珠宝商、自行车店——但往往人手不足。Podium 的使命是帮助这些企业及时回复客户咨询,从而将潜在客户转化为实际销售。
Podium 的数据显示,在 5 分钟内回复客户咨询,其潜在客户转化率比 1 小时内回复高出 46%。为了提升潜在客户的获取能力,Podium 推出了 AI Employee——他们的智能体应用(也是旗舰产品),用于与本地企业客户互动、安排预约并促成销售。
最初,Podium 使用 LangChain 框架处理单轮交互。随着他们的智能体用例在广泛的客户群体和业务领域中变得越来越复杂,Podium 需要更好地洞察其 LLM 调用和交互情况——于是转向 LangSmith 进行 LLM 测试和可观测性管理。
贯穿智能体开发全生命周期的测试
建立反馈循环对 Podium 的智能体开发生命周期尤为重要。LangSmith 使 Podium 的工程师能够测试并持续监控其 AI Employee 的表现,将新的边界情况添加到数据集中,以不断优化和测试模型。
- 基线数据集构建:创建初始数据集,以覆盖智能体的基本用例和需求。这为测试和开发奠定了基础。
- 基线离线评估:在发布到生产环境之前,使用构建好的数据集进行初始测试,评估智能体在基本需求上的表现。
- 收集反馈:用户反馈:收集与智能体交互用户的直接输入。在线评估:使用 LLM 进行自我评估,实时监控回复质量,标记潜在问题以供进一步调查。
- 优化:提示词调优:优化用于引导智能体回复的提示词。检索调优:调整用于生成回复的检索机制。模型微调:使用追踪数据进一步训练模型,使其在特定任务上更加专业化。
- 持续评估:离线评估:使用回测、成对比较和其他测试方法评估智能体的表现,并识别优化机会。数据集构建:持续更新和扩展测试数据集,加入新的场景和边界情况用于回归测试,确保新变更不会对现有功能产生负面影响。

使用 LangSmith 进行数据集构建和模型微调
在使用 LangSmith 之前,由于 Podium 的工程师每次交互需要调用 20-30 次 LLM,理解客户咨询的内容以及员工应采取的解决步骤非常困难。借助 LangSmith,他们迅速完成了部署,并能够记录和查看追踪数据以汇总洞察。
Podium 的 AI Employee 遇到的一个具体挑战是,智能体难以识别对话何时自然结束,导致出现尴尬的反复道别。为了解决这个问题,Podium 首先在 LangSmith 中创建了一个包含各种对话场景的数据集,涵盖不同对话可能结束的方式。
随后,他们的工程团队发现升级到更大的模型很有帮助,并将输出结果整理提炼到较小的模型中(使用一种称为模型蒸馏的技术)。由于模型的输入和输出会自动记录在 LangSmith 的追踪数据中,团队可以轻松整理数据集,因此模型升级过程十分顺利。
Podium 的工程师还在 LangSmith 的 trace 中丰富了关于客户画像、业务类型以及其他对其业务至关重要的参数的元数据。他们使用 LangSmith 中的特定标识符对 trace 进行分组,从而在数据整理过程中轻松聚合相关 trace。这些丰富的数据使 Podium 能够创建更高质量、更均衡的数据集,从而改进模型微调,并帮助他们避免过拟合。
凭借这一均衡的数据集,Podium 团队随后使用成对评估(pairwise evaluations),将微调后模型的结果与原先更大模型的结果进行比较。这一对比使他们能够评估升级后的模型在多大程度上提升了智能体判断何时结束对话的能力。
微调之后,Podium 的新模型在识别其智能体应在何处结束自然对话方面表现出显著提升。使用微调模型后,Podium 的 F1 分数提升了 7.5%,从 91.7% 提高到 98.6%,超过了他们 98% 的质量阈值。
在无需工程干预的情况下,为 AI 平台提供高质量客户支持
在 Podium,工程师必须了解与客户的沟通何时出现问题,以便持续交付可靠且高质量的产品。
自从 1 月份公开发布 AI Employee 以来,Podium 的技术产品专家(TPS)团队能否实时排查用户遇到的问题变得至关重要。在 Podium,TPS 团队通常为他们的中小企业客户提供客户支持。然而,准确定位问题根源(以及如何采取行动)颇具挑战。
让 TPS 团队使用 LangSmith 提供了清晰的视角,使团队能够快速识别客户报告的问题,并判断:“这个问题是由应用程序中的 bug、上下文不完整、指令不一致,还是 LLM 本身的问题引起的?”
- 应用程序 bug:这类问题属于编排失败,例如集成未能返回数据。这些问题需要工程干预。
- 上下文不完整:LLM 缺少回答问题所需的信息。TPS 团队可以通过补充额外内容来解决。
- 指令不一致:指令基于业务需求制定;需求中的任何问题都可能影响智能体行为。TPS 团队可以通过在内容编写系统中进行修改,以更好地符合业务需求来解决。
- LLM 问题:即使具备必要的上下文,LLM 仍可能生成意外或错误的信息。这些问题需要工程干预。
例如,许多汽车经销商使用 Podium 的 AI Employee 来回复客户咨询。如果 AI Employee 错误地回复某家汽车经销商不提供换油服务,TPS 团队可以使用 LangSmith 的 playground 功能编辑系统输出,并判断在 Admin 界面中进行简单的设置更改是否能解决该问题。

在引入 LangSmith 之前,排查智能体行为问题通常需要工程干预。这是一个耗时的过程,需要召集工程师先审查模型输入和输出,然后重写并重构代码。
通过让 TPS 团队使用 LangSmith trace,Podium 将工程干预的需求减少了 90%,使工程师能够将更多精力放在开发而非支持任务上。
- 提升了 Podium 支持团队的效率,使他们能够更快、更独立地解决问题。
- 提高了支持互动以及 Podium AI 驱动服务的客户满意度(CSAT)评分。
Podium 的下一步计划
通过集成LangSmith和LangChain,Podium在客户体验工具领域获得了竞争优势。LangSmith增强了可观测性,简化了大型数据集的管理,并优化了模型性能。Podium团队还将LangGraph整合到其工作流程中,在服务不同目标客户时降低了智能体编排的复杂性,同时增强了对智能体对话的可控性。
这些产品共同使Podium能够专注于其核心价值主张——帮助小企业更有效地获取潜在客户——并高效地设计、测试和监控其LLM应用。
Podium正在多个岗位招聘,以帮助本地企业赢得市场。受到Podium故事的启发?您也可以免费试用LangSmith,或与LangSmith专家交流以了解更多信息。
如需获取测试和评估LLM应用的更全面最佳实践,请参阅这本指南手册。
了解你的智能体真正在做什么
LangSmith,我们的智能体工程平台,帮助开发者调试每一个智能体决策、评估变更,并一键部署。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。