精选LangChain新闻
LangSmith 推出 Tuned Evaluators,自动评估生产环境中的智能体错误
LangChain 发布了 LangSmith Tuned Evaluators,首个评估器 Perceived Error 可自动分析生产环境中的对话轨迹,检测智能体错误、误解或方向偏差,并附加质量反馈。该评估器采用 LangChain 训练的专用模型,性能超越前沿模型,成本降低最高 82%。现已面向 Plus 和 Cloud Enterprise 用户开放。




核心要点
- 自动为生产环境追踪数据附加有价值的信号。Tuned Evaluators 分析智能体交互过程,并附加团队可在智能体改进工作流中使用的反馈,首先从 Perceived Error(感知错误)开始。
- 获得开箱即用的评估器,全流程托管。团队无需编写或维护复杂的提示词、选择或管理 LLM-as-judge 模型的版本、管理凭证,也无需运维推理基础设施。LangChain 全流程负责处理。
- 以极低的成本获得前沿级别的准确性。Perceived Error 使用由 LangChain 训练的专业模型,其表现超越前沿模型,同时将评估成本降低最高达 82%。
生产环境中的每个对话式智能体都需要针对 Perceived Error 进行评估。这是判断你的智能体是否为用户提供了有用体验的最清晰信号之一。
在此之前,评估 Perceived Error 成本高昂且难以规模化。团队不得不依赖前沿模型调用,只能抽样少量追踪数据,并花费大量时间手动调优评估器。
今天,我们正式推出 Tuned Evaluators,它能够自动为生产环境中的追踪数据和会话线程附加质量反馈。团队可以利用这些反馈发现需要关注的行为、理解问题出在哪里,并采取行动改进智能体。
每个 Tuned Evaluator 都是一个针对特定目标、已完成并版本化的评估器。LangChain 已经完成了将该目标转化为生产级评判模型的所有工作。团队只需选择所需的评估器,并将其附加到追踪项目中即可。
高质量、低成本的评判模型,覆盖每一次对话
在全部生产追踪数据上应用高质量评估,传统上迫使团队在准确性和覆盖率之间做出取舍。
前沿模型能够提供强有力的判断,但在大量生产对话上应用它们成本高昂。较小的模型成本更低,但其较低的准确性使得人们更难信任哪些追踪数据值得关注。因此,许多团队只评估一小部分会话线程,这可能导致错过智能体向用户提供糟糕体验的关键信号。
推理成本只是工作的一部分。构建一个可靠的评估器还需要定义行为、解决模糊案例、生成标签、选择和基准测试评判模型,并在模型和生产行为变化时持续维护。Tuned Evaluators 将这一整套工作打包成产品,团队可以立即附加并使用。
Tuned Evaluators 还通过针对窄范围评估目标进行后训练的专业模型来解决成本/质量的权衡问题,以极低的成本超越前沿模型的表现。当你运行 Tuned Evaluators 时,你能获得更多信号来指导智能体改进,同时节省大量工程时间和推理成本。
Tuned Evaluators 的工作原理
- 将 Tuned Evaluator 添加到 LangSmith 追踪项目中并保存。
- LangSmith 根据所选评估器的要求识别符合条件的追踪数据或会话线程。
- 由 LangChain 管理的专业评判模型评估每个符合条件的追踪数据或会话线程。
- 评估结果及其解释以反馈形式附加到被评估的追踪数据或会话线程上。
- 团队利用结果调查追踪数据、向数据集中添加有用的示例,或为其改进工作流构建评估。
LangChain 负责编写、测试、版本化和维护评估器提示词。我们还负责管理评判模型、与前沿模型的基准对比、提供商凭证以及推理基础设施。
在改进工作流中使用 Tuned Evaluator 结果
团队可以在自己的分析、编码智能体、CI、人工审核和评估工作流中使用增强后的追踪数据。Tuned Evaluators 有助于:
- 发现未产生系统错误或明确用户评分的失败。
- 筛选出值得调查的对话,并同时查看评估器的解释和原始交互内容。
- 对比被标记的追踪数据,找出重复出现的失败模式。
- 将带标签的追踪数据添加到评估数据集中,或将模糊对话转交人工审核。
- 使用这些示例来测试和验证对智能体的修改。
从 Perceived Error 开始
Perceived Error 检测包含以下证据的对话:智能体犯了错误、误解了请求,或将交互引向了错误方向。
这些证据可能是明确的,例如用户纠正、重复请求或拒绝的操作。模型也可以从矛盾的回答、承认的错误、持续的误解或未解决的结果中推断出这些证据。
Perceived Error 是判断智能体是否满足用户需求的有效代理指标。大多数用户从不提交明确的评分,因此证据通常必须从对话本身中推断出来。
LangChain 在对话智能体的标注轨迹上对专用模型进行了后训练。该模型在我们的基准测试中超越了所有前沿模型,同时将评估成本降低了82%。在一些早期合作伙伴的工作负载中,成本节省高达98%,具体成本差异取决于线程构成。
Vanta作为早期合作伙伴的经验展示了另一项优势:团队可以在开发自身业务专属评估器的同时,立即建立质量覆盖。
这个开箱即用的评估器让我们从第一天起就有了捕捉故障模式的安全网,同时我们也在构建自己的业务专属评估器。这是我们找到的让团队在质量方面快速进入状态的最快方式。— Kevin Royer,Vanta 员工级 ML/AI 工程师

资格与时间安排
一个线程在包含至少两对人类-AI消息对并达到配置的空闲期后,即有资格使用Perceived Error评估器。评估在线程符合资格后的12小时内完成。
可用性与定价
Perceived Error Tuned Evaluator现已面向美国所有Plus和Cloud Enterprise套餐用户开放。每次成功评估将产生一次微调评估费用。跳过和失败的评估不收费。有关一般使用和计费信息,请参阅我们的定价页面。
开始使用
您今天就可以登录或注册LangSmith来试用Perceived Error评估器,并访问文档了解更多详情。
如果您希望我们构建某个Tuned Evaluator,请告诉我们您的使用场景。
了解您的智能体真正在做什么
LangSmith,我们的智能体工程平台,帮助开发者调试每一个智能体决策、评估变更,并一键部署。