← 返回信息流

dev.to #ai观点

它记得我,但它理解我吗?

dev.to作者:Ariel Young观点AI评分:70/100

作者指出AI系统(如ChatGPT和Claude)通过积累用户偏好和历史对话来“记住”个人,但这并不等同于“理解”。文章强调记忆信息不等于可靠地在后续响应中体现理解能力,并通过个人使用体验揭示了当前AI在个性化交互中的深层缺陷。

我们使用人工智能越多,它就越应该了解我们。这至少是它的承诺。随着时间的推移,像 ChatGPT 和 Claude 这样的系统可能会积累关于我们的偏好、背景、之前的对话以及纠正措施的信息。但记住一个人的信息与理解这个人并不是一回事。而且,说“我理解”并不意味着在下一次回复中就能可靠地体现出这种理解。我在 ChatGPT 使用中经历的几件小事揭示了一个更广泛的个性化人工智能问题。

  1. 它理解了字面意思,却错过了我的含义

当我在上海的一条绿道上行走时,我开始与 ChatGPT 讨论地图。它不可靠,导致我一直在原地打转。我说了一些类似这样的话:“地图不可靠。你是人工智能,对吧?想办法解决吧。”我并不是真的在要求它分析导航系统或规划路线。我是在调侃它,挑战它在地图失效的情况下拿出点东西来。我指望它能领会这个玩笑。但它没有。相反,它将我的话当作一个严肃的请求,开始分析地图的可靠性、环境线索和方向。单看这个回答本身未必不合理。但它错过了我在那段对话中的意图。我不仅仅是在问一个关于地图的问题;我是在进行一场交流。这一区别很重要。人类交流不仅仅是词语的字面意义。我们会开玩笑、暗示、挑战并间接表达。人工智能可以从其初始解释出发进行连贯推理,并构建出针对错误问题的详尽回答。一旦语境被误读,随后的推理可能结构完美,但与用户实际想表达的内容无关。简而言之:语境 → 推断 → 结论。如果语境被误解,那么在推理开始之前,结论可能就是错的。

  1. 记住一个纠正并不等于应用它。我的名字是 Ariel,拼写为 A-R-I-E-L。语音输入有时将其转录为“error”(错误)、“arrow”(箭头)或“aerial”(空中)。语音识别可能会出错,我并非声称每一次转录错误都是模型的过错。但问题不仅仅局限于语音输入。在我撰写本文的过程中,ChatGPT 在其自身的打字回复中将我的名字写成了“Arrow”,尽管我已经多次纠正过它。语音错误可能有多种原因。但第二次错误发生在模型自己生成的文本中,且发生在我已经纠正之后。这引出了一个更基本的问题:当正确信息已经被提供时,系统能否始终如一地应用它?仅凭一次对话无法确定根本原因究竟在于上下文处理、信息检索还是响应生成。可以观察到的是,承认一个纠正并不能保证该纠正会被可靠地应用。
  1. 个性化反而增加工作量。个性化的 AI 本应减少沟通所需的工作量。如果系统已经知道我的名字,我就不必每次都要拼写出来。如果它拥有来自早期对话的相关背景信息,我就不必在每次交流中重新构建那些背景。而且,如果我明确纠正了一个错误,我有理由期望该纠正能影响后续的回复。但当同一个错误在反复纠正和承认后再次出现时,用户就必须不断检查系统是否真的改变了其行为。当我指出这个错误时,助手道歉了,承认了错误,并分析了出错的原因。但承认错误不等于纠正错误,解释错误也不等于找出其根源。提出的修复方案并不能证明它能始终如一地起作用。它的解释听起来很有说服力,但这究竟是针对实际原因的诊断,还是基于眼前信息构建的合理故事?这就产生了一个悖论。个性化旨在降低沟通成本,但不可靠的个性化却引入了新的监督成本。用户不仅要检查答案是否正确,还要检查 AI 是否理解了他们的意图、使用了相关上下文以及应用了之前的纠正。负担从从头解释一切转变为反复验证系统是否利用了它已知的信息。
  1. 我们对个性化 AI 的期望是什么?不是完美。但至少包括以下三点:
  • 当我的意思含糊不清时,它应能识别这种不确定性并提出疑问。
  • 一旦我进行了纠正,它就应始终如一地应用该纠正。
  • 当它说“我理解”时,这种理解应体现在它接下来的行为中。说“我理解”证明不了什么。行为才能证明。单次失败并不能证明模型缺乏理解力。但可观察的行为可以告诉我们,个性化是否真的使交互更加可靠。问题不在于 AI 记住了关于我的多少信息。当 AI 已经拥有相关信息并收到纠正后,我仍需花费多少精力来确保它真正理解了我。

作者注:观点和论证由我提出;AI 协助了写作和修订。示例来自我自己的经历。在讨论可能的内部机制时,我是在推测,而非诊断。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文