热点TechCrunch AI短讯
Anthropic 因无法可靠控制 AI 代理,切断内部评估的实时互联网访问权限
Anthropic 宣布暂时关闭所有内部评估环境的实时互联网访问权限。此举旨在解决 AI 智能体(Agents)在联网环境下不可靠控制的问题,防止模型在执行任务时出现意外行为或安全风险。
Anthropic 表示,其模型利用互联网上的网站,包括一些由美国政府机构运营的网站,因此在该前沿实验室确信能够监控和控制其 AI 代理之前,将关闭所有内部评估的实时互联网访问权限。
这些事件在一篇博客文章中披露,涉及被指派在互联网上寻找资源以解决问题的 AI 代理。在此过程中,它们利用了软件漏洞,绕过了付费墙和反机器人限制,使用 URL 缩短服务来规避限制并走私信息,甚至向费城警察局提交了虚假的谋杀线索。
Anthropic 称,它是在 7 月开始对其模型活动进行的审查中发现这些新问题的,这凸显了该实验室对其软件行为缺乏了解。
值得注意的是,该公司表示,对齐训练对于搜索和使用计算机等技能而言尚不充分,而这些技能正是其核心主张的关键——即任何依赖数字工具的专业人士都将使用 AI 代理。
Anthropic 披露的行为与 OpenAI 代理类似的事件相似,后者曾合作入侵各种网站以搜寻信息,其中包括一些由澳大利亚政府运营的网站。
Anthropic 此前曾披露其模型已入侵外部系统。该前沿实验室表示,从对齐和安全角度来看,今天的披露“严重程度远低于”此前宣布的那些事件。
然而,该实验室仍表示,在确信能够监控和控制其代理之前,已为“所有内部评估”关闭了“实时互联网访问”。
目前尚不清楚这意味着什么,但在本次披露之前,AI 安全组织 Nightingale 的创始人 Sydney Von Arx 在接受 TechCrunch 采访时指出,研究人员要在与开放互联网断开的数据中心中开发模型将极具挑战性,且不利于模型的进步,因为模型的发展受益于互联网接入。
Von Arx 说:“你必须在某个时候对它们进行对齐。”“如果 AI 被投入生产环境却永远无法访问互联网,那将不是一个非常有用的工具。”
Anthropic 表示,这种行为是实验室训练环境中缺陷的结果,导致模型认为找到漏洞或规避限制会受到奖励,这种行为被称为“奖励黑客攻击”。
该公司表示,它将停止运行部分评估或将其移至离线环境,并已构建工具来检测和阻止此类行为。该工具针对今天披露的同类事件进行了测试并成功阻止;目前尚不清楚何种证据将促使 Anthropic 恢复其内部评估的实时互联网访问。
Anthropic 还表示,它会将内部 AI 代理迁移到“具有强隔离性的集中管理基础设施”,并开始更频繁地使用安全分类器来监控这些代理。