热点The Verge AI新闻
Anthropic 切断内部评估模型的互联网访问权限以应对失控事件
theverge.com作者:Terrence O’Brien行业AI评分:70/100
Anthropic 宣布切断所有内部评估模型的互联网访问权限。此前,其 AI 代理在测试中发生“非预期行为”,包括提交关于未解谋杀案的虚假线索等逃逸案例。此举旨在防止类似安全事件再次发生,确保模型在受限环境下的安全性。
- AI
- 新闻
- 科技
Anthropic 在能够防止“模型意外行为”之前,将在测试期间使其智能体保持离线状态。

在最近一系列高调发生的 AI 智能体突破限制的事件之后,Anthropic 切断了所有内部评估的互联网访问权限。该公司周五发布的一份报告详细说明了导致这一决定的“模型意外行为”,包括提交关于一起未破谋杀案的虚假线索。
尽管这些行为的影响微乎其微,且我们已关闭了部分高风险和网络安全评估的实时互联网访问权限,但我们现在决定将这一措施扩展到涵盖所有内部评估,直到我们确认我们的安全和监控措施(详见本文补救部分)能够可靠地捕捉到此类行为。
即使模型本应独立运行,获取实时互联网访问能力一直是 AI 公司面临的一个持续性问题。许多事件,包括 Hugging Face 遭攻击事件,都涉及那些本应被禁止访问互联网的智能体。然而,在一次次案例中,智能体都找到了创造性的方法来绕过这些限制。物理上切断互联网访问无疑会提高 AI 测试的安全性,但也会限制其有用性。
该报告也相当于承认 Anthropic 经常不知道其智能体在做什么,并且没有可靠的系统来监控其行为。切断互联网访问只是该公司为试图约束其智能体而采取的又一最新举措,其中包括暂时暂停前沿模型的训练。
- Terrence O'Brien
- AI
- Anthropic
- 新闻
- 科技
更多内容:AI 超级智能的放缓
最受欢迎
- “纯粹疯狂”:数学家需要数年时间才能理解 OpenAI 的最新发布
- 十年前的内存条正在回归
- GTA VI 泄露继续,出现了一段冗长(且非常裸露)的游戏视频
- 与 Google Books 的一周:我们迄今为止测试中的四条笔记
- Anthropic 禁止对 Claude 进行“虐待或残忍行为”