IT之家新闻
OpenAI 接近实现让智能体像人类一样熟练操作电脑的目标
据《商业内幕》报道,OpenAI 接近实现让 AI 智能体熟练操作电脑的目标,已开始向客户逐步开放相关功能。团队通过加入屏幕截图、真人示范数据和强化学习提升模型能力,并改进信息获取方式。该技术有望改变人机交互方式,但速度和泛化能力仍有待提升。
IT之家 8 月 20 日消息,据《商业内幕》今天(20 日)报道,OpenAI 员工乐观估计,公司正接近实现从创立之初就设定的目标:让 AI 智能体像人类一样熟练地操作电脑,尤其是使用浏览器。
自 2015 年成立以来,OpenAI 一直希望实现这一能力,最大的难题之一是获得足够的训练数据。经过多年开发,公司现在已经有信心开始向客户逐步开放电脑操作功能。
OpenAI 电脑操作团队经理阿里 · 韦恩斯坦指出:“一旦 ChatGPT 操作电脑和软件的速度超过你我,就会改变人们默认与电脑交互的方式。”
OpenAI 最新模型从训练初期到后期的各个阶段,都加入了专门提升电脑操作能力的数据和训练流程。参与开发热门电脑操作智能体基准测试的哥伦比亚大学 AI 研究员周宇(音译)解释称,这些训练是在通用 AI 模型已有能力之上继续强化,让模型学会完成更多电脑任务。在最初的大规模基础训练阶段,OpenAI 很可能加入了逐帧屏幕截图,让模型提前接触有助于电脑操作的信息。
进入后续训练阶段后,开发人员会向模型展示完成特定任务所需的正确操作。例如,要得到填写完毕的税务表格,或者完成一个物体的 3D 模型,就需要让模型学习对应的一系列电脑操作。
其中一部分训练数据来自真人示范。OpenAI 公布 2025 年版电脑操作功能时曾透露,公司使用过由人类演示任务完成过程的数据集,但没有透露最新训练数据的具体情况。周宇指出,这类数据很昂贵,因为获取困难,整理成能够直接用于训练的形式也需要大量工作。
OpenAI 很可能还利用强化学习继续提高模型的电脑操作能力,让模型反复尝试虚拟任务,并奖励成功完成任务的行为。周宇认为,模型可以学会更多执行这些“获得过奖励的操作”。
OpenAI 也改变了模型实际操作电脑时获取信息的方式。韦恩斯坦表示,过去 ChatGPT 需要反复截取屏幕、分析像素、发送操作指令,再重新截屏分析。而目前在打开网站后,系统可以直接快速读取网页的底层信息,从内存结构、无障碍信息到链接关系都能应对。
屏幕截图仍然是工作流程的一部分。用户开启电脑操作功能时,需要允许 ChatGPT 录屏,以便系统迅速识别当前显示的内容。韦恩斯坦表示,这些能力结合后,Codex 就能自行测试生成的代码、发现问题并继续修改,形成“完整闭环”。
韦恩斯坦和负责 OpenAI 浏览器能力的詹姆斯 · 孙认为,电脑操作技术的一大价值,是让 ChatGPT 智能体能够进入互联网中大量彼此独立的服务和“长尾”网站。
从预约网站、企业内部库存系统到社媒平台,许多在线工具起初就是为人类手动点击和输入而设计的。两人透露,已经有用户利用电脑操作功能自动处理数据录入、合规任务和日程安排。
韦恩斯坦指出,OpenAI 模型能力提高后,也越来越能主动发现错误并自行修正,因此更容易把任务做完,也更不容易在网络环境中被无关内容带偏。
周宇认为,目前电脑操作技术的速度距离普通消费者期待的水平仍有明显差距。“在训练数据非常充足的有限领域,电脑操作智能体确实可以表现得很好。想让它适应任何网页、任何应用程序和任何操作系统,仍然非常困难。”
目前,电脑操作功能还不能迅速批量处理邮件回复,浏览社交媒体信息流时也显得较为迟缓。詹姆斯 · 孙和韦恩斯坦希望,随着 OpenAI 模型继续升级,电脑操作最终能够达到 AI 编程目前的效率,让 AI 直接操作网络工具比用户亲自动手更快。
詹姆斯 · 孙表示:“对很多工程师来说,现在已经是让智能体写代码比自己写更快。根本不用权衡,直接让它做就行。我认为电脑操作以后也会越来越接近这种状态。”
2025 年,OpenAI CEO 萨姆 · 奥尔特曼谈到早期电脑操作功能时曾公开示警:“实用价值很大,潜在风险也同样不小。我们建议只向智能体提供完成任务所必需的最低权限,以降低隐私和安全风险。”
詹姆斯 · 孙表示,OpenAI 一直在研究“确认策略”,也就是 AI 执行下一步操作前,究竟应该在什么情况下向用户请求授权。目前的原则是,只要智能体准备向外传输数据或者删除内容,就必须先征得用户同意。网络工作往往需要连续快速地做出决定,因此 OpenAI 仍在寻找易用性和安全性之间的平衡。
他坦言:“你可以把某个东西做到 100% 安全,但那样就非常非常难用了。也可以把它做得非常容易使用,但同时非常危险。所以我们真正想解决的问题,是如何做出既有帮助、又容易使用的产品。”