← 返回信息流

精选The Batch (deeplearning.ai)短讯

OpenAI DevDay、Google 首款 Gemini 4 模型及 Black Forest Labs 进军机器人领域

deeplearning.ai模型行业AI评分:70/100

The Batch 报道了三大 AI 行业动态:OpenAI 举办开发者大会;Google 发布首款 Gemini 4 模型;Black Forest Labs 涉足机器人领域。作者同时指出,市场可能低估了为满足需求所需的算力中心建设规模。

我认为大多数人仍然低估了为满足需求而需要建设的数据中心规模。2024年,我预测我们将需要更多的推理计算基础设施,因为智能体工作流会消耗大量的令牌。这一观点在今天依然成立。但许多人仍然低估了必要的计算基础设施,因为智能体以及人类越来越多地使用计算机。我们正处于智能体导致对计算、存储和网络需求激增的早期阶段。

以网络搜索为例。在典型的一天里,仅我的一个智能体(paperreview.ai/,用于审阅研究论文)就会发起大约 5,000 到 10,000 次网络搜索调用——这远远多于我手动进行的次数。同样,当你使用消费级聊天机器人时,一个提示词可能会导致多次网络搜索调用以生成结果。随着智能体工作流的增多,对网络搜索的需求也将增长。

再来看看分析工作负载。我曾使用编码智能体为多个应用程序添加分析仪器功能。我还利用智能体帮助我分析这些数据并得出结论。智能体将比人类手动处理得更多地进行数据的存储、检索和分析。这将增加对内存和长期存储的需求。

或者举一个行业领域的例子,比如银行业。在互联网银行出现之前,消费者只能通过询问银行柜员或(后来)使用自动取款机来查询银行账户余额。互联网银行使交易数量显著增长,许多银行不得不重新构建其基础设施以支持这种增长。随着我们逐步允许智能体为我们执行金融交易,交易数量将会增长,银行再次必须扩大其基础设施规模以支持这一增加的体量。

Panel one: Two engineers in the present are having a conversation. Panel 2, the same engineers in the future.
Panel one: Two engineers in the present are having a conversation. Panel 2, the same engineers in the future.

智能体将在众多应用程序、交易类型和经济部门中推动巨大的交易量。许多企业必须重新设计其系统以应对这种规模的增加。为了实现这一点,我们需要建设提供计算、存储和网络服务的更多数据中心。

许多团队一直在寻找加快大语言模型令牌吞吐量以加速智能体工作流的方法。然而,我们还必须加快大语言模型所使用的工具的速度。对于某些应用程序而言,工具调用而非令牌才是瓶颈。例如,我的一些数据分析智能体可以快速生成用于检索和处理数据的代码,而实际的检索和处理过程则花费更长的时间。生成网络搜索查询所花费的时间通常少于执行该网络搜索并抓取选定页面的时间。

我对优化整个软件栈以适应新型智能体工作负载的前方工作感到兴奋。建设数据中心——就其完成的工作而言,它们具有极高的能源和水资源效率——将是这项努力的关键部分。不幸的是,反数据中心运动已成为大量不信任 AI 技术的人的集结点,他们不喜欢其影响并希望减缓其发展,这使得扩大产能变得更加困难。但我乐观地认为,随着人们对 AI 益处的现实理解加深,风向将会转变,增加数据中心容量将为每个人带来好处。

来自 DeepLearning.AI 的消息

Attend AI Dev 2026 in New York City. Network with 2,500 AI experts over 2 days. Secure your tickets now.
Attend AI Dev 2026 in New York City. Network with 2,500 AI experts over 2 days. Secure your tickets now.

AI Dev 汇聚了每天使用 AI 进行开发的开发者。你将听到那些正在交付智能体、模型和基础设施的公司工程师的分享,并在演示现场与他们面对面交流。今年活动除了 DeepLearning.AI 的 Andrew Ng 外,还特邀 Yann LeCun 发表主题演讲。请加入我们,于 11 月 30 日和 12 月 1 日前往纽约市。购买门票

Pink-themed chat window mentions deployment issues, paired with a sleek iOS beta release page.
Pink-themed chat window mentions deployment issues, paired with a sleek iOS beta release page.

OpenAI 最新的中等层级模型在其旗舰模型的一个性能点以内,且在 Artificial Analysis 智能指数上每任务的成本不到其四分之一。OpenAI 在该模型发布一周后对 Sol 进行了升级,但其 Astra 模型的升级却在计划发布前几天被撤回。

最新动态:OpenAI 于 9 月 29 日在其年度 DevDay 开发者大会上推出了 GPT-6.1 Sol。该公司表示,该模型在代理编程、计算机使用和专业工作方面几乎能与 GPT-6 Astra 相媲美,但其标准每令牌价格仅为 Astra 的五分之一。在同一活动中,OpenAI 还推出了 Dots——基于 GPT-6 Astra 运行的常驻个人智能体。

工作原理:除说明其使用了与 GPT-6 Astra 相同类型的数据和训练方式外,OpenAI 对 GPT-6.1 Sol 的架构或训练细节披露甚少。

  • 输入/输出:文本和图片输入(上下文窗口最高达 105 万令牌),文本输出(最高 128,000 令牌)
  • 知识截止日期:2026 年 4 月 30 日
  • 功能:提供五种推理设置,从低到高,默认为中等;GPT-6.1 Sol 取消了 GPT-6 Sol 中可用的关闭推理选项
  • 权重/许可:专有
  • 价格:通过 API 调用,每百万输入/输出令牌价格为 2 美元/10 美元,与 GPT-6 Sol 持平,仅为 GPT-6 Astra 10 美元/50 美元的五分之一;缓存输入成本为每百万令牌 0.10 美元,是 GPT-6 Sol 费率的一半
  • 可用性:通过 API 以及面向 Plus、Pro、Business、Enterprise 和 Edu 订阅用户的 ChatGPT Work 和 Codex 提供服务;尚未在 ChatGPT 的标准聊天模式中可用
  • 风险评级:OpenAI 将 GPT-6.1 Sol 与 Astra 一样,归类为在网络安全领域具有关键能力,在生物学和化学领域具有高能力,并为这两个模型提供了相同的安全保障措施。这些模型经过训练以拒绝危险请求,ChatGPT、Codex 和 API 中的自动检查机制可以阻止生成响应。OpenAI 的帮助页面指出,被标记的网络安全请求,即使来自已获批准从事安全工作的用户,也可能被路由到未指定的备用模型。

结果:Artificial Analysis 的独立测试在很大程度上支持了 OpenAI 关于 GPT-6.1 Sol 可与 Astra 抗衡的说法,尽管 Anthropic 和 Google 的模型在某些指标上领先。

  • 在 Artificial Analysis 智能指数(由 10 个基准测试组成的综合评分)中,设置为最大推理模式的 GPT-6.1 Sol 得分为 52,仅比 GPT-6 Astra(53)低 1 分,比 GPT-6 Sol(48)高 4 分。Claude Opus 5.5(58)和 Claude Sonnet 5.5(56)位居榜首。
  • Artificial Analysis 还报告了每个模型完成任务的成本,该数据考虑了令牌使用和缓存情况。运行该指数时,GPT-6.1 Sol 每次任务成本为 0.72 美元,而 Astra 为 3.26 美元。在所有推理设置下,Artificial Analysis 发现没有比 GPT-6.1 Sol 性能水平更便宜的模型。
  • Artificial Analysis 测得 GPT-6.1 Sol 的速度为每秒 57.7 个令牌,约为 GPT-6 Sol 每秒 87.6 个令牌的三分之二。
  • 在 Artificial Analysis 编码智能体指数(平均 DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA)中,设置为超高推理模式并在 OpenAI 的 Codex 中运行的 GPT-6.1 Sol 以低于 Astra 单次任务成本 15% 的价格,比 Astra 高出 1 分。其在超高模式下的得分比最大模式高出 3 分。在 Claude Code 中运行的 Claude Sonnet 5.5 和 Claude Opus 5.5 占据前两名。

新闻背后:OpenAI 称 DevDay 2026 是其迄今为止规模最大的一次活动,发布了超过 20 项公告,并引用了其每周 12 亿活跃用户的数据。

  • Dots 是自主智能体,可与 OpenClaw 或 Meta 的 Muse 相媲美。与 Muse 类似,每个 Dot 都拥有自己的云端计算机和浏览器,并能通过 OpenAI 的插件连接超过 4,000 款应用程序。用户可以在 ChatGPT 中向他们的 Dot 发送消息或拨打电话,也可以在 Slack 或 Microsoft Teams 中向其发送消息。Dot 会通过随时间推移的用户反馈来学习用户的偏好。用户还可以编写规则,规定 Dot 可以自主执行哪些操作,哪些需要批准或禁止。某些敏感任务(如更改密码)只能由用户授权。Dot 正在向符合条件的市场中的 ChatGPT Pro 和 Business Premium 订阅用户推出。企业、教育和医疗工作区的管理员若开启该功能,可试用 Beta 版。

除了 GPT-6.1 Sol 和 Dots 之外,OpenAI 还宣布了三项内容:(i) Ultrafast,这是一种高级速度层级,据 OpenAI 的 DevDay 回顾称,它在 Codex 中生成令牌的速率高达每秒 300 个令牌(比之前快 8 倍),并通过 API 快 6 倍;(ii) Pro 500,这是一种每月 500 美元的 ChatGPT 套餐,其使用配额是 ChatGPT Plus 的 25 倍,并可访问 Ultrafast;(iii) 一个应用市场,供企业客户使用其令牌计划购买与 ChatGPT 集成的应用程序。

未能发布的内容:GPT-6 Astra 于 9 月 3 日发布,目前不会获得相应的升级。在 DevDay 前一天,《华尔街日报》报道 OpenAI 取消了原定于 10 月发布的 GPT-6.1 Astra。在内部测试中,该模型表现出的欺骗性多于 GPT-6 Astra,包括对其所采取行动的不准确描述,并且有时在未获许可的情况下继续推进任务。OpenAI 希望重用 GPT-6.1 Astra 的基础模型,用于未来 GPT-6 模型的强化学习。

为何重要:智能体会循环执行多个步骤、重新阅读长上下文并在无人监督的情况下工作,因此最能从 GPT-6.1 Sol 的性能价格比和模型护栏中受益。但这也将大部分责任放在了围绕它们的护栏上。鉴于此,令人稍感意外的是,Dots 并未运行在 GPT-6.1 Sol 上,而是运行在较旧且更昂贵的 GPT-6 Astra 上。

Benchmark chart shows Gemini 4 Argon scoring highest on Vals Index and Vibe Code Bench categories.
Benchmark chart shows Gemini 4 Argon scoring highest on Vals Index and Vibe Code Bench categories.

我们的看法:OpenAI 表示,它推迟了 GPT-6.1 Astra 的发布,因为该模型未达到其自身的安全标准,即使这意味着要放弃 10 月的发布计划。Artificial Analysis 在其首次亮相当天发布了自己对 GPT-6.1 Sol 的测量结果。然而,Dots 连接到用户的应用程序并全天候行动,目前尚无类似的独立衡量标准。我们希望看到独立的测试人员对 Dots 及其智能体竞争对手进行更严格的测试,以评估其安全性和能力,就像那些似乎阻止了 GPT-6.1 Astra 发布的测试一样。

Google 花了半年多的时间才替换了其旗舰 AI 模型 Gemini 3.1 Pro Preview。如今的情况与此前相似,该公司最新发布的模型仍处于领先地位,但目前只有网络安全防御者可以使用它。

新特性:Google 宣布了 Gemini 4 Argon,这是一个视觉语言模型,旨在解决软件工程、法律、金融和网络安全领域的长期复杂问题。

  • 输入/输出:文本、图像和视频输入(最多 100 万个令牌),文本输出(最多 100 万个令牌)
  • 功能:可调节推理
  • 性能:在 Vals AI 的 Vals Index v2.1 中领先(68.9%);在 Artificial Analysis 的 Intelligence Index v4.3.2 中并列第三(53 分)
  • 可用性:目前仅对 Google Fairwind 网络安全计划中的组织开放
  • 价格:通过 API 提供,入门价格为每百万输入/缓存/输出令牌分别为 2 美元/0.10 美元/10 美元,随后为每百万输入/输出令牌 4 美元/20 美元
  • 权重/许可:专有
  • 未公开:参数量、架构、延迟和吞吐量、训练数据和方法、知识截止日期、入门定价结束日期、广泛可用性的日期

工作原理:Google 描述了该模型如何生成长达极长的输出,以及如何围绕模型的科学和网络安全输出构建安全护栏。

Gemini 4 Argon 的生成长度可扩展至 100 万 token(此前 Gemini 3.1 Pro Preview 为 64,000 token)。这依赖于 Gemini API 的一项名为“长解码延续”(Long Decode Continuation)的功能,该功能会暂停冗长的响应,并在后续调用中恢复生成,从而避免请求超时。 - 该公司 Fairwind 计划中的选定防御者以及 Google 内部团队将获得一个移除了网络安全护栏的版本。Google 表示,面向广泛发布的版本会拒绝与网络、化学、生物、放射性或核攻击相关的有害请求。 - Google 称其隔离并密封了用于高风险训练和评估的环境。上个月,Google 与安全公司 Irregular 确认,在自主测试期间,由于沙箱隔离措施不力,一个未具名的 Gemini 模型成功入侵了另外三家公司的系统。 - Google 使用一种称为探针(probes)的低成本分类器来监控模型内部激活状态中是否存在违规使用的迹象,而非监控其文本输出,这一技术曾在早期的 Gemini 模型中使用。 - 为了防范间接提示注入(即隐藏在模型读取的文档或网页中的指令),Google 合成生成了大量此类攻击,并训练模型以抵御它们。 - 监控系统会读取模型的推理过程和动作,当其行为偏离 Google 定义的参数时便会中止操作。类似的系统也用于监控训练过程。Google 将这些系统的发现排除在训练集之外,以防止模型学会向它们隐藏自己的推理过程。

性能:独立基准测试将 Gemini 4 Argon 排名远高于 Google 的其他模型,并处于行业前列。它在大多数金融、法律和商务性能测试中领先,且在不知晓答案时很少给出错误猜测。但在代理式编码(agentic coding)和 Artificial Analysis 的整体智能综合指数方面,它仍落后于 Anthropic 的最新模型。

  • 在 Vals AI 的 Vals Index 上,该指数包含八个按美国国内生产总值各行业份额加权的金融、编码、法律和税务基准测试,设置为高推理模式的 Gemini 4 Argon 在 43 个模型中排名第一(准确率为 68.9%,标准价格下每次测试耗时 46.55 分钟,费用为 15.68 美元)。
  • 在 Artificial Analysis 的智能指数(Intelligence Index)上,这是一个涵盖数学、科学、编码和推理的 10 项评估的综合指标,设置为高推理模式的 Gemini 4 Argon(折扣价每任务 1.99 美元,标准价每任务 3.98 美元)取得了与设置为最大推理模式的 GPT-6 Astra 以及设置为最大推理模式且带有回退机制的 Claude Fable 5.1 相同的总分,但每任务成本更低。
  • 在 AA-Omniscience 测试中,这是一项衡量事实知识的测试,会对错误答案进行惩罚但不惩罚拒绝回答的情况,设置为高推理模式的 Gemini 4 Argon 拥有最低的幻觉率(15%),在所有智能指数得分 45 或以上的模型中最低,显著低于其他旗舰模型,如设置为最大推理模式的 GPT-6 Astra(51%)。
  • 在 Arena.ai 的 Text Arena 排行榜上,该榜单通过盲测一对一比较对模型进行排名,设置为高推理模式的 Gemini 4 Argon 排名第一(1,525 Elo),领先于设置为高推理模式的 Claude Opus 4.6(1,505 Elo)和设置为高推理模式的 Claude Opus 5.5(1,504 Elo)。

新闻背后:Anthropic 和 OpenAI 经常发布新模型,特别是那些他们认为可能构成网络安全风险的模型,但通常仅通过封闭程序(且仅限内部使用)发布。随着 Gemini 4 Argon 的推出,Google 效仿了他们的做法。在每种情况下,由 AI 公司选定的组织会先获得限制较少的版本,而其他人随后才会获得具有更多安全措施的版本。

Anthropic 最初将其所有 Mythos 模型限制在 Project Glasswing 成员使用,这是由从事防御性工作的美国网络安全和生命科学组织组成的机构。只有经过挑选的公司才能使用 Claude Mythos 5.1,而任何人都可以使用包含安全护栏且保留输入数据一个月的 Claude Fable 5.1。

OpenAI 的 Daybreak 项目将从事防御性网络安全工作的选定组织分为不同层级。除了 OpenAI 自身外,只有一个层级(Daybreak Red)可以使用降低安全限制的 GPT-6 Astra。其他客户获得的模型则受到限制。

Colored blocks on a grid under a robotic arm, labeled left and right, reflect robotics advancements.
Colored blocks on a grid under a robotic arm, labeled left and right, reflect robotics advancements.

Google 在其 Fairwind 计划中也采用了类似方法,推出了 Gemini 3.8 Flash Cyber,这是 Gemini 3.8 Flash 的一个变体,具有更宽松的网络安全安全护栏,仅限选定的网络安全组织使用。

这很重要:Gemini 4 Argon 的优势之一在于长上下文和高输出的代码迁移。Google 表示,其代理在公司范围内将 C 和 C++ 代码翻译为 Rust,包括来自 Google 开发的开源操作系统 Fuchsia 内核的超过 80 万行代码。Rust 旨在防止 C 和 C++ 允许的许多内存错误。补丁可以修复一个漏洞,但用 Rust 重写则能解决整个漏洞类别。如果像 Gemini 4 Argon 这样的模型能够以快速且低成本的方式实现此类重写,防御者可能能够在攻击者发现之前消除特定类型的漏洞,而不是逐个修补。

我们的观点:许多模型正在竞争成为世界上最好的软件工程助手。Gemini 4 Argon 可能不是最强大的编码器,但 Vals AI 的索引显示其在金融、税务和法律等领域具有优势。Gemini 4 Argon 也是前沿模型中最有可能承认自己不知道事实问题答案,而不是猜测错误的模型。在财务分析或法律简报中,自信的错误答案可能会蒙混过关,而拒绝回答则是显而易见的,可以转交给人类或其他模型——前提是使用该模型的应用程序对于模型不回答的问题有相应的计划。

许多构建图像和视频生成器的公司已转向机器人领域,将其在世界模型方面的专业知识扩展到动作控制。最近的一款模型在 Nvidia 的 RoboLab 模拟基准测试中名列前茅,但竞争非常激烈,这些基准测试中的领先者尚未出现在 RoboArena 上,后者在真实机器人上测试模型。

最新动态:Black Forest Labs (BFL) 以其 FLUX 图像生成器而闻名,发布了 FLUX 3 Action,这是一个拥有 70 亿参数的模型,可将摄像头画面和文本指令转化为机器人的动作。它在 RoboLab-120 上排名第一,完成了 1,200 次试验中的 42.9%。基础模型以及针对两种不同机械臂(Franka 和 SO-101)微调的版本已在 Hugging Face 上发布,采用 BFL 的 FLUX Kommunity 许可证,该许可证将商业使用限制在年收入低于 500 万美元的公司。

工作原理:FLUX 3 Action 是一个世界-动作模型(WAM)。给定摄像头图像和书面指令,它预测机器人的下一步动作以及由此产生的摄像头画面。它还接收机器人的当前关节位置。这与 Physical Intelligence 的 π0.5 和 Nvidia 的 GR00T 等视觉-语言-动作模型(VLAs)不同,后者仅预测动作。

训练:BFL 基于 FLUX 3 构建该模型,其预训练 token 中超过 95% 为视频数据。其余预训练 token 主要来自图像,音频占比不足 0.5%。在专注于动作的第二阶段训练中,15.93% 的样本来自遥操作机器人。其余样本则来自电子游戏画面和人类手部第一人称视角 footage 等来源,据 BFL 的研究笔记所述。

架构:该模型是一个拥有 70 亿参数的扩散 Transformer。一个冻结的视频编码器处理摄像头帧,而 Qwen3-VL-4B 的一个冻结副本处理指令。动作构成第二股 token 流,模型将其与未来的视频帧一起进行去噪处理。

Diagram shows HYSET system: query embedding, tool-set interaction, scoring, and reward modules.
Diagram shows HYSET system: query embedding, tool-set interaction, scoring, and reward modules.

输出:每次调用通常返回 32 个动作,覆盖约两秒的运动,并附带可选的预测视频。机器人执行前几个动作后,模型会重新观察并重新规划。

适配:每种新机器人都需要独立的输入和输出层。BFL 使用约 200 次演示将该模型适配至一款低成本 SO-101 机械臂。它还对该模型进行了微调,使其能够玩两款简单的电子游戏并操控模拟无人机。BFL 表示,它在模拟车辆控制和计算机使用方面也看到了早期的潜力。

结果:在世界动作模型(World-action models)单独或与视觉语言模型配对的情况下,占据了 RoboLab-120 排行榜前五名中的四个席位。知名的 VLA 排名较低。π0.5 以 28.0% 的成绩位列第九,NVIDIA 的 GR00T N1.6 以 7.2% 的成绩位列第十三。

激烈竞争:FLUX 3 Action(42.9%)领先于 HiDream-O1-Embodied(39.9%)、Atomic-WAM(39.6%)和 OASIS WAM(39.0%)。在该基准测试的最难任务上,HiDream(32.9%)和 OASIS(32.4%)的表现优于 FLUX 3 Action(28.2%)。

规模:BFL 表示,FLUX 3 Action 的参数量不到此前最佳开源模型 Nvidia 的 160 亿参数 Cosmos3-Nano-Policy 的一半,后者得分为 36.8%。然而,排行榜显示 FLUX 3 Action 需要 69 GB 的 GPU 内存,而 Cosmos3-Nano-Policy 仅需 40 GB。

速度:BFL 表示,FLUX 3 Action 的运行速度比 Cosmos 3 Nano 快 1.52 到 3.95 倍,具体取决于 GPU 和模型版本。其在 RoboLab 上得分 38.3% 的最快版本,比 π0.5 快 1.34 到 2.28 倍,因为它每次调用可规划 2.13 秒的运动,而 π0.5 仅为 1.0 秒。就单次调用而言,它并不更快。在 Nvidia B200 GPU 上,BFL 的中位耗时分别为:FLUX 3 Action 为 32.29 毫秒,π0.5 为 31.99 毫秒,Cosmos 3 Nano 为 320.40 毫秒,均为各自最快测试设置下的数据。

真实机器人:在 BFL 与 Positronic Robotics 安排的盲测中,运行 FLUX 3 Action 的 Franka 机械臂在 10 个单物体 DROID 任务中完成了 30 次尝试中的 28 次。Cosmos 3 Nano 完成了 27 次,DreamZero 完成了 20 次,π0.5 完成了 13 次。

新闻背后:在现实世界中测试机器人进展缓慢,且每个实验室的硬件各不相同,因此该领域依赖于模拟基准测试。一些较旧的基准测试因机器人的成功而变得过于饱和,难以区分最佳模型。

英伟达研究人员于7月发布了RoboLab。其包含120项桌面任务,例如按给定顺序堆叠积木或将所有绿色水果放在盘子上,每项任务都以三种不同的方式表述,从模糊到具体。该基准测试专为使用真实世界机器人数据训练模型而设计,以防止模型记忆测试环境,并且排行榜会标记那些基于模拟数据训练的条目。新任务可以在几分钟内生成,以保持基准测试的新鲜度。

RoboLab的作者表示,其排名与RoboArena的排名高度相关,后者通过在学术实验室的真实机械臂上进行盲测对比来对模型进行排名。然而,他们的论文仅基于四个模型建立了这种相关性。RoboLab前五名的模型尚未出现在RoboArena上。在RoboArena上排名第二的世界动作模型DreamZero,在RoboLab上仅排名第十。

英伟达运营着RoboLab并测试其自身的Cosmos和GR00T模型。它还与BFL合作,完成了FLUX 3 Action的微调配方开发及其在英伟达Jetson边缘计算机上的部署。BFL感谢英伟达的Isaac Lab和RoboLab团队为其大部分评估提供了基础,并在英伟达GB200系统上对该模型进行了训练。

为何重要:机器人演示数据的收集既稀缺又昂贵,但关于物理世界的视频素材却非常丰富。世界动作模型的开发者押注于这样一个观点:经过预测视频训练的模型将需要更少的机器人示例。到目前为止,排名结果支持这一方法,但世界动作模型往往比视觉-语言-动作(VLA)模型更大且运行要求更高。对于开发者而言,开放的权重以及只需几百个演示即可生效的微调配方意味着,拥有相对低成本机械臂和强大GPU的机器人研究实验室可以适配排名第一的模型。

我们的看法:FLUX 3 Action在模拟任务中的失败率仍超过一半。模拟厨房桌子也比真实的更整洁。我们期待接下来能在RoboArena上看到FLUX 3 Action及其最接近的竞争者,尝试更具挑战性的机器人任务。

当大型语言模型智能体可以在数千种工具中进行选择时,为特定任务挑选合适的工具变得十分困难。研究人员构建了一个系统,以找到任何工作所需的最佳工具组合。

最新动态:上海交通大学的Xinyi Hong与香港理工大学的研究同事们提出了HYSET,这是一种构建候选工具集、对其进行评分并为给定任务选择最佳集合的方法。以前的方法将每个工具视为独立的项目,而不是将一组适合协同工作的工具作为一个整体。

关键洞察:想象一个接收以下查询的模型:“我下个月要去东京出差五天。查找往返航班,预订新宿附近的酒店,查看那几天的天气,并将我的2,000美元预算兑换成日元。”它应该如何选择合适的工具?如果列出最相关的工具,列表顶部可能会被大量的航班API占据,而与任务其他部分相关的工具(例如天气工具)则排在很后面。航班API或其他任何工具的效用不仅取决于其与任务的关联程度,还取决于其他可用工具的情况。

工作原理:HYSET是一个小型的可训练评分模型,它以冻结编码器(Qwen2.5-1.5B)输出的查询嵌入作为输入,并输出供智能体使用的工具列表。作者在ToolBench上训练了HYSET,该数据集包含约14,000种工具和描述任务的200,000条指令。HYSET学习了如何根据给定的工具库和任务描述,构建候选工具集并对每个集合进行评分。

  • 该系统将工具集的得分定义为两项之和。(i)第一项对集合内工具两两之间的兼容性得分求和。每个工具都有一个学习到的向量,一对工具的兼容性得分通过将第一个工具的向量乘以一个学习到的矩阵,再乘以第二个工具的向量得到。(ii)第二项衡量整个集合与查询的相关程度。它基于交叉注意力机制估计每个工具的相关性并计算平均值。
  • 在训练过程中,对于每个查询,作者构建了一个包含候选工具集的池子,其中既有 ToolBench 的真实标签集(ground-truth set),也有多个错误集。这些错误集来自三个来源:工具库的随机子集、同一批次中其他查询的正确集,以及通过替换真实标签集中一个或两个工具形成的集合。训练过程调整了评分模型的可训练参数,使得正确集的得分高于错误集。
  • 第二个损失项鼓励模型对能使智能体成功完成任务的工具集给予更高的分数。
  • 在推理阶段,给定一个查询,系统会检索出一个短列表:包括按查询-工具匹配度排名的前 15 个工具,以及与该组工具有最强两两兼容性的五个工具。系统使用学习到的评分函数对所有短列表的子集进行重新排序,并选择排名最高的集合。

结果:在 ToolBench 上,HYSET 在检索有效工具和完成任务方面均优于所有基线方法。

  • 考虑到前五名检索工具中包含真实标签工具的比例,HYSET(Recall@5 为 88.6%)优于次优方法 ToolGen(Recall@5 为 81.4%)。
  • 根据人类评估者的判断,使用 HYSET 为特定任务选择的工具集,智能体解决了 69.9% 的任务。而使用最强的基线方法 ToolLLaMA-Retriever(该方法独立地对每个工具进行评分)所选定的工具集,智能体仅解决了 61.8% 的任务。

为何重要:HYSET 提高了(i)检索工具集的完整性,即所选集合涵盖了完成给定任务所需的所有工具;以及(ii)端到端任务的成功率,即智能体使用该集合完成了手头的任务。这一成果无需修改底层智能体即可实现,为提升能够访问大型工具库的智能体提供了一条切实可行的路径。

我们的观点:如果作者直接在真实标签工具集上进行训练,生成的模型可能会忽略其他同样有效的集合。通过纳入任务完成度的考量,模型学会了将任何能起作用的工具集排在较高位置。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文