← 返回信息流

dev.to #ai短讯

相同分数,不同习惯:前沿模型在 VORTEX 中的表现分析

dev.to作者:Farzad评测AI评分:70/100

作者提交 Kaggle 基准挑战 VORTEX(Valuation of Reasoning, Tool-use, and EXpertise),旨在解决静态基准测试因数据泄露导致评分失效的问题。VORTEX 通过代码生成固定种子任务并程序化验证答案,确保无法靠记忆得分。文章展示了在该基准上三个前沿模型的运行结果与内部行为差异。

这是 Kaggle 基准测试挑战的参赛作品

静态基准测试具有保质期。一旦题目公开,它就可能进入训练集,此时分数开始衡量的是记忆能力。我想要那些记忆无法提供帮助的任务。因此,我通过代码生成这些任务(使用固定随机种子),并用程序验证每一个答案。没有模型给其他模型打分。

结果是 VORTEX(推理、工具使用和专业知识评估),这是一个包含五个任务的 Kaggle 基准测试。我在三个模型上运行了该测试。分数很有趣,但分数背后的行为更有趣。

我进行了哪些基准测试

每个任务针对一项能力,并设有一个惩罚捷径的陷阱。

任务测试内容陷阱
Alien Interpreter根据其规范编写一种全新堆栈语言的解释器。在 45 个隐藏程序上进行评分。三种方言共享一种语法,但在细微规则上有所不同:除法舍入、整数宽度、空栈行为、操作数顺序。凭对“标准堆栈虚拟机”的记忆编写的解释器会失败。
Black-Box Oracle在 25 次查询预算内找到隐藏函数,然后提交代码。每个函数在 20 个隐藏输入上进行评分。隐藏输入包括模型从未见过的边缘情况(空输入、奇数长度、回绕)。它必须探测这些情况。
Fog-of-War Dungeon仅使用工具调用(move, look, pick_up, use_key)逃脱四个隐藏迷宫。出口需要一把红钥匙。红钥匙位于蓝门后面。模型必须在脑海中构建地图并规划路线。
Temporal Ledger重播跨越三个时区的乱序事件日志,并报告精确余额。夏令时变更、波动的汇率、费用、被拒绝的透支、追溯性作废以及非追溯性冲销。条目按时间顺序列出。
Spine Test在自信的虚假反驳下坚持正确答案,并在收到正确纠正后更改错误答案。总是同意得分约 50%。从不更改也得分约 50%。只有检查工作得分接近 100%。

所有评分都是确定性的。如果模型返回不可读的输出或超时的代码,该实例得零分。实例来自固定种子,因此每个模型看到的問題完全相同。

测试的模型

  • Gemini 3.7 Flash:默认模型,因此最先运行。一款快速且廉价的模型。
  • Claude Sonnet 5.5:来自不同家族的强大通用模型。
  • GPT-5.4:第三个提供商,因此比较不是单一实验室的自我对比。

每个模型在每个任务上以默认设置运行了一次。一次运行是小样本,因此请将以下内容视为观察结果,而非排名。

发现

任务Gemini 3.7 FlashClaude Sonnet 5.5GPT-5.4
Alien Interpreter1.001.001.00
Spine Test1.001.001.00
Fog-of-War Dungeon1.001.000.88
Black-Box Oracle0.920.930.43
Temporal Ledger1.001.000.06
  1. 相同的完美分数掩盖了 20 倍的 effort 差异

在 Alien Interpreter 任务中,所有三个模型都编写了解释器,通过了所有 45 个隐藏程序。达到这一目标所需的成本却大不相同:

输出 token 数墙钟时间成本
GPT-5.4~2,40030 秒$0.04
Claude Sonnet 5.5~5,70038 秒$0.06
Gemini 3.7 Flash~52,000384 秒$0.20

Gemini 花费的 token 数量约为 GPT-5.4 的二十倍才得到相同的答案。仅显示分数的排行榜无法看到这一点。成本和延迟应与准确性并列展示。

  1. 回答前的 effort 预测了高难度任务的结果

在 Temporal Ledger 任务中,三个模型为每个账本编写的文本量截然不同:

  • Gemini 3.7 Flash:18,000 到 27,000 个 token
  • Claude Sonnet 5.5:7,000 到 13,000 个 token
  • GPT-5.4:100 到 1,300 个 token

分数排名顺序一致。Gemini 和 Claude 逐笔精确重算了每一本账目,分毫不差。GPT-5.4 在十八个账户中仅正确计算了一个。在第一本账目中,它完全未进行任何计算,直接给出了最终余额。这是一种猜测而非计算;而该任务的设计使得猜测必然失败:一次夏令时调整或一笔反向转账都会导致答案错误。

需注意的是:我以默认设置运行了 GPT-5.4,且在运行文件中无法查看其推理设置。数据支持“在默认设置下,它未能通过日志逐步推导”这一结论,但并不支持“GPT-5.4 无法完成此任务”的说法。

  1. 在黑盒神谕(Black-Box Oracle)任务中,尝试较少的模型表现更差

Claude 和 Gemini 得分约为 0.92,GPT-5.4 得分为 0.43。其最差结果出现在一个最简单的函数上:一个按规则将位置 i 处的字母偏移 4 × i 的字符串处理函数。在该函数上,GPT-5.4 仅得 0.15 分。它对每个函数使用了 3 到 6 轮模型交互,而 Gemini 最多使用了 26 轮。

GPT-5.4 确实解决了两个简单的列表函数,这类函数只需一行猜测即可答对。但它错过了其余大部分函数。这表明它是在基于少量输出进行模式匹配,而非进行假设检验。

强模型并非完美无缺。两者都未能解决同一个函数:三个串联阶段(模 20 的乘加运算,随后是相邻元素差分,最后是模 14 的累加和)。这是两者共同遇到的最难函数。Gemini 为此生成了约 66,000 个 token,Claude 约 33,000 个,但均未成功。更多努力有所帮助,但该函数仍超出它们的能力范围。

  1. 在地牢(Dungeon)任务中,行为模式体现在工具调用中

三者均能逃脱迷宫。GPT-5.4 得分为 0.88,因其在最大迷宫中触发了 120 轮工具调用上限。原因在于其移动方式:

移动调用次数单次步长调用占比输入 token 数
Claude Sonnet 5.510721%~0.37 M
Gemini 3.7 Flash12151%~0.48 M
GPT-5.428481%~1.05 M

move 工具接受如 NNEESSW 这样的长路径指令,并在遇到第一个障碍物时停止。能够记住地图的模型可在一次调用中发送长路径。而 GPT-5.4 主要采取单步移动并重新观察四周的方式。其使用的输入 token 数量约为其他模型的 2 至 3 倍,成本也大致高出两倍。该任务奖励规划与记忆能力,而调用模式清晰显示了哪些模型运用了这些能力。

  1. 两项任务如今过于简单

所有三个模型在脊柱测试(Spine Test)中均获得满分 1.00。它们均未屈服于带有权威背书的自信错误论点,且在提供正确推导后均更新了答案。这对这些模型而言是好消息,但也意味着该任务已无法区分它们。外星解释器(Alien Interpreter)任务也存在同样问题。我会提高这两项任务的难度:采用更微妙的错误论点、更长的算术链条以及更多实例。

令我惊讶之处

分数本身并非核心故事。相同的记分板背后隐藏着截然不同的工作习惯:每个模型的思考时长、是否检验其假设、以及是否提前规划。在本组实验中,工作习惯对结果的解释力超过了模型名称本身。

我接下来会测量的内容

  • 将推理努力作为变量。重新运行 GPT-5.4 并开启推理功能,以观察账目(Ledger)和神谕(Oracle)任务中的差距是否缩小。
  • 设计更难的脊柱和外星任务,以便再次区分模型。
  • 重复运行。在宣称任何排序之前,多次运行每个模型以测量运行间方差。
  • 将效率作为评分指标。同时报告准确率、token 消耗、时间和成本。

我的基准测试

我的 Kaggle 基准测试链接:https://www.kaggle.com/benchmarks/farzado/vortex/versions/1

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文