← 返回信息流

精选The Batch (deeplearning.ai)短讯

GLM-5.3在ExploitBench得分高,应鼓励AI的网络安全能力

deeplearning.ai模型评测AI评分:70/100

The Batch News & Insights指出,Anthropic近期发布了一份关于开源模型GLM-5.3网络能力的分析报告。该报告对GLM-5.3在ExploitBench基准测试中取得的高分持积极态度,认为这反映了AI在网络安全领域的潜力,是好消息。

Anthropic 最近发布了一份令人鼓舞的分析报告,探讨了开源权重模型 GLM-5.3 的网络能力。该研究表明,GLM-5.3 在网络能力方面已接近 Claude 的闭源权重模型 Mythos。例如,下图显示,在使用可比数量的 token 的情况下,GLM-5.3 在 ExploitBench 部分任务中成功利用漏洞的比例为 12%,而 Mythos 为 14%。(有趣的是,在 GLM-5.3 开发者的全基准测试报告中,Anthropic 报告的差距更小:GLM-5.3 的成功率为 54.4%,而 Mythos 为 78.0%。)这为网络防御者铺平了道路,包括那些无法访问 Mythos 的防御者,可以使用高度强大的模型来保护自身。鉴于攻击者也能获得类似的能力,加强防御的紧迫性日益增长。

此外,发现漏洞并利用其创建攻击(即创建针对已识别漏洞的有效载荷)的成本正在下降。Anthropic 发现,花费 20.40 美元购买 GLM-5.3-Flash 的 token 就足以发现 Google Chrome 中一个近期披露的缺陷。报告中所用的结果基于未修改版本的 GLM-5.3。同时,很容易获得那些护栏已被削弱的顶级开源权重模型。此类模型在网络防御(或网络进攻)中将更加有效。

ExploitBench results showing that Claude Mythos Preview only has a slightly higher score than GLM-5.3
ExploitBench results showing that Claude Mythos Preview only has a slightly higher score than GLM-5.3

许多 AI 风险,包括网络漏洞以及如何限制智能体,都是需要解决的工程问题。明确地说,这些都是困难的工程问题!但我发现,许多制造恐慌的场景隐含地假设我们在这些问题上将几乎毫无进展或完全没有进展。

打个比方,考虑航空业。根据国家邮政博物馆的数据,1919 年,每飞行约 11.5 万英里就会有一人死亡。如今,航空公司每年飞行约 6 万亿乘客英里。那么,飞机每年会杀死大约 6 万亿 / 115,000 = 5200 万人吗?并非如此。由于我们已将飞机工程设计得更加安全,现在大约每 300 亿乘客英里才会出现一起死亡事故。

同样,尽管大众媒体将 OpenAI-Hugging Face 被黑客攻击的事件描述为危险的智能体“失控”,但这一事件正促使各地的团队构建更好的沙箱隔离和监控机制——这些重要的改变正在使 AI 变得更加安全。(在 OpenWorker 上,这是一个支持安全工作流的智能体框架,Rohit Prasad、Devika Verma 和我正在基于 Nvidia 的新安全框架进行改进,以增强沙箱隔离功能。)

在航空和软件领域,我们通过反复发现问题、修复问题以及进一步识别和解决根本原因来提高安全性,从而降低未来发生问题的概率。前沿模型正在加速这一过程。

开源权重模型的高级网络能力确实给攻击者留下了造成损害的窗口。从长远来看,防御者占据优势,因为他们拥有更多信息来发现和缓解漏洞。关键在于尽快开展这项重要且困难的工程工作,以便我们都能以更安全、更稳健的软件走向未来。

来自 DeepLearning.AI 的消息

Enroll in the Data Engineering Professional Certificate today.
Enroll in the Data Engineering Professional Certificate today.

数据工程专业证书现已在 DeepLearning.AI 上线。通过四门课程,设计和构建能够生成、摄入、存储、转换和提供数据的系统,包括在 AWS 上的批处理和流处理管道以及开源工具。由《数据工程基础》合著者 Joe Reis 授课。免费注册

Chart ranks Artificial Analysis models by score; Xiaomi's MiMo-V2.6-Pro-RL leads open weights category.
Chart ranks Artificial Analysis models by score; Xiaomi's MiMo-V2.6-Pro-RL leads open weights category.

小米以其智能手机和电动汽车闻名,发布了 Artificial Analysis 智能指数中得分最高的开源权重模型。其性能与 GPT-6 Sol 相似,但每项任务的成本更低。

最新动态:除了 MiMo-V2.6-Pro-RL 及其轻量版 MiMo-V2.6-Flash 之外,该公司还发布了 MiMo-V2.6-Distill-Qwen-9B(基于阿里巴巴 Qwen3.5-9B,并使用 MiMo 输出进行微调)。除模型外,小米还发布了超过 7,000 个强化学习 (RL) 任务环境(即模型尝试执行任务并接收反馈的软件工作区)以及用于在这些环境上训练的代码。

  • 输入/输出:文本、图像、视频和音频输入(最高支持 100 万 token),文本输出(最高支持 128,000 token,44.4 token/秒)
  • 架构:混合专家 (MoE) Transformer;MiMo-V2.6-Pro-RL 拥有 1.02 万亿参数,每 token 激活 420 亿参数;MiMo-V2.6-Flash 拥有 3,090 亿参数,每 token 激活 150 亿参数
  • 特性:可选推理功能(默认开启)、工具调用、可选的 UltraSpeed 模式,该模式下生成速度可达标准模式的 20 倍,但每 token 成本为标准的 10 倍
  • 性能:在 Artificial Analysis 的智能指数(46)中,MiMo-V2.6-Pro-RL 位居开源权重模型榜首;在 Vals 指数中,MiMo-V2.6-Flash(59.58%)位居开源权重模型榜首,而 MiMo-V2.6-Pro-RL(59.47%)紧随其后,两者差异在误差范围内
  • 可用性/价格:月订阅费从 6 美元至 100 美元不等;MiMo-V2.6-Pro API 价格为每百万输入/缓存/输出 token 分别 0.435/0.0036/0.87 美元,UltraSpeed 模式价格为每百万输入/缓存/输出 token 分别 4.35/0.036/8.70 美元;MiMo-V2.6-Flash API 价格为每百万输入/缓存/输出 token 分别 0.14/0.0028/0.28 美元;批量处理价格为标准价格的半价
  • 权重/许可:所有三个模型均在 MIT 许可下免费开放下载,可用于商业和非商业用途
  • 未公开信息:知识截止日期、具体训练数据集

工作原理:MiMo-V2.6-Pro 通过独立的编码器处理图像、视频和音频,然后将数据输入其语言模型。根据小米的技术报告,其训练方法结合了早期工作的成果,其中大部分来自小米自身的研究。主要的创新在于奖励机制:不仅奖励任务通过的情况,更奖励编码尝试的质量。

小米首先在27万亿个来自网页、书籍、学术论文、代码和STEM材料的文本令牌上预训练模型,随后在3万亿个包含文本、图像、视频和音频的多模态数据上进行训练。在中期训练阶段,它继续在记录智能体执行编码、视觉和研究任务的语料上继续训练,并将输入上下文扩展至100万个令牌。

经过简短的监督微调后,该公司在一个强化学习(RL)运行中对模型进行了微调,该运行混合了所有任务类型,而非训练独立的专家模型。其中编码任务占68%,网站设计及其他视觉产物(游戏、3D场景、幻灯片、SVG)占13%;工具使用占12%,网络安全占4%,上下文遵循占3%。此次强化学习运行采用了组相对策略优化(Group Relative Policy Optimization),该方法为每个提示生成多个尝试,并相互比较评分。每个训练步骤抽取1,568个提示,并为每个提示生成16次尝试,总计约25,000次尝试。模型在一个最小化智能体框架的不同变体中尝试任务,针对通用、编码、视觉和网络安全任务配置不同,以确保成功不依赖于特定的框架。此次强化学习运行共进行了30步,耗时略超过123小时。

在训练期间对编码尝试进行评分的自动化测试仅能揭示代码是否可用,而非其质量优劣,因此小米还使用AI模型对通过的尝试按质量进行评级。对于经常通过的编码任务,一个智能体会研究一组早期的尝试,并为方法的质量编写特定于任务的检查清单。在训练过程中,每次尝试的奖励等于其测试结果(1或0)乘以其两个检查清单得分。对于不常通过的编码任务,一个评级模型会共同审查任务的所有16次尝试,检查代码仓库,并在需要时运行测试。它根据诸如方法的适用性、修改次数最少以及与代码库惯例的一致性等因素对通过的尝试进行排名。随后,训练过程更强烈地强化排名较高的尝试,而较弱地强化排名较低的尝试。

为了应对奖励黑客行为(例如下载已发布的解决方案而非编写新的方案),团队清理了任务环境中残留的答案,阻止网络访问,并运行了一个搜索漏洞直至未发现的智能体。经确认使用了泄露答案的尝试获得零奖励,与失败的尝试相同,且在整个训练过程中占比始终低于2%。

该公司在结果难以自动检查的任务(如游戏开发、科学研究和具身智能——控制机器人和其他物理系统)上训练了单独的教师模型。然后,它通过在线策略蒸馏(on-policy distillation)训练MiMo-V2.6-Pro模仿这些教师模型,在此过程中学生模型学习使其输出与教师模型预测的下一个令牌对齐。

性能:MiMo-V2.6-Pro在两项独立的综合评估中位居开源权重模型之首,相比其前身取得了巨大提升。它以远低于专有模型的单位任务成本匹配了部分专有模型的性能,但仍落后于领先者,且生成输出的速度较慢。

Gemini 3.8 Live Extended Thinking achieves 82.6% in performance, shown as the tallest bar on the chart.
Gemini 3.8 Live Extended Thinking achieves 82.6% in performance, shown as the tallest bar on the chart.

在 Artificial Analysis 的 Intelligence Index v4.3.2 中,该指数是对数学、科学、编码和推理领域共 10 项评估的加权平均值,MiMo-V2.6-Pro 设置为推理模式(每项任务得分 46,成本 0.13 美元,耗时 19.5 分钟)领跑开源权重模型,领先于设置为最大推理模式的 GLM-5.3(每项任务得分 45,成本 2.01 美元,耗时 10.7 分钟)以及设置为最大推理模式的 Kimi K3(每项任务得分 44,成本 2.00 美元)。其前身 MiMo-V2.5-Pro 得分为 26。在专有模型中,它与设置为高推理模式的 Grok 4.7 并列(每项任务得分 46,成本 2.73 美元,耗时 14.2 分钟),并落后于 Anthropic、Meta 和 OpenAI 的几款模型。

在 Vals 指数中,该指数根据各行业占美国 GDP 的比重对金融、编码和法律工作的七项代理基准测试进行加权,较小的 MiMo-V2.6-Flash 设置为推理模式(准确率 59.58%,每次测试成本 0.20 美元,耗时 45.03 分钟)和 MiMo-V2.6-Pro 设置为推理模式(准确率 59.47%,每次测试成本 0.39 美元,耗时 52.33 分钟)的表现优于所有其他被测试的开源权重模型。这两款模型均落后于 15 款专有模型,其中领先的是设置为最大推理模式的 Claude Opus 5.5(准确率 69.69%,每次测试成本 22.30 美元,耗时 72 分钟)。

在 Vals 的 CyberBench v1.1 中,该基准测试旨在检验代理能否复现并修补开源软件中的漏洞,MiMo-V2.6-Flash 设置为推理模式(准确率 75.36%,每次测试成本 0.05 美元,耗时 32.48 分钟)在九款模型中排名第一,MiMo-V2.6-Pro 设置为推理模式(准确率 72.86%,每次测试成本 0.09 美元,耗时 31.73 分钟)排名第三,领先于 Muse Spark 1.3 Max(准确率 72.74%,每次测试成本 3.34 美元,耗时 19.75 分钟)和 Claude Fable 5.1(准确率 70.42%,每次测试成本 4.03 美元,耗时 22.12 分钟)。

幕后新闻:近日,Anthropic 指控小米在 2026 年 3 月和 4 月的 20 天内,通过编码工具 OpenClaw 和 OpenCode 将 MiMo 用户的对话和编码会话路由至 Claude,产生了超过 40 万次的交互记录,并将其用作训练数据。截至目前,小米尚未公开回应 Anthropic 的指控。

为何重要:通过测试的代码不一定是优质代码。小米发现,一个未使用代码质量评分器进行训练的模型版本,习得了使软件更难维护的习惯:该模型添加了任务未要求的代码,让错误无声地通过,并且在检查传入数据时较为松懈,直到测试通过为止。在使用代码质量评分器进行训练后,该模型做出的更改更小且更聚焦。奖励人类审查员会接受的代码与奖励能运行的代码同样重要。

我们的观点:开源权重很棒,但开源配方更好。通过发布其强化学习任务、运行这些任务的软件以及训练代码,小米让其他人能够重复产生其模型大部分改进的步骤。它还披露了这些步骤的成本:MiMo-V2.6-Pro 为 260 万美元,MiMo-V2.6-Flash 为 90 万美元。计划训练代理的团队获得了一套无需自行构建的任务集,以及在此规模下进行强化学习的粗略价格。我们希望其他实验室能够复现并扩展小米在训练这些模型时所取得的成果。

Google 发布了两个新的语音到语音模型,加入了一个突然变得拥挤的、旨在驱动语音代理的模型行列。

Graph illustrates decreasing memory use per token in DeepSeek models, highlighting V4.1-Flash efficiency.
Graph illustrates decreasing memory use per token in DeepSeek models, highlighting V4.1-Flash efficiency.

最新动态:Google 推出了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是两款可作为实时语音代理的语音到语音模型。Gemini 3.8 Live 模型专为规模和成本效率而设计,而 3.8 Live Extended Thinking 则旨在处理高复杂度任务。这两款模型的设计目标都是减少实时对话期间的响应延迟。

工作原理:Google 关于模型架构和训练数据的细节发布得很少,但表示这些模型基于 Gemini 3 Pro 构建。Gemini 3.8 Live 可以接收图像和视频输入,支持 97 种语言,并且可以在继续对话的同时在后台执行工具和 API 调用。Live Extended Thinking 也可以同时推理和思考。这些模型的知识截止日期为 2025 年 1 月。

在评估 AI 模型的公司 Artificial Analysis 进行的语音到语音基准测试中,Gemini 3.8 Live Extended Thinking 在各种测试中通常排名高于其性能较弱的兄弟模型 3.8 Live,但用户在某些任务中更偏好 3.8 Live。Live Extended Thinking 模型在“语音到语音索引”基准测试中排名第一,得分为 82.6%。在 AA 的“语音推理”基准测试中(该测试评估音频模型回答基于推理问题的能力),它位列第四,排在 StepAudio 3 Realtime 和两个 Qwen 模型之后。它在 Tau Voice 基准测试中排名第一,得分为 68.6%。相比之下,Gemini 3.8 Live 在“语音到语音索引”中的排名较低,为 76%,位居第五;在“代理性能基准测试”中则显著更低,仅为 30.1%。然而,3.8 Live 在“语音代理竞技场排行榜”中排名第二,在该排行榜中,人们进行盲测实时语音对话,并选择他们偏好的模型来完成诸如预约牙医等任务。在某些衡量对话动态和正确完成任务百分比的基准测试中,它的表现也优于 Live Extended Thinking。

这些模型可通过 Gemini API 和应用、Google Cloud Vertex / Vertex AI 以及 Google AI Studio 向开发者提供。Gemini 3.8 Live 还用于 Search Live,而 Gemini 3.8 Live Extended Thinking 则为 Gemini 应用以及包括 Docs 和 Gmail 在内的 Google Workspace 产品中的语音体验提供支持。

谷歌表示,其 AI 产品生成的所有音频均带有 SynthID 水印,这是一种用于检测 AI 生成内容的技术。

这两个模型在 Gemini 应用、Google 搜索和 Gemini API 等某些产品中可免费使用,但有一定限制。付费层级的查询不会用于改进模型,而免费层级的查询会。付费层级按每百万个 token 定价:文本输入价格为 0.75 美元,音频输入价格为 3.00 美元(每分钟 0.005 美元),图像或视频输入价格为 1.00 美元(或每分钟 0.002 美元)。对于输出,文本模型的价格为每百万个 token 4.50 美元,音频模型的价格为每百万个 token 12.00 美元或每分钟 0.018 美元。Artificial Analysis 发现,Gemini 3.8 Live 处理每小时输入音频的成本为 0.84 美元——是索引中最便宜的模型——且成本显著低于 Live Extended Thinking 的每小时 3.50 美元。

幕后新闻:传统上,语音助手依赖一个将语音转换为文本、发送给推理模型、再将响应转换回语音的流程。这种方法长期以来被认为更准确,且更容易让开发者控制,因为大型语言模型(LLM)通常在文本中进行推理。然而,每一步都可能增加延迟,从而损害用户体验。OpenAI 最近发布了一个名为 GPT-Live-1 的语音到语音模型,这是一个开发者可用于构建支持语音应用的语音模型。该模型可以同时听和说,使其能够处理中断并做出更自然的回应,同时独立的推理模型在后台运行。

为何重要:称 Gemini 3.8 Live 为语音模型是正确的,因为其主要的语言输入是语音而非文本,但它理解和推理图像及视频输入的能力使其更加多功能。将语音和视频输入结合在一起,对于帮助用户利用 AI 实时处理屏幕上的任何内容(如网页界面、游戏、多应用程序工作流等)特别有力。这将其与仅严格处理语音和音频的 GPT-Live-1 及其他模型区分开来。

我们的观点:由语音驱动的助手对开发者来说尤其令人兴奋,因为它们为构建应用程序提供了新的实时界面。语音是一种自然输入格式,大多数人无论计算机使用经验如何都可以使用。它在文本输入不太方便的移动设备和车载界面中特别有用。创造应用程序以普及用户对 AI 的访问权,取决于开发者的努力。

当智能体调用工具时,它们每次都会将相同的上下文重新发送回模型。DeepSeek 表示,存储和传输所有这些上下文已成为降低服务成本的更大障碍,其影响甚至超过了模型生成输出所需的计算量。其新架构规避了这一瓶颈。

最新动态:DeepSeek 发布了 DeepSeek-V4.1-Flash,这是其首款采用重新设计架构的模型,该架构在每 token 上下文中使用的内存大幅减少。它还降低了 API 价格。这是 DeepSeek V4 系列中第一款在非实验性预览之外接受图像作为输入的模型。它的速度也非常快,仅次于 Gemini 3.8 Flash(按每秒 token 数计)。

AREX diagram shows inner and outer loops for structured query analysis, involving observation and feedback.
AREX diagram shows inner and outer loops for structured query analysis, involving observation and feedback.
  • 输入/输出:文本和图像输入(最多 100 万 token),文本输出(最多 384,000 token,225.6 个 token/秒)
  • 架构:编码器-解码器混合专家 Transformer、基于 Transformer 的视觉编码器、5520 亿骨干参数加上 1960 亿内存模块参数,读取输入时每个 token 激活 80 亿参数,生成输出时激活 160 亿参数
  • 功能:推理(通过 API 提供无、低、高或最大选项;已发布权重支持 1 到 100 之间的任意整数)、工具调用、上下文缓存
  • 性能:Artificial Analysis 智能指数得分 39 分;发布时 Vals AI 指数上表现最佳的开源权重模型(目前排名第四,得分 51.32%)
  • 可用性/价格:可通过 DeepSeek 的应用程序和网站访问;通过 DeepSeek API 访问,高峰时段每百万输入/cached/输出 token 分别为 0.30 美元/0.006 美元/1.20 美元,其他时间半价
  • 权重/许可:根据 MIT 许可证,免费用于商业和非商业用途
  • 未公开信息:知识截止日期、训练数据

工作原理:一篇论文详细介绍了 DeepSeek 如何重新设计其 V4 架构。作者减少了键值缓存(Transformer 为每个已读取 token 存储的键和值,以避免重新计算它们)以及读取输入所花费的计算量。

  • 在模型的40层中,一半用于读取,一半用于写入。解码器并非像传统方式那样对完整输入自行计算键(keys)和值(values),而是从编码器的最后一层派生它们,因此提示词的大部分仅通过编码器运行。DeepSeek表示,这几乎将预填充计算量(即在生成回复前读取提示词的步骤)减半。
  • 大多数层借用其他层的缓存。在DeepSeek-V4.1-Flash中,每层采用三种模式之一:全计算层(Full layers)计算键和值,并选择最相关的512个条目进行注意力机制处理;重索引层(reindex layers)借用前一全计算层的缓存,但自行决定选择哪512个条目进行注意力处理;复用层(reuse layers)则直接借用早期层的缓存及其已选定的512个条目。40层中仅有4层会计算完整的输入缓存,其中3层位于编码器,1层位于解码器。每一层都保留自己最近128个令牌的不压缩缓存,该缓存基于其自身对文本的视角计算得出,使其能够完全关注最近的令牌,而共享缓存则提供来自整个输入的最相关512个条目。
  • DeepSeek-V4.1-Flash将其完整输入缓存以4位数值存储而非8位,但每16个数值共享一个8位乘数来恢复该组的缩放比例,并在微调期间训练模型以容忍舍入误差,从而有助于保持精度。跨层共享缓存结合4位存储,使整个输入缓存降至每个令牌890字节,约为DeepSeek-V4-Flash的四分之一,仅为DeepSeek-V1的1/437。随着输入从4,000个令牌增长至100万个令牌,由于这些综合改进,生成每个输出令牌所需的计算量仅增加25%。
  • DeepSeek的服务器至少保留每个提示词的完整输入缓存72小时,因此重复的前缀无需重新计算。DeepSeek-V4.1-Flash仅在服务器内存中保留几分钟。如果请求在缓存过期后到达,系统会重新读取提示词的最后128个令牌以重建近似版本。若要精确重建,则需要为40层中的每一层重新读取128个令牌(共5,120个令牌),因为每层的短程缓存依赖于其前置层。DeepSeek表示,这种近似处理对输出质量的影响微乎其微,并将缓存大小缩减至DeepSeek-V4的八分之一。
  • DeepSeek使用45万亿个文本和图像令牌对模型进行了预训练。其微调遵循DeepSeek-V4的方案:监督学习、强化学习,然后是对策蒸馏(on-policy distillation),即微调模型以匹配超过40个专业模型可能生成的内容。这些“教师”模型来自DeepSeek在不同训练阶段和领域的检查点。
  • DeepSeek表示并未更改其训练算法;相反,作者将性能相较于DeepSeek-V4的提升归功于自动化管道,这些管道负责生成训练任务和智能体环境。

性能:独立评估机构发现,DeepSeek-V4.1-Flash的表现优于其前身以及体量更大的DeepSeek-V4-Pro-0813。其每项任务的成本不到后者的一半,且生成速度是其两倍以上。它曾短暂在Vals.ai指数上领跑开源权重模型(在MiMo v2.6 Pro发布之前),并在一项针对商业软件智能体的独立测试中位居所有模型之首。

在 Artificial Analysis 的智能指数 v4.3.2 中,这是一个涵盖数学、科学、编码和推理方面对智能体进行综合评估的十项评价组合,DeepSeek-V4.1-Flash 设置为最大推理模式(每项任务 39 分,0.27 美元,耗时 4.9 分钟),表现优于 DeepSeek-V4-Pro-0813 设置为最大推理模式(每项任务 36 分,0.67 美元,耗时 8.7 分钟)。在开源权重模型中,它落后于 MiMo v2.6 Pro(每项任务 46 分,0.13 美元)、GLM-5.3(45 分,2.01 美元)和 GLM-5.3-Flash(42 分,0.25 美元,每项任务耗时 11.1 分钟)。 在 AutomationBench-AA 上,这是一项测试智能体在模拟应用环境(如 Gmail、Salesforce 和 Jira)中完成业务流程能力的评测,DeepSeek-V4.1-Flash 设置为最大推理模式(68.9%)领先所有受测模型,包括 GPT-6 Astra 设置为最大推理模式(68.5%)和 Grok 4.6 设置为高推理模式(67%)。

幕后新闻:自第二代模型以来,缩小键值缓存一直是 DeepSeek 的主题。竞争对手借鉴了 DeepSeek 的技术并开发了各自的技术,以同样在缓存规模上进行竞争。

  • 2024 年 5 月,DeepSeek-V2 引入了多头潜在注意力机制,将键和值压缩为一个小向量,与 DeepSeek 67B 相比,将键值缓存减少了 93.3%。三个月后,DeepSeek 开始在硬盘上存储缓存,并对缓存已持有的输入收取十分之一的费用。
  • DeepSeek-V4.1-Flash 的设计建立在 YOCO 的基础上,这是微软和清华大学在 2024 年提出的一种设计,其中 Transformer 的上半部分层复用下半部分层产生的缓存。
  • 此次发布正值 Anthropic 指控 DeepSeek 及其他六家中国开发者蒸馏 Claude 模型以改进自身模型并向其客户提供 Claude 的输出之后几天。DeepSeek 的论文称,它是从其自身的 40 多个检查点蒸馏该模型的,这些检查点取自训练的不同阶段,并未提及外部模型。

为何重要:智能体通常读取的内容多于写入的内容。因为每次工具调用都会将不断增长的对话记录通过模型传回,存储和重新读取上下文的成本可能高于生成输出的成本。DeepSeek 的价格削减在长期运行的智能体使用最多令牌的地方最为显著:之前缓存输入的 costs 下降了 57%,而输出的成本下降了 9%。

我们的观点:一年前,模型制造商致力于延长上下文窗口。DeepSeek-V4.1-Flash 保留了其前身的一百万令牌上下文,而是降低了保持它的成本:每令牌 890 字节的缓存,比 DeepSeek-V1 小 437 倍,比 DeepSeek-V4-Flash 小 4 倍。如果其他模型制造商效仿 DeepSeek 的做法,发布产品时可能会很快将每令牌的缓存大小与上下文窗口和每令牌的成本并列宣传。

当被问及需要广泛推理和工具使用才能回答的问题时,智能体可能会进行搜索却毫无进展,重复失败的策略,或者满足于部分验证的答案。迭代式构建答案有助于解决这些不足。

最新动态:北京人工智能研究院的研究人员开发了 AREX,这是一种研究智能体,它通过反复循环收集证据、反思暂定答案以及发起有针对性的后续搜索来磨练其工作。迭代 harness 与微调模型的结合优于竞争性方法。

关键见解:一些早期的智能体会根据问题的要求检查候选答案,并接受或拒绝它。然而,检查过程可以做更多工作。当暂定答案未能满足所有要求时,逐条检查它会揭示哪些要求仍未得到支持,以及现有证据在哪里存在冲突。与其丢弃整个答案,智能体可以保留已确认的部分,并将未满足的要求作为进一步研究的基础问题。这将一个通过/不通过的判断转变为一个驱动改进的循环。

工作原理:作者构建了一个智能体框架来回答复杂的研究问题。他们使用该框架构建数据集,并微调了两个模型以更有效地处理该数据:Qwen3.5-4B(规模相对较小)和 Qwen3.5-122B-A10B(一个规模更大的混合专家模型)。

  • 他们设计的框架使智能体首先采取研究智能体的典型行动:搜索网页、阅读网页内容并构建初步答案。在任何时候,它都可以调用工具将其操作轨迹压缩为简要的研究状态,记录已验证的事实、考虑过但被排除的假设、未解决的要点以及下一步计划。
  • 当智能体判断通过进一步研究不太可能改善其答案时,它会生成一个带有 0 到 100 之间置信评分的答案。如果评分超过作者设定的阈值,智能体便接受该答案;否则,智能体会要么优化其工作(保留有用证据,同时专注于剩余的知识空白),要么从头开始重新进行。
  • 为了构建数据集,作者为需要综合多个来源、进行多步规划或推理,或整合学术论文的研究问题创建了模板提示词。他们使用这些模板和一个未指明的模型来生成问题。随后,他们将框架与未指明的模型配对,由这些模型回答问题并记录其操作轨迹。
  • 他们使用监督微调来训练两个 Qwen3.5 模型以复现这些轨迹。然后应用强化学习来训练模型生成答案。由于长轨迹包含许多常规步骤,只有少数关键决策步骤,因此他们使用手工编写的规则来标记最重要的时刻,例如模型找到关键证据、放弃错误假设或浓缩研究状态的时刻。在监督微调和强化学习期间,他们将训练信号集中在这些被标记的关键决策点上。

结果:在六个智能体基准测试中,基于微调后 Qwen3.5 模型的 AREX 系统表现优于使用相同框架搭配同等规模模型的系统,也优于未经微调的 Qwen3.5 模型。

  • 在测试多步网页搜索的 BrowseComp 基准上,基于微调后 Qwen3.5-122B-A10B 的 AREX 系统实现了 82.5% 的准确率。这一结果略低于次优竞争对手——作者框架搭配 Gemini Pro 3.1(推测是一个规模大得多的模型)所达到的 85.9%。
  • 在评估从多个检索来源综合输出能力的 WideSearch-en 基准上,基于微调后 Qwen3.5-122B-A10B 的 AREX 系统实现了 82.0% 的 F1 分数。这一结果显著领先于次优系统——作者框架搭配 Kimi-K2.6 所实现的 80.8% F1 分数。
  • 作者框架搭配微调后的 Qwen3.5-122B-A10B 模型,相较于仅执行研究智能体典型步骤的同款模型框架,性能提升了多达 10 个百分点(在 BrowseComp 上)。
  • 同样,微调显著提升了系统性能。在 BrowseComp 和 WideSearch-en 上,未经微调的类似系统性能下降了多达 20 个百分点。在六个基准中的五个上,基于相对微小的微调后 Qwen3.5-4B 模型的 AREX 系统表现优于基于未微调的更大规模 Qwen3.5‑35B 模型的系统。

意义所在:研究智能体可以通过微调和对输出结果的反复改进获得更好的表现。这种识别并放大最具信息量决策点的训练策略,为改善智能体行为提供了实用的启示:长轨迹中的每一步并非同等重要。将训练重点放在关键决策点上,比对所有行动一视同仁能产生更好的效果。

我们的想法是:作者使用手工编写的规则而非学习模型来检测和定位训练样本。这些规则使模型学会如何将长轨迹压缩为更有价值的决策点。这种组合表明,当检测目标明确时,简单但清晰的启发式方法可以优于复杂的启发式方法。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文