← 返回信息流

宝玉推文

智谱联合创始人唐杰分享:GLM-5.3 纯靠后训练让编码能力提升 50%

模型行业AI评分:70/100

智谱联合创始人唐杰透露,GLM-5.3 未更换基座,基于 GLM-5.2(743B MoE,激活 40B)通过一个月长周期强化学习,编码能力提升 50%。他强调总参数量决定知识量,激活参数与有效深度决定推理深度,并指出后训练仍有巨大潜力,模型扩展不止堆参数一条路。

译文

智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享: 智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。 GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。 这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。 推文中特别区分了两个概念: 1. 总参数量决定模型学习了多少知识 2. 激活参数量和有效深度决定模型能想多深。 比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。 至于为什么不换底座也能大幅提升呢? AI 模型的扩展(scaling)不止堆参数这一条途径。 如果梳理下这些年模型训练的发展路线: - 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。 - 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。 - 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。 模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。 对于现阶段,模型后训练还有很大潜力可以挖掘。

宝玉

@dotey

智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享: 智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。 GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。 这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。 推文中特别区分了两个概念: 1. 总参数量决定模型学习了多少知识 2. 激活参数量和有效深度决定模型能想多深。 比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。 至于为什么不换底座也能大幅提升呢? AI 模型的扩展(scaling)不止堆参数这一条途径。 如果梳理下这些年模型训练的发展路线: - 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。 - 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。 - 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。 模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。 对于现阶段,模型后训练还有很大潜力可以挖掘。

阅读原文