← 返回信息流

向阳乔木推文

国产模型蒸馏只是加速数据收集,真正靠扎实预训练与架构创新

观点AI评分:50/100

作者听播客后总结:国产模型的蒸馏仅加速高质量数据收集,实际水平来自扎实的预训练、新架构和优秀后训练,加上国产显卡推理和电力资源带来的性价比优势;但前沿探索研究仍落后于国外。

译文

听了不少播客,大家的一致看法是国产模型的蒸馏只是加速了高质量数据收集速度。 能达到现在水平,还是靠国产模型扎实的预训练,新的构架和不错的后训练。(得益于国内人才密度) 加上国产显卡大批量用于模型推理,国内电力资源的充沛,性价比拉上来了。 但前沿顶级探索研究还是国外要更领先。 https://twitter.com/crazychenxin/status/2092859395994698098

向阳乔木

@vista8

听了不少播客,大家的一致看法是国产模型的蒸馏只是加速了高质量数据收集速度。 能达到现在水平,还是靠国产模型扎实的预训练,新的构架和不错的后训练。(得益于国内人才密度) 加上国产显卡大批量用于模型推理,国内电力资源的充沛,性价比拉上来了。 但前沿顶级探索研究还是国外要更领先。 https://twitter.com/crazychenxin/status/2092859395994698098

阅读原文