首页
关于领沨
投资理念
领沨团队
投资项目
新闻动态
联系我们
EN
简
繁
首页
关于领沨
投资理念
领沨团队
投资项目
新闻动态
联系我们
EN
简
繁
领沨资本
<p><span class="ql-size-huge">引领风向,增加价值</span></p>
潞晨科技 - 发布 OrScale 优化器,探索大模型训练中的动态步长优化
<p>近日,潞晨科技团队发布 OrScale 优化器,并同步开源论文与代码。OrScale 在 Muon 正交化更新基础上引入逐层动态信任比机制,根据不同参数矩阵的权重规模与更新幅度实时调整步长,在保留 Muon 方向校准优势的同时,改善不同网络层使用统一更新幅度的问题。团队在 125M 至 16B 参数语言模型上完成缩放实验。其中,在 Moonlight-16B-A3B MoE 模型上,OrScale 仅使用约三分之二的 Token 训练量即可达到 Muon+Moonlight 完成 10B Token 训练后的最终损失水平。该方法无需重新调整既有学习率与 weight decay,额外计算开销较低,并可兼容多种 Muon 及分布式训练方案,进一步展示了潞晨科技在大模型训练优化与高效分布式训练基础设施方面的技术积累。</p>