DeepSeek 提出了流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)。mHC 是一个通用框架,它将 HC 的残差连接空间投影到特定的流形上以恢复恒等映射特性,同时结合严格的基础设施优化来确保效率。
实验表明,mHC 能够有效地进行大规模训练,提供显著的性能提升和优异的可扩展性。这将有助于加深对拓扑架构设计的理解,并为基础模型的演进指明有前景的方向。
方法论
团队提出将残差映射投影到一个流形上,该流形既能保持信号在各层间传播的稳定性,又能促进残差流之间的相互作用,从而保持模型的表达能力。
研究人员设定了一个双重随机性的参数 H,选择赋予了模型若干严格的理论性质,有利于大规模模型的训练。
此外,他们还对输入映射 H 施加非负性约束。
通过严格的优化,团队以仅 6.7% 的训练开销,在大规模模型中实现了 mHC。
他们采用混合精度策略在维持速度的前提下最大化数值精度,并将多个具有共享内存访问的操作融合到统一的计算内核中,以减少内存带宽瓶颈。
为了缓解内存开销这个问题,研究人员在前向传播之后丢弃 mHC 核的中间激活值,并在反向传播过程中通过重新执行 mHC 核来动态地重新计算这些激活值。
为了防止阻塞通信流,研究人员在专用的高优先级计算流上执行 MLP 层的 Fkernel。此外,他们还避免在注意力层中对长时间运行的操作使用持久内核,从而避免长时间的停顿。
这种设计能够抢占重叠的注意力计算,从而在保持计算设备处理单元高利用率的同时,实现灵活的调度。
此外,由于每个阶段 x 的初始激活已在本地缓存,因此重新计算过程与流水线通信依赖性解耦。
实验结果
结果表明,mHC 在损失和梯度范数方面均表现出更优的稳定性。
mHC 有效地缓解了 HC 中观察到的训练不稳定性,最终损失值比基线模型降低了 0.021。mHC 的表现明显优于 HC,并保持了与基线模型相当的稳定性。
在多种基准测试中的下游性能,mHC 实现了全面的性能提升,始终优于基线模型,并在大多数任务上超越了 HC 模型。值得注意的是,与 HC 模型相比,mHC 模型进一步增强了推理能力,在 BBH 任务上性能提升了 2.1%,在 DROP 任务上性能提升了 2.3%。
即使在更高的计算预算下,mHC 性能优势依然保持稳定。与 HC 相比,mHC 显著提高了传播稳定性,确保了稳定的前向信号和后向梯度流。
相关人员表示,对不同几何约束的进一步研究可能会产生新的方法,从而更好地优化可塑性和稳定性之间的权衡。通过加深对拓扑结构如何影响优化和表征学习的理解,mHC 将有助于解决当前的局限性,并有可能为下一代基础架构的演进指明新的方向。
参考资料:
https://www.arxiv.org/pdf/2512.24880
(来源:维科网)







