编程 别再当调参侠:Tensor Programs 和超参迁移背后的数学

2026-08-31 00:03:26

别再当调参侠:Tensor Programs 和超参迁移背后的数学

先看一个让人肉疼的场景

你在一亿参数的小模型上把学习率、初始化 scale、warmup 全部调好,效果不错。然后把同一组超参搬到十亿参数模型上,训练直接发散;把 LR 调小一个数量级,勉强收敛但性能稀烂。你开始怀疑自己不会调参,但更本质的问题在于:超参在模型宽度变化时以你无法预测的方式漂移

这就是工程上最常见的“scaling 时旧超参失效”问题。调参侠在 1B 模型上的经验,到了 7B、70B 上基本归零。你要么烧钱重调,要么赌一把经验公式。而 Tensor Programs 这个理论框架,恰好给你一个“小模型定超参、大模型沿用”的可行性论证,以及一套具体的参数化方案。

Tensor Programs 是什么

Greg Yang(Microsoft Research)提出的一套理论框架,核心思路很工程化:把神经网络训练(前向 + 反向 + SGD 更新)看作一个“程序”,当其中张量(矩阵/向量)的维度趋于无穷时,用一套称为 Master Theorem(主定理)的规则来计算各类量的极限行为。

它不是一篇论文,而是一整个系列:

  • Tensor Programs I(NeurIPS 2019):宽前馈/循环网络任意架构收敛为高斯过程(NN-GP correspondence),提出 NETSOR 计算图语言。
  • Tensor Programs II(2020):任意架构初始化下 NTK 收敛到确定性极限,提出 Simple GIA Check 来判断梯度独立性假设何时成立。
  • Tensor Programs IIb:证明 NTK 训练的架构普适性,训练中遵循核梯度下降。
  • Tensor Programs III:Neural Matrix Laws(矩阵律)。
  • Tensor Programs IV(ICML 2021, Yang & Hu):特征学习。证明标准参数化与 NTK 参数化在无限宽极限下无法学习特征,提出 µ-parametrization(µP),让极限下仍然能特征学习,由此实现超参迁移。
  • Non-Gaussian Tensor Programs(NeurIPS 2022):将初始化分布的普适性扩展到非高斯分布。
  • Tensor Programs VI:无限深网络的特征学习。

相关代码仓库:

三种极限,为什么前两种对你不实用

研究宽网络极限,传统上有两条路线:

  1. NNGP 极限:宽度 → ∞,网络变成高斯过程,对应一个静态核。训练跟你没关系了——这是一个先验的分布,不感知数据。
  2. NTK 极限:核在训练中保持不变,网络等价于核回归。核不更新,等于模型不学特征。在这种极限下,你调的超参本质上是“核方法超参”,不是“深度学习超参”。

µP 要的是第三种极限:宽度趋于无穷,但网络仍然能学特征。关键区别在于——特征学习的极限行为在宽度变化时保持稳定

这就是超参迁移的理论基础:如果你保证从小模型到大模型采用了正确的 scaling 规则(每层权重/学习率按宽度做特定 scale),那么最优超参的形状不随宽度变化。小模型上调好的学习率和初始化方差,搬到大模型上依然成立。

对工程师的真实意义

直说:训练超大模型时重新调学习率/初始化 scale 的成本是不可接受的。µP/Tensor Programs 给出了一条“小模型上定超参、大模型沿用”的路径,这也是 DeepSeek、Llama 等大规模训练的论文/报告中经常被引用的超参策略的理论支撑。

但注意,这不是零成本换来的。µP 的参数化方式与常规不同:

  • 权重初始化的 scale 要按宽度逐层计算;
  • 学习率也要按宽度做特定的缩放;
  • 需要配套的优化器与初始化实现。

这意味着你不能直接拿现成框架的默认初始化 + Adam + cosine schedule 就跑出 µP 效果。你需要读论文的表格,把每一层(embedding、attention proj、MLP 等)都按规则处理好。具体 scale 规则原文有详细推导,这里不展开,但记住一条:逐层算 scale,不是全局统一缩放

边界在哪,什么时候别指望它

这套理论有明确的前提和短板,别当银弹:

  • 依赖“宽网络”假设:它分析的是无限宽极限行为,对窄网络(如某些 bottleneck 结构)不一定成立。
  • 窄网络和特殊架构不在覆盖范围内:标准架构还好,如果你自己设计了一个奇怪的模块,TP 的结论可能直接失效。
  • µP 实现门槛高:需要逐层计算 scale,且要与优化器、初始化配合。工程上手成本不低,容易踩坑。
  • 训练过程中核剧烈偏离的情况仍需验证:µP 保证的是极限行为稳定,实际有限宽度下,核动态偏离的程度和影响还是一个 open question。
  • 理论推导与实测之间存在 gap:论文里的结论是渐进性的,具体模型具体分析。落地前务必在你自己的架构上跑小规模验证。

换句话说:对一个接近标准 transformer、宽架构为主的大模型训练,µP 是有理论依据的实操指导;对你的 3 层自定义 MLP + weird activation,别假设它一定适用。

最后留一个未解点:µP 在无限宽极限下成立,但实际大模型的“有限但很大”的宽度下,超参迁移的误差界到底是多少、如何随宽度衰减——这部分理论还没有一个干净的答案。工程上你只能对几个关键超参做小规模扫描,然后赌 µP 的有效性。至少,这比盲调强得多。

推荐文章

程序员茄子在线接单