哪些归纳偏置活到了 scaling 时代:从时间序列预测十年复盘说起

结论先行:过去十年时间序列预测模型的设计史,可以重写成一部“押注竞赛”——每个方法都在押不同的数据结构假设:什么该成为一个 token、attention 该花在哪个轴上、要不要显式分解趋势、未来该一步步生成还是整窗输出。scaling 是选择环境:跨域预训练之后,trend 分解、频域基、严格 channel independence 这些强领域偏置大多被淘汰,patch、归一化、参数共享这些弱而通用的偏置活了下来。归纳偏置这个视角的全部用处,是逼你回答五个问题:假设了什么、针对哪个瓶颈、何时失效、能否让数据去学、放大后还值不值得保留。 引子:有限数据 + 归纳偏置 → 泛化 为什么一个只见过有限训练点的模型,能在没见过的点上做对预测?因为数据本身给不出答案:与训练数据完全一致的函数有无穷多个,它们在训练范围外彼此分歧。要让学习发生,学习器必须对“哪些解更合理”有一个系统性的偏好——这就是归纳偏置: $$\text{有限数据} + \text{归纳偏置} \rightarrow \text{泛化}$$No Free Lunch 定理给了它一个反面表述:如果对所有可能任务一视同仁,就不存在在任何任务上都更优的算法。现实学习之所以可能,是因为真实世界不是任意的,它有结构,而模型必须押注这些结构。 先澄清一个容易混淆的点。教科书(比如李航《统计学习方法》)给人的印象是归纳偏置≈假设空间,但它只是偏置的一部分:架构、损失函数、正则、优化器、参数共享、tokenization、归一化、数据增强、预测形式,甚至搜索与决策过程,每一处都在注入偏好。它贯穿学习流程的每个环节。 另外,这里的 bias 不是统计学里“估计有偏差”的那个 bias,它更接近 preference / prior / tendency:面对多个可能解时不保持中立,而是系统性偏向其中一部分。 下面这张图是整场讨论的全景框架,本文按其中第 5 到第 10 块展开: 模型演进:每个模型押了什么,买到什么,付出什么 用“它预先假定了什么结构”重读经典模型,会发现每个架构本质上是一笔押注:拿一个假设换样本效率,同时付出另一种能力作为代价。下图是五个模型的完整对照和 ViT patch 的拆解,正文只提炼主线。 五个模型的押注 模型 押了什么(归纳偏置) 买到什么 付出什么 MLP 复杂函数可由多层简单非线性映射组合;不假设输入有空间或时序结构 通用性强,能学习层次化表示 不利用任何数据结构,样本效率低 CNN 局部性、空间参数共享、平移等变 契合自然图像局部模式重复、相邻像素相关的分布 固定局部连接,对远距离关系不够灵活 RNN 信息可递归压缩进状态、时间上参数共享 契合序列天然有顺序,过去信息可压进固定状态 长程依赖难,并行性差 Transformer token 间共享计算、基于内容动态决定关注谁、位置与因果另行编码 全局的、内容依赖的信息路由;表达灵活,易于 scaling 视觉/时序专用先验弱,数据和算力需求更高 ViT 把图像先离散成局部 token,再交给全局内容驱动的 attention 保留最少量 2D 结构,同时吃到 Transformer 的全局建模 局部先验弱于 CNN,小数据上不如 CNN 高效 这张表里有一个可读出的规律:越往下,假设越弱、越通用,对数据的要求越高。MLP 什么结构假设都不写;CNN 把“局部 + 共享”写死在架构里;Transformer 的合同里只写“token 间共享计算”这一条,其余留给数据说话。于是得到第一个判断:模型的发展不是“偏置越来越少”,而是偏置越来越通用、越来越抽象、越来越可学习。这个判断马上会在时间序列领域得到一次干净的检验。 ...

2026-09-25 · 3 分钟 · 495 字 · LetsGetAI