<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Machine Learning on The Herta</title><link>https://letsgetai.github.io/categories/machine-learning/</link><description>Recent content in Machine Learning on The Herta</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 25 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://letsgetai.github.io/categories/machine-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>哪些归纳偏置活到了 scaling 时代：从时间序列预测十年复盘说起</title><link>https://letsgetai.github.io/posts/inductive-bias-time-series-scaling/</link><pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate><guid>https://letsgetai.github.io/posts/inductive-bias-time-series-scaling/</guid><description>&lt;blockquote&gt;
&lt;p&gt;结论先行：过去十年时间序列预测模型的设计史，可以重写成一部“押注竞赛”——每个方法都在押不同的数据结构假设：什么该成为一个 token、attention 该花在哪个轴上、要不要显式分解趋势、未来该一步步生成还是整窗输出。scaling 是选择环境：跨域预训练之后，trend 分解、频域基、严格 channel independence 这些强领域偏置大多被淘汰，patch、归一化、参数共享这些弱而通用的偏置活了下来。归纳偏置这个视角的全部用处，是逼你回答五个问题：假设了什么、针对哪个瓶颈、何时失效、能否让数据去学、放大后还值不值得保留。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="引子有限数据--归纳偏置--泛化"&gt;引子：有限数据 + 归纳偏置 → 泛化&lt;/h2&gt;
&lt;p&gt;为什么一个只见过有限训练点的模型，能在没见过的点上做对预测？因为数据本身给不出答案：与训练数据完全一致的函数有无穷多个，它们在训练范围外彼此分歧。要让学习发生，学习器必须对“哪些解更合理”有一个系统性的偏好——这就是归纳偏置：&lt;/p&gt;
$$\text{有限数据} + \text{归纳偏置} \rightarrow \text{泛化}$$&lt;p&gt;No Free Lunch 定理给了它一个反面表述：如果对所有可能任务一视同仁，就不存在在任何任务上都更优的算法。现实学习之所以可能，是因为真实世界不是任意的，它有结构，而模型必须押注这些结构。&lt;/p&gt;
&lt;p&gt;先澄清一个容易混淆的点。教科书（比如李航《统计学习方法》）给人的印象是归纳偏置≈假设空间，但它只是偏置的一部分：架构、损失函数、正则、优化器、参数共享、tokenization、归一化、数据增强、预测形式，甚至搜索与决策过程，每一处都在注入偏好。它贯穿学习流程的每个环节。&lt;/p&gt;
&lt;p&gt;另外，这里的 bias 不是统计学里“估计有偏差”的那个 bias，它更接近 preference / prior / tendency：面对多个可能解时不保持中立，而是系统性偏向其中一部分。&lt;/p&gt;
&lt;p&gt;下面这张图是整场讨论的全景框架，本文按其中第 5 到第 10 块展开：&lt;/p&gt;
&lt;p&gt;&lt;img alt="归纳偏置、模型设计与 scaling 的统一视角全景图" loading="lazy" src="https://letsgetai.github.io/images/inductive-bias-time-series-scaling/overview.png"&gt;&lt;/p&gt;
&lt;h2 id="模型演进每个模型押了什么买到什么付出什么"&gt;模型演进：每个模型押了什么，买到什么，付出什么&lt;/h2&gt;
&lt;p&gt;用“它预先假定了什么结构”重读经典模型，会发现每个架构本质上是一笔押注：拿一个假设换样本效率，同时付出另一种能力作为代价。下图是五个模型的完整对照和 ViT patch 的拆解，正文只提炼主线。&lt;/p&gt;
&lt;p&gt;&lt;img alt="MLP / CNN / RNN / Transformer / ViT 的归纳偏置对照与 ViT patch 拆解" loading="lazy" src="https://letsgetai.github.io/images/inductive-bias-time-series-scaling/model-evolution.png"&gt;&lt;/p&gt;
&lt;h3 id="五个模型的押注"&gt;五个模型的押注&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;模型&lt;/th&gt;
&lt;th&gt;押了什么（归纳偏置）&lt;/th&gt;
&lt;th&gt;买到什么&lt;/th&gt;
&lt;th&gt;付出什么&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;MLP&lt;/td&gt;
&lt;td&gt;复杂函数可由多层简单非线性映射组合；不假设输入有空间或时序结构&lt;/td&gt;
&lt;td&gt;通用性强，能学习层次化表示&lt;/td&gt;
&lt;td&gt;不利用任何数据结构，样本效率低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;CNN&lt;/td&gt;
&lt;td&gt;局部性、空间参数共享、平移等变&lt;/td&gt;
&lt;td&gt;契合自然图像局部模式重复、相邻像素相关的分布&lt;/td&gt;
&lt;td&gt;固定局部连接，对远距离关系不够灵活&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RNN&lt;/td&gt;
&lt;td&gt;信息可递归压缩进状态、时间上参数共享&lt;/td&gt;
&lt;td&gt;契合序列天然有顺序，过去信息可压进固定状态&lt;/td&gt;
&lt;td&gt;长程依赖难，并行性差&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Transformer&lt;/td&gt;
&lt;td&gt;token 间共享计算、基于内容动态决定关注谁、位置与因果另行编码&lt;/td&gt;
&lt;td&gt;全局的、内容依赖的信息路由；表达灵活，易于 scaling&lt;/td&gt;
&lt;td&gt;视觉/时序专用先验弱，数据和算力需求更高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ViT&lt;/td&gt;
&lt;td&gt;把图像先离散成局部 token，再交给全局内容驱动的 attention&lt;/td&gt;
&lt;td&gt;保留最少量 2D 结构，同时吃到 Transformer 的全局建模&lt;/td&gt;
&lt;td&gt;局部先验弱于 CNN，小数据上不如 CNN 高效&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这张表里有一个可读出的规律：越往下，假设越弱、越通用，对数据的要求越高。MLP 什么结构假设都不写；CNN 把“局部 + 共享”写死在架构里；Transformer 的合同里只写“token 间共享计算”这一条，其余留给数据说话。于是得到第一个判断：模型的发展不是“偏置越来越少”，而是偏置越来越通用、越来越抽象、越来越可学习。这个判断马上会在时间序列领域得到一次干净的检验。&lt;/p&gt;</description></item></channel></rss>