<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>RL on The Herta</title><link>https://letsgetai.github.io/categories/rl/</link><description>Recent content in RL on The Herta</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Mon, 31 Aug 2026 00:30:00 +0800</lastBuildDate><atom:link href="https://letsgetai.github.io/categories/rl/index.xml" rel="self" type="application/rss+xml"/><item><title>OPD 本质分析：从在线蒸馏公式、TRL 最小复现到 GSM8K 验证</title><link>https://letsgetai.github.io/posts/opd-on-policy-distillation-trl-repro/</link><pubDate>Mon, 31 Aug 2026 00:30:00 +0800</pubDate><guid>https://letsgetai.github.io/posts/opd-on-policy-distillation-trl-repro/</guid><description>&lt;blockquote&gt;
&lt;p&gt;一句话版本：OPD（on-policy distillation，在线策略蒸馏）用「学生自己采样的数据」加「教师逐 token 的密集信号」，同时绕开离线蒸馏的分布错位和纯 RL 的信号稀疏。我们基于 TRL 做了一次最小复现，得到三个可量化的结论：数据筛选把 GSM8K 准确率从 11.52% 抬到 43.06%；换更强的教师做离线蒸馏几乎不动（43.06% → 43.21%）；只有「强教师 + 完整生成预算」的组合下，on-policy 的价值才兑现（54% &amp;gt; 42% &amp;gt; 39%）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;本文面向已经接触过 RL 和蒸馏、想理解 OPD 来龙去脉并动手复现的读者。主线：OPD 本质是什么 → TRL 怎么实现 → 我们的实验证明了什么 → 结论能否被外部证据验证。&lt;/p&gt;
&lt;h2 id="开篇opd-的本质"&gt;开篇：OPD 的本质&lt;/h2&gt;
&lt;h3 id="为什么现在都在谈-opd"&gt;为什么现在都在谈 OPD&lt;/h3&gt;
&lt;p&gt;OPD 最近在大模型后训练里升温：Qwen3、GLM-5、DeepSeek 的后训练实践都涉及「在线蒸馏」思路，社区里也有不错的入门视频：&lt;a href="https://www.bilibili.com/video/BV1bNGz6xEQf/"&gt;从 RL 到 OPD：Qwen3、GLM-5、DeepSeek 都在关注什么？&lt;/a&gt;。核心主张一句话：保留 RL 里「学生自己探索」的 on-policy 采样，同时引入教师对每个 token 的密集反馈，缓解传统蒸馏的分布错位，也降低纯 RL 里信号稀疏、成本高、训练不稳定的压力。&lt;/p&gt;
&lt;h3 id="三范式对比"&gt;三范式对比&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;离线蒸馏 offline KD&lt;/th&gt;
&lt;th&gt;OPD 在线策略蒸馏&lt;/th&gt;
&lt;th&gt;RL（PPO/GRPO）&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;采样分布&lt;/td&gt;
&lt;td&gt;教师或固定数据（off-policy）&lt;/td&gt;
&lt;td&gt;学生当前策略（on-policy）&lt;/td&gt;
&lt;td&gt;学生当前策略（on-policy）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;学习信号&lt;/td&gt;
&lt;td&gt;教师逐 token 分布&lt;/td&gt;
&lt;td&gt;教师逐 token 分布&lt;/td&gt;
&lt;td&gt;奖励（通常稀疏）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;是否要奖励模型&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;分布错位&lt;/td&gt;
&lt;td&gt;有&lt;/td&gt;
&lt;td&gt;无&lt;/td&gt;
&lt;td&gt;无&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;信号密度&lt;/td&gt;
&lt;td&gt;高&lt;/td&gt;
&lt;td&gt;高&lt;/td&gt;
&lt;td&gt;低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;不稳定风险&lt;/td&gt;
&lt;td&gt;低&lt;/td&gt;
&lt;td&gt;中（依赖采样质量）&lt;/td&gt;
&lt;td&gt;高&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;本质是两个维度的交集：「谁的数据」决定分布是否错位——离线蒸馏用教师生成的数据，学生学的是「自己不太会产生的输入」上的分布，且固定数据不会随学生进步自适应；「谁的信号」决定密度——教师逐 token 的 KL 目标密集，RL 的奖励通常只出现在序列末尾。OPD 取交集：学生数据 × 教师信号。&lt;/p&gt;</description></item></channel></rss>