#用采样"翻译"专家数据:SFT 其实比你想的强得多 —— Projection Sampling 详解

论文:Finetuning with Sampling: SFT Learns Better Than You Think(Aayush Karan, Sitan Chen, Yilun Du,Harvard,2026-10)

#一句话 thesis

SFT 学不好的锅,不在 SFT 这个学习算法,而在喂给它的数据太 off-policy。与其改目标函数,不如在训练前用 MCMC 采样把专家数据"改写"成 base model 自己会说的话——改写完再 SFT,泛化和保留旧能力都超过 on-policy RL。

这篇论文直接挑战了当前 posttraining 领域最有共识的一条"slogan":RL 泛化好、SFT 记忆+遗忘。它给出的答案是:SFT 的弱不是本质属性,是数据分布问题。


#1. 它想解决什么问题

#1.1 背景共识:RL vs SFT

近两年的大量工作(Chu et al. 2025 "SFT memorizes, RL generalizes"、Shenfeld et al. 2025 "RL's Razor"、Chen et al. 2025)指向同一组结论:

  • RL 泛化好:因为 on-policy,模型自己采样、自己更新,学到的分布离 base model 不远,旧能力天然保留;
  • SFT 泛化差、灾难性遗忘:因为 off-policy,硬灌专家轨迹,梯度大且不稳,模型被拽到离 base model 很远的地方(Xiong et al. 2025 甚至给出了数学解释,Shenfeld 用实证表明遗忘程度与 finetuned model 对 base model 的 KL 散度正相关)。

#1.2 但 on-policy 也有致命短板

RL 靠模型自己反复采样找到成功轨迹。如果模型连一个正确 rollout 都采不出来,奖励方差为零,学习信号就是零。Qu et al. 2026 (POPE) 在实践中观察到:存在一大块"太难"的训练样本,在 RL 里被整块丢弃——恰好是"引入新能力"最需要的样本(模型本来就不会,才需要学)。

而这里恰是 SFT 的主场:SFT 直接吃 off-policy 专家轨迹,不需要模型先会做,也不需要可显式定义的 reward。

#1.3 论文的核心提问

两个范式各拿了一半的好处:

RL / on-policySFT / off-policy
数据来源模型自己采样专家轨迹(特权信息)
泛化 & 防遗忘✅ 好❌ 差
冷启动新能力(模型不会的题)❌ 零信号直接放弃✅ 有监督信号

能不能同时拿到两半? 之前的工作走的是"改学习目标"路线(重要性加权 SFT、加 KL 项的 anchored SFT、GRPO 里塞专家 in-context 的 UFT/POPE)。这篇论文反着来:学习算法(SFT)原封不动,改数据分布。

直觉类比:与其给一个消化不好的人换药(改 loss),不如把食物预先咀嚼打碎成他好吸收的形态(改数据)。数据是为学习者定制的,而不是让学习者去迁就数据。


#2. 方法:Projection Sampling

#2.1 形式化:目标是"信息投影"

给定 base model 分布 和专家轨迹集合 。定义等价类 :与专家轨迹"语义等价"的所有轨迹(数学题=任何能推出正确答案且用到专家信息的解法;事实类=LLM 判分器认为事实内容一致的回答)。

要找的数据分布是 在"只输出等价轨迹"这个约束集合上的信息投影(Csiszár 1995):

命题 1 给出闭式解: 就是 base model 限制在等价轨迹上的条件分布——"模型自己说的话里,所有说得对的那些"。这是既保住专家信息、又最贴近 base model 的理想数据分布。

人话:最理想的训练数据不是专家写的解答,而是"假如 base model 自己会这道题,它会怎么写"。专家数据的价值只是告诉你答案和关键信息,表述方式应该换成模型自己的。

#2.2 怎么采样:Metropolis-Hastings

直接从 采样做不到(等于要求模型本来就会做)。但如果模型连一个正确样本都采不出,就退化为普通 rejection sampling = 最低配 on-policy RL,回到冷启动问题。

论文的解法:用专家轨迹当起点,跑 MCMC,逐步演化。用 Metropolis-Hastings:从专家轨迹 出发,用"信息保持"的 proposal (只提议仍在 内的候选)变异,按接受率

决定是否接受。核心性质(命题 3):每一步 MCMC 都单调减小数据分布与 base model 的 KL 距离——数据被逐步"搬"向 on-policy,且全程不丢正确性。

Figure 2:概念示意
Figure 2:采样算法把原始数据策略 πdata 逐步推向更靠近 base model πbase 的目标策略 πtarget

这就是上图的意思:(专家)经过采样链逐步移向 (贴近 )。采样步数是一个可以花钱买的轴:MCMC 跑得越多,数据越 on-policy。

#2.3 工程实现:块状 MH + in-context 改写

直接对全长序列做 MH 需要反复整段重新生成,且高维空间混合极慢。论文沿用 Karan & Du 2025("Reasoning with Sampling")的技巧:

  1. 分块:把长度 的序列按块长 (论文取 32)切成若干段,先采样第一块的分布,再以此为初始化采样下一块,逐块推进;
  2. Proposal 是"看着专家答案续写自己":随机截断当前候选到位置 ,然后把「题目 + 完整专家解 + 部分草稿」塞进 prompt,让 base model 以自己的口吻续写完,并要求与专家解逻辑一致、答案正确。预训练模型强大的 in-context 指令跟随能力保证了 proposal 基本落在等价类 内;
  3. 每块内跑 步 MH 接受/拒绝(接受率用 base model 的序列似然 + proposal 似然之比计算)。
Algorithm 1:投影采样伪代码
Algorithm 1:Projection Sampling——分块 MH,用 κC(条件于专家轨迹的 base model)做 proposal

一个重要的成本性质:与 Karan & Du 2025 在推理时反复做 MCMC 不同,projection sampling 是训练前一次性成本(对数据集跑一遍就完),不进入推理路径。平均 token 开销约为 。

#2.4 和已有路线的本质区别

路线代表改什么
改目标函数Wu et al.(重要性加权 SFT)、Zhu et al.(+KL 项)让 SFT loss 去迁就 off-policy 数据
RL 里借专家UFT、POPE让 RL rollout 时看专家 in-context
自蒸馏OPSD构造"看了特权信息的 teacher",再 KL 蒸馏
本文Projection SamplingSFT 一字不改,把数据改造成 on-policy 等价物

#3. 实验:SFT 打赢了谁

任务三个,都是"base model 本来不擅长"的领域:

  • Chemistry:SciKnowEval L-3 子集(配平方程、摩尔质量等),Qwen2.5-7B-Instruct / Olmo-3-7B-Instruct,专家轨迹由 GPT-5 生成;
  • Math:MATH 数据集 Level 3-5(最难档),Qwen2.5-3B,用数据集自带专家解;
  • Medical:HuatuoGPT-o1 SFT 数据(约 2 万题),Qwen2.5-7B-Instruct,开放式回答用 GPT-5-mini 判分。

基线包括:vanilla SFT、Rewrite SFT(只用 proposal prompt 做一次零阶改写,即"0 步 MCMC")、OPSD(on-policy 自蒸馏,当前持续学习的强基线)、GRPO / UFT(math 上加的 RL 基线)。

Table 1:主结果
Table 1:三个任务上,Sampling SFT 在新任务精度和旧能力保留两轴上均达到或超过 on-policy 基线

几个关键数字(相对 base model):

任务指标Sampling SFT对比
Chemistry新任务+31.7%(0.660)比 OPSD 多 +4.2%
Chemistry旧能力均值-1.10%遗忘最少,MMLU 零损失
Math (3B)MATH(3,4,5)+18.0%(0.495)超过 GRPO 的 +14.2%
Math (3B)MATH500 (OOD)+33.7%(0.582)超次优基线 +26.9%
Math (3B)Sampling SFT + GRPO+40.7% MATH500全表最强
Medical旧能力均值损失仅 -8.1%vanilla SFT 损失 -24.4%
Figure 1:总览
Figure 1:Chemistry 任务上,采样版 SFT(右)在新任务精度与旧能力保留两个轴上同时最优

特别值得注意的两个消融证据:

  1. 一次改写不够:Rewrite SFT(只做一次零阶改写)明显弱于完整 MCMC 过程——说明"逐步向 on-policy 演化"的迭代本身是关键,不只是换个口吻;
  2. 必须 per-model 定制:用为 Olmo boost 的数据去训 Qwen,结果崩掉、低于所有基线。数据必须是对这个 base model on-policy 的,不能通用。

#3.1 数据真的变 on-policy 了吗

Figure 3:数据似然直方图
Figure 3:boosted 轨迹在 base model 下的平均对数概率显著高于原始专家轨迹

对训练数据在 base model 下算序列对数似然:boosted 轨迹的似然直方图整体大幅右移(math 上从约 0-1.5 提升到 1-2 nats/level),且保持正确性。"改写"是可度量的,不只是感觉。

#3.2 是学到新能力,还是只是 sharpening?

一个尖锐的问题:把数据推向模型分布内,会不会只是把 base model 已有的能力"锐化"(提高采样命中正确答案的概率),而非教会新东西?

Figure 4:Pass@k 曲线
Figure 4:Olmo-3-7B pass@k 曲线严格高于 base 和 OPSD,大 k 下差距不闭合

如果只是 sharpening,pass@k 曲线会随 增大收敛回 base model。实际上曲线严格高于 base 与 OPSD,到 差距依然巨大。更细的证据:base model pass@k 恒为 0 的"绝对做不出"的题,finetune 后 pass rate 升到 53.1%~67.2%——这是分布层面之外的新能力。

#3.3 采样算力是一个可扩展的轴

Figure 5:KL 与精度随 MCMC 步数变化
Figure 5:MCMC 步数从 0 到 10,数据分布对 base model 的 KL 单调下降,finetune 后精度单调上升

把 MCMC 步数从 0 扫到 10:数据分布的 KL 单调降、下游精度单调升。这给了 posttraining 一个新的 scaling 维度——训练前的数据采样算力,与训练算力、推理算力并列。


#4. 局限与没解决的问题

诚实地列几条:

  1. 等价类 依赖判分器/LLM grader:数学有 verifier,医疗靠 GPT-5-mini 判分。开放式领域里 的定义质量直接决定上限,"信息保持"在不可验证领域仍是个软假设;
  2. 一次性成本不小:,对超大数据集(预训练/持续预训练规模)是否可行未讨论,论文只在中型 SFT 数据(2 千~2 万样本)上验证;
  3. base model 弱到连 proposal 都给不出正确续写时会退化:in-context 跟随能力是 proposal 质量的前提,对极小模型或极难任务这一前提可能不成立;
  4. 任务粒度还是"单任务持续学习":连续学多个新任务、任务间干扰、以及与 full posttraining 流水线(RLHF 偏好数据)的衔接,论文只给了展望没给实验;
  5. 理论上 MH 收敛需要不可约+非周期,LLM 的高维离散空间实际只跑 10 步,远未收敛到 ——但实验说明"部分 on-policy 化"已经够用,这本身也是个有意思的观察。

#5. 为什么这件事重要:采样作为 posttraining 的通用原语

论文最后一段的野心值得单独说:把"采样"提升为 model-native 的数据算子(model-native operator that shapes data for learnability)。三个可推广的方向:

  • SFT(本文主体):off-policy 专家数据 → on-policy 等价物;
  • 蒸馏:MCMC 直接从初始蒸馏轨迹诱导出一个 KL 上更贴近 student 的 teacher 分布,更新更稳;
  • RL 冷启动:在模型采不出成功轨迹的难题上,条件于专家信息模拟"on-policy rollout",制造学习信号——正对着 POPE 指出的"难题被 RL 丢弃"的痛点。

#6. 对我们研究方向的启发

(以下是我的引申,非论文内容)

  • "SFT vs RL"之争可以重新框定为"数据 off-policy 程度"的谱系问题。既然 KL(数据 ‖ base) 单调可控、且与下游泛化/遗忘强相关,它就是一个可操作的中间变量——比"SFT/RL"这个二分法细得多。后续工作可以系统量化:多大规模下、多少 KL 程度是"最优甜点"。
  • 与长轨迹 Agent RL 的直接接口:Agent 任务几乎全是"模型采不出完整成功轨迹"的冷启动场景。projection sampling 提供了一条不依赖 reward、不依赖模型先验成功率的替代路径:拿专家 agent 轨迹做 MCMC 演化,逐块变成 base model 的"自然行为"。对环境交互昂贵、奖励稀疏的设定尤其值得试。
  • Model-based 视角:MCMC 步数 = 花 inference 算力买数据质量,本质上是用 base model 自身的分布知识去"重参数化"训练数据。这和 latent-space reasoning、inference-time scaling 是同一个哲学:模型分布本身就是可以被显式计算和操纵的对象,而不只是采样黑盒。
  • 对持续预训练:数据单次改写成本高的问题,或许可以和"只 boost 高价值/高难度样本"结合——POPE 式的难度分层 + 投影采样,可能是一个高性价比的组合。

#参考

  • 论文:arXiv:2610.02140(附 Website / Code 链接,见 arXiv 页)
  • 直接相关工作:Karan & Du, Reasoning with Sampling(arXiv:2510.14901,推理时 MCMC 锐化的前作);Shenfeld et al., OPSD / Self-Distillation Enables Continual Learning(arXiv:2601.19897);Qu et al., POPE(arXiv:2601.18779);Chu et al., SFT Memorizes, RL Generalizes(arXiv:2501.17161)