#MOPD(Multi-Teacher On-Policy Distillation)进展综述

一句话核心结论:截至 2026 年 8 月,MOPD 已经证明:在教师同源、tokenizer 一致、领域标签已知、学生容量足够时,可以把多个经过 RL 的 specialist 的大部分能力重新装回一个 generalist;但它还远没有解决“任意多个强模型自动融合成更强模型”。真正的难点已经从“怎么做 token-level 蒸馏”转移到:当前状态该听谁、谁真的可靠、多个教师的能力是否可兼容、学生是否装得下,以及如何控制成本和行为漂移。

#0. 先消歧:这里的 MOPD 到底是什么?

本文所称 MOPD 指:

Multi-Teacher On-Policy Distillation,多教师在策略蒸馏。

它的典型过程是:

  1. student 对 prompt 自己生成 rollout
  2. 把 student 已经走到的 prefix/state 发给一个或多个 teacher;
  3. teacher 在这些 student-visited states 上给出 token log-prob、top-k logits 或其他策略监督;
  4. student 学习 teacher 在这些状态上的动作偏好。

最直白的理解是:

不是让学生背老师写好的标准答案,而是让学生先自己做;做到哪一步,就让合适的老师在那一步批改。

这里有三个容易混淆的概念:

  • Multi-Teacher OPD:有多个独立 teacher policies,是本文主题。
  • Multi-Rollout OPD:同一个 student/teacher 对每题采多条 rollout,用成功与失败轨迹互相提供信息;“multi”指轨迹数,不指教师数。
  • 离线多教师 KD / SFT:多个教师预先生成答案或 logits,再让 student 在固定数据上学习;它不是严格的 on-policy distillation。

另外,MOPD 也不是跨领域早已统一的缩写。2026 年 Baichuan-M3 使用过 Multi-Teacher Online Policy Distillation,而标题为 MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training 的论文(arXiv:2606.30406)才把这一 LLM 后训练范式系统化。下文统一用“多教师在策略蒸馏”。


#1. 为什么需要 MOPD?

#1.1 单教师离线蒸馏的问题:老师走的路,不是学生会走的路

传统 sequence KD / CoT SFT 通常让强 teacher 先生成一条轨迹,然后 student 学这条轨迹:

teacher 生成标准解法 → 固定为训练数据 → student 模仿

问题是,推理时 student 一旦在中间生成了不同 token,就进入 teacher 数据里没有出现过的状态。后面即使每一步只偏一点,误差也会滚雪球。这就是自回归生成中的 state-distribution mismatch / exposure bias

单教师 OPD(以 MiniLLM、GKD 为代表)把流程改成:

student 自己生成 → teacher 在 student prefix 上重新判断 → 逐 token 纠偏

因此它更像驾校教练坐在副驾:不是只给你看高手录像,而是在你真的开错到某个路口时告诉你该怎么办。

#1.2 单教师 OPD 的问题:一个老师不可能什么都最强

现代 LLM 后训练往往面对多个能力域:

  • 数学 reasoning;
  • 代码生成与 repository-level SWE;
  • instruction following;
  • tool use / GUI / Web agent;
  • 医疗、法律等垂直领域;
  • 多模态 grounding 和抽象推理。

把所有数据和 reward 混在一次 RL 里,会遇到:

  • 不同 domain 的 reward scale 不一致;
  • rollout 长度、环境和 sandbox 不一致;
  • 梯度冲突;
  • 后训练阶段互相遗忘;
  • 每改一个领域就要重新协调整套联合训练。

于是 2026 年逐渐形成了 specialize-then-unify 路线:

  1. 从同一个 general SFT checkpoint 出发;
  2. 各领域独立做 RL,得到 Math Teacher、Code Teacher、IF Teacher……;
  3. 再通过 MOPD 把这些 specialist 装回一个 student。
MOPD 三阶段流程:通用 SFT、领域 RL 专家、在 student rollout 上进行多教师蒸馏
MOPD 论文 Figure 1:三阶段 capability integration pipeline

这时 teacher 和 student 甚至可以同架构、同参数量。目标不再只是“用大模型压小模型”,而是:

把多个局部最优策略整合成一个可部署的统一策略。


#2. 发展脉络:从单教师 OPD 到 Teacher Union

#2.1 阶段一:单教师 on-policy distillation 奠基(2023–2024)

#MiniLLM(arXiv:2306.08543)

之前的问题:传统 forward-KL KD 容易覆盖 teacher 的大量模式,却未必让 student 在自身生成分布上稳定;固定 teacher 数据还带来 exposure mismatch。

解决方法:student 从自身 policy 采样;teacher 在 student prefix 上提供分布;使用更 mode-seeking 的 reverse KL。

留下的新问题:仍然假设一个 teacher 在所有状态和任务上都值得模仿,而且白盒 teacher scoring 成本较高。

#GKD(arXiv:2306.13649,ICLR 2024)

之前的问题:蒸馏和 RLHF 的数据分布、散度选择缺少统一框架。

解决方法:Generalized Knowledge Distillation 支持 teacher-generated 与 student-generated 序列混合,并允许 forward KL、reverse KL、JSD 等目标。

推动下一阶段:确立了后续 MOPD 的核心操作:student samples, teacher scores

#DistiLLM(arXiv:2402.03898)

它通过 skew KL 和 adaptive off-policy replay 减少纯 on-policy KD 的成本,说明该方向从一开始就面临“监督更贴近 student,但 teacher 在线计算太贵”的矛盾。

#2.2 阶段二:多模型能力融合,但主要仍是离线(2024–2025)

Knowledge Fusion / FuseLLM(arXiv:2401.10491)、FuseChat(arXiv:2408.07990)、InfiFusion 等工作尝试对齐不同模型的 token 分布、生成数据或参数,把多个模型的知识融合进一个 target。

它们解决了“多个 source models 能否提供互补知识”,但主要仍依赖固定文本、token alignment 或 parameter merging。student 推理时真正走到的异常状态没有被 teacher 交互式纠正。

与此同时,Qwen3 Technical Report(arXiv:2505.09388)把 strong-to-weak OPD 带入主流 reasoning 模型训练:student 在 think/no-think 模式下生成,再与 32B 或 235B teacher logits 对齐。它还是以单 teacher 为主,但证明 OPD 可以进入工业后训练管线。

#2.3 阶段三:多个领域专家“先专门化,再统一”(2026 年初)

这一阶段的重要变化是:多教师不一定来自外部大模型,而是来自同一个 base/SFT checkpoint 的不同 RL 分支

代表系统包括:

  • Baichuan-M3(arXiv:2602.06570):明确使用 Multi-Teacher Online Policy Distillation,面向临床子能力统一;
  • GLM-5(arXiv:2602.15763):用前序 Reasoning RL、General RL checkpoint 作为教师恢复能力;
  • Nemotron-Cascade 2(arXiv:2603.19220):Cascade RL + multi-domain OPD,恢复后续阶段退化的领域;
  • KAT-Coder-V2(arXiv:2603.27703):将 SWE、WebCoding、Terminal、WebSearch、General 五类 agentic coding 专家统一。

这些系统给出了很强的整体 benchmark 成绩,但通常无法把提升单独归因于 MOPD:基础模型、SFT、RL、数据、工具和蒸馏共同作用。因此它们是生产级可行性证据,不是最干净的算法消融。

#2.4 阶段四:MOPD 被正式系统化(2026 年 6 月)

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training(arXiv:2606.30406)提供了目前最标准的受控设置:

  • base/student:Qwen3-30B-A3B;
  • teachers:从同一 SFT checkpoint 出发,分别做 Math RL、Instruction Following RL、SWE RL;
  • student 在混合 prompt 上自己 rollout;
  • 根据 prompt domain 路由到对应 teacher;
  • teacher 对 student prefix prefill,返回 sampled-token log-prob 或 top-k logits;
  • student 做 dense reverse-KL 风格更新。

主结果如下:

方法归一化能力整合分数
Cascade RL0.7752
Off-Policy Finetune0.8241
Parameter Merge(Task Arithmetic)0.8574
Mix-RL0.8818
MOPD0.9373
各领域 RL teacher envelope1.0000

MOPD 的具体结果包括:AIME25 51.46、AIME26 65.31、IFBench 77.89、IFEval 93.84、SWE-bench Verified 50.40。论文据此称其关闭了各领域约 91%–95% 的 student–teacher headroom。

MOPD 主实验结果页:与 Mix-RL、Cascade RL、离线微调和参数合并比较
MOPD 论文主结果:多领域能力整合

但必须注意:这里的 “multi-teacher” 主要是多个领域教师 + 已知领域路由。每个 prompt 通常只查询一个 teacher,并不是多个 teacher 在同一个状态上共同决策。

#2.5 阶段五:从静态领域路由走向动态教师联合(2026 年 5–8 月)

#Uni-OPD:让 outcome 校准 token-level teacher signal

Uni-OPD(arXiv:2605.03677)覆盖文本 math/code 和多模态 math/logic/document,共 5 个能力域、16 个 benchmark。它发现:teacher 的逐 token log-ratio 与最终 correctness 可能不一致,于是:

  • 对 student rollout 做 correct/incorrect online filtering;
  • 用 outcome-guided margin 校准 trajectory-level OPD return;
  • 避免“最终答错的轨迹反而得到更高蒸馏回报”。

它仍是按任务路由专门 teacher,但开始显式处理“teacher token signal 不一定等价于任务收益”。

Uni-OPD 总览与性能对比:用 outcome 信息校准 OPD
Uni-OPD:dual-perspective、outcome-calibrated OPD

#CaMOPD:general recovery 与 domain preservation 会互相打架

CaMOPD(arXiv:2605.27115)研究一个现实问题:垂直领域模型想恢复通用能力,又不能破坏已有专业行为。

它观察到 general teacher 与 domain teacher 的更新长期出现负梯度点积,即两个目标互相 counteract。它用:

  • general recovery / domain review 两分支交替更新;
  • 根据 teacher–student log-prob gap 做样本选择;
  • 周期性回看 domain prompts;

来降低冲突。

CaMOPD:通用能力恢复与领域保持之间的梯度冲突及训练设计
CaMOPD Figure 1:counteraction-aware training

#MAD-OPD:让多个 teacher 先 debate,再监督 student

MAD-OPD(arXiv:2605.01347)不直接平均多个 teacher 的 token distribution,而是让 teacher agents 先讨论 student 当前状态,再按置信度聚合监督。

它的重要经验是:朴素多教师平均会产生 gradient conflict。在代码任务中,不同 teacher 偏好的完整程序路径可能互斥,逐 token 平均甚至会弱于单教师 OPD。MAD-OPD 在六组 teacher–student 配置中整体平均领先,并报告 4B student 在 LiveCodeBench v6 上超过 14B teacher。

代价也很明显:teacher debate 比单次 prefill 路由昂贵得多。

#Teacher-Union OPD:不只融合现有教师,还主动制造互补教师

Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold(arXiv:2607.27770)把问题推进了一步:随机训练出的多个 teacher 未必真互补,因此先 expand,再 compress

  1. Residual GRPO:第一位 teacher 训练后,找出 teacher union 仍不会的样本;下一位 teacher 专门训练这些 residual samples;连续构造互补教师。
  2. Reliability-Gated Teacher-Union OPD:对同一个 example 判断哪些 teacher 可靠,再按 per-example quality 加权其 sampled-token OPD loss。
  3. Consensus-Residual Decomposition:除了共同偏好,还保留 winner teacher 相对其他可靠教师的额外 top-k residual,避免 specialist signal 被平均掉。
Teacher-Union OPD 的 expand-then-compress 框架
Teacher-Union OPD:先扩展互补教师解流形,再压缩进单个 student

在 Qwen3-1.7B 上,最终 student 相对最强单 teacher 报告:数学相对提升 2.0%,代码 8.3%,instruction following 6.9%。这是当前“student 能否越过最佳单 teacher”最有力的公开证据之一。

Teacher-Union OPD 主结果:student 在数学、代码和指令遵循上超过最强单教师
Teacher-Union OPD 主实验结果

这条演化链可以概括为:

领域标签路由
  → 用 outcome 校准 teacher signal
  → 显式处理跨域梯度冲突
  → 多教师 debate / 动态聚合
  → 主动构造互补 teacher union,并按样本可靠性压缩

#3. 当前大家刷什么 benchmark?

目前没有统一的“MOPD benchmark”。大家仍然使用各能力域已有榜单,并额外比较能力整合后的平均分或 teacher headroom closure。

#3.1 数学推理

高频 benchmark:

  • AIME 2024 / 2025 / 2026;
  • HMMT Feb./Nov. 不同年份;
  • AMC23;
  • 多模态数学:MathVision、DynaMath、WeMath。

注意论文可能报告:

  • greedy / pass@1;
  • Avg.@N:N 次采样的平均正确率;
  • Pass@N:N 次中至少一次正确的 oracle 成功率。

三者不能直接横比。例如 AIME avg@32 和 pass@8 衡量的不是同一件事。

#3.2 代码与软件工程

常见层级:

  • 函数级生成:HumanEval+、MBPP+;
  • 竞赛代码:LiveCodeBench v5/v6;
  • repository-level agent:SWE-bench Verified;
  • 完整 agentic coding 系统还会使用 Terminal-Bench、Web/GUI benchmark。

SWE-bench 和 HumanEval 的环境成本、trajectory length、工具调用完全不同,不能把百分比简单平均后宣称整体代码 SOTA。

#3.3 指令遵循与通用能力

常见 benchmark:

  • IFBench;
  • IFEval;
  • Arena-Hard v2;
  • LiveBench;
  • ZebraLogic。

MOPD 主论文把 IFBench/IFEval 作为一个独立 teacher domain;CaMOPD 则用它们衡量垂直模型恢复通用能力时是否发生退化。

#3.4 科学、医疗、多模态与 Agent

  • 科学推理:GPQA-Diamond;
  • 医疗:MedQA-USMLE、MedXpertQA;
  • 多模态逻辑:LogicVista、VisuLogic;
  • 文档理解:AI2D、ChartQA、DocVQA、InfoVQA;
  • GUI:OSWorld、MobileWorld;
  • 多语言 ASR:各语言 CER/WER;
  • 长时程 planning:部分工作使用自建合成环境,而不是统一公开套件。

现状判断:数学、代码、IF 的 benchmark 最成熟;真正面向长轨迹 Agent 的标准化 MOPD 评测仍很薄弱。


#4. 代表性实验 settings

下表只填写论文明确报告的设置;未报告的温度或 rollout 数不猜测。

工作Student / Teachers数据与能力域Student rolloutBatch 与长度Teacher signal / loss
MOPD 2606.30406Qwen3-30B-A3B;同源 Math/IF/SWE RL teachersBigMath/ORZ、IFBench recipe、R2E-Gym-LiteN=1 / prompt2048 prompts;Math:IF:SWE=0.35:0.35:0.30;Math/IF 32K,SWE 65K、最多 50 turnssampled-token log-ratio advantage,或 bias-corrected teacher top-k(默认 k=64);reverse-KL 风格
Uni-OPD 2605.03677Qwen3-4B Math/Code teachers;Qwen3-VL-4B 的 Math/Logic/Document teachersDeepMath 57K、Eurus Code 25.3K,多模态各约 14.xKN=16 / prompt64 prompts,即 1024 trajectories;prompt 2K、response 16Kreverse-KL OPD + correctness filtering + outcome margin calibration;T=1.0、top-p=.95、top-k=50
CaMOPD 2605.27115general teacher + role-play/medical domain teacher通用 recovery 10K;领域 review 10KN=1 / prompt512 prompts,120 steps;general:domain=3:1;prompt 4K、rollout 32Ksampled-token OPD;两分支交替更新;gap-based sample selection
Teacher-Union 2607.27770Qwen3-1.7B/4B;每域 4 个 Residual-GRPO teachersSkywork-OR1-RL-Data、IFBench trainStudent OPD 的 N 未明确报告global BS=32,1 epoch,32K;LR=2e-6reliable teachers quality-weighted reverse-KL;winner top-k residual,k=8,λ=.05;teacher-weight temperature=.25

#4.1 两种主流 OPD 实现

MOPD 论文把目标写成 student state 上的逐 token reverse KL。工程上主要有两种实现。

A. Sampled-token / policy-gradient 式

student 只对自己实际采样的 token 计算:

advantage_t = log p_teacher(y_t | prefix) - log p_student(y_t | prefix)

teacher 比 student 更喜欢这个 token,advantage 为正;反之为负。然后复用 PPO/GRPO trainer 更新,但这不等于同时优化 task-reward GRPO。

优点:通信量小,只需 sampled-token log-prob。缺点:只观察被 student 采样到的动作,对未采样但重要的替代动作监督弱。

B. Teacher top-k logits 式

teacher 每个位置返回 top-k token 分布,student 对更完整的局部 support 做蒸馏。

优点:监督更丰富。缺点:网络和存储成本更高,并且 top-k 可能遗漏低概率但决策关键的 token。

#4.2 当前主流不是“OPD loss + RL loss 同时混合”

常见 pipeline 是:

先用 GRPO / RLVR 把各领域 teacher 训练强
→ 再冻结 teachers
→ student 阶段主要做 OPD

Uni-OPD 使用 outcome reward 做筛选和 margin 校准,但并不是简单的:

L = L_OPD + β L_GRPO

因此复现时必须区分:

  • RL 是用于制造 teachers
  • reward 是用于校准 teacher signal
  • 还是 student 真正在同时优化一个独立 task-reward objective。

#5. 目前到底做到了什么份上?

不能给一个统一“SOTA”,更适合分赛道判断。

#5.1 最干净的多领域整合证据:MOPD 2606.30406

它在相同 student 起点、相同 domain teachers 下系统比较 Mix-RL、Cascade RL、离线微调和参数合并,normalized integration score 为 0.9373,优于最强基线 Mix-RL 的 0.8818。

这支持:

同源的多个 RL specialists,确实可以通过 student-on-policy dense supervision 整合回统一模型,而且比直接混合 RL 更少互相干扰。

但实验只有三个明确领域,而且 domain router 是已知的。

#5.2 最强的“超过最佳单教师”证据:Teacher-Union OPD

它不满足于复现 teacher envelope,而是主动训练互补教师,最终 student 在数学、代码和 IF 上同时超过最强单 teacher。

这说明 student 不一定只能模仿某一个老师;如果多位 teacher 覆盖不同成功路径,student 有可能压缩其 union。

但目前主要是 1.7B/4B Qwen3 设置,结论能否稳定扩展到 30B/100B、长轨迹 Agent 和真正异构 teacher 还不知道。

#5.3 生产级系统:可行,但归因不干净

Nemotron-Cascade 2、GLM-5、KAT-Coder-V2、MiMo-V2-Flash 等表明 MOPD/多阶段 OPD 已进入大型后训练 pipeline。它们的完整系统成绩很强,但 MOPD 的独立贡献通常缺少同预算、同数据的完整消融。

#5.4 当前能确信的边界

已经较可信:

  • 同源 teacher;
  • 共享 tokenizer/vocabulary;
  • 领域标签已知;
  • 白盒 teacher log-prob 可取;
  • 能力域数量有限;
  • student 容量不明显小于 teacher 能力并集。

尚未证明:

  • 任意异构、闭源、不同 tokenizer 的多个 frontier teachers 可稳定融合;
  • learned router 能在开放域 prompt 和长轨迹中可靠切换;
  • teacher 数量增长后仍有正的质量—成本收益;
  • student 能无损保存所有 teacher 的 Pareto front;
  • 提升能在时间后移、私有、去污染的 Agent 环境中复现。

#6. 当前最关键的问题

#6.1 Teacher routing:不只是“这题属于哪个领域”

MOPD 主论文使用 prompt/domain 路由,适合数学、IF、SWE 这种边界清晰的数据。但一条真实 Agent 轨迹可能依次需要:

理解用户意图 → 制定计划 → 搜索 → 读页面 → 写代码 → 调工具 → 检查结果

整条轨迹固定一个 teacher 很粗糙;逐 token 切 teacher 又可能破坏全局计划,而且成本近似随 teacher 数量增长。

更合理的粒度可能是事件/决策阶段

  • plan teacher;
  • tool-selection teacher;
  • argument-filling teacher;
  • observation-understanding teacher;
  • final-response teacher。

真正的 router 不应只问“谁最自信”,而应问:

哪位 teacher 在当前状态上既更可能正确,又更可能被这个 student 学会,并且查询成本值得?

#6.2 教师更强,不等于更可教

MOPD 论文用更强但异源的 Qwen3-235B-A22B 替换同源数学 teacher 时,初始 teacher–student KL 明显增大;policy-gradient 版本性能下降,top-k 版本甚至训练崩溃。

这说明有效迁移大致取决于:

teacher quality × state overlap × student teachability − gradient conflict

同源 teacher 稳定,恰恰说明当前方法还没有解决任意模型之间的 policy-support mismatch。

#6.3 多教师“分数互补”不等于“策略可组合”

Math teacher 数学榜高、Code teacher 代码榜高,只能说明任务级互补。还需要区分:

  • coverage complementarity:会做的题不同;
  • error complementarity:错误相关性低;
  • trajectory complementarity:推理路径覆盖不同;
  • calibration complementarity:各自在擅长处知道自己可靠;
  • gradient complementarity:更新方向可以兼容;
  • capacity compatibility:student 装得下能力并集。

MAD-OPD 已经观察到:两个 teacher 偏好的完整代码路径可能都正确,但逐 token 混合后得到一条谁都不会写的“拼接路径”。所以多教师平均不是天然的能力并集。

#6.4 Confidence 不等于 correctness

不同 teacher 的 raw entropy / logit scale 不可直接比较:

  • RL 后的模型可能分布更尖锐;
  • 短答案 teacher 天然低熵;
  • 多路径 reasoning teacher 可能保持较高熵;
  • 过度自信也可能来自 reward hacking 或 mode collapse。

因此按最大概率或 entropy 选 teacher,会偏向“更自信的模型”,不一定是“更正确的模型”。需要 outcome calibration、selective risk、abstention 和 per-domain temperature calibration。

#6.5 Top-k 概率质量高,不代表行为决策被保留

When Top-K Misses the Decision(arXiv:2607.07050)给出了非常具体的工具调用反例:

  • response teacher 的 top-32 覆盖约 99.99% 概率质量;
  • 但决定是否进入 <tool_call> 模式的关键 token,在审计 prompt 中只有 0.4% 落入 top-32;
  • 只修复首位置时,错误调用只是迁移到后续位置;
  • 恢复所有位置的 decision support 才显著降低 over-calling,但会牺牲真正需要工具时的 recall。
Top-k 遗漏决策关键 token:高概率质量覆盖并不等于保留工具调用边界
Top-k decision drift:mass coverage 与 behavior support 不等价

关键启示是:

MOPD 中最危险的 token 可能不是 teacher 高概率 token,而是 student 高概率、teacher 低概率、但决定行为模式的 token

所以应使用 teacher/student support union,并显式保留 tool entry、EOS、refusal、JSON entry、final-answer marker 等 decision-critical tokens。

#6.6 Tokenizer / vocabulary mismatch

严格 token-level KL 默认 teacher 和 student 共享 token support。不同 tokenizer 时:

  • 一个 student token 对应 teacher 多个 subword;
  • position 不对齐;
  • Unicode、空格、代码、JSON、tool special tokens 尤其麻烦;
  • 字符串映射无法保持概率守恒。

ULD、FuseChat、CoT2Align、InfiFusion 等研究了 optimal transport 或统计 token alignment,但主要证据来自离线固定文本。它们能否在长序列 student-on-policy state 上稳定工作,仍缺乏充分验证。

更值得探索的是 byte/span-level 共同支持空间、segment probability、显式 semantic action ontology,或先蒸馏 latent action/state 再由 student tokenizer 解码。

#6.7 白盒 logits 与真实成本

当前最强 MOPD 基本要求:

  • 任意 student prefix 可送入 teacher;
  • teacher 返回 sampled-token log-prob 或 top-k logits;
  • teacher 版本和 tokenizer 可固定;
  • 能部署多个 teacher prefill service。

论文称异步 prefill 可以和 student sampling 重叠,使 wall-clock 增量很小。但这不等于 teacher 免费:FLOPs、显存、能耗、网络传输、模型服务和各领域 RL teacher 的训练成本都存在。

尤其同一状态同时查询 M 个 teacher 时,成本从“路由到一个 teacher”变成近似 O(MT)。未来必须报告:teacher creation FLOPs、distillation prefill FLOPs、accelerator-hours、网络流量,以及等总预算下与 Mix-RL、离线 KD、parameter merge 的比较。

#6.8 On-policy state 也可能放大风险

On-policy 的优势是纠正 student 真正访问的状态,但也有四个问题:

  1. bad-state extrapolation:student 产生奇怪 prefix,teacher 在该 OOD 状态也未必可靠;
  2. support collapse:student 从未探索到的成功路径,teacher 仅打分也教不过来;
  3. long-horizon compounding:早期 action 错误改变后续整个 occupancy;
  4. moving target:student 更新后状态分布变化,旧 feedback 很快 off-policy。

这说明平均 token KL 不是长轨迹 Agent 的充分目标。更应关注 decision point、state repairability、trajectory regret 和环境终局收益。

#6.9 Benchmark contamination 会被多教师放大

任意一个 teacher 见过测试题,student 都可能继承;按公开 benchmark 选择“最强 teacher”本身也相当于在测试集上做模型选择。多教师还增加了:

  • 污染来源数量;
  • router 记忆 benchmark 模板的可能;
  • oracle best-teacher envelope 的 multiple-comparisons advantage;
  • 闭源 teacher 数据不可审计的问题。

因此需要时间后移 benchmark、私有 test set、程序重采样题、变量替换和全 teacher/router/student 分别审计。对于 Agent,最好使用新网站、新 API、新仓库 commit 和真实环境,而不是长期公开静态题库。


#7. 我认为最值得做的研究方向

#7.1 Teachability-aware routing

不要选择绝对最强 teacher,而要选当前最能教会 student 的 teacher:

routing score
= 预期正确性
− λ × teacher-student policy distance
− μ × 查询成本
− ν × 梯度冲突/不可修复风险

这与 learnability-aware OPD 很接近:teacher 的答案是否正确不是唯一标准,还要判断 student 当前处在 mastered、learnable boundary、repairable 还是 unrepairable state。

#7.2 Decision-aware sparse distillation

围绕 tool-call、EOS、refusal、代码结构、JSON schema 等行为边界选择 support,而不是机械取 teacher top-k。评价指标也应从 retained probability mass 改成:

  • decision-support recall;
  • action-mode confusion;
  • full-trajectory over-calling / under-calling;
  • recovery after wrong branch。

#7.3 Hierarchical Agent MOPD

把 token-level teacher routing 提升到 agent abstraction:

任务层:选择领域 teacher 集合
  ↓
阶段层:planning / acting / observing / checking
  ↓
关键决策点:必要时查询多个 teacher 或 verifier
  ↓
普通语言 token:不做昂贵多教师仲裁

这比每 token 多教师打分更符合长轨迹 credit assignment,也更节省成本。

#7.4 Model-based MOPD:在分支状态上比较老师,而不只看一条真实轨迹

当前 MOPD 只在 student 已走到的 prefix 上让 teacher 打分。如果引入 world model / environment snapshot,可以在关键状态分支:

  • student action;
  • teacher A action;
  • teacher B action;

并比较各自未来可达结果。此时 router 学的不是 token confidence,而是近似 counterfactual value。

对 code agent,可以保存 repository + terminal snapshot,从同一状态 fork 多个策略分支,并用 tests / verifier 判定哪条更新真正提高成功率。这才是 MOPD 与 model-based RL 最自然的结合点;当前 MOPD 本身还不能称为 model-based RL。

#7.5 Latent / decision-sufficient distillation

多个 teacher 的表面 CoT、代码风格和 tokenizer 可能不同,但它们真正共享的可能是:

  • 当前子目标;
  • 对环境状态的判断;
  • 下一类动作;
  • 哪些约束仍未满足;
  • 当前轨迹是否可修复。

因此可以不强行逐 token 对齐,而蒸馏一个 decision-sufficient latent state。这既可能降低 cross-tokenizer mismatch,也更适合长轨迹 Agent 的状态压缩和潜空间推理。

#7.6 Teacher–Student capacity scaling law

需要系统研究:

教师数量 × 教师互补度 × policy KL × 学生参数量 × 梯度冲突
→ 最终可保留能力比例

没有这类 scaling law,“不断增加教师”只是经验堆叠。最终问题是:一个固定容量 student 到底能装下多少互补策略,以及什么时候应该使用 modular/MoE policy,而不是强行压进一个 dense model。


#8. 如果要复现,建议采用什么基线与报告规范?

#8.1 最小可复现实验

建议先用同源、同 tokenizer 设置:

  • base/student:Qwen3-1.7B 或 4B;
  • 两个能力域:Math + Code;
  • teachers:从同一 SFT checkpoint 分别做小规模 GRPO;
  • distillation prompts:严格与测试集隔离;
  • 对比:

- Mix-RL;

- Cascade RL;

- 离线 teacher trace SFT;

- 单教师 OPD;

- 静态 domain-routed MOPD;

- 同样本 teacher averaging;

- reliability-gated teacher union。

#8.2 必须记录的 settings

  • prompt batch size;
  • 每 prompt 的 student rollout N;
  • trajectory batch = prompt batch × N;
  • student rollout temperature / top-p / top-k;
  • teacher weighting temperature;
  • max prompt、max response、agent max turns;
  • sampled-token、full-vocab 还是 teacher top-k;
  • divergence 类型;
  • teacher selection 粒度;
  • teacher 与 student 是否同源、同 tokenizer;
  • teacher creation 和 distillation 的独立算力成本;
  • Avg.@N、Pass@N、pass@1 的明确定义。

#8.3 必须做的消融

  • oracle router / learned router / random router;
  • strongest single teacher;
  • teacher ensemble inference 上界;
  • same-origin vs heterogeneous teacher;
  • teacher 数量扩展曲线;
  • top-k 大小与 decision-support recall;
  • 学生容量;
  • per-domain regression,而不是只有宏平均;
  • 时间后移或私有 benchmark;
  • rollout temperature 与部署 decoding mismatch;
  • 完整 wall-clock + FLOPs 成本。

#9. 代表工作速查表

时间工作关键进展
2023-06MiniLLM,2306.08543reverse-KL on-policy LLM distillation
2023-06 / ICLR 2024GKD,2306.13649student-generated states 上的统一 KD 框架
2024-01FuseLLM / Knowledge Fusion,2401.10491多异构 LLM 能力融合,主要仍是离线
2024-02DistiLLM,2402.03898adaptive off-policy 降低 OPD 成本
2025-05Qwen3,2505.09388reasoning 模型生产级 strong-to-weak OPD
2026-02Baichuan-M3,2602.06570明确使用 multi-teacher online policy distillation
2026-02GLM-5,2602.15763多训练阶段 checkpoint teacher 能力恢复
2026-03Nemotron-Cascade 2,2603.19220Cascade RL + multi-domain OPD
2026-03KAT-Coder-V2,2603.27703五类 agentic coding 专家 specialize-then-unify
2026-05MAD-OPD,2605.01347多教师 debate 与 confidence aggregation
2026-05Uni-OPD,2605.03677outcome-calibrated multi-domain OPD
2026-05CaMOPD,2605.27115处理 general recovery 与 domain preservation 冲突
2026-06MOPD,2606.30406正式系统化多领域 capability integration
2026-07Top-K Decision Drift,2607.07050揭示 top-k 遗漏低概率决策关键 token
2026-07Teacher-Union OPD,2607.27770主动构造互补 teacher union,student 超越最佳单 teacher
2026-08LS-MOPD,2608.03610扩展到多语言 LLM-ASR

#10. 最终判断

MOPD 的历史意义可能不在“又一种蒸馏 loss”,而在它改变了后训练的组织方式:

过去:所有能力一次性混合训练,希望一个 objective 自己协调
现在:各能力独立专门化,再把局部最优策略整合回来

这对复杂 LLM Agent 尤其有吸引力,因为不同 agent 能力需要完全不同的环境、reward 和 rollout infrastructure。

但截至 2026 年 8 月,它仍是一个条件依赖很强的能力整合框架

  • 静态领域路由相对成熟;
  • 同样本 teacher union 刚开始;
  • 异构黑盒 teacher、跨 tokenizer、长时程环境和自动 router 仍未解决;
  • 多教师带来的收益尚缺少统一 benchmark 和等成本比较;
  • benchmark contamination 与行为边界漂移是容易被平均分掩盖的风险。

所以最值得追的下一步不是简单地“加更多 teacher”,而是:

teachability-aware、decision-aware、cost-aware、contamination-aware 的动态多教师蒸馏,并在可分支、可验证的长轨迹 Agent 环境中学习真正的 latent task state 和 counterfactual teacher value。


#参考论文

  1. Gu et al. MiniLLM: Knowledge Distillation of Large Language Models. arXiv:2306.08543.

https://arxiv.org/abs/2306.08543

  1. Agarwal et al. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes. arXiv:2306.13649.

https://arxiv.org/abs/2306.13649

  1. Ko et al. DistiLLM: Towards Streamlined Distillation for Large Language Models. arXiv:2402.03898.

https://arxiv.org/abs/2402.03898

  1. Wan et al. Knowledge Fusion of Large Language Models. arXiv:2401.10491.

https://arxiv.org/abs/2401.10491

  1. Qwen Team. Qwen3 Technical Report. arXiv:2505.09388.

https://arxiv.org/abs/2505.09388

  1. Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making. arXiv:2602.06570.

https://arxiv.org/abs/2602.06570

  1. GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763.

https://arxiv.org/abs/2602.15763

  1. Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation. arXiv:2603.19220.

https://arxiv.org/abs/2603.19220

  1. KAT-Coder-V2 Technical Report. arXiv:2603.27703.

https://arxiv.org/abs/2603.27703

  1. MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate. arXiv:2605.01347.

https://arxiv.org/abs/2605.01347

  1. Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe. arXiv:2605.03677.

https://arxiv.org/abs/2605.03677

  1. Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation. arXiv:2605.27115.

https://arxiv.org/abs/2605.27115

  1. MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training. arXiv:2606.30406.

https://arxiv.org/abs/2606.30406

  1. When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation. arXiv:2607.07050.

https://arxiv.org/abs/2607.07050

  1. Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold. arXiv:2607.27770.

https://arxiv.org/abs/2607.27770

  1. Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR. arXiv:2608.03610.

https://arxiv.org/abs/2608.03610