#MOPD(Multi-Teacher On-Policy Distillation)进展综述
一句话核心结论:截至 2026 年 8 月,MOPD 已经证明:在教师同源、tokenizer 一致、领域标签已知、学生容量足够时,可以把多个经过 RL 的 specialist 的大部分能力重新装回一个 generalist;但它还远没有解决“任意多个强模型自动融合成更强模型”。真正的难点已经从“怎么做 token-level 蒸馏”转移到:当前状态该听谁、谁真的可靠、多个教师的能力是否可兼容、学生是否装得下,以及如何控制成本和行为漂移。
#0. 先消歧:这里的 MOPD 到底是什么?
本文所称 MOPD 指:
Multi-Teacher On-Policy Distillation,多教师在策略蒸馏。
它的典型过程是:
- student 对 prompt 自己生成 rollout;
- 把 student 已经走到的 prefix/state 发给一个或多个 teacher;
- teacher 在这些 student-visited states 上给出 token log-prob、top-k logits 或其他策略监督;
- student 学习 teacher 在这些状态上的动作偏好。
最直白的理解是:
不是让学生背老师写好的标准答案,而是让学生先自己做;做到哪一步,就让合适的老师在那一步批改。
这里有三个容易混淆的概念:
- Multi-Teacher OPD:有多个独立 teacher policies,是本文主题。
- Multi-Rollout OPD:同一个 student/teacher 对每题采多条 rollout,用成功与失败轨迹互相提供信息;“multi”指轨迹数,不指教师数。
- 离线多教师 KD / SFT:多个教师预先生成答案或 logits,再让 student 在固定数据上学习;它不是严格的 on-policy distillation。
另外,MOPD 也不是跨领域早已统一的缩写。2026 年 Baichuan-M3 使用过 Multi-Teacher Online Policy Distillation,而标题为 MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training 的论文(arXiv:2606.30406)才把这一 LLM 后训练范式系统化。下文统一用“多教师在策略蒸馏”。
#1. 为什么需要 MOPD?
#1.1 单教师离线蒸馏的问题:老师走的路,不是学生会走的路
传统 sequence KD / CoT SFT 通常让强 teacher 先生成一条轨迹,然后 student 学这条轨迹:
teacher 生成标准解法 → 固定为训练数据 → student 模仿
问题是,推理时 student 一旦在中间生成了不同 token,就进入 teacher 数据里没有出现过的状态。后面即使每一步只偏一点,误差也会滚雪球。这就是自回归生成中的 state-distribution mismatch / exposure bias。
单教师 OPD(以 MiniLLM、GKD 为代表)把流程改成:
student 自己生成 → teacher 在 student prefix 上重新判断 → 逐 token 纠偏
因此它更像驾校教练坐在副驾:不是只给你看高手录像,而是在你真的开错到某个路口时告诉你该怎么办。
#1.2 单教师 OPD 的问题:一个老师不可能什么都最强
现代 LLM 后训练往往面对多个能力域:
- 数学 reasoning;
- 代码生成与 repository-level SWE;
- instruction following;
- tool use / GUI / Web agent;
- 医疗、法律等垂直领域;
- 多模态 grounding 和抽象推理。
把所有数据和 reward 混在一次 RL 里,会遇到:
- 不同 domain 的 reward scale 不一致;
- rollout 长度、环境和 sandbox 不一致;
- 梯度冲突;
- 后训练阶段互相遗忘;
- 每改一个领域就要重新协调整套联合训练。
于是 2026 年逐渐形成了 specialize-then-unify 路线:
- 从同一个 general SFT checkpoint 出发;
- 各领域独立做 RL,得到 Math Teacher、Code Teacher、IF Teacher……;
- 再通过 MOPD 把这些 specialist 装回一个 student。

这时 teacher 和 student 甚至可以同架构、同参数量。目标不再只是“用大模型压小模型”,而是:
把多个局部最优策略整合成一个可部署的统一策略。
#2. 发展脉络:从单教师 OPD 到 Teacher Union
#2.1 阶段一:单教师 on-policy distillation 奠基(2023–2024)
#MiniLLM(arXiv:2306.08543)
之前的问题:传统 forward-KL KD 容易覆盖 teacher 的大量模式,却未必让 student 在自身生成分布上稳定;固定 teacher 数据还带来 exposure mismatch。
解决方法:student 从自身 policy 采样;teacher 在 student prefix 上提供分布;使用更 mode-seeking 的 reverse KL。
留下的新问题:仍然假设一个 teacher 在所有状态和任务上都值得模仿,而且白盒 teacher scoring 成本较高。
#GKD(arXiv:2306.13649,ICLR 2024)
之前的问题:蒸馏和 RLHF 的数据分布、散度选择缺少统一框架。
解决方法:Generalized Knowledge Distillation 支持 teacher-generated 与 student-generated 序列混合,并允许 forward KL、reverse KL、JSD 等目标。
推动下一阶段:确立了后续 MOPD 的核心操作:student samples, teacher scores。
#DistiLLM(arXiv:2402.03898)
它通过 skew KL 和 adaptive off-policy replay 减少纯 on-policy KD 的成本,说明该方向从一开始就面临“监督更贴近 student,但 teacher 在线计算太贵”的矛盾。
#2.2 阶段二:多模型能力融合,但主要仍是离线(2024–2025)
Knowledge Fusion / FuseLLM(arXiv:2401.10491)、FuseChat(arXiv:2408.07990)、InfiFusion 等工作尝试对齐不同模型的 token 分布、生成数据或参数,把多个模型的知识融合进一个 target。
它们解决了“多个 source models 能否提供互补知识”,但主要仍依赖固定文本、token alignment 或 parameter merging。student 推理时真正走到的异常状态没有被 teacher 交互式纠正。
与此同时,Qwen3 Technical Report(arXiv:2505.09388)把 strong-to-weak OPD 带入主流 reasoning 模型训练:student 在 think/no-think 模式下生成,再与 32B 或 235B teacher logits 对齐。它还是以单 teacher 为主,但证明 OPD 可以进入工业后训练管线。
#2.3 阶段三:多个领域专家“先专门化,再统一”(2026 年初)
这一阶段的重要变化是:多教师不一定来自外部大模型,而是来自同一个 base/SFT checkpoint 的不同 RL 分支。
代表系统包括:
- Baichuan-M3(arXiv:2602.06570):明确使用 Multi-Teacher Online Policy Distillation,面向临床子能力统一;
- GLM-5(arXiv:2602.15763):用前序 Reasoning RL、General RL checkpoint 作为教师恢复能力;
- Nemotron-Cascade 2(arXiv:2603.19220):Cascade RL + multi-domain OPD,恢复后续阶段退化的领域;
- KAT-Coder-V2(arXiv:2603.27703):将 SWE、WebCoding、Terminal、WebSearch、General 五类 agentic coding 专家统一。
这些系统给出了很强的整体 benchmark 成绩,但通常无法把提升单独归因于 MOPD:基础模型、SFT、RL、数据、工具和蒸馏共同作用。因此它们是生产级可行性证据,不是最干净的算法消融。
#2.4 阶段四:MOPD 被正式系统化(2026 年 6 月)
MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training(arXiv:2606.30406)提供了目前最标准的受控设置:
- base/student:Qwen3-30B-A3B;
- teachers:从同一 SFT checkpoint 出发,分别做 Math RL、Instruction Following RL、SWE RL;
- student 在混合 prompt 上自己 rollout;
- 根据 prompt domain 路由到对应 teacher;
- teacher 对 student prefix prefill,返回 sampled-token log-prob 或 top-k logits;
- student 做 dense reverse-KL 风格更新。
主结果如下:
| 方法 | 归一化能力整合分数 |
|---|---|
| Cascade RL | 0.7752 |
| Off-Policy Finetune | 0.8241 |
| Parameter Merge(Task Arithmetic) | 0.8574 |
| Mix-RL | 0.8818 |
| MOPD | 0.9373 |
| 各领域 RL teacher envelope | 1.0000 |
MOPD 的具体结果包括:AIME25 51.46、AIME26 65.31、IFBench 77.89、IFEval 93.84、SWE-bench Verified 50.40。论文据此称其关闭了各领域约 91%–95% 的 student–teacher headroom。

但必须注意:这里的 “multi-teacher” 主要是多个领域教师 + 已知领域路由。每个 prompt 通常只查询一个 teacher,并不是多个 teacher 在同一个状态上共同决策。
#2.5 阶段五:从静态领域路由走向动态教师联合(2026 年 5–8 月)
#Uni-OPD:让 outcome 校准 token-level teacher signal
Uni-OPD(arXiv:2605.03677)覆盖文本 math/code 和多模态 math/logic/document,共 5 个能力域、16 个 benchmark。它发现:teacher 的逐 token log-ratio 与最终 correctness 可能不一致,于是:
- 对 student rollout 做 correct/incorrect online filtering;
- 用 outcome-guided margin 校准 trajectory-level OPD return;
- 避免“最终答错的轨迹反而得到更高蒸馏回报”。
它仍是按任务路由专门 teacher,但开始显式处理“teacher token signal 不一定等价于任务收益”。

#CaMOPD:general recovery 与 domain preservation 会互相打架
CaMOPD(arXiv:2605.27115)研究一个现实问题:垂直领域模型想恢复通用能力,又不能破坏已有专业行为。
它观察到 general teacher 与 domain teacher 的更新长期出现负梯度点积,即两个目标互相 counteract。它用:
- general recovery / domain review 两分支交替更新;
- 根据 teacher–student log-prob gap 做样本选择;
- 周期性回看 domain prompts;
来降低冲突。

#MAD-OPD:让多个 teacher 先 debate,再监督 student
MAD-OPD(arXiv:2605.01347)不直接平均多个 teacher 的 token distribution,而是让 teacher agents 先讨论 student 当前状态,再按置信度聚合监督。
它的重要经验是:朴素多教师平均会产生 gradient conflict。在代码任务中,不同 teacher 偏好的完整程序路径可能互斥,逐 token 平均甚至会弱于单教师 OPD。MAD-OPD 在六组 teacher–student 配置中整体平均领先,并报告 4B student 在 LiveCodeBench v6 上超过 14B teacher。
代价也很明显:teacher debate 比单次 prefill 路由昂贵得多。
#Teacher-Union OPD:不只融合现有教师,还主动制造互补教师
Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold(arXiv:2607.27770)把问题推进了一步:随机训练出的多个 teacher 未必真互补,因此先 expand,再 compress。
- Residual GRPO:第一位 teacher 训练后,找出 teacher union 仍不会的样本;下一位 teacher 专门训练这些 residual samples;连续构造互补教师。
- Reliability-Gated Teacher-Union OPD:对同一个 example 判断哪些 teacher 可靠,再按 per-example quality 加权其 sampled-token OPD loss。
- Consensus-Residual Decomposition:除了共同偏好,还保留 winner teacher 相对其他可靠教师的额外 top-k residual,避免 specialist signal 被平均掉。

在 Qwen3-1.7B 上,最终 student 相对最强单 teacher 报告:数学相对提升 2.0%,代码 8.3%,instruction following 6.9%。这是当前“student 能否越过最佳单 teacher”最有力的公开证据之一。

这条演化链可以概括为:
领域标签路由
→ 用 outcome 校准 teacher signal
→ 显式处理跨域梯度冲突
→ 多教师 debate / 动态聚合
→ 主动构造互补 teacher union,并按样本可靠性压缩
#3. 当前大家刷什么 benchmark?
目前没有统一的“MOPD benchmark”。大家仍然使用各能力域已有榜单,并额外比较能力整合后的平均分或 teacher headroom closure。
#3.1 数学推理
高频 benchmark:
- AIME 2024 / 2025 / 2026;
- HMMT Feb./Nov. 不同年份;
- AMC23;
- 多模态数学:MathVision、DynaMath、WeMath。
注意论文可能报告:
- greedy / pass@1;
- Avg.@N:N 次采样的平均正确率;
- Pass@N:N 次中至少一次正确的 oracle 成功率。
三者不能直接横比。例如 AIME avg@32 和 pass@8 衡量的不是同一件事。
#3.2 代码与软件工程
常见层级:
- 函数级生成:HumanEval+、MBPP+;
- 竞赛代码:LiveCodeBench v5/v6;
- repository-level agent:SWE-bench Verified;
- 完整 agentic coding 系统还会使用 Terminal-Bench、Web/GUI benchmark。
SWE-bench 和 HumanEval 的环境成本、trajectory length、工具调用完全不同,不能把百分比简单平均后宣称整体代码 SOTA。
#3.3 指令遵循与通用能力
常见 benchmark:
- IFBench;
- IFEval;
- Arena-Hard v2;
- LiveBench;
- ZebraLogic。
MOPD 主论文把 IFBench/IFEval 作为一个独立 teacher domain;CaMOPD 则用它们衡量垂直模型恢复通用能力时是否发生退化。
#3.4 科学、医疗、多模态与 Agent
- 科学推理:GPQA-Diamond;
- 医疗:MedQA-USMLE、MedXpertQA;
- 多模态逻辑:LogicVista、VisuLogic;
- 文档理解:AI2D、ChartQA、DocVQA、InfoVQA;
- GUI:OSWorld、MobileWorld;
- 多语言 ASR:各语言 CER/WER;
- 长时程 planning:部分工作使用自建合成环境,而不是统一公开套件。
现状判断:数学、代码、IF 的 benchmark 最成熟;真正面向长轨迹 Agent 的标准化 MOPD 评测仍很薄弱。
#4. 代表性实验 settings
下表只填写论文明确报告的设置;未报告的温度或 rollout 数不猜测。
| 工作 | Student / Teachers | 数据与能力域 | Student rollout | Batch 与长度 | Teacher signal / loss |
|---|---|---|---|---|---|
| MOPD 2606.30406 | Qwen3-30B-A3B;同源 Math/IF/SWE RL teachers | BigMath/ORZ、IFBench recipe、R2E-Gym-Lite | N=1 / prompt | 2048 prompts;Math:IF:SWE=0.35:0.35:0.30;Math/IF 32K,SWE 65K、最多 50 turns | sampled-token log-ratio advantage,或 bias-corrected teacher top-k(默认 k=64);reverse-KL 风格 |
| Uni-OPD 2605.03677 | Qwen3-4B Math/Code teachers;Qwen3-VL-4B 的 Math/Logic/Document teachers | DeepMath 57K、Eurus Code 25.3K,多模态各约 14.xK | N=16 / prompt | 64 prompts,即 1024 trajectories;prompt 2K、response 16K | reverse-KL OPD + correctness filtering + outcome margin calibration;T=1.0、top-p=.95、top-k=50 |
| CaMOPD 2605.27115 | general teacher + role-play/medical domain teacher | 通用 recovery 10K;领域 review 10K | N=1 / prompt | 512 prompts,120 steps;general:domain=3:1;prompt 4K、rollout 32K | sampled-token OPD;两分支交替更新;gap-based sample selection |
| Teacher-Union 2607.27770 | Qwen3-1.7B/4B;每域 4 个 Residual-GRPO teachers | Skywork-OR1-RL-Data、IFBench train | Student OPD 的 N 未明确报告 | global BS=32,1 epoch,32K;LR=2e-6 | reliable teachers quality-weighted reverse-KL;winner top-k residual,k=8,λ=.05;teacher-weight temperature=.25 |
#4.1 两种主流 OPD 实现
MOPD 论文把目标写成 student state 上的逐 token reverse KL。工程上主要有两种实现。
A. Sampled-token / policy-gradient 式
student 只对自己实际采样的 token 计算:
advantage_t = log p_teacher(y_t | prefix) - log p_student(y_t | prefix)
teacher 比 student 更喜欢这个 token,advantage 为正;反之为负。然后复用 PPO/GRPO trainer 更新,但这不等于同时优化 task-reward GRPO。
优点:通信量小,只需 sampled-token log-prob。缺点:只观察被 student 采样到的动作,对未采样但重要的替代动作监督弱。
B. Teacher top-k logits 式
teacher 每个位置返回 top-k token 分布,student 对更完整的局部 support 做蒸馏。
优点:监督更丰富。缺点:网络和存储成本更高,并且 top-k 可能遗漏低概率但决策关键的 token。
#4.2 当前主流不是“OPD loss + RL loss 同时混合”
常见 pipeline 是:
先用 GRPO / RLVR 把各领域 teacher 训练强
→ 再冻结 teachers
→ student 阶段主要做 OPD
Uni-OPD 使用 outcome reward 做筛选和 margin 校准,但并不是简单的:
L = L_OPD + β L_GRPO
因此复现时必须区分:
- RL 是用于制造 teachers;
- reward 是用于校准 teacher signal;
- 还是 student 真正在同时优化一个独立 task-reward objective。
#5. 目前到底做到了什么份上?
不能给一个统一“SOTA”,更适合分赛道判断。
#5.1 最干净的多领域整合证据:MOPD 2606.30406
它在相同 student 起点、相同 domain teachers 下系统比较 Mix-RL、Cascade RL、离线微调和参数合并,normalized integration score 为 0.9373,优于最强基线 Mix-RL 的 0.8818。
这支持:
同源的多个 RL specialists,确实可以通过 student-on-policy dense supervision 整合回统一模型,而且比直接混合 RL 更少互相干扰。
但实验只有三个明确领域,而且 domain router 是已知的。
#5.2 最强的“超过最佳单教师”证据:Teacher-Union OPD
它不满足于复现 teacher envelope,而是主动训练互补教师,最终 student 在数学、代码和 IF 上同时超过最强单 teacher。
这说明 student 不一定只能模仿某一个老师;如果多位 teacher 覆盖不同成功路径,student 有可能压缩其 union。
但目前主要是 1.7B/4B Qwen3 设置,结论能否稳定扩展到 30B/100B、长轨迹 Agent 和真正异构 teacher 还不知道。
#5.3 生产级系统:可行,但归因不干净
Nemotron-Cascade 2、GLM-5、KAT-Coder-V2、MiMo-V2-Flash 等表明 MOPD/多阶段 OPD 已进入大型后训练 pipeline。它们的完整系统成绩很强,但 MOPD 的独立贡献通常缺少同预算、同数据的完整消融。
#5.4 当前能确信的边界
已经较可信:
- 同源 teacher;
- 共享 tokenizer/vocabulary;
- 领域标签已知;
- 白盒 teacher log-prob 可取;
- 能力域数量有限;
- student 容量不明显小于 teacher 能力并集。
尚未证明:
- 任意异构、闭源、不同 tokenizer 的多个 frontier teachers 可稳定融合;
- learned router 能在开放域 prompt 和长轨迹中可靠切换;
- teacher 数量增长后仍有正的质量—成本收益;
- student 能无损保存所有 teacher 的 Pareto front;
- 提升能在时间后移、私有、去污染的 Agent 环境中复现。
#6. 当前最关键的问题
#6.1 Teacher routing:不只是“这题属于哪个领域”
MOPD 主论文使用 prompt/domain 路由,适合数学、IF、SWE 这种边界清晰的数据。但一条真实 Agent 轨迹可能依次需要:
理解用户意图 → 制定计划 → 搜索 → 读页面 → 写代码 → 调工具 → 检查结果
整条轨迹固定一个 teacher 很粗糙;逐 token 切 teacher 又可能破坏全局计划,而且成本近似随 teacher 数量增长。
更合理的粒度可能是事件/决策阶段:
- plan teacher;
- tool-selection teacher;
- argument-filling teacher;
- observation-understanding teacher;
- final-response teacher。
真正的 router 不应只问“谁最自信”,而应问:
哪位 teacher 在当前状态上既更可能正确,又更可能被这个 student 学会,并且查询成本值得?
#6.2 教师更强,不等于更可教
MOPD 论文用更强但异源的 Qwen3-235B-A22B 替换同源数学 teacher 时,初始 teacher–student KL 明显增大;policy-gradient 版本性能下降,top-k 版本甚至训练崩溃。
这说明有效迁移大致取决于:
teacher quality × state overlap × student teachability − gradient conflict
同源 teacher 稳定,恰恰说明当前方法还没有解决任意模型之间的 policy-support mismatch。
#6.3 多教师“分数互补”不等于“策略可组合”
Math teacher 数学榜高、Code teacher 代码榜高,只能说明任务级互补。还需要区分:
- coverage complementarity:会做的题不同;
- error complementarity:错误相关性低;
- trajectory complementarity:推理路径覆盖不同;
- calibration complementarity:各自在擅长处知道自己可靠;
- gradient complementarity:更新方向可以兼容;
- capacity compatibility:student 装得下能力并集。
MAD-OPD 已经观察到:两个 teacher 偏好的完整代码路径可能都正确,但逐 token 混合后得到一条谁都不会写的“拼接路径”。所以多教师平均不是天然的能力并集。
#6.4 Confidence 不等于 correctness
不同 teacher 的 raw entropy / logit scale 不可直接比较:
- RL 后的模型可能分布更尖锐;
- 短答案 teacher 天然低熵;
- 多路径 reasoning teacher 可能保持较高熵;
- 过度自信也可能来自 reward hacking 或 mode collapse。
因此按最大概率或 entropy 选 teacher,会偏向“更自信的模型”,不一定是“更正确的模型”。需要 outcome calibration、selective risk、abstention 和 per-domain temperature calibration。
#6.5 Top-k 概率质量高,不代表行为决策被保留
When Top-K Misses the Decision(arXiv:2607.07050)给出了非常具体的工具调用反例:
- response teacher 的 top-32 覆盖约 99.99% 概率质量;
- 但决定是否进入
<tool_call>模式的关键 token,在审计 prompt 中只有 0.4% 落入 top-32; - 只修复首位置时,错误调用只是迁移到后续位置;
- 恢复所有位置的 decision support 才显著降低 over-calling,但会牺牲真正需要工具时的 recall。

关键启示是:
MOPD 中最危险的 token 可能不是 teacher 高概率 token,而是 student 高概率、teacher 低概率、但决定行为模式的 token。
所以应使用 teacher/student support union,并显式保留 tool entry、EOS、refusal、JSON entry、final-answer marker 等 decision-critical tokens。
#6.6 Tokenizer / vocabulary mismatch
严格 token-level KL 默认 teacher 和 student 共享 token support。不同 tokenizer 时:
- 一个 student token 对应 teacher 多个 subword;
- position 不对齐;
- Unicode、空格、代码、JSON、tool special tokens 尤其麻烦;
- 字符串映射无法保持概率守恒。
ULD、FuseChat、CoT2Align、InfiFusion 等研究了 optimal transport 或统计 token alignment,但主要证据来自离线固定文本。它们能否在长序列 student-on-policy state 上稳定工作,仍缺乏充分验证。
更值得探索的是 byte/span-level 共同支持空间、segment probability、显式 semantic action ontology,或先蒸馏 latent action/state 再由 student tokenizer 解码。
#6.7 白盒 logits 与真实成本
当前最强 MOPD 基本要求:
- 任意 student prefix 可送入 teacher;
- teacher 返回 sampled-token log-prob 或 top-k logits;
- teacher 版本和 tokenizer 可固定;
- 能部署多个 teacher prefill service。
论文称异步 prefill 可以和 student sampling 重叠,使 wall-clock 增量很小。但这不等于 teacher 免费:FLOPs、显存、能耗、网络传输、模型服务和各领域 RL teacher 的训练成本都存在。
尤其同一状态同时查询 M 个 teacher 时,成本从“路由到一个 teacher”变成近似 O(MT)。未来必须报告:teacher creation FLOPs、distillation prefill FLOPs、accelerator-hours、网络流量,以及等总预算下与 Mix-RL、离线 KD、parameter merge 的比较。
#6.8 On-policy state 也可能放大风险
On-policy 的优势是纠正 student 真正访问的状态,但也有四个问题:
- bad-state extrapolation:student 产生奇怪 prefix,teacher 在该 OOD 状态也未必可靠;
- support collapse:student 从未探索到的成功路径,teacher 仅打分也教不过来;
- long-horizon compounding:早期 action 错误改变后续整个 occupancy;
- moving target:student 更新后状态分布变化,旧 feedback 很快 off-policy。
这说明平均 token KL 不是长轨迹 Agent 的充分目标。更应关注 decision point、state repairability、trajectory regret 和环境终局收益。
#6.9 Benchmark contamination 会被多教师放大
任意一个 teacher 见过测试题,student 都可能继承;按公开 benchmark 选择“最强 teacher”本身也相当于在测试集上做模型选择。多教师还增加了:
- 污染来源数量;
- router 记忆 benchmark 模板的可能;
- oracle best-teacher envelope 的 multiple-comparisons advantage;
- 闭源 teacher 数据不可审计的问题。
因此需要时间后移 benchmark、私有 test set、程序重采样题、变量替换和全 teacher/router/student 分别审计。对于 Agent,最好使用新网站、新 API、新仓库 commit 和真实环境,而不是长期公开静态题库。
#7. 我认为最值得做的研究方向
#7.1 Teachability-aware routing
不要选择绝对最强 teacher,而要选当前最能教会 student 的 teacher:
routing score
= 预期正确性
− λ × teacher-student policy distance
− μ × 查询成本
− ν × 梯度冲突/不可修复风险
这与 learnability-aware OPD 很接近:teacher 的答案是否正确不是唯一标准,还要判断 student 当前处在 mastered、learnable boundary、repairable 还是 unrepairable state。
#7.2 Decision-aware sparse distillation
围绕 tool-call、EOS、refusal、代码结构、JSON schema 等行为边界选择 support,而不是机械取 teacher top-k。评价指标也应从 retained probability mass 改成:
- decision-support recall;
- action-mode confusion;
- full-trajectory over-calling / under-calling;
- recovery after wrong branch。
#7.3 Hierarchical Agent MOPD
把 token-level teacher routing 提升到 agent abstraction:
任务层:选择领域 teacher 集合
↓
阶段层:planning / acting / observing / checking
↓
关键决策点:必要时查询多个 teacher 或 verifier
↓
普通语言 token:不做昂贵多教师仲裁
这比每 token 多教师打分更符合长轨迹 credit assignment,也更节省成本。
#7.4 Model-based MOPD:在分支状态上比较老师,而不只看一条真实轨迹
当前 MOPD 只在 student 已走到的 prefix 上让 teacher 打分。如果引入 world model / environment snapshot,可以在关键状态分支:
- student action;
- teacher A action;
- teacher B action;
并比较各自未来可达结果。此时 router 学的不是 token confidence,而是近似 counterfactual value。
对 code agent,可以保存 repository + terminal snapshot,从同一状态 fork 多个策略分支,并用 tests / verifier 判定哪条更新真正提高成功率。这才是 MOPD 与 model-based RL 最自然的结合点;当前 MOPD 本身还不能称为 model-based RL。
#7.5 Latent / decision-sufficient distillation
多个 teacher 的表面 CoT、代码风格和 tokenizer 可能不同,但它们真正共享的可能是:
- 当前子目标;
- 对环境状态的判断;
- 下一类动作;
- 哪些约束仍未满足;
- 当前轨迹是否可修复。
因此可以不强行逐 token 对齐,而蒸馏一个 decision-sufficient latent state。这既可能降低 cross-tokenizer mismatch,也更适合长轨迹 Agent 的状态压缩和潜空间推理。
#7.6 Teacher–Student capacity scaling law
需要系统研究:
教师数量 × 教师互补度 × policy KL × 学生参数量 × 梯度冲突
→ 最终可保留能力比例
没有这类 scaling law,“不断增加教师”只是经验堆叠。最终问题是:一个固定容量 student 到底能装下多少互补策略,以及什么时候应该使用 modular/MoE policy,而不是强行压进一个 dense model。
#8. 如果要复现,建议采用什么基线与报告规范?
#8.1 最小可复现实验
建议先用同源、同 tokenizer 设置:
- base/student:Qwen3-1.7B 或 4B;
- 两个能力域:Math + Code;
- teachers:从同一 SFT checkpoint 分别做小规模 GRPO;
- distillation prompts:严格与测试集隔离;
- 对比:
- Mix-RL;
- Cascade RL;
- 离线 teacher trace SFT;
- 单教师 OPD;
- 静态 domain-routed MOPD;
- 同样本 teacher averaging;
- reliability-gated teacher union。
#8.2 必须记录的 settings
- prompt batch size;
- 每 prompt 的 student rollout N;
- trajectory batch = prompt batch × N;
- student rollout temperature / top-p / top-k;
- teacher weighting temperature;
- max prompt、max response、agent max turns;
- sampled-token、full-vocab 还是 teacher top-k;
- divergence 类型;
- teacher selection 粒度;
- teacher 与 student 是否同源、同 tokenizer;
- teacher creation 和 distillation 的独立算力成本;
- Avg.@N、Pass@N、pass@1 的明确定义。
#8.3 必须做的消融
- oracle router / learned router / random router;
- strongest single teacher;
- teacher ensemble inference 上界;
- same-origin vs heterogeneous teacher;
- teacher 数量扩展曲线;
- top-k 大小与 decision-support recall;
- 学生容量;
- per-domain regression,而不是只有宏平均;
- 时间后移或私有 benchmark;
- rollout temperature 与部署 decoding mismatch;
- 完整 wall-clock + FLOPs 成本。
#9. 代表工作速查表
| 时间 | 工作 | 关键进展 |
|---|---|---|
| 2023-06 | MiniLLM,2306.08543 | reverse-KL on-policy LLM distillation |
| 2023-06 / ICLR 2024 | GKD,2306.13649 | student-generated states 上的统一 KD 框架 |
| 2024-01 | FuseLLM / Knowledge Fusion,2401.10491 | 多异构 LLM 能力融合,主要仍是离线 |
| 2024-02 | DistiLLM,2402.03898 | adaptive off-policy 降低 OPD 成本 |
| 2025-05 | Qwen3,2505.09388 | reasoning 模型生产级 strong-to-weak OPD |
| 2026-02 | Baichuan-M3,2602.06570 | 明确使用 multi-teacher online policy distillation |
| 2026-02 | GLM-5,2602.15763 | 多训练阶段 checkpoint teacher 能力恢复 |
| 2026-03 | Nemotron-Cascade 2,2603.19220 | Cascade RL + multi-domain OPD |
| 2026-03 | KAT-Coder-V2,2603.27703 | 五类 agentic coding 专家 specialize-then-unify |
| 2026-05 | MAD-OPD,2605.01347 | 多教师 debate 与 confidence aggregation |
| 2026-05 | Uni-OPD,2605.03677 | outcome-calibrated multi-domain OPD |
| 2026-05 | CaMOPD,2605.27115 | 处理 general recovery 与 domain preservation 冲突 |
| 2026-06 | MOPD,2606.30406 | 正式系统化多领域 capability integration |
| 2026-07 | Top-K Decision Drift,2607.07050 | 揭示 top-k 遗漏低概率决策关键 token |
| 2026-07 | Teacher-Union OPD,2607.27770 | 主动构造互补 teacher union,student 超越最佳单 teacher |
| 2026-08 | LS-MOPD,2608.03610 | 扩展到多语言 LLM-ASR |
#10. 最终判断
MOPD 的历史意义可能不在“又一种蒸馏 loss”,而在它改变了后训练的组织方式:
过去:所有能力一次性混合训练,希望一个 objective 自己协调
现在:各能力独立专门化,再把局部最优策略整合回来
这对复杂 LLM Agent 尤其有吸引力,因为不同 agent 能力需要完全不同的环境、reward 和 rollout infrastructure。
但截至 2026 年 8 月,它仍是一个条件依赖很强的能力整合框架:
- 静态领域路由相对成熟;
- 同样本 teacher union 刚开始;
- 异构黑盒 teacher、跨 tokenizer、长时程环境和自动 router 仍未解决;
- 多教师带来的收益尚缺少统一 benchmark 和等成本比较;
- benchmark contamination 与行为边界漂移是容易被平均分掩盖的风险。
所以最值得追的下一步不是简单地“加更多 teacher”,而是:
teachability-aware、decision-aware、cost-aware、contamination-aware 的动态多教师蒸馏,并在可分支、可验证的长轨迹 Agent 环境中学习真正的 latent task state 和 counterfactual teacher value。
#参考论文
- Gu et al. MiniLLM: Knowledge Distillation of Large Language Models. arXiv:2306.08543.
https://arxiv.org/abs/2306.08543
- Agarwal et al. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes. arXiv:2306.13649.
https://arxiv.org/abs/2306.13649
- Ko et al. DistiLLM: Towards Streamlined Distillation for Large Language Models. arXiv:2402.03898.
https://arxiv.org/abs/2402.03898
- Wan et al. Knowledge Fusion of Large Language Models. arXiv:2401.10491.
https://arxiv.org/abs/2401.10491
- Qwen Team. Qwen3 Technical Report. arXiv:2505.09388.
https://arxiv.org/abs/2505.09388
- Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making. arXiv:2602.06570.
https://arxiv.org/abs/2602.06570
- GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763.
https://arxiv.org/abs/2602.15763
- Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation. arXiv:2603.19220.
https://arxiv.org/abs/2603.19220
- KAT-Coder-V2 Technical Report. arXiv:2603.27703.
https://arxiv.org/abs/2603.27703
- MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate. arXiv:2605.01347.
https://arxiv.org/abs/2605.01347
- Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe. arXiv:2605.03677.
https://arxiv.org/abs/2605.03677
- Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation. arXiv:2605.27115.
https://arxiv.org/abs/2605.27115
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training. arXiv:2606.30406.
https://arxiv.org/abs/2606.30406
- When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation. arXiv:2607.07050.
https://arxiv.org/abs/2607.07050
- Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold. arXiv:2607.27770.
https://arxiv.org/abs/2607.27770
- Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR. arXiv:2608.03610.