Tag Archive

标签:On-Policy Distillation

这里整理所有带有「On-Policy Distillation」标签的文章,方便按主题快速回看。

On-Policy Distillation

共 4 篇
主题归档 · 2026-08-10

MOPD(Multi-Teacher On-Policy Distillation)进展综述:多教师能力如何蒸馏进一个模型?

系统梳理多教师在策略蒸馏从单教师 OPD、领域专家路由到 Teacher Union 的发展,汇总 benchmark、训练 settings、已达到的效果及仍未解决的关键问题。
MOPDOn-Policy DistillationMulti-TeacherLLM Post-TrainingAgent RL
主题归档 · 2026-08-09

MOPD:把学生的成功与失败都变成老师的上下文——进展、边界与 Agent 时代的问题

MOPD 用同一问题下的多条学生 rollout,让成功与失败互为参照,改善 on-policy distillation 的教师信号;真正难题正在从单轮推理转向多轮 Agent 的状态漂移、教师可靠性、信用分配与交互成本。
MOPDOn-Policy DistillationLLM Agent强化学习知识蒸馏
主题归档 · 2026-06-16

Think SFT 的 Off-Policy 问题:从反思轨迹到 On-Policy Distillation 的研究线

梳理带 think/反思轨迹的 SFT 为什么会有 off-policy 问题,以及从 CoT、搜索轨迹、RL 到 OPD/Agent OPD 的最新研究进展。
LLM ReasoningSFTOff-PolicyOn-Policy DistillationAgent RL
主题归档 · 2026-05-16

大模型 OPD:经典工作、发展逻辑与最新问题

系统梳理大模型 On-Policy Distillation 的定义、经典工作、发展逻辑、方法谱系与当前开放问题。
LLMOPDOn-Policy Distillation后训练LLM Agent