主题归档 · 2026-08-10
系统梳理多教师在策略蒸馏从单教师 OPD、领域专家路由到 Teacher Union 的发展,汇总 benchmark、训练 settings、已达到的效果及仍未解决的关键问题。
主题归档 · 2026-08-09
MOPD 用同一问题下的多条学生 rollout,让成功与失败互为参照,改善 on-policy distillation 的教师信号;真正难题正在从单轮推理转向多轮 Agent 的状态漂移、教师可靠性、信用分配与交互成本。
主题归档 · 2026-06-16
梳理带 think/反思轨迹的 SFT 为什么会有 off-policy 问题,以及从 CoT、搜索轨迹、RL 到 OPD/Agent OPD 的最新研究进展。
主题归档 · 2026-05-16
系统梳理大模型 On-Policy Distillation 的定义、经典工作、发展逻辑、方法谱系与当前开放问题。