主题归档 · 2026-08-09
MOPD 用同一问题下的多条学生 rollout,让成功与失败互为参照,改善 on-policy distillation 的教师信号;真正难题正在从单轮推理转向多轮 Agent 的状态漂移、教师可靠性、信用分配与交互成本。
主题归档 · 2026-06-14
从不动点方程、压缩映射、采样估计、分布漂移和三重耦合出发,用小白能听懂的方式解释强化学习为什么比监督学习难。
主题归档 · 2026-06-14
用小白能听懂的方式拆解 V777 关于强化学习的知乎回答:对偶配对、占据测度、HJB 对偶、Actor-Critic、PPO、single shooting、MPC,以及这套叙事对 LLM Agent 的启发。