★★★★★ · 主题归档 · 2026-08-09
MOPD 用同一问题下的多条学生 rollout,让成功与失败互为参照,改善 on-policy distillation 的教师信号;真正难题正在从单轮推理转向多轮 Agent 的状态漂移、教师可靠性、信用分配与交互成本。
★★★★★ · 主题归档 · 2026-08-04
梳理 fast weights、Learning to Learn、MAML 和 RL² 的共同问题意识:外层训练不再只寻找某个固定任务的最优参数,而是学习一种能利用少量新数据快速生成任务解的内层更新过程。
★★★★★ · 主题归档 · 2026-08-01
讲解 CL-Bench / CL-bench 这个新 benchmark 的核心思想、任务例子、评测方式,以及围绕它展开的上下文学习、规格归纳、技能抽取、持续学习和参数化记忆研究。
★★★★★ · 论文精读 · 2026-07-07
详解 DUSt3R 如何用 pointmap 表示统一无标定双目/多视图重建、深度估计、像素匹配与相机位姿恢复。
★★★★★ · 主题归档 · 2026-06-30
详细解读 Cybench 这个开放网络安全 Agent benchmark:它如何把真实 CTF 任务封装成可执行环境,如何用子任务和人类首解时间衡量能力,以及它对长轨迹 Agent 评测的启发与局限。