论文精读 · 2026-06-21
"详解 arXiv 2606.17024:ExpRL 如何用参考解答构造 dense reward,解决稀疏奖励 RL 在硬题上的探索覆盖不足问题。"
主题归档 · 2026-06-21
详细解读 OpenAI Alignment 团队的 Beneficial Trait RL 论文:为什么从“让模型完成任务”转向“强化有益人格特质”,它如何构造数据、训练模型、验证跨域泛化与对抗持久性,以及这对 RLHF、模型对齐和未来 Agent 训练意味着什么。
主题归档 · 2026-05-04
解读 Thinking Machines 的 On-Policy Distillation 博客,以及 arXiv:2604.13016、2603.25562、2601.18734、2602.12125 四篇工作,讲清 OPD、SFT 冷启动、teacher-supported region、OPSD、自蒸馏、多专家蒸馏和 log-prob shift 背后的技术逻辑。
主题归档 · 2026-04-25
系统梳理具身智能从经典机器人控制、深度强化学习、sim2real、模仿学习,到机器人基础模型、VLA 与跨机器人通用策略的发展逻辑,讲清每一阶段在解决什么核心问题。