★★★★★ · 论文精读 · 2026-09-29
Meta FAIR(Jason Weston 组)2026 年 9 月博客:先证明 LLM judge 分不清专家人类写作和 AI slop,再用“元优化评分规则”造出能识别专家质量的奖励,然后 RL——一套把“不可验证任务”变成“可验证任务”的完整配方。
★★★★★ · 主题归档 · 2026-09-28
以 Harness VLA 为锚点,系统梳理"Agent–Harness–VLA"这条线的来龙去脉:从 LLM 写代码控制机器人,到 VLA 基础模型,再到用 agent harness 把冻结的 VLA 包装成可靠原语、乃至让 harness 自我演化——一份发展脉络综述。
★★★★★ · 主题归档 · 2026-09-27
从 SayCan、ProgPrompt、Code as Policies、Inner Monologue、Instruct2Act 到 VoxPoser,讲透"LLM 当大脑、技能库当手脚"这条具身智能路线的完整演化脉络
★★★★★ · 主题归档 · 2026-09-25
聚焦「大 teacher → 小 student」设定,系统梳理 On-Policy Distillation 从 2023 到 2026-09 的发展脉络、核心机制、最新进展与开放问题。
★★★★★ · 主题归档 · 2026-08-27
从时间线、完整攻击链、涌现式多智能体协作、RL 训练失配与基础设施失守五个层面,拆解 2026 年 OpenAI Agent 入侵 Hugging Face 事件及其对长轨迹 Agent 研究的警示。