#2026-09-04 AI/LLM 最新论文与研究热点简报
覆盖窗口:截至北京时间 2026-09-04 08:00,重点覆盖 arXiv 2026-09-03 recent feed(新稿 v1 多为 9 月 1–2 日)与 Hugging Face Daily Papers 9 月 3 日榜单。本期新增内容充足,无需扩展到 7 天。
检索与核验:抓取 arXiv
cs.AI / cs.CL / cs.LG / cs.SE / stat.MLRSS(合计 548 个分类条目,去重后再按主题筛选),用 arXiv abstract/API、Hugging Face Papers API、GitHub API 交叉核对;对 14 篇候选论文下载 PDF,并以 PyMuPDF 抽取全文核查方法、表格、消融与局限。OpenAlex 本轮多次返回 503,仅一个查询成功且无高相关补充;X/Twitter 没有稳定、可审计的公开时间线接口,因此不把社交转述作为证据,改用论文、项目页、HF 与 GitHub。所有性能数字均为作者报告,不等于独立复现。
#一、早读结论:今天最重要的 6 个信号
- LLM Agent 的 world model 正从“复述未来页面”转向“为决策保留反事实差异”。 Discriminative World Models 不再要求生成固定 HTML/AXTree,而要求预测表示能区分同一状态下不同动作导致的结果;这比 next-state reconstruction 更贴近 planner/PRM 真正需要的信息。
- Dreamer for LLM Agent 可能需要两类可显式检查的模型。 昨天的 BB-WM 关注“我现在相信什么”,今天的 BCO 关注“我相信某种 scaffold 修改会造成什么变化”;前者是 state belief,后者是 intervention belief。二者结合才接近代码 Agent 的 belief–imagination–action loop。
- Agent 持续学习的核心对象正在从原始轨迹变为可执行 skill。 Repo-To-Skill 把 GitHub 中的 operational knowledge 编译成 5,000+ skills,CHIME / MASkills 则分别从阶段归因和多 Agent 层级归因出发更新 memory/skill;共同趋势是“先归因,再固化”。
- 上下文压缩不应只问“删什么”,还要问“什么状态应放在上下文之前”。 Trace as State 表明,同一份 reasoning trace 放在长上下文前方,比追加在后方更有效;Declarative Attention 则让模型在生成时声明关注范围。前者处理因果读取顺序,后者处理 KV 读取成本。
- 长轨迹 credit assignment 出现一条简单但强的边界:第一次错误。 Cliff 用 teacher 找到首个错误,把此前 token 给正 advantage、此后给负反馈;它比按固定 token/turn 切段更语义化,但尚未解决工具动作、环境噪声和恢复行为中的多因果归因。
- 代码智能的瓶颈越来越像“训练—检索—验证闭环”,而非单次生成。 Nemotron 竞赛代码报告把数据策划、合成 reasoning、SFT、RL 与 GenCorrect 连成一体;PaperCompiler 约束 paper-to-repo 的跨文件一致性;ExecRetrieval 则指出代码 embedding 对功能正确性几乎失明。
#二、重点精读(Top 5)
#1. Discriminative World Models for Web Agents
- 类别:
Model-based RL/LLM Agent/World Model/Web Agent - 标题:Discriminative World Models for Web Agents
- 来源与日期:arXiv:2609.02885,v1 2026-09-02;2026-09-03 recent feed
- 项目页:DWM
- 一句话核心贡献:提出 predicted-state matching,让 world model 生成的状态表示必须区分“当前动作的真实后继状态”和“同一决策点其他动作的后继状态”,而不是只拟合固定页面表示。
为什么值得关注?
传统 web world model 通常学 history + action → HTML/AXTree/文本状态。但 planner 并不关心预测文本是否像真实页面,而关心预测是否能解释 候选动作之间为什么不同。如果两个动作生成的描述都很流畅,却把登录成功与留在原页混在一起,next-state loss 很低也没有决策价值。
本文从 WebArena Go-Browse 轨迹构造 branching data:每个共享决策点保留多个候选动作及其真实结果。训练时,模型生成自由形式的 predicted representation,judge 只看该表示和两个候选后继状态,判断哪个才与查询动作匹配。这样目标对表示格式无要求,却直接优化 action-conditioned discriminability。
关键结果:
- held-out state matching 上,本文模型平均 80.80%,高于 WebDreamer-7B 的 74.51%、WebWorld-8B 的 70.17% 和同数据 AXTree SFT 的 47.77%;换 GPT-4o / Llama-3.1-70B judge 后趋势保持;
- 在 WebPRMBench 上,把 matching-state 交给训练过或冻结的 ranker,通常比无状态或 WebWorld 状态更能区分 preferred action;
- WebArena-Lite 上,GPT-4o ReAct 为 13.94%,Best-of-5 action-only 为 21.82%,加入 DWM 预测状态后升到 28.48%。
与 wenjun 研究方向的关系:这是今天最直接命中 model-based RL / Dreamer for LLM Agent 的工作。对代码 Agent,世界模型不必重建完整 repo 或 terminal transcript;更有价值的目标是:给定同一 belief state,能否区分“读文件 / 跑测试 / 改 patch / 回滚”等候选动作会导致的关键 outcome。可以把 matching loss 与 imagined planning reward 对齐,学习 decision-sufficient latent state。
边界:目前只在 Go-Browse/WebArena 分支数据上训练,端到端只用 GPT-4o policy;matching reward 仍依赖 LLM judge;branching data 只覆盖观察到的候选动作,并非完整 action space。
#2. Belief-Calibrated Optimization:把 Agent 对环境的判断写成可校准 world model
- 类别:
Model-based RL/Self-evolving Agent/Harness Optimization/Continual Learning - 标题:Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization
- 来源与日期:arXiv:2609.01861,v1 2026-09-01;2026-09-03 recent feed
- 一句话核心贡献:在 coding-agent 优化 scaffold 的循环中,持续维护一份可证伪、带置信度和证据的 belief 文档,并在每次修改前预测影响、评测后校正 belief。
为什么值得关注?
多数自动 harness/scaffold 优化只把分数、diff 和轨迹留给下一轮;“上次为什么失败、什么改动应对哪类任务有效”仍埋在一次性 CoT 中。BCO 把这些判断持久化为原子 belief:包括 falsifiable claim、适用条件、confidence、hypothesis/confirmed/refuted 状态、正反证据和能解释的失败质量 mass。每轮执行 predict → edit/evaluate → correct,强迫 optimizer 对干预效果承担预测责任。
在 LongMemEval、LoCoMo、GAIA、AppWorld、Terminal-Bench 2.0 五个 benchmark 上,BCO 的 train pass rate 都高于只缺少 belief world model 的 matched control;held-out 提升从 +2.2 到 +15.2 个点不等。比如 GAIA held-out 从 vanilla 34.3% 到 BCO 49.5%,AppWorld 从 76.6% 到 79.6%。交换 frozen target model 后,BCO 选择的 scaffold 除 context overrun 未完成项外仍领先。把 belief 内容打乱后,预测环境反应的能力介于无文档与完整文档之间,说明收益不只是模板形式。
与 wenjun 研究方向的关系:BCO 不是 neural Dreamer,却展示了一个很有用的训练接口:world model 应记录 intervention belief,即“修改哪一部分 harness/skill 会在哪类状态下改变什么行为”。它可以成为 latent world model 的可解释 teacher,也能用于主动实验设计:优先测试高质量、高不确定、可区分 competing hypotheses 的改动。
边界:文档由强 coding LLM 维护,成本和偏差不可忽略;部分 memory benchmark 的候选选择用了披露的 best-of-three;论文证明同一优化轨迹内的 belief 有用,但还未证明跨项目迁移,也没有直接训练 latent dynamics/policy。
#3. Repo-To-Skill:把 GitHub 仓库编译成 Agent 可复用的操作知识
- 类别:
Agent Pretraining Data/Continual Learning/Tool-use/AI4AI - 标题:Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
- 来源与日期:arXiv:2609.02749,v1 2026-09-02;HF Daily Papers 2026-09-03(榜单第 1,抓取时 494 upvotes)
- 代码 / Skill Library:VectorSpaceLab/AREX-Skill
- 一句话核心贡献:提出 DisCo,把 repo/paper 中“知道方法之外的落地诀窍”蒸馏为渐进展开、可验证的 skills,并发布从 1,000 个 ML repo 得到的 5,000+ skills。
为什么值得关注?
这篇把 Agent stack 明确拆成三层:model + harness + operational knowledge。README、源码、issue、示例里真正影响实验成败的不是概念定义,而是“什么时候用哪个 API、配置什么参数、常见错误怎么修、验证证据是什么”。把整个 repo 塞进上下文太贵,单纯 RAG 又容易检到声明而非程序性知识;skill 则把触发条件、步骤、参考材料和脚本包装成可调用单元,并通过 progressive disclosure 避免 5,000 个 skill 同时占上下文。
AREX-Skill 覆盖 20 个领域、178 个 capability families。固定 GPT-5.5 backbone、research harness 和下游预算,只加入 skills 后,作者报告:MLE-bench +134.3%、PaperBench +34.4%、FrontierCS +9.2%、PassNet +14.0%。PaperBench 平均从 29.45% 到 39.59%;FrontierCS 从 70.63 到 77.14,但平均 token 也从 2.46M 增至 4.47M——能力提升并非“免费压缩”。
与 wenjun 研究方向的关系:它给“agent 预训练数据如何塑造能力”提供了不同答案:也许 repo 数据不应只作为 next-token corpus,而应先编译成带触发、依赖、验证和版本信息的 procedural skill graph。更进一步,可将 skill 当作 option/action abstraction,让 model-based RL 预测调用某个 skill 后的状态变化,而不是在 token/action 级别漫游。
边界:核心实验依赖强闭源 backbone;自动 verification 能发现多少“看似可运行、实则方法错误”的 skill 仍需审计;skills 也可能误导——论文中部分任务因错误 skill 匹配而退化。仓库更新后如何做版本化失效同样未彻底解决。
#4. Trace as State:让推理结果先于长上下文,作为第二遍读取的条件状态
- 类别:
Latent Reasoning/Context Compression/Long-context/State Representation - 标题:Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers
- 来源与日期:arXiv:2609.02702,v1 2026-09-02;2026-09-03 recent feed
- 一句话核心贡献:第一遍从长上下文得到 reasoning trace,第二遍把 trace 放在原上下文之前,让它充当 causal processor 的初始 task state;同样 trace 若追加在末尾则明显更差。
为什么值得关注?
论文的理论直觉很干净:如果状态更新所需 condition 在序列开始就知道,processor 只需维护当前 realized state;如果 condition 最后才出现,它可能要同时保留所有可能 condition 下的 residual map,最坏情况下需要指数更多 memory。因果 Transformer 无法让末尾新发现的状态回头影响已经读过的 token,因此需要 fresh pass。
方法本身不训练模型:先正常推理得到 trace T,再以 [T, long context, question] 重读;matched control Trace Append 使用相同 trace 和 token,只改成 [long context, T, question]。三个模型、三个长上下文数据集、27 个 model-task-metric 组合中,Trace as State 赢了 26 个。GraphWalks Parents 上,DeepSeek V4 Pro Preview 从 initial 29.2%、Trace Append 43.0% 升到 81.8%;GLM-5.2 从 66.4% / 83.2% 升到 100%。
与 wenjun 研究方向的关系:它处在 latent-space reasoning 和通用上下文压缩的交界。文本 trace 只是 task state 的显式 proxy;下一步可把第一遍轨迹压成 learned latent state,再作为 prefix token / recurrent state 条件化第二遍扫描。对代码 Agent,这对应“先形成 bug hypothesis / repo belief,再带着它重读代码”,而不是读完所有文件后才在末尾追加总结。
边界:当前需要额外一遍长上下文 prefill,未必省计算;trace 仍是文本,不是端到端学习的 latent;GraphWalks 等任务与真实 repo 轨迹之间仍有距离。它证明的是 state ordering,不是通用压缩器已经解决。
#5. Cliff:从“第一次推理错误”构造 token-level RLVR 信号
- 类别:
Post-training RL/RLVR/Credit Assignment/Code Reasoning - 标题:Cliff: Learning Process Rewards from the First Mistake
- 来源与日期:arXiv:2609.02817,v1 2026-09-02;HF Daily Papers 2026-09-03
- 一句话核心贡献:让现成 teacher 定位错误 rollout 的首个 pitfall step,把之前 token 视为有效前缀、之后视为无效后缀,并转换成 token-level advantage。
为什么值得关注?
terminal reward 把一条轨迹的所有 token 同奖同罚;但一旦第一个关键推理错误出现,后续 reasoning 已经条件化在错误 prefix 上,再逐步评价往往信息有限。Cliff 因而只需要定位一个边界,不训练专门 PRM,也不要求 teacher/student 有相同 reasoning path。作者先让 teacher 生成 reference,经过自动 verifier 过滤,再比较 student rollout,输出首个 pitfall step。
在数学与算法代码 benchmark、不同 student/teacher 的 12 种设置中,Cliff 每组都优于对照;作者汇总称平均比 on-policy distillation 高 15%、比 vanilla GRPO 高 7%。全文分析还显示:judge 往往比独立解题更容易;正确 reference 可显著改善 first-mistake 定位,而错误 reference 会明显伤害 judge。
与 wenjun 研究方向的关系:对长轨迹 Code Agent,可以把 pitfall 从 token 扩展到 typed event:错误假设、无信息搜索、破坏性 patch、误读测试、无效 recovery。关键研究问题不是简单把首错之后全部判负,而是判断后续是否出现了 recovery;这可与昨天 CE-GRPO 的 shared-prefix branch rollout 结合,用环境执行验证“此处换动作是否真的改变结局”。
边界:实验仍以数学/竞赛代码 reasoning 为主,作者也把 agentic setting 列为未来工作;LLM teacher 的定位不是 ground truth,且“首错后全负”会低估高质量恢复轨迹。
#三、其他高相关论文与动态
#6. Nemotron 竞赛代码后训练:数据、RL 与 test-time feedback 的系统级胜利
- 类别:
Code Intelligence/Post-training RL/Synthetic Data/Test-time Scaling - 标题:Post-Training Language Models for Gold-Medal Performance in Coding Competitions
- 来源与日期:arXiv:2609.02849,v1 2026-09-02;HF Daily Papers 2026-09-03
- 一句话贡献:用 22,000 道策划题、DeepSeek-V4-Flash 生成的 120 万 / 477,642 条 reasoning trace、SFT、可执行 reward RL 和 GenCorrect,构建 IOI 级代码系统。
Nano-CC(30B-A3B)在 IOI 2025 从 base 130 分到 post-training 291 分,再经五轮 GenCorrect 到 468,超过金牌线 438.3;Ultra-CC 经 SFT 与 GenCorrect 到 502。比赛特化 Ultra-CC 在 IOI 2026 题目公开前按相同时间、网络和提交限制运行,得 535.4/600,高于最高人类 498.27,但这是非官方、未监督系统运行,不是等算力的人类对比。训练中明确排除 IOI 2025、ICPC 2025、LiveCodeBench Pro 并做去重,IOI 2026 则是 prospective evaluation。
研究判断:最重要的不是“AI 超越 IOI 冠军”标题,而是 SFT 学多样解法、RL 改 Score@1、GenCorrect 用 evaluator feedback 消耗 submission budget 的分工。完整训练集受第三方许可限制不能公开;模型与可运行 recipe 计划通过 NeMo Skills 发布,且 Ultra 未做 code-specific RL,所以还不能干净比较规模与 RL 的作用。
#7. CHIME:先判断失败属于 planning 还是 execution,再写入记忆
- 类别:
LLM Agent/Continual Learning/Agent Memory/Credit Assignment - 标题:CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning
- 来源与日期:arXiv:2609.02074,v1 2026-09-02;2026-09-03 recent feed
- 代码(论文称将发布于此):ATH-MaaS/Marco-DeepResearch
- 一句话贡献:维护 planning bank 与 execution bank,并以 attribution gate 将 outcome 归因给 plan、execution、两者或都不是,只更新相应 memory。
四个长轨迹 benchmark、Qwen3.5-Flash / DeepSeek-V4-Flash 上,作者报告 eval 平均比最强 baseline 高 2.96 / 3.68 点;仅保留 129 条 memory,而强 baseline 为 3,585 条。跨 backbone 转移优于 A-MapReduce 2.25–4.68 点,但跨 benchmark 迁移较弱。其关键不是多一个 memory bank,而是明确了 attribute-before-memorize:未经阶段归因的 terminal outcome 会污染长期经验。
#8. Declarative Attention:让模型像调用工具一样声明自己要看哪里
- 类别:
Context Compression/Systems/Long-context/Attention - 标题:Language Models Can Control Their Own Attention
- 来源与日期:arXiv:2609.02737,v1 2026-09-02;HF Daily Papers 2026-09-03
- 一句话贡献:定义
<global> / <focus> / <local>三种生成模式,模型在 CoT 中声明需要读取的上下文区域,推理引擎据此跳过多数 KV cache read。
在 15 个长上下文任务上,零训练的 DA 为 Gemma-4-31B / Qwen-3.6-27B 减少 52.0% / 31.1% attended tokens,平均准确率下降 1.27 / 2.75 点;roofline 估计 decode wall time 降到 vanilla 的 0.71× / 0.77×。值得注意:thinking mode 下模型目前不能稳定遵循协议,论文关闭了 thinking;多段综合任务的掉点也更大。它更像 模型可解释的动态 KV 路由协议,不是压缩后的信息保持学习。
#9. PaperCompiler:paper-to-code 的中间层不该是自由文本计划,而应是可追溯 specification
- 类别:
Code Agent/Paper-to-Code/Specification/Evaluation - 标题:PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compilation
- 来源与日期:arXiv:2609.02272,v1 2026-09-02;HF Daily Papers 2026-09-03
- 代码:Daethalous/PaperCompiler
- 一句话贡献:把 paper evidence 编译成带 provenance、支持/推断/外包/未决状态、non-degradation requirement、ownership 和跨文件依赖的 repo-level specification。
Paper2CodeBench 上 reference-based fidelity 从 3.64 到 4.15(相对 +13.8%),高严重度 critique 从 13.2% 降到 6.1%。它与 Repo-To-Skill 可组成一个很自然的闭环:skill 提供 operational knowledge,compiler 负责把论文证据变成不可随意压缩的 implementation contract。
#10. EarlyEval:Agent 评测可以在结果已高度可预测时提前结束
- 类别:
Evaluation/Code Agent/Systems - 标题:EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
- 来源与日期:arXiv:2609.02783,v1 2026-09-02;HF Daily Papers 2026-09-03
- 代码:inphotoo/earlyeval
- 一句话贡献:以行为、文本与 reference features 训练 success/failure LightGBM,在置信度过阈值时停止 rollout,从单个任务内部而非只靠 benchmark subset 降低评测成本。
在 SWE-bench Verified、TerminalBench、Toolathlon 上,leave-one-agent-out 条件下可省 13–26% steps、最多 44.1% input token / 29.4% output token,预测准确率 89–97%,排行榜 Spearman 相关不低于 0.959。它适合 Agent RL 的频繁回归评测,但若把它用于训练 rollout 截断,预测器偏差会直接改变数据分布,必须另做 off-policy/selection-bias 校正。
#11. ExecRetrieval:代码 embedding 找得到“像的”,却分不清“能运行的”
- 类别:
Code Intelligence/Retrieval/Evaluation/Pretraining Data - 标题:ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding Retrieval
- 来源与日期:arXiv:2609.01865,v1 2026-09-01;HF Daily Papers 2026-09-03
- 数据集:AaryanK/ExecRetrieval
- 一句话贡献:为 939 个 Python task 在检索池中植入单编辑、执行验证的 buggy near-clone,直接测 embedding 是否能把 canonical 实现排在功能错误的相似代码之前。
最佳 hosted system 的 exec@10 可达 1.00,但 exec@1 仅 0.331;领先系统 91.5–99.4% 的 rank-1 miss 是配对 buggy variant,67–78% 查询里至少一个 buggy clone 分数高于 canonical。这说明代码检索/pretraining embedding 的“语义相似”目标缺少 execution-grounded negative;对 Code Agent RAG,reranker 必须加入测试、静态分析或可执行 counterfactual。
#12. 两条值得放入 watchlist 的新工作
- 类别:
Model-based RL/Self-evolving Agent - 标题:WMLLM: Self-Evolving Optimization Agents via Predict-Then-Act World Modeling
- 来源与日期:arXiv:2609.01608,v1 2026-09-01;2026-09-03 recent feed
- 一句话贡献:先预测 candidate outcome、再执行真实 evaluator,把 prediction error 作为自监督信号,并结合多轮 refinement、population search 与 GRPO;ALFWorld 初步结果从 30.00±6.08 提到 43.59±4.02。
它更接近“prediction responsibility + RL”,但主要证据仍是多目标分子和结构化 black-box optimization,不应直接当通用 Agent world model 结论。
- 类别:
Continual Learning/Multi-Agent/Skills - 标题:MASkills: Continual Skills Optimization for Multi-Agent LLM Systems
- 来源与日期:arXiv:2609.02094,v1 2026-09-02;2026-09-03 recent feed
- 代码:DaRL-GenAI/MASkills
- 一句话贡献:以 skill-conditioned credit、层级聚合和 momentum-smoothed optimization,对 multi-agent skill 做 refine / induce / consolidate / prune。
它与 CHIME 的共同判断是:memory 若没有局部信用与更新算子,就只是越来越大的经验文本库;但 MASkills 仓库目前很新,值得等代码完整度与可复现实验进一步确认。
#四、今日最值得精读的 3 篇
- Discriminative World Models for Web Agents:world model 训练目标与 action ranking 直接对齐;重点看 branching data、representation-agnostic matching 与端到端 Best-of-5。
- Belief-Calibrated Optimization:把自演化 harness 中隐性的 intervention hypothesis 变成可证伪 world model,最适合和 Dreamer / active experiment design 对接。
- Trace as State:对 latent state、长上下文重读和上下文压缩的连接最清晰;核心不是多一段 CoT,而是 condition-first 的因果处理顺序。
代码 Agent / Agent 数据替代选择:若今天更偏工程与数据,把第 3 篇换成 Repo-To-Skill;若更偏 post-training credit assignment,换成 Cliff。
#五、今日最值得跟进的 3 个 repo / model / dataset
GitHub / HF 状态快照:2026-09-04 08:00(stars/downloads 只表示当前可见度,不代表研究质量)。
- VectorSpaceLab/AREX-Skill — 112 stars、8 forks,9 月 3 日有 push;包含 5,000+ skills、CLI、脚本和中英文文档。优先检查 skill verification、router、版本依赖和 repo→skill graph schema,适合作为 Agent 预训练数据形态的真实大样本。
- Daethalous/PaperCompiler — 9 月 3 日新建,2 stars;已包含 README、data、scripts 与 code。优先看 provenance label、cross-file dependency、non-degradation constraint 是否能接到 coding harness 的 verifier。
- AaryanK/ExecRetrieval — 939 个 Python task 与 execution-verified buggy counterfactual;HF 快照 128 downloads、CC-BY-4.0。很适合快速训练一个 execution-aware reranker,或作为代码 embedding 预训练 hard-negative curriculum。
模型发布 watch:NVIDIA-NeMo/Skills(Nemotron-3-Ultra-CC checkpoint 与 runnable recipe 尚属计划发布,仓库抓取时 1,032 stars);持续学习 watch:DaRL-GenAI/MASkills(代码仓库已存在但仍很新);评测 watch:inphotoo/earlyeval。
#六、研究机会 / Idea
#Idea 1:Contrastive Belief-Dreamer——同时学习“当前 belief”与“动作可区分的未来”
把昨天 BB-WM 与今天 DWM / BCO 合成三部分:
belief encoder:从 repo observation、工具输出和历史形成带不确定性的 latent belief;discriminative transition model:不要求还原完整 next state,而要求区分共享 prefix 下不同 semantic actions 的真实后继;intervention ledger:像 BCO 一样记录“某类修改在什么条件下预计改善/退化”,用于主动选择最能减少 model uncertainty 的实验。
训练信号可由真实 sandbox branching 产生:固定 repo snapshot,从同一 state 执行 read/test/patch/revert 候选,结合 state-matching、verifier outcome 与 calibration loss。关键指标是 action ranking、belief calibration、branch discriminability 和真实工具预算,而不只是 next-token/state reconstruction。
#Idea 2:从 Repo-To-Skill 到 Skill-Dreamer——把 skill 当作 Agent RL 的 option
AREX-Skill 说明 repo 可被编译成 5,000+ operational options;CHIME / MASkills 说明经验更新前需要 credit。可以把每个 skill 表示成:
precondition → procedure/tool sequence → expected state delta → verifier → invalidation dependency。
然后做 hierarchical model-based RL:高层在 belief state 上选择 skill,低层执行并回报预测误差;成功/失败只更新与 attribution 对应的 skill 节点。比较 raw repo RAG、text skill、executable skill、learned latent option 四种表示,测跨 repo、跨模型和版本更新后的迁移。核心问题是:procedural data 是否比同 token 数的源码/README NTP 更能塑造 Agent 的工具能力?
#Idea 3:First-Mistake 不是终点——面向 Code Agent 的 Error–Recovery Credit Graph
Cliff 的单边界适合纯 reasoning,但长轨迹 Agent 常出现“先错、后发现、再恢复”。可用 AGENTSCOPE/typed trace 把轨迹变成事件图,并从同一 prefix 分叉执行 counterfactual:
- 如果替换事件显著改变最终 verifier outcome,它是 causal mistake;
- 如果后续事件恢复成功,则给 recovery skill 正 credit,而非一律把首错后 token 判负;
- 将责任分为 belief error、planning error、execution error、evaluation error,并分别更新 world model、planner、tool policy 和 evaluator belief。
这能把 Cliff、CE-GRPO、CHIME 与 BCO 接成一个真正适合软件环境的 credit pipeline。
#七、今日研究判断
今天最值得记住的不是单篇 SOTA,而是一条逐渐清晰的系统链:
先用 belief 表示 Agent 当前知道什么;再用 discriminative world model 预测候选动作之间真正影响决策的差异;把 operational knowledge 编译成可执行 skill;用 first-mistake / stage attribution 找到该更新哪个 skill 或 memory;最后通过 Trace as State / Declarative Attention 把必要状态放到正确的位置并控制读取成本。
对 wenjun 当前主线,最有潜力的切口是:
不要让 LLM world model 重建一切,而要学习对 action ranking、信息搜集和 credit assignment 都足够的 decision-sufficient latent belief。
这比“让 LLM 多生成几条未来”更接近 Dreamer 的核心:压缩历史、预测与控制相关的未来、在 imagined alternatives 中选动作,并持续用真实环境误差校准模型。