#2026-09-05 AI/LLM 最新论文与研究热点简报

覆盖窗口:截至北京时间 2026-09-05 08:00,重点覆盖 arXiv 2026-09-04 recent feed(新稿 v1 集中于 9 月 3 日)与 Hugging Face Papers 9 月 4 日可见榜单。本期高相关新稿充足,无需扩展到 7 天。

检索与核验:抓取 arXiv cs.AI / cs.CL / cs.LG / cs.SE / stat.ML RSS(五个 feed 共 586 个去重条目),用 Hugging Face Papers/Daily Papers API、GitHub API 交叉核对;对 15 篇候选论文下载 PDF,并用 PyMuPDF 抽取全文核查方法、实验与局限。OpenAlex 七组检索均返回 503;X/Twitter 的公开机构页返回 404,无法稳定核验社交时间线,因此本期不把社交转述当作证据,改用 arXiv、HF、论文全文和 GitHub。所有性能数字均为作者报告,不等于独立复现。

#一、早读结论:今天最重要的 6 个信号

  1. Code Agent 的稀缺训练资产正在从 trajectory 转向 executable environment。 Terminal-Universe 把一条冻结演示“反编译”为可重放、可重新出题、可验证的工作空间;同一环境可被更强模型反复探索,比直接模仿旧 policy 的轨迹更有长期价值。
  2. 环境设计开始从“围着当前 policy 找弱点”转向 off-policy 的开放式课程。 Environment Evolution 沿场景新颖度、技能稀有度和执行长度构造难度 lineage,再按掌握进度调度;它把 environment generator 从数据工厂推向 curriculum dynamics。
  3. 长轨迹 credit assignment 出现两条互补路径。 DRACO 在没有最终 verifier 时用动态 rubric 把过程判断分配到步骤;TIGPO 在有终局奖励时,把跨 policy update 的状态转移图保留下来,但只给当前 rollout 梯度。一个解决“奖励从哪里来”,一个解决“历史结构如何复用”。
  4. OPD 的数据单位也许不是 query,而是 rollout 诱导出的 state coverage。 One-Shot OPD 用一个 query 就覆盖 full-data 训练访问状态的 71.5%;16 个语义多样 query 达 98.9% 并匹配全量训练。作者的判断是:OPD data-overfed, algorithm-starved
  5. latent reasoning 正从“反复过同一隐藏态”变成有记忆、会停的深度轨迹。 RecurTrace 让每个 token 沿 loop-time 读取自己早先迭代状态,并用“继续一层是否还降 loss”的 oracle 蒸馏 halting head;这是比固定递归深度更像真正 adaptive computation 的接口。
  6. 代码修复的 reward specification 正在变厚。 SWE-Gate 表明“功能测试通过”不等于满足维护者的兼容性/实现约束;Minimal Edit 工作则说明“正确”不等于“少改、可审查”。Code Agent RL 若只优化 pass/fail,很可能系统性学会 test overfitting 和 over-editing。

#二、重点精读(Top 5)

#1. Terminal-Universe:把 Agent 轨迹反演成可复用训练环境

  • 类别Code Agent / Agent Pretraining Data / Environment Design / Post-training
  • 标题Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
  • 来源与日期:arXiv:2609.04148,v1 2026-09-03;HF Papers 2026-09-04(抓取时 213 upvotes)
  • 一句话核心贡献:通过逆向重放 Read/Write/Edit 等工具操作恢复 Agent 修改前的文件,再由 completion agent 补齐缺失依赖,把公开 terminal 轨迹变成 37.3k 个可执行工作空间,并在其上重新出题、验证和 rollout。

为什么值得关注?

过去的常见路线是 environment → rollout trajectory,本文把箭头反过来:轨迹已经泄露了它运行过的文件结构和内容,因此可以从工具调用恢复 partial workspace,再补成 task-sufficient environment。恢复后不仅重构原始意图,还能做三类 re-query:单仓库新任务、跨工作空间依赖任务,以及带后续需求与修复反馈的多轮任务。每个新任务配 agent 编写的 verifier,只保留测试通过的教师轨迹。

从公开轨迹恢复出的 37.3k 环境最终产生 31,977 条 verifier-filtered SFT 演示,约 1.42B token。Qwen3.5-27B 在 full mixture 上,Terminal-Bench 2.1 从 46.2% 升至 58.1%,EvoCode-Bench v2 MT@4 从 6.3% 升至 20.1%。最关键的消融不是最终 SOTA,而是:直接模仿 35.8k 条 source trajectory 平均只有 36.7%,让更强 teacher 在恢复环境中重新解决同一任务则为 52.1%;replay + agentic completion 又比只 deterministic replay 高 4.2 点。

与 wenjun 研究方向的关系:这可能是“agent 预训练数据如何塑造能力”最重要的近期答案之一:轨迹不只是一串 token,它还是一个环境的 压缩观测。把轨迹升级回可分支环境后,才能采集 counterfactual action、训练 world model、做在线 RL,并让 verifier 而不是旧 policy 风格决定数据质量。对 Dreamer for Code Agent,可以直接从同一恢复 snapshot 执行多个 read/test/patch 候选,学习 action-conditioned latent transition。

边界:恢复的是轨迹可见的 partial workspace,completion agent 可能引入不真实文件或泄漏式捷径;verifier 也是 agent 生成,存在 specification gaming;训练是 SFT 而非 agentic RL,且 256k context、强 teacher 和大规模执行成本不低。论文尚未给出公开仓库链接。

#2. Environment Evolution:让训练环境自己沿难度谱系演化

  • 类别Code Agent / Post-training RL / Self-evolution / Environment Design
  • 标题Environment Evolution for Terminal Agents
  • 来源与日期:arXiv:2609.04128,v1 2026-09-03;HF Papers 2026-09-04
  • 一句话核心贡献:不依赖当前 policy rollout,而沿场景新颖度、技能稀有度与执行长度三个方向,逐代生成更难且经过验证的 terminal environment lineage,并用课程调度维持非零 RL 学习信号。

为什么值得关注?

当 frontier model 已经能稳定解 seed environment 时,GRPO 一个 group 全对,组内 advantage 归零;很多昂贵环境因而失去训练价值。现有 agent–environment co-evolution 用当前 policy 的失败建 weakness bank,但它容易与某个模型共适应,policy 变强后还要重新 rollout 才知道哪里难。

本文从高层轨迹 scenario–skill–scenario 出发,把难度拆成:少见场景、在该场景中少见的技能、以及有效步骤长度。evolver 每代只沿一个方向修改环境,形成 15 代 lineage;EL scheduler 只有在较早代达到 pass-rate 阈值后才放出下一代,让 8-rollout group 尽量保持“部分解出”而非全对/全错。200-step GRPO 后,Qwen3.6-27B / 35B-A3B 在 Terminal-Bench 2.1 的 peak accuracy 为 71.5% / 64.9%,相对各自 RFT step-0 提升 14.4 / 18.0 点,也高于 co-evolution 的 62.9% / 55.1%。

与 wenjun 研究方向的关系:这直接命中“通过环境设计催生自演化智能”。更值得做的扩展是让 world model 估计一个环境在哪些 latent belief/skill 上产生最大 learning progress,而不是让 LLM 仅凭广泛知识判断 rarity。环境谱系也可以充当 Dreamer 的 curriculum:先学短 horizon 的可校准 dynamics,再逐代增加 scenario shift、tool dependency 和 recovery length。

边界:所谓 model-agnostic difficulty 仍由 deep-research/evolver LLM 估计,并非真正不依赖模型分布;实验使用未公开或 frontier 模型参与生成/评估;目前只覆盖 terminal tasks,论文自己也把 SWE Agent 和 Computer-Use 留作未来工作。

#3. DRACO:没有最终答案 verifier,也能给长轨迹步骤分 credit

  • 类别Post-training RL / LLM Agent / Credit Assignment / Tool-use
  • 标题DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
  • 来源与日期:arXiv:2609.04094,v1 2026-09-03;HF Papers 2026-09-04
  • 代码IBM/draco
  • 一句话核心贡献:针对 outcome-blind 任务,为每组实际 rollout 动态生成、合并与去重 rubric,一次性评整条轨迹,再按 rubric 指向的责任步骤闭式重分配 GRPO advantage,无需训练 attribution model。

为什么值得关注?

开放研究、客服、复杂工具使用往往没有单元测试式真值。固定 rubric 又无法预先覆盖 rollout 实际暴露的失败模式。DRACO 先从 instruction 和每条 rollout 提议 criteria,合并为 mutually-exclusive / collectively-exhaustive 集合,并做 discriminative dropout;judge 对每条 criteria 给 pass/fail/N/A 和责任步骤。轨迹总 reward 仍经 GRPO 归一化,但不是给所有 token 同一个 advantage,而是把推动量分配给被 rubric 归因的 steps,并保持总推动量、符号和长度无关等性质。

在 Qwen3.6-27B 上,AppWorldTN 的 TGC/SGC 从 69.4/41.1 升至 85.3/70.6;零样本转移到 τ-bench banking,成功率从 15.8 升至 20.4。论文特别强调:训练过程没有使用 ground-truth verifier、gold answer 或 reference trajectory;self-judge 版本仍有收益,但低于 frontier external judge。

与 wenjun 研究方向的关系:长轨迹 Code Agent 并非都能靠 final tests 归因,例如代码审查质量、探索是否充分、修改是否可维护。DRACO 可以把 judge 的自由文本评价转换成 typed event credit;再与真实环境的 counterfactual branching 结合,可把 rubric says responsible 校准成 replacing this event actually changes outcome

边界:它把 verifier 缺失替换成 frozen LLM judge,rubric 漏项、偏见与 reward hacking 仍在;step attribution 是 judge 声明而非因果识别;AppWorld 仍是结构化 benchmark,开放研究 Agent 上的可靠性尚未证明。GitHub 快照仅 1 star,代码成熟度需另审。

#4. One-Shot OPD:一个训练问题为什么能学几百步?

  • 类别Foundation Model Training / Post-training / On-policy Distillation / Data Mechanism
  • 标题Rethinking On-Policy Distillation of Large Language Models II: One Training Example
  • 来源与日期:arXiv:2609.04172,v1 2026-09-03;HF Papers 2026-09-04(抓取时 65 upvotes)
  • 代码Thinking-Space/One-Shot-OPD
  • 一句话核心贡献:证明 OPD 即使用单个 query 反复 on-policy rollout,也能恢复全量数据的大部分收益;关键数据量不是 query 数,而是 rollout 访问到、可被 teacher 密集监督的 autoregressive state coverage。

为什么值得关注?

OPD 的 teacher 在 student 自己访问的每个 prefix/state 上提供 token-level 分布监督。一条 query 每个 update 采 64 条 rollout,本身就产生数万 supervised states。作者用 teacher final hidden state 表示 prefix、PCA + K-means 建 200 个 state cluster:单 query 覆盖 full-data OPD state space 的 71.5%,16 个语义不同 query 覆盖 98.9% 并匹配 17k-query 全量训练。

数学实验中 one-shot 在第 300 步达到 68.5,对比 full-data 69.8;到第 1,000 步仍恢复 full-data 增益的 72%。结论也跨代码生成、instruction following 和 agent tool use 成立,分别恢复 teacher–student gap 的 73%、66%、64%。更反直觉的是,content-light template 与 off-domain WildChat prompt 也能接近真实 query:输入的重要性可能主要在于 诱导 student 进入哪些内部状态。与此同时,不论一条还是全量数据,student 吸收剩余 teacher gap 的速度都相似地下降,因此作者称 OPD “数据过剩、算法饥饿”。

与 wenjun 研究方向的关系:这把基础模型训练数据研究从“收集多少题”推进到“哪些 prompt/environment 能诱导高价值 state visitation”。对 Agent OPD,可按 belief/action/error-state 覆盖选环境,而不是按任务文本 embedding 去重;对 code trajectory data,真正应去重的也许不是 issue 文本,而是 teacher-signature / tool-state cluster。

边界:state coverage 依赖 teacher hidden representation、采样位置和 K-means 粒度;coverage 是相关性解释,不是唯一因果变量;大部分核心实验仍是 reasoning,BFCL 并非长轨迹真实环境;“一个样本”不等于低计算,训练仍反复生成大量长 rollout 并查询 teacher logits。

#5. RecurTrace:给 latent recurrence 一条可寻址的 loop-time memory

  • 类别Latent Reasoning / Adaptive Computation / Foundation Model Architecture
  • 标题RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory
  • 来源与日期:arXiv:2609.03379,v1 2026-09-03;arXiv cs.LG recent feed
  • 一句话核心贡献:让 looped Transformer 的每个 token 沿“递归迭代时间”关注自己此前的 hidden states,并训练一个由 oracle depth 蒸馏的 halting head,按样本决定何时停止增加 latent depth。

为什么值得关注?

普通 looped Transformer 每轮只把最新 hidden state 传给下一轮,早先计算若被覆盖就无法再读;固定 loop 数又会让简单样本浪费计算、困难样本计算不足。RecurTrace 加入 Loop Memory Attention,同一 token 只在自己的历史 loop states 上注意,不跨 token 位置,因此不引入 future-token 泄漏;halting oracle 则寻找“再加一层是否仍降低 loss”,而不是用置信度阈值或额外 compute penalty。

在同一 1.7B looped backbone 的 MathQA 控制实验中,RecurTrace 平均 2.0 loops 得到 56.9%,比最佳固定深度高 2.2 点;CALM 用 5.6 loops 只有 54.1%,ACT/PonderNet 则塌到 1 loop。方法冻结 base weights,新增参数至多约 2.2%;从 0.6B 到 8B 均超过同预算微调 baseline,生成准确率收益从 0.6 增长到 3.4 点。

与 wenjun 研究方向的关系:它把 latent reasoning 明确成一条 depth trajectory:状态不必压成一个不可寻址向量,而可以保留跨迭代 memory,并由 learned value-of-computation 决定继续。对 latent Dreamer,可以把 loop-time state 改为 imagined belief trajectory,并让 halting 标记“继续 imagined rollout 是否仍改善 action value/uncertainty”。

边界:主要是 MathQA 等短答案推理,不是工具 Agent;halting supervision 需要离线跑多个深度得到 oracle;它只在同一 token 的 loop 维度读记忆,无法直接表达外部环境事件图;新增 attention 会随 loop 数增加 memory cost。

#三、其他高相关论文与动态

#6. TIGPO:跨 policy update 保存图结构,但不对旧轨迹反传

  • 类别Post-training RL / LLM Agent / Credit Assignment
  • 标题TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents
  • 来源与日期:arXiv:2609.03383,v1 2026-09-03;arXiv cs.LG recent feed
  • 一句话贡献:为每个 task 保留跨更新的 transition graph,并在固定 rollout budget 内安排 Exploration/Revisit;历史边与分数只作为 detached structure/statistics,policy loss 仍只训练当前 policy rollout。

同为 64 条当前 rollout/update,Qwen2.5-1.5B 在 ALFWorld 达 91.28%,比 GraphGPO 高 1.96 点;WebShop success 为 77.54%,高 1.17 点。亮点是绕开 stale log-probability:旧经验帮助 current credit,却不直接 off-policy 反传。局限也明显:小模型、老 benchmark、提升不大,persistent graph 的 state identity 在真实 repo 中如何稳定定义仍未解决。

#7. SWE-Gate:功能测试通过后,仍有三分之一不满足 review gate

SWE-Gate 含 303 个任务、75 个 Python repo;四种模型在共同 scaffold 下共有 644 个修复通过 functional tests,其中 221 个仍违反 review constraints。它非常适合给 Code Agent RL 增加第二 reward channel:不仅“修好了”,还要保持兼容性、异常语义和 repo-specific convention。

#8. Minimal Code Edits:over-editing 是独立于正确率的能力轴

  • 类别Code Intelligence / Code Agent / Post-training RL / Evaluation
  • 标题When Models Edit Too Much: On the Fidelity of Minimal Code Edits
  • 来源与日期:arXiv:2609.04061,v1 2026-09-03;arXiv cs.SE/cs.AI/cs.CL recent feed
  • 代码nreHieW/over-editing
  • 一句话贡献:对 400 个 BigCodeBench reference 注入已知最小 AST corruption,测模型在修复正确时是否仍做不必要重写;保留原实现的提示使 excess edit distance 从 0.195 降到 0.131、额外复杂度降 26.6%、Pass@1 反升 2.3 点。

作者还发现 SFT 容易过拟合见过的 corruption pattern,RL 在 OOD edit fidelity 与能力保持之间最好。对 agentic coding,tests pass - λ·unnecessary diff - μ·complexity - ν·review-gate violation 比单一 pass reward 更接近真实合并标准。

#9. Random Attention:长 CoT 的 KV selector 也许没有我们想的那么重要

论文解释:prompt 是一次性、不可恢复的脆弱信息;CoT 会文本复述,且同一 token 在多个 attention head 有冗余副本。这个结论不能外推到 repo Agent——那里恰恰存在大量“只出现一次”的 tool observation;但它给所有 learned compressor 提出更强 baseline:先统一保护 prompt/rare evidence,再证明内容评分本身有增益。

#10. LatentPress:冻结 reader,只训练 0.1% writer,把历史写成 soft tokens

  • 类别Latent Reasoning / Context Compression / Agent Memory
  • 标题LatentPress: Context Compression Beyond Text and Vision
  • 来源与日期:arXiv:2609.01507,v2 2026-09-03(v1 2026-09-01);HF Papers 2026-09-04(抓取时 102 upvotes)
  • 代码HJSang/LatentPress
  • 一句话贡献:小型 reader-matched writer 把对话/文档写成 4–16× 压缩的连续 memory tokens,经 frozen decoder 的 input embedding 直接读取,不在推理时重建文本。

LongMemEval 上 7.70× 压缩为 0.504,略高于 uncompressed evidence 的 0.490,明显高于 text summary 0.184;写入 43ms,读取比 raw/OCR 快 5–9×。但 compression allocation 仍是手工 role heuristic,主要任务是 QA,不是 action selection;soft memory 与 reader 强绑定,也牺牲跨模型互操作和人类审计。

#11. GRPO 的两个新诊断:幸运猜中与 gradient-aligned dense reward

  • 类别Post-training RL / RLVR / Reward Design
  • 标题Spurious Advantage Hidden in GRPO
  • 来源与日期:arXiv:2609.04063,v1 2026-09-03;arXiv cs.AI recent feed
  • 一句话贡献:指出小答案空间或多路径搜索中,GRPO 会给“幸运猜中/绕路碰到答案”的稀有成功异常大权重;提出与组内正负构成无关、保留符号并做全局平衡的 SIGNBALANCE。

二者方向不同但问题相同:binary success 既无法识别 lucky path,也无法区分高低质量 correct path。对 Agent,更理想的 anchor 不是 expert 文本梯度,而是 verifier-grounded state/action effect;否则 GAR 可能奖励“像专家写法”,不一定奖励更好的环境控制。

#12. 两条系统与能力形态 watchlist

  • 类别Tool-use / Systems
  • 标题Speculative Macro Commit for Faster Tool-Using Agents
  • 来源与日期:arXiv:2609.03236,v1 2026-09-03;arXiv cs.AI recent feed
  • 一句话贡献:小 drafter 在隔离 snapshot 上预执行未来动作链;当 authoritative actor 同意首个动作且命中轨迹中挖出的 macro,runtime 直接提交其余已执行步骤与 observation。τ²-Bench Telecom 延迟较串行低 18.59%,AppWorld 低 44.9%,但它是 approximate commit,后者有轻微任务完成率损失。

后一篇可视为一种“能力缓存”:Agent 不必每次都调用大模型,而是把稳定、高频子策略编译成 local neural option。不过它依赖 hosted teacher 和共享 interpreter,且 benchmark 规模与安全审计仍有限。

#四、今日最值得精读的 3 篇

  1. Terminal-Universe:今天最重要的数据观转变——把冻结轨迹恢复成可分支、可验证、可反复采样的环境;重点看 reconstruction sufficiency、re-solving vs imitation 与 multi-round verifier。
  2. Environment Evolution:把 environment design 写成可持续的 off-policy curriculum;重点看难度三因子、lineage scheduler 和“维持 partial-solved group”的 RL 机制。
  3. Rethinking OPD II / One-Shot OPD:对基础模型能力形成与数据效率最有方法论价值;重点看 state coverage 的定义、吸收率下降以及 content-light prompt 实验。

方向替换:若今天专注长轨迹 RL credit,把第 3 篇换成 DRACO;若专注 latent-space reasoning,换成 RecurTrace

#五、今日最值得跟进的 3 个 repo / model / dataset

GitHub 状态快照:2026-09-05 08:00(stars 只表示当前可见度,不代表研究质量)。Terminal-Universe 与 Environment Evolution 抓取时未见论文提供的公开仓库,因此不编造链接。

  1. Thinking-Space/One-Shot-OPD — 30 stars、1 fork,9 月 4 日仍有 push。优先检查 teacher-signature state clustering、one-shot/full-data 配置和 query-diversity selection;最适合直接改成 Agent trajectory 的 state-coverage 实验。
  2. SalesforceAIResearch/Random-Attention — 25 stars,9 月 4 日更新;含 vLLM 侧实现。适合建立 context/KV compression 的 matched baseline,并专门测试 Code Agent 中 once-stated tool evidence 是否让随机淘汰失效。
  3. DeepSoftwareAnalytics/SWE-Gate — 新仓库,抓取时 0 stars;论文承诺代码、数据与实验结果。优先检查 303 个实例的 constraint taxonomy、双 verifier 和 non-compliant patch,可与 nreHieW/over-editing 合成 richer Code Agent reward suite。

额外 watchIBM/draco(动态 rubric credit,1 star)、HJSang/LatentPress(soft-token compressor,1 star)。HF 最新模型/数据流高度噪声化,本轮没有发现经过论文全文与仓库双重核验、比上述资产更值得强推的新 checkpoint/dataset,因此不为凑数推荐。

#六、研究机会 / Idea

#Idea 1:Trajectory-to-Dreamer——把旧轨迹恢复为 counterfactual world-model 数据工厂

以 Terminal-Universe 的环境恢复为起点,不只让 teacher 重解一次,而是在同一 repo snapshot 的关键 event boundary 分叉:

  1. 从原轨迹提取 belief-changing events:读文件、跑测试、发现依赖、首次失败、patch、revert;
  2. 对每个 shared prefix 执行多个 semantic action,记录 observation delta、test delta、cost 与 recovery distance;
  3. 训练 latent belief updater 与 discriminative transition model,使预测表示能区分候选动作后果;
  4. 在 imagined graph 中选 information-gain action 或 task-progress action,再回真实 sandbox 校准。

关键比较应是 raw trajectory SFT / environment re-solving SFT / model-free RL / latent Dreamer,并报告 counterfactual calibration、action ranking 与真实工具预算。这样能把本周的 BB-WM、DWM、Terminal-Universe 与 TIGPO 接成完整 pipeline。

#Idea 2:State-Coverage Data Curriculum——按诱导状态,而不是按题面去重 Agent 数据

把 One-Shot OPD 的 state coverage 扩展到 tool agent:用 belief embedding + tool state + verifier/event type 表示每个决策点,对 rollout state 聚类。数据选择目标不再是 issue/query 语义多样,而是:

  • 覆盖多少 belief/error/recovery clusters;
  • 哪些 prompt/environment 能以最低 rollout 成本诱导新状态;
  • teacher–student gap 在哪些 cluster 吸收最慢;
  • 新状态是真正新的环境机制,还是表面文本变化。

可比较文本 MinHash、prompt embedding 去重、trajectory embedding、teacher-signature state coverage 四种选择。若少量环境也能诱导大范围 state coverage,这会直接改变 agent 预训练数据采购与去重策略。

#Idea 3:Constraint-Aware Environment Evolution——让环境沿“可合并性”而不只沿长度变难

Environment Evolution 目前用 scenario novelty、skill rarity、length 增难;SWE-Gate 与 minimal-edit 论文说明真实软件难度还包括隐含 acceptance contract。可让环境 lineage 逐代增加:

功能需求 → backward compatibility → exception semantics → minimal diff → cross-repo convention → multi-round requirement revision

训练 reward 同时包含 functional verifier、review-gate verifier、edit fidelity、regression 和 cost;DRACO 只负责没有程序化 oracle 的 criteria,程序化 gate 保留最高证据等级。核心研究问题是:环境难度沿 specification thickness 增长,是否比单纯拉长 trajectory 更能产生可迁移的软件工程能力?

#七、今日研究判断

今天的新稿把一个常被混为一谈的“Agent 数据问题”拆成了四层:

trajectory 是历史行为记录;environment 是可重新采样的因果对象;state coverage 是训练真正访问到的监督空间;rubric / verifier / review gate 决定哪些行为值得被强化。

对 wenjun 当前主线,最值得尽快验证的组合不是再收更多轨迹,而是:

把公开轨迹恢复成 executable environments,用 state coverage 选环境和分叉点,用 world model 学候选动作的状态差异,再用程序 verifier + 动态 rubric + review constraints 做分层 credit。

这条线同时连接 model-based RL、Code Agent、agent 预训练数据、长轨迹 credit assignment 与环境自演化;而 RecurTrace 提供了内部 latent computation 的对应启发:状态不仅要被压缩,还要可回看、可延长、并知道什么时候继续计算已经不值。