#2026-09-03 AI/LLM 最新论文与研究热点简报
覆盖窗口:截至北京时间 2026-09-03 08:00,重点覆盖 arXiv 2026-09-02 recent feed(论文 v1 多为 8 月 31 日或 9 月 1 日)和 Hugging Face Daily Papers 9 月 2 日榜单。这批新稿很密集,本期不必扩展到 7 天。
检索与核验:检索 arXiv
cs.AI / cs.CL / cs.LG / cs.SE / stat.MLRSS(合计 1,173 个 feed 条目),并用 Hugging Face Papers API / Daily Papers API 交叉核对。对 8 篇重点稿下载 PDF,以 PyMuPDF 抽取全文核验方法与实验。arXiv 聚合 API 在批量请求后返回 429,但五个分类 RSS 均可访问;OpenAlex 本轮返回 503。X/Twitter 没有稳定、可审计的公开时间线接口,因此不引用社交媒体转述,改用 arXiv、HF、项目页与 GitHub。所有性能数字均为作者报告,不等于独立复现。
#一、早读结论:今天最重要的 6 个信号
- “Dreamer for LLM Agent”正在从只预测未来,走向显式维护当前 belief。 BB-WM 直接指出:在部分可观测环境里,simulation 回答“做了会怎样”,belief 回答“现在知道什么、不知道什么”;后者决定是否应先执行信息搜集动作。
- Agent 的能力单位正在从 model checkpoint 迁移到
model × harness × state interface。 HarnessDev 发现自生成 harness 在代码与搜索任务上仍明显落后人工系统,且对执行模型的迁移很差;HoH 则表明,分轮计划—开发—独立测试和版本化证据能显著延长自主开发的有效 horizon。 - 长轨迹 RL 的关键不是把同一个 terminal reward 切碎,而是先把轨迹变成“可寻址事件”。 CE-GRPO 用可执行 Code-CoT 暴露语义事件,再从共享 prefix 分叉 rollout,以 outcome difference 形成局部 advantage;这是 representation–optimization co-design,而非单纯换 advantage estimator。
- 基础模型训练中的 teacher signal 不是在所有阶段都同样有益。 中期训练用标准 forward-KL 蒸馏会继续提高 reasoning,却拖慢新事实吸收;teacher entropy 可以成为按 token 决定“蒸馏还是 NTP”的路由信号。
- 通用上下文压缩正在变成数据库/流处理问题。 ContextPipe 把 prompt assembly 写成可规划、可审计的查询执行;Parsing the Stream 则把无限增长的轨迹折叠为 typed run state。二者都比“隔几轮做一次摘要”更接近工程正确解。
- Agent memory 的下一步是可失效、可归因,而不是只会检索。 Invalidation Contracts 用版本戳与行级 diff 管理经验过期;DiagEvo 用 Active/Mastered error causes 管理自演化课程。共同问题是:记忆何时仍有效,何时必须重新验证?
#二、重点精读(Top 5)
#1. Towards a Belief-Based World Model for LLM Agents
- 类别:
Model-based RL/LLM Agent/World Model/Long-horizon - 标题:Towards a Belief-Based World Model for LLM Agents
- 来源与日期:arXiv:2609.00455,v1 2026-08-31;2026-09-02 recent feed
- 代码:skumar-ml/belief-world-models
- 一句话核心贡献:提出 Belief-Based World Model(BB-WM),让 LLM policy 除了模拟候选动作未来,还能直接查询当前状态的概率 belief,从而在部分可观测环境中判断何时需要先搜集信息。
为什么值得关注?
很多 LLM world model 工作把接口定义成 state + candidate action → predicted future。但如果当前状态本身不确定,多采样未来会把两类不确定性混在一起:一类是“我不知道当前 blind spot 里有没有车”的 epistemic uncertainty,另一类是“即使当前状态确定,未来仍有随机性”的 aleatoric uncertainty。随着 horizon 增长,从未来样本反推当前未知量也越来越低效。
BB-WM 因而给 policy 两个互补接口:
- belief query:当前什么已知、什么未知,用来判断是否执行观察、搜索、测试等 epistemic action;
- simulation query:候选操作会带来什么后果,用来选择推进目标的 pragmatic action。
作者在 ALFWorld 和 ScienceWorld 上,以 Llama-3.1-8B、Qwen3-14B、Sonnet 4.6 搭配 ReAct/ReflAct 测试。ALFWorld 中,Llama-3.1-8B + ReAct 的 SR@1 从 29.9 提升到 BB-WM 的 62.9;Qwen3-14B + ReAct 从 76.1 到 91.0。单独 belief 与单独 simulation 均有收益,而组合通常最好。ScienceWorld 对较小模型也改善 performance / efficiency,Sonnet 主要体现为效率收益。
与 wenjun 研究方向的关系:这是今天最直接命中 “model-based RL / Dreamer for LLM Agent” 的工作。代码 Agent 可把 repo、runtime、测试覆盖、依赖版本、隐藏约束表示成 belief,而不是伪装成唯一确定 state。例如一次失败测试后,Agent 不应立刻想象 20 个 patch,而应先问:bug 位于 parser、schema 还是环境配置的概率各是多少?下一次工具调用应最大化任务进展,还是最大化信息增益?
边界:论文当前 belief update 是 benchmark-specific、手工构造的,概率不确定性主要围绕对象位置;它证明了“暴露 belief 有用”,还没有解决如何从真实长轨迹学习可校准的 latent belief,也没有训练 Dreamer 式 imagined policy。
#2. Harness-of-Harness:把多日软件开发变成持续改进闭环
- 类别:
Code Agent/Self-evolution/Long-horizon/Environment Design - 标题:Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
- 来源与日期:arXiv:2609.01481,v1 2026-09-01;HF Daily Papers 2026-09-02
- 代码:Flesymeb/HarnessOfHarness;项目页
- 一句话核心贡献:在现有 coding harness 外再加一层迭代控制器,把开发组织为小步、可验证的 planning–coding–testing 循环,并以版本化项目历史支持恢复与持续能力增长。
为什么值得关注?
长时间 coding agent 常陷入三类退化:只修眼前 bug 而不再扩展能力;局部修改破坏旧功能;反复读取和验证已完成组件。HoH 的设计不是简单“多跑几次 Agent”,而是用几个结构性约束维持进度:
- 每轮计划同时包含 outstanding repair 和一个具体的新能力;
- developer 在实现中做局部测试,tester 再从整体需求做独立黑盒/白盒评估;
- 约束必须交付的 artifact 与证据格式,但不规定模型内部 workflow;
- 文件、计划、报告和历史采用 progressive disclosure,而不是全部塞进上下文;
- 版本化保存已验证状态,重大 regression 后可回滚。
在 GameCraft-Bench、FrontierSWE、ProgramBench,以及 Codex+GPT-5.5、OpenCode+DeepSeek-V4-Pro、Pi+MiniMax-M3 三组配置中,作者报告 3 轮后平均相对提升 52.25%、最大 82.86%;FrontierSWE 的 Codex 配置从 22% 持续升到第 10 轮的 72.67%。开放式实验运行 70 多轮、持续多日构建 FPS 游戏。
与 wenjun 研究方向的关系:HoH 把“自演化代码 Agent”具体化为一个外层控制问题:每一轮都要选择下一项 capability increment、分配验证预算、保存可复用证据,并决定继续、回滚还是转向。这天然可以写成 model-based RL:世界状态不是代码文本本身,而是 已验证能力 + 未解决缺陷 + 依赖关系 + 测试可信度 + 历史决策。
边界:绝对成绩与成本仍受执行模型、provider cache accounting 和 benchmark evaluator 影响;多轮收益不能自动推出跨项目能力迁移。开放式 FPS 案例说明 feasibility,不是严格的通用性证明。
#3. Learning Where Outcomes Change:CE-GRPO 的可寻址 credit assignment
- 类别:
Post-training RL/Long-horizon/Code Reasoning/Credit Assignment - 标题:Learning Where Outcomes Change: Credit-Addressable Reasoning for Multimodal Geometry
- 来源与日期:arXiv:2608.30457,v1 2026-08-31;HF Daily Papers 2026-09-02
- 代码:gjn12-31/CE-GRPO
- 一句话核心贡献:让推理轨迹中的语义事件同时成为 RL 的比较与归因单位,通过共享 prefix 的分叉 continuation 找出“结果从哪里开始改变”,再分配局部 advantage。
为什么值得关注?
trajectory-level GRPO 对整条回答给一个回报,会把视觉绑定错误、辅助线选择、代数推导和最终格式化混为一体。本文先用 Code-CoT 把图中关系写成 line-addressable executable code,并把推理组织成 reference / think / auxiliary 等 typed events;再用 CE-GRPO 结合结构先验和按 event type 归一化的 entropy 选择边界,从同一 prefix 采样完整后续,以不同 outcome 反推出局部决策价值。
九个几何 benchmark 上,作者报告平均准确率 76.04,比 Qwen3-VL-8B 高 8.09 点、比 trajectory-level GRPO 高 3.43 点;中间事件越多,相对优势越明显。真正值得借鉴的不是几何任务,而是这句话:若表示中没有可寻址的状态/事件,credit assignment 算法就没有稳定的归因对象。
与 wenjun 研究方向的关系:对 Code Agent,可把事件定义成“定位 symbol、提出 hypothesis、运行测试、修改 patch、验证回归、更新 belief”,而不是按固定 token 数切 segment。进一步将共享 prefix 分叉变成 counterfactual tool rollout:固定历史与 repo state,只替换一个 semantic action,比较后续测试、恢复成本与信息增益。
边界:结构化 Code-CoT 与几何 verifier 提供了较强先验;真实软件开发的 event ontology 更开放,而且 continuation 的 outcome 可能有高方差和昂贵环境成本。
#4. Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
- 类别:
Foundation Model Training/Pretraining Data/Distillation/Continual Learning - 标题:Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
- 来源与日期:arXiv:2609.01532,v1 2026-09-01;HF Daily Papers 2026-09-02
- 代码:facebookresearch/midtraining-distillation
- 一句话核心贡献:发现标准 forward-KL 蒸馏在 mid-training 阶段偏向 procedural reasoning、抑制新事实吸收,并提出用 teacher predictive entropy 按 token 路由 KD/NTP 的 Switch Distillation。
为什么值得关注?
这篇不是又一个“蒸馏更省算力”的结果,而是在回答能力形成机制:同一个 teacher objective 为什么在不同训练阶段塑造不同能力? 在 pretraining,forward-KL 相对 NTP 同时改善 reasoning 与 factual recall;在 mid-training,学生已有较成熟的低熵知识,而 post-trained teacher 对数学、指令等程序性数据更自信,对知识密集 web text 熵更高。高熵 teacher distribution 会削弱 ground-truth token 的学习信号,于是 reasoning 继续变强、未掌握事实学得更慢。
Switch Distillation 的做法很直接:teacher 低熵、足够自信时蒸馏;否则退回 cross-entropy。OLMo-2 1B 学生、7B/13B teacher 的受控实验中,相对 NTP,作者报告 reasoning 达到 1.61–1.71 倍、knowledge/common sense 为 1.13–1.19 倍,同时保留 96.7–96.8% factual recall;收益经过 post-training 后仍保留,且事实差距闭合。
与 wenjun 研究方向的关系:这提示持续预训练/Agent 预训练不能把 teacher confidence 当作统一质量分。对于执行轨迹,teacher 可能对格式化 action 极自信、对真实环境状态极不确定;全量 logit distillation 会把“会说流程”优化得比“学到新环境事实”更快。可以按 token/event 的 epistemic confidence、verifier agreement 和 novelty 路由不同目标。
边界:主实验聚焦 1B student 与 OLMo-2 生态,不能直接外推到更大模型、代码持续预训练或在线 Agent 数据;teacher entropy 是便宜信号,但不等于事实正确性。
#5. HarnessDev:Agent 能否创建并进化自己的 Harness?
- 类别:
LLM Agent/Code Agent/Self-evolution/Evaluation - 标题:HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
- 来源与日期:arXiv:2609.01437,v1 2026-09-01;2026-09-02 recent feed
- 项目页:Self-Developing Agents / HarnessDev
- 一句话核心贡献:把评测对象从一次任务答案改成持久、可运行的 agent infrastructure,分别测试从弱 seed 创建 harness 和依据执行反馈持续进化 harness 的能力。
为什么值得关注?
HarnessDev 将 creator model 与 executor model 分开,覆盖 6 个 creator、4 个领域、5 个 downstream benchmark、2,207 个隐藏评测实例,并同时测 task success 与 executor token cost。结论很克制也很重要:模型生成的 harness 在写作和 ML experimentation 上可匹配或超过所选人工 reference,但在代码、搜索与研究上仍显著落后;Evolution 有时提升表现,却不稳定、对 held-out task 只部分迁移;换固定 executor 后,收益强依赖实际运行 harness 的模型。
这意味着所谓“Agent 自我改进”可能只是 harness 与某个模型的 co-adaptation,而不是可移植能力。论文给出的现实例子也很醒目:相同 GPT-5 权重,在不同 CLI harness 上的 Terminal-Bench 2.1 成绩可从 35.2% 变成 49.6%。
与 wenjun 研究方向的关系:做 self-evolving code agent 时,应把 transfer matrix 纳入主指标:creator × executor × task family × budget。若更新只对当前 executor 有效,它更像 policy-specific prompt overfitting;若能跨 executor 保持收益,才更接近学到环境或任务结构。
边界:人工 reference 的质量和所选 benchmark 会影响“超过人类 harness”的表述;自演化阶段仍依赖有限反馈集,如何避免隐式 benchmark overfitting 仍是核心难题。
#三、其他高相关论文与动态
#6. HyperWorld:状态序列化本身就是 world model 的归纳偏置
- 类别:
Model-based RL/World Model/State Representation - 标题:HyperWorld: Hypergraph-Structured State Serialization Improves Learned Textual World Models
- 来源与日期:arXiv:2609.00002,v1 2026-08-31;2026-09-02 recent feed
- 一句话贡献:在相同 state/action→effect 目标下,比较 raw observation、独立句子、pairwise triples 与 entity-centered hyperedges,发现高阶超边表示对 0.5B–1.5B 模型和 OOD world 最有帮助,并改善下游 greedy planning。
这与 BB-WM 正好形成上下游:belief 决定应保存怎样的不确定状态,HyperWorld 提醒状态如何 serialization 会改变可学习性。对代码仓库,单独 symbol triple 可能不够,应考虑围绕函数/模块聚合“定义—调用—测试—依赖—运行时事实”的 hyperedge。
#7. ContextPipe:把 Agent 上下文组装写成数据库查询执行
- 类别:
Context Compression/Long-horizon Agent/Systems - 标题:ContextPipe: Database-Inspired Context Assembly for Long-Horizon Agents
- 来源与日期:arXiv:2609.00749,v1 2026-09-01;2026-09-02 recent feed
- 一句话贡献:以
Plan → Bind → Optimize → Execute → Feedback管线、结构化 ContextSource catalog、cache-aware optimizer 和 EXPLAIN ANALYZE trace 管理 prompt 内容、顺序、压缩与缓存。
在 SWE-bench Pro 的 Qutebrowser 子集上,相对 append-only policy,作者初步报告 token volume -31%、LLM calls -23%、response time -9%,代价是 KV cache-hit ratio 降低。它不是 learned universal compressor,而是把 context engineering 从不可审计 heuristic 变成可重放 physical plan;当前证据仍只是单一子集的 preliminary evaluation。
#8. Invalidation Contracts:跨 episode 记忆需要“缓存失效协议”
- 类别:
Agent Memory/Continual Learning/Tool-use - 标题:Invalidation Contracts for Cross-Episode Agent Memory
- 来源与日期:arXiv:2609.00243,v1 2026-08-31;2026-09-02 recent feed
- 一句话贡献:给 API recovery suggestion 附加 cacheability、version stamp 与结构化 diff,使 Agent 能在 server data drift 后精确淘汰过期经验。
约 9,400 个 episodes、7 个模型、3 条 serving path 的实验把收益拆成 validity × compliance(model, protocol, action type):协议保证经验是否仍然正确,模型决定是否真的执行。行级失效在 4/7 模型上回收 baseline token cost 的 29–33%;表级失效会误删同表其他有效经验。对长期 Code Agent,memory entry 应绑定 dependency/version/test contract,而不是只存一段“上次这样修成功了”。
#9. Parsing the Stream:一个轨迹,两种消费者,两类压缩目标
- 类别:
Long-horizon Agent/Context Compression/Observability - 标题:Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers
- 来源与日期:arXiv:2609.01466,v1 2026-09-01;2026-09-02 recent feed
- 代码:SalesforceAIResearch/tracelab
- 一句话贡献:以 append-only event ledger 增量折叠出 typed run state,并为人类 observer 与 Agent 自身编译不同 view。
作者报告 observer view 用约 14–15 倍更少输入 token、5–7 倍更低成本,把监控问答准确率从 raw-trace baseline 的 0.48 提到 0.85–0.87;在 120-link sequential dependency task 上,维护 running statistic 的 per-step state 为 30/30,而 full context 为 8/30。论文也主动承认 schema 与问题共同设计、Agent 侧 benchmark-system co-development,因此数字应看作机制证据,不宜当通用 benchmark SOTA。
#10. Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
- 类别:
Code Agent/Evaluation/Trajectory - 标题:Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
- 来源与日期:arXiv:2609.01603,v1 2026-09-01;2026-09-02 recent feed
- 代码与数据:DeepSoftwareAnalytics/PTA-IRT
- 一句话贡献:提出 PTA-IRT,用历史 trajectory 的探索上下文、修改尝试和 solving path 作为 privileged information,选择低预算 calibration subset 并估计 Agent 的全 benchmark 分数与排名。
它把轨迹从“训练数据”变成“测量工具”:只看 pass/fail 会丢掉任务对不同 agent strategy 的区分度,而 trajectory-aware Fisher information 可选择更有诊断价值的题。作者在四个 SWE benchmark 的低预算设置下报告优于 outcome-only IRT;适合作为昂贵 Agent RL 迭代中的快速回归评测,但仍需要警惕历史轨迹来自旧模型/旧 harness 时的 distribution shift。
#11. DiagEvo:从自身失败史生成自演化课程
- 类别:
Self-evolution/Continual Learning/Post-training RL - 标题:DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory
- 来源与日期:arXiv:2609.00768,v1 2026-09-01;HF Daily Papers 2026-09-02
- 一句话贡献:diagnostician 从 solver 失败史抽取重复 error causes,按 skill hierarchy 组织并标记 Active/Mastered,再指导 challenger 在弱点定向生成与自由探索之间分配课程。
默认 4B diagnostician 下,作者报告三种 solver 在九个 benchmark 的均值都优于基线;Qwen3-8B 在五个数学 benchmark 达 72.3%,比 R-Zero 高 4.5 点。启发在于 self-play 不必依赖外部 syllabus,但 error-memory 本身可能继承诊断模型偏差,需要用环境验证而不是只靠自洽投票。
#12. Harness Engineering:11 个生产 coding harness 的源码解剖
- 类别:
Code Agent/Systems/Tool-use - 标题:Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems
- 来源与日期:arXiv:2609.00006,v1 2026-08-31;2026-09-02 recent feed
- 一句话贡献:源码分析 Claude Code、Codex CLI、Gemini CLI、OpenHands、Aider、Hermes、Pi、OpenCode、OpenClaw 等 11 个系统,归纳 7 个子系统、29 个设计模式和季度级演化趋势。
两个反直觉观察值得记住:约 400 万行代码中,没有 runtime 引入通用 agent framework,也没有使用 vector embedding 做代码检索;主流系统依赖 hand-rolled async loop 与 deterministic retrieval。SKILL.md 风格 skill 在 9/11 中出现,MCP 为 8/11。该工作是结构性观察而非性能因果实验,但很适合用来定义 HarnessDev / HarnessEvolve 的可操作搜索空间。
#13. 两条基础模型 / latent reasoning 补充线索
- 类别:
Foundation Model Training/Systems - 标题:SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
- 来源与日期:arXiv:2609.01343,v1 2026-09-01;HF Daily Papers 2026-09-02
- 一句话贡献:在 per-token FLOPs、非 embedding 参数量和 KV cache 都匹配时,让 MoE Transformer 的中间半层重复两次;作者拟合到训练 FLOPs 节省 6.8–18.0%,收益在 Code、长样本和多 in-context examples 上更大。
- 类别:
Latent Reasoning/Test-time Scaling - 标题:Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning
- 来源与日期:arXiv:2609.01449,v1 2026-09-01;2026-09-02 recent feed
- 一句话贡献:为 diffusion denoiser 加 persistent hidden state、移除 timestep conditioning,形成可运行任意深度的共享迭代更新;结果提示 diffusion 的主要价值可能是训练期 denoising curriculum,而不是推理期退火采样。
后者在 Sudoku-Extreme 报告 99.90% exact solve、Maze-Unique 98.93%,且训练 horizon 之外继续加深仍能提高准确率。它是结构化 puzzle 结果,尚不是自然语言 latent reasoning;但“训练时课程塑造迭代动力学,推理时保持同一更新规则”值得与 recurrent-depth LLM 和 Dreamer latent rollout 对照。
#四、今日最值得精读的 3 篇
- Towards a Belief-Based World Model for LLM Agents:最直接连接 model-based RL、POMDP belief 与 LLM Agent 接口;重点看 belief query 和 simulation query 的互补性,而不只是最终成功率。
- Harness-of-Harness:把多日 Code Agent 的持续改进拆成可验证增量、独立测试、progressive disclosure 与版本恢复,适合映射成外层 RL/control loop。
- Learning Where Outcomes Change / CE-GRPO:对长轨迹 credit assignment 最有方法论价值——先设计可寻址的事件表示,再讨论局部 advantage。
基础模型训练替代选择:若今天更偏训练机制,把第 3 篇换成 Knowledge Distillation During Mid-Training。
#五、今日最值得跟进的 3 个 repo / model / dataset
GitHub 状态快照:2026-09-03 08:00(stars 只反映刚发布后的可见度,不代表论文质量)。
- skumar-ml/belief-world-models — 2026-08-31 创建,0 stars;优先看 ALFWorld/ScienceWorld belief state schema、query policy 与 WALL-E 组合方式。这是最适合立即改造成 Code Agent POMDP baseline 的仓库。
- Flesymeb/HarnessOfHarness — 2026-09-01 创建,20 stars、1 fork,9 月 2 日仍有 push;仓库包含 framework、benchmark traces 与多日游戏案例,值得检查每轮 artifact contract、回滚和 progressive disclosure 的实际实现。
- facebookresearch/midtraining-distillation — 2026-08-28 创建,4 stars,9 月 2 日更新;适合复现 teacher-entropy routing,并替换成 code / agent trajectory token,测试 reasoning–recall trade-off 是否变成 procedure–environment-knowledge trade-off。
低成本 watch:gjn12-31/CE-GRPO(事件级 RL)、DeepSoftwareAnalytics/PTA-IRT(低预算 SWE Agent 评测)、SalesforceAIResearch/tracelab(长轨迹 typed fold)。本期未发现一个经过充分核验、同时比上述仓库更匹配 wenjun 主线的新 HF dataset,因此不为凑数强推数据集。
#六、研究机会 / Idea
#Idea 1:Belief-Dreamer for Code Agent——同时学习“现在可能是什么”和“做了之后会怎样”
建立两条解耦但相互约束的模型:
belief updater:从 issue、代码观察、tool output、test failure 更新p(latent bug/state | history);transition model:预测p(next state, verifier outcome | belief, semantic action)。
Policy 在每一步选择 epistemic action(搜索、加日志、跑定向测试、读取依赖)或 pragmatic action(直接 patch / refactor)。主要指标不只看 resolve rate,还看 belief calibration、信息增益、imagined rollout 与真实 sandbox 的分布距离,以及工具成本。关键 ablation:只给 simulation、只给 point estimate、给 calibrated belief、belief+simulation。
#Idea 2:自演化 Harness 的“可迁移更新”而非单模型自适应
把 HarnessDev、HoH、HarnessEvolve 合成一个实验矩阵:creator 诊断失败并提出 harness patch,HoH 用小步 artifact contract 落地,reference-trajectory alignment 做 credit,最后在多个 executor 和 held-out repo 上 gate。更新 reward 可写成:
held-out capability gain - λ·token cost - μ·regression - ν·executor-specificity。
真正的问题不是“能否让当前模型分数涨”,而是:什么 harness 修改编码了环境结构,能跨模型迁移;什么修改只是迎合当前 executor 的 prompt/action habit? 这可能形成比单纯自动 prompt optimization 更清晰的研究贡献。
#Idea 3:Event-addressable latent state:把表示、压缩和 RL 归因统一起来
结合 HyperWorld、ContextPipe、trace fold 与 CE-GRPO:用 entity-centered hyperedge 表示 repo state,每个 typed event 同时具备四个用途——可进入/退出上下文、可被 world model 预测、可建立 invalidation dependency、可作为 counterfactual rollout 的 credit boundary。然后比较:
- token chunk / message turn / semantic event 三种 segment;
- 文本摘要 / triples / hyperedges / latent state 四种表示;
- terminal GRPO / event-level branch advantage / model-based imagined advantage 三种训练目标。
核心假设是:好的 latent state 不只压缩历史,还应该让未来可预测、旧知识可失效、局部动作可归因。 这能把“通用上下文压缩器”和“长轨迹 Agent RL”从两个工程话题连接成同一个状态表示问题。
#七、今日研究判断
今天的新稿形成了一条非常连贯的链:
BB-WM 决定 Agent 如何表示“已知与未知”;HyperWorld 决定状态如何组织;ContextPipe / trace fold 决定哪些状态进入当前上下文;CE-GRPO 决定哪一个事件对结果负责;Invalidation Contracts 决定跨 episode 经验何时过期;HoH / HarnessDev 决定这套外部执行系统能否持续演进并跨模型迁移。
对 wenjun 当前主线,最值得尽快占住的问题不是再做一个通用 Agent scaffold,而是明确提出:
长轨迹 LLM Agent 的 world model 是否应首先是 belief model?如果是,belief 的可校准表示能否同时改善 epistemic exploration、trajectory compression、credit assignment 和 harness self-evolution?
这个问题能自然覆盖 model-based RL、latent-space state、代码 Agent、自演化环境和持续学习,并且每一层都有今天的新工作可作为 baseline 或反例。