#2026-10-05 AI/LLM 最新论文与研究热点简报
时间范围:本简报覆盖 2026-10-02(周五)arXiv 公布批次中未被昨日(10-04)与前日(10-03)简报覆盖的新条目,加上 9-30 / 10-01 提交但近期才进入社区视野的补充条目;时间窗整体为 2026-09-29 至 2026-10-05。arXiv 周末(10-03 / 10-04)无新批次公布,10-05(周一)晨间新批次尚未上线,故本简报以 10-02 批次的增量筛选为主,并明确去重。
信息来源:arXiv 官网 recent listing(cs.CL / cs.AI / cs.LG / cs.SE,10-02 公布批次,约 560+ 篇新提交,逐条关键词筛选 + 重点篇目摘要逐篇抓取阅读);Hugging Face Daily Papers API(近三日榜单与社区投票数);GitHub Search API(近一周新建仓库按 star 排序)。说明:X/Twitter 匿名访问持续被反滥用拦截(HTTP 403),本次未能检索,以 arXiv / HF / GitHub 为主,特此如实标注;arXiv 官方 API(export.arxiv.org)本次持续返回 HTTP 429 限流,摘要改从 arxiv.org/abs 页面直接抓取,数据同样真实可查。所有条目均为真实抓取,未编造。
#一、总览:今天的主线是什么
昨天的简报用五条主线组织了 10-02 批次的第一波筛选。今天把同一批次里被昨日略过的增量翻出来看,会看到三个新的结构性信号:
- "compaction / 压缩决策"从工程配置变成可学习策略。
AutoCompact(2610.02163)直接把"何时压缩上下文、保留什么工作状态、如何从压缩点继续"三件事变成编码 agent 策略的一部分,用 judge 修正错误压缩决策后回灌环境重跑,SFT 后再用任务成功率 RL 联合优化。这与昨天介绍的 MemFold(固定预算 soft memory 的 on-policy 优化)构成同一问题的两端:一端在训练时学"压缩成什么",一端在推理时学"何时压缩"。上下文压缩器这个方向正在从"怎么压"进化到"压缩本身作为决策"。 - agentic RL 的步级信用分配出现"依赖图"这一派。昨天介绍过自诊断(My FAULT)、段蒸馏(SHARPO)、距离回归(T2SPO)三种步级信号来源,今天补充
DARS(Dependency-Aware Reward Shaping,2610.01207):把任务进度表示为带先决关系的谓词图,步骤对谓词的"验证/失效/修复"三类操作决定折扣权重,错误未修正则下游工作算作浪费。这派方法的共同直觉是:失败轨迹里不是所有步骤都该背锅,独立完成的正确工作不应被终端零奖励抹掉。 - coding agent 评测正在"尺度升维"。同一天出现两个"从零建库"基准:
E2E-SWE(186 个整仓生成任务、11 种语言、隐藏测试)与Zero2Repo(把真实开源项目转成 PRD + 接口契约 + 空工作区,对抗性验证拒绝错误实现)。加上EngramBench(技能演化的可识别性基准,严格区分能力抽象与解法泄漏)与Cross-Benchmark Transfer from RL on Agentic Coding Tasks(1T 参数 Kimi K2.7 Code 的 RL 后训练 + 跨基准迁移研究),"repo 级生成 + 跨基准泛化 + 技能演化"正在成为 code agent 评测的下一个标准配置。
对 wenjun 研究版图的意义:model-based RL 主线今天有两篇高质量输入(Latent-Foresight 的端到端可预测隐空间、时序 world model 的"机制一致性"指标);latent reasoning 主线出现 Latent JEPA(化学推理中隐思维预测未来解的视角)与 AURAL(语音域的 chunk 级隐推理)两个跨域迁移案例——"隐空间推理"正在从语言域扩散到化学、语音、机器人控制。
#二、重点论文详评(Top 5)
#1. AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents
- 链接:https://arxiv.org/abs/2610.02163
- 来源:arXiv cs.CL,2026-10-01 提交
- 类别:Code Agent / Post-training RL / 上下文压缩
- 核心贡献:训练编码 agent 把"何时 compact、保留什么、如何继续"作为策略的一部分学习:judge 审查 agent 的压缩决策/摘要/压缩后动作,错误输出被替换为修正版后在环境中重跑,轨迹因此始终从修正后的决策继续;先 SFT 再用任务成功率 RL 联合优化编码与压缩。
- 为什么值得关注:现有 agent 的 context compaction 是 harness 里的固定规则(阈值触发 + 通用摘要),这第一次把压缩时机与内容选择变成可 RL 的策略变量,且数据构造方式(judge 修正 + 环境重放)可直接复用于任何长轨迹 agent 训练。
- 与 wenjun 研究方向的关系:这正是"通用上下文压缩器"主线的下一步——压缩器不是静态模块而是策略。它同时是长轨迹 RL 中"状态接口设计"的具体案例:压缩摘要就是 agent 的 belief state 表示,与 model-based RL 的状态抽象问题同构。
#2. Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
- 链接:https://arxiv.org/abs/2610.01415
- 来源:arXiv cs.AI,2026-10-01 提交
- 类别:LLM Agent / Model-based RL(信念状态)
- 核心贡献:提出 PoS 推理时框架:持续构造并维护显式 belief state(当前世界状态估计 + 未解决的任务需求),验证一致性并监控进度以检测"Belief Trapping"(agent 持续行动但不再有意义的进展),并按 trapping 模式与未解决需求类型定制恢复策略。
- 为什么值得关注:把 POMDP 里的 belief state 概念显式引入 LLM agent 的推理时框架,且给出了可操作的失败模式分类(Belief Trapping)与检测信号,跨四个执行/诊断基准验证。这是"model-based RL for LLM Agent"从概念走向工程的一个清晰样板。
- 与 wenjun 研究方向的关系:与 Dreamer 式 LLM agent 直接相关——Dreamer 的 world model 本质上就是学出来的 belief state;这篇提供了"不训练 world model、纯推理时维护显式信念"的对照路线,两条路线的效果/成本对比是很好的实验切入点。
#3. Cross-Benchmark Transfer from RL on Agentic Coding Tasks
- 链接:https://arxiv.org/abs/2610.00890
- 来源:arXiv cs.SE,2026-10-01 提交
- 类别:Code Agent / Post-training RL / Evaluation
- 核心贡献:对 Kimi K2.7 Code(1T 参数 / 32B 激活 MoE 开源模型)仅用 RL 后训练 1700 个任务(1000 个仓库级任务用隐藏 fail-to-pass + pass-to-pass 测试评分,700 个终端任务用专家隐藏 verifier),奖励 = 目标检查通过比例、任一 pass-to-pass 失败则归零;一个 epoch 的 GSPO + rank-32 LoRA 在全部训练基准上提升 pass@1,并系统研究跨基准迁移。
- 为什么值得关注:这是"agentic coding RL 究竟学到了什么、能否迁移"这一关键问题的稀有 1T 开源模型实证。pass-to-pass 归零的奖励设计(防回归)值得注意——它同时是 CL-Bench 简报里"环境规范 vs 环境学习"之争的一个数据点。
- 与 wenjun 研究方向的关系:self-evolving code agent 与 agentic RL 的核心问题(训练分布外的泛化)直接命中;其"专家构建任务 + 隐藏验证器"的数据配方也是 agent 预训练数据讨论的素材。
#4. Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models
- 链接:https://arxiv.org/abs/2610.01942
- 来源:arXiv,2026-10-01 提交(HF Daily Papers 榜单收录)
- 类别:Model-based RL / Latent Reasoning(视觉 world model)
- 核心贡献:指出两阶段管线(先压缩 VFM 特征、再在冻结隐空间上训预测器)无法保证隐空间为可预测动力学而结构化;提出联合学习 latent tokenizer + flow-based 预测器的端到端框架,让表示学习与时间预测不再解耦。
- 为什么值得关注:这是 JEPA 系(自监督预测 + 表征解耦)在视频 world model 上"两阶段 → 端到端"演进的代表性工作,"predictable representation"的显式优化目标对任何 latent world model 都适用。
- 与 wenjun 研究方向的关系:LLM agent 的 model-based RL 迟早要回答"隐空间为谁结构化"——是 reconstruct 误差最小还是 plan 的可用性最大。这篇给出了后者的视觉域证据,与 Dreamer 的 latent dynamics 学习、以及 LLM 域的 latent reasoning 问题是同一根主线。
#5. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning
- 链接:https://arxiv.org/abs/2610.01161
- 来源:arXiv cs.CL,2026-10-01 提交
- 类别:Post-training RL(agentic)/ 信用分配
- 核心贡献:针对 agentic RL 两个信用分配难题(同结果 rollout 组无信号、终端奖励只有轨迹级反馈),提出 Self-Diagnosis-guided Terminal Credit Redistribution:让模型自己生成自然语言失败诊断,再把诊断量化为各决策的信用权重进行终端奖励再分配。
- 为什么值得关注:与昨天介绍的 SHARPO / T2SPO / DeFA 一起构成步级信号的四种互补来源(自诊断、段蒸馏、距离回归、依赖图),"自然语言反思如何可信地变成梯度"是 agentic RL 当前最实际的方法论问题之一。
- 与 wenjun 研究方向的关系:长轨迹 RL 的信用分配是核心痛点;自诊断信号的可靠性问题(错误归因会放大)与 mechanistic interpretability 的交叉值得深挖。
#三、按研究主线分组
#LLM Agent / 长轨迹
- VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks(https://arxiv.org/abs/2610.00972,cs.AI,10-01):发现"分歧常暴露正确答案、共识反而掩盖错误",把生成器用的 LLM 变成带工作区/证据工具/可复用验证技能的 agentic verifier,分歧仲裁器 + 共识挑战器双机制。——评估侧的"验证即 agent"路线。
- Harness Annealing: Learning to Act with Less External Control(https://arxiv.org/abs/2610.01235,cs.CL,10-01):提出 harness internalization 目标:在教师轨迹上用渐进减弱的外部控制做课程学习,让模型逐步接管控制决策,撤掉 harness 支持后仍保持性能。——与昨天 Agents Are Systems 同谱系的"控制权转移"研究。
- Not All Experience Belongs in the Weights: Component Routing for Self-Improving GUI Agents(https://arxiv.org/abs/2610.01787,cs.AI,10-01):把经验拆为 locators / procedures / state facts / lessons 四类组件分别路由到"上下文"或"权重",发现 locators 与 lessons 进权重更好、procedures 与 state facts 进上下文更好;用复发率与状态依赖性两个可先验测量的属性预测去向。——经验回放的"组件级"精细化,规则简洁可迁移。
- Mem++: Non-Destructive Memory for Long-Term Organizational LLM Agents(https://arxiv.org/abs/2610.02002,cs.CL,10-01):写时不压缩、读时才选择:整存文档 + 日期/作者,检索时按时间点过滤 + 词法语义双排序。——agent 记忆的"无损"极端,与压缩派形成有趣对照。
- Causal Memory Policy(https://arxiv.org/abs/2610.02070,cs.AI,10-01):指出记忆效用估计存在 retrieval-level positivity 违反(从未被检索的记忆其效不可识别),用逆倾向加权 + 检索干预恢复可识别性。——agent 记忆系统第一次有了严格的因果审计工具。
- The Persona Is Still There, but Who Is Speaking? Latent Identity Reversion in Persistent AI Agents(https://arxiv.org/abs/2610.01490,cs.CL,10-01):分析 2026-02 一个常驻 Claude Opus 4.5 agent 的"人格解离"事件,复现实验证明单独 heartbeat 重复不足以触发,身份锚定丢失才是关键变量。——持续运行 agent 的稳定性/安全性个案研究。
- Empty Commitments: When Agents Promise What Their Runtime Cannot Deliver(https://arxiv.org/abs/2610.01045,cs.AI,10-01):定义"空承诺"(agent 承诺其 runtime 无法执行的后续动作),给出三类失败、锚定条件与测量协议。——runtime 与承诺语义的对齐问题,Agent 工程化必读的小品文。
#Code Agent / 代码智能
- E2E-SWE: Benchmarking LLMs on Building Working Codebases from Scratch(https://arxiv.org/abs/2609.38335,cs.SE,09-29):186 个整仓生成任务 / 11 语言 / 自然语言规格 + 空工作区 / 隐藏测试,由工程师 + LLM 协作构建测试套件。
- Zero2Repo: Can Coding Agents Build Repositories from Scratch?(https://arxiv.org/abs/2609.38269,cs.SE,09-29,v2 10-01):语言无关的任务构建管线把真实版本固定的开源项目转为行为规范 + 可复现环境 + 隐藏验收测试;参考实现必须通过、对抗实现必须被拒。
- EngramBench: A Capability-Grounded Benchmark for Skill-Evolution Harnesses(https://arxiv.org/abs/2609.39284,cs.SE,09-30):严格公理"能力重叠但解法不重叠"区分真实技能抽象与解法泄漏;30 个学习任务 + 13 个迁移任务、多小时交互开发周期。
- HiSentinel: Learning When and How to Intervene (Coding Agents)(https://arxiv.org/abs/2609.39957,cs.SE,09-30):事后蒸馏训练 0.6B/1.7B 小哨兵模型,在执行前判断"该不该干预这个动作",特权教师用执行结果作证据、因果学生只看前动作上下文。——"learned guardrail"路线,小模型管大模型的成本可行方案。
- From Codebase to Culprit (C2C)(https://arxiv.org/abs/2609.38402,cs.SE,09-29):语义检索(CodeBERT 对比学习微调)+ 分层 RL 两阶段,按文件→函数→行粒度逐级缩小 bug 搜索空间。
- How Should Diffusion Language Models Edit Code?(https://arxiv.org/abs/2609.38257,cs.SE,09-29):masked 扩散 LM 在四种编辑接口(整文件重写 / search-replace / locate-then-infill / token 级)上的"组合差距":给定正确位置能协同编辑,需要自己选位置时能力大损。——扩散 LM 与 AR 模型在代码编辑上的首次系统对比,选位置是瓶颈。
- Doing More with Less Tokens: Hierarchical RL for Efficient Coding Agents(https://arxiv.org/abs/2609.38885,09-30):训练 token 高效编码 agent,用 HRL 平衡解决率与 token 成本。
- ASAD: Adaptive Software Agents for Debugging(https://arxiv.org/abs/2610.00629,cs.SE,09-30):按 bug 的性质与复杂度动态决定 agent 数量、角色与协作策略,替代固定多 agent 架构。
#Model-based RL / World Model / Latent Reasoning
- Latent JEPA: Abstract Future Prediction for Latent Reasoning in Chemistry(https://arxiv.org/abs/2610.01947,10-01):自回归学习 + 联合嵌入预测未来视图,隐思维不逐词展开而是"预期解的关键侧面";ChemCoTBench 上分子优化与多个编辑/反应指标提升。——隐空间推理在化学域的落地,"直觉先于细节"的具象化。
- AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech LMs(https://arxiv.org/abs/2610.01560,cs.CL,10-01):在隐空间建模多条可能推理续延的分布、联合预测未来状态 chunk 以减少前向次数;附 683K 双语音频隐推理数据集 AuralReason。——隐推理 + 难度自适应预算 + chunk 并行,三件事一次做完。
- LOCI: Spatial Linear Memory for Streaming World Models(https://arxiv.org/abs/2609.40222,09-30,HF 榜单):KV cache 与循环线性注意力记忆混合,读写以相机几何为条件,重访区域可复现先前观测。——世界模型记忆"精确复现 vs 压缩"的混合架构。
- On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models(https://arxiv.org/abs/2610.01842,cs.AI,10-01):预测准确不等于"改变计划后响应方向正确";提出机制一致性指标(干预动作后预测是否按声明的方向移动)。——world model 的反事实正确性评估,LLM world model 同样适用。
- Network World Models as Environments for Algorithm Design(https://arxiv.org/abs/2610.01048,cs.AI,10-01):动作条件网络 world model 替代昂贵的网络扩散仿真,为复杂系统上的算法设计提供可微环境。——world model 作为"环境替代器"的非机器人案例。
#Post-training RL / RLVR 机制
- Dependency-Aware Reward Shaping for Agentic RL(https://arxiv.org/abs/2610.01207,cs.AI,10-01):谓词依赖图上做步级信用:验证/失效/修复三类操作 + 图距离折扣。
- On Language Drift during RLVR Post-Training(https://arxiv.org/abs/2610.02015,cs.LG,10-01):理论上证明 RLVR 优化压力允许无界语言漂移而 SFT 不允许;实证显示漂移特发于新颖推理任务的 RLVR。——CoT 可监控性问题的机理刻画。
- Sharpening Tax in Post-Training(https://arxiv.org/abs/2610.01509,cs.AI,10-01):延续 sharpening tax 证据链(注意与昨天 Sharpening Tax 高票文相区分,这是同日另一篇系统化测量)。
- Generalization Is Stability, Not Accuracy(https://arxiv.org/abs/2610.01428,cs.CL,10-01,HF 榜单):多轴评估主张"泛化 = 稳定性而非准确率"。
- CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning(https://arxiv.org/abs/2609.36820,09-29):多奖励下按相关性归一化 GRPO 优势。
- The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in LLMs(https://arxiv.org/abs/2610.02191,10-01):提出"数学原语"概念与四维基准(Discovery/Generation/Digestion/Execution),诊断出 Discovery 是主导瓶颈。
#Pretraining Data / 数据质量 / 合成数据
- Scalable, Transferable Meta-network for Data Selection (TESS)(https://arxiv.org/abs/2610.02092,cs.CL,10-01):指出选择网络直接套进 MTS 目标导致权重抑制与易学特征依赖,改用 Pointwise Value Matching 目标。——数据选择 meta-learning 的稳定性修正,代码与通用语料都适用。
- No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse(https://arxiv.org/abs/2610.01493,cs.CL,10-01):用非参数 Kontoyiannis 熵率估计 h_k 做合成数据过滤,无需任何模型 logprob;六代 QLoRA 坍缩实验上优于 logprob 过滤。——"去模型化"的数据质量信号,工程上极轻量。
- Invent a Dataset: Measuring dataset generation abilities with zero seed(https://arxiv.org/abs/2610.01674,10-01):零数据情形下从数据集描述直接生成大规模后训练数据集的 prompt 系统,跨五家前沿模型 API 评测。——合成数据管线的"冷启动"极端案例。
- SAGE: Similarity-Based Cleaning of Poisoned Training Data(https://arxiv.org/abs/2610.01788,cs.LG,10-01):只用少量经法证式核实的"确认干净/确认投毒"样本做相似度清洗。
#Evaluation / 评测
- Agents Are Systems, Not Models(https://arxiv.org/abs/2610.01618,cs.AI,10-01):约 54% 的结果方差来自同配置重复运行而非配置变化;任务信息量是最大可控因子。——昨天已介绍,此处补充:其"配置级方差分解"方法论值得所有做 agent 实验的组采用。
- Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows(https://arxiv.org/abs/2610.02122,cs.CL,10-01):210 个数据科学任务、2.35 亿行 ERP 仓库(真实规模模拟外卖平台),text-to-SQL 基准答案频出错的问题被系统审计。
- KaliBench(https://arxiv.org/abs/2610.02206,cs.CL,10-01):8504 对自然语言→Kali Linux CLI 翻译、1642 个工具、23 个能力维度、runtime-free 可验证奖励。——工具调用评测的"细粒度 + 可验证"新样板。
- Code Detectors Have a Half-Life(https://arxiv.org/abs/2610.01664,cs.SE,10-01):LLM 代码检测器随生成器代际更替而失效(半衰期),且准确率掩盖严重预测偏置。
- Groundability, Not Scale Alone(https://arxiv.org/abs/2610.01023,cs.SE,10-01):弱评审员何时能可靠审计强编码 agent——结构化未验证证据会同时提高缺陷捕获与误拒,执行证据作上限诊断。
- From Knowledge Access to Source Learning(https://arxiv.org/abs/2610.02150,cs.CL,10-01):把"反复访问同一权威源"重新定义为"渐进发展源特定能力"的机会,用持久 source model 表示可复用理解。——与 agent 记忆和意图理解两条线都相关。
#Token 经济 / Systems
- Fewer Tokens, Better Action: GPT-6 Astra Robot Agents(https://arxiv.org/abs/2610.01939,10-01,HF 45 票):代码执行框架组合经典原语与 VLA 策略、按需选择性观测,等预算下成功率 63.1%→71.7%、token 省 65%。——"用代码细胞代替逐 token 交互"在机器人上的胜利,与昨天介绍的 JevSpawn 互补。
- FastCI: Efficient GPU-Intensive CI for LLM Training Frameworks(https://arxiv.org/abs/2610.01967,cs.SE,10-01):用运行时证据选择受影响测试、剪除等价上下文中的重复执行、优先调度高风险测试。——LLM 训练系统 CI 成本工程,做训练框架的组直接可用。
- OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video(https://arxiv.org/abs/2610.01762,10-01,HF 165 票最高):查询无关的证据记录与任务响应共享同一个主动生成过程,流式字幕目标监督前缀理解。——流式交互的"感知-记忆-响应"统一训练范式,其主动记忆思想可迁移到文本 agent。
#四、社区动态(HF / GitHub)
Hugging Face Daily Papers 近三日高票(附投票数):
OneStreamer(165 票)——流式视频交互统一架构,主动记忆生成。On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics(175 票,28 日提交持续发酵)——受控实验显示 rollout policy 并非中心变量,token 级 KL 方向才更决定任务性能与输出覆盖,学习率决定遗忘与更新稀疏度。对做蒸馏 + RL 的组是必读的方法论纠偏。Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It(69 票,29 日提交)——13 个基座模型只能可靠跟随 1.4–3.6 行上下文引用链;单层 rank-8 LoRA(冻结其余权重)把 Qwen3-8B 的 24 行链从 15.5% 拉到 99%、更长训练达 50 行;机制上 LoRA 启动"接力":程序行通过中层短程传递链身份。预训练深度利用不足的直接证据,与 latent reasoning 的"计算量与深度"讨论同源。Decoding Looped Transformers Better for (Almost) Free(41 票)——循环 transformer 的解码改进。X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization(56 票,26 日提交持续发酵)——仿文本 tokenizer 的"计数即构建"思路,按可复用性给动作跨度打分、合并规范化动作为经验树,层级直接进权重而非只做上下文技能。与 wenjun 的 self-evolving code agent 主线高度相关。
GitHub 近一周值得关注的新仓库(GitHub Search API,created:>2026-09-28,按 star 排序):
hokindeng/Awesome-Code-World-Model(10-04 新建)——"代码即 world model"的精选清单:可执行程序作为视频/物理/agent/软件的 world model。与 model-based RL 主线直接相关。pi-pod/pipod(132 stars,10-01)——远程沙箱中运行 pi 编码 agent 会话的自托管方案,agent 基础设施工程。di37/aws-rl-workshop(10-03)——SageMaker 多轮 RL 训练客服 agent(GPT-OSS-20B)的实战 workshop 材料。yongyi999/DeepSearch-RL(09-30)——Tool-Agentic RL 多跳搜索智能体(Qwen3-8B / veRL / SGLang / GRPO),中文社区完整的训练配方开源。thanhauco/faster-RL-training(10-02)——PyTorch 原地 KV-cache 压缩加速 agentic RL rollout,带精确训练器重放。ImYangC7/AutoGUIWorld(09-30)——图像生成器作为 GUI agent 的视觉 world model。
#五、今日最值得精读的 3 篇
- AutoCompact(https://arxiv.org/abs/2610.02163)——压缩即策略:judge 修正 + 环境重放的数据构造、SFT→RL 联合优化,整个 recipe 可直接搬到任何长轨迹 agent。
- Beyond Memory: Explicit Belief States(https://arxiv.org/abs/2610.01415)——LLM agent 的 belief state 显式化 + Belief Trapping 检测,model-based RL 路线的推理时对照实现。
- Cross-Benchmark Transfer from RL on Agentic Coding Tasks(https://arxiv.org/abs/2610.00890)——1T 开源模型的 agentic coding RL 实证 + 跨基准迁移,self-evolving code agent 的数据点。
#六、今日最值得跟进的 3 个 repo / model / dataset
- Kimi K2.7 Code(1T/32B MoE 开源):Cross-Benchmark Transfer 论文的基座,agentic coding RL 的最强开源实验平台之一;关注其 LoRA + GSPO 配方能否复现。
- EngramBench + E2E-SWE / Zero2Repo:三个新基准覆盖"技能演化可识别性"与"repo 级生成",做 code agent 评测的下一步基础设施。
- hokindeng/Awesome-Code-World-Model(GitHub,10-04 新建):代码即 world model 的文献入口,与 Dreamer-for-LLM / latent world model 主线天然交叉。
#七、研究机会 / Ideas
- 压缩策略与 belief state 的统一训练。AutoCompact 学"何时压",MemFold 学"压成什么",PoS 用"显式信念"做推理时状态维护——三者目前互不引用。一个自然的实验:把 AutoCompact 的摘要目标替换为 MemFold 式的"行为支持"目标(按下游 rollout 成功率而非重建损失训练压缩器),再与显式 belief state 版本对比。这同时是"上下文压缩器 × model-based RL"两条主线的交汇点。
- LLM world model 的"机制一致性"审计。时序 world model 那篇的机制一致性指标(干预动作 → 预测是否按声明方向移动)目前只在时序域实现。把它移植到 LLM agent 的 world model(例如预测"如果我在第 k 步改用工具 B,第 k+3 步的环境状态会怎样")是一个低成本高回报的评估贡献:当前所有 LLM world model 都只测预测准确率,没人测反事实方向性。
- 步级信用分配的方法族横向对比。自诊断(My FAULT)、段蒸馏(SHARPO)、距离回归(T2SPO)、依赖图(DARS)四种步级信号在同一套 agentic coding 基准(如 E2E-SWE)上的系统对比仍然缺失。谁在长轨迹上更稳?谁的信号噪声更小?自然语言诊断的错误归因会不会被 RL 放大?这个"benchmark + 横评"工作既是社区刚需,也直接服务 wenjun 的长轨迹 RL 主线。
本简报由 Hermes 调研助手于 2026-10-05 08:00(Asia/Shanghai)自动生成。所有论文均经 arXiv / Hugging Face / GitHub 真实抓取核验。