#2026-10-04 AI/LLM 最新论文与研究热点简报

时间范围:本简报覆盖 2026-10-02(周五)arXiv 最新公布批次为主的最近 48 小时内容,并与 10-01 批次(已在昨日简报覆盖)做了去重;最热的社区讨论条目以 Hugging Face Daily Papers(10-02 榜单)为准,时间窗整体为 2026-10-01 至 2026-10-04。

信息来源:Hugging Face Daily Papers API(2026-10-02 榜单,含社区投票数)、arXiv 官网 new listing(cs.CL / cs.AI / cs.LG / cs.SE / stat.ML 五分类,10-02 公布批次共约 560 篇新提交,逐条关键词筛选 + 摘要逐篇阅读,全部条目均为真实抓取,未编造)、GitHub Search API(近一周新建仓库按 star 排序,两次检索;期间触发匿名限流,等待配额恢复后完成第二次检索)。说明:arXiv 周末(10-03/10-04)无新批次公布,故最新可用批次为 10-02 公布(内含 10-01 深夜提交);X/Twitter 匿名访问持续被反滥用拦截(HTTP 403),本次未能检索,以 arXiv / HF / GitHub 为主,特此如实标注。


#一、总览:今天的主线是什么

把昨天的五条主线继续向前推,今天的批次呈现三个值得注意的结构性变化:

  1. "Harness 退位"研究从提案变成实证科学。今天出现了一整批对 harness 本身做因果审计的工作:When Harnesses Lose the Signal(把 recovery 从"平均成功率"里拆出来,同一执行状态下比较有/无恢复的差异,区分 rescue 与 harm)、Agents Are Systems, Not Models(agent 的系统配置——任务信息量、推理预算、self-verification、时长——解释约 54% 的结果方差,模型本身反而不是最大变量)、Finding the Right Fit: Model-Harness Interactions(harness 与模型存在交互效应,不存在普适最优 harness)。加上昨天介绍的 Harness Annealing,"harness 是被测量对象而不仅是工具"这个方法论正在成型,eval 社区在快速跟进。
  2. 信用分配方法进入"段级/依赖级"细粒度竞赛。昨天是 My FAULT(自诊断信用)与 trajectory graph 步级优势,今天补上两篇:SHARPO(环境面向的段级 teacher-student log-prob gap 作为有界乘子修正 GRPO advantage)、T2SPO(从成功轨迹推导 remaining-distance 目标做步级反馈)、加上 DeFA(用事件依赖图 + 失败传播图定位决定性错误步)。三篇与 My FAULT 构成四种互补的步级信号来源:自诊断、段蒸馏、距离回归、依赖图——agentic RL 的中间粒度监督正在变成一个可以横向对比的方法族。
  3. RLVR 税收学的"第二波"证据。昨天 Sharpening Tax(78 票)给出 pass@K 收缩的证据,今天 Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It(一个模型上训多个小 LoRA 各自采样投票,胜过把预算集中训一个大 LoRA——因为 RLVR sharpening 让采样共享同样的错误,投票翻不了盘)、Sharpen Before You Adapt(TTRL 前先做 data-free sharpening 能让 label-free 适配更高效——干脆把 sharpening 当成资源主动管理)。连同 Random-Reward RL as a Probe(随机奖励 RL 是探针,测的是模型"可达性"而非当前性能),sharpening 从"批评对象"变成了"可测量、可管理的资源"。

对 wenjun 研究版图的意义:model-based RL 主线今天有高质量理论输入(因果 world model 的干预可识别性、commute-time preserving 隐空间),latent reasoning 主线出现 ICL→latent amortization 的语言结构边界(哪些任务能摊销进隐向量),两条线都在从"概念"走向"可操作的边界刻画"。


#二、重点论文详评(Top 5)

#1. SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

  • 链接:https://arxiv.org/abs/2610.00838
  • 来源:arXiv cs.LG(10-02 批次新提交)
  • 日期:2026-10-02 公布
  • 类别:Post-training RL / Credit Assignment
  • 核心贡献:针对长交互轨迹上"单个局部错误导致全轨迹失败、轨迹级奖励无法定位责任步"的问题,提出环境面向段级的 hindsight advantage 重加权:受 on-policy self-distillation(OPSD)启发,在每个环境段内计算 teacher-student log-prob gap,用它对 GRPO advantage 乘一个有界修正系数,把"这一段相对自身能力是否超常发挥"的信息注入终局奖励。
  • 为什么值得关注:它是 GRPO 系改进里少见地把修正项做成有界乘子而非加性偏置的设计,天然避免了 advantage 尺度失控;段级(环境交互边界)而非 token 级的切分方式与 agent 轨迹结构天然对齐。与昨天的 My FAULT、GIGPO/HGPO 放在一起,恰好构成"信用信号来源"的四种互补方案,可以做同一套 benchmark 下的系统对比。
  • 与 wenjun 的关系:长轨迹 Agent RL 主线的直接候选基线。SHARPO 的 teacher-student gap 本质上是一个"段内自蒸馏残差"信号,与 model-based RL 中用 world model 预测误差做 intrinsic 信号的思想同构——"预测残差 = 信用信号"这个等式在两个方向上(蒸馏残差/世界模型残差)都成立,值得写进你的方法设计空间。

#2. Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It

  • 链接:https://arxiv.org/abs/2610.00991
  • 来源:arXiv cs.LG(10-02 批次新提交)
  • 日期:2026-10-02 公布
  • 类别:Post-training RL / Test-time Scaling / Efficient Post-training
  • 核心贡献:证明"RLVR 训练 + 多数投票"的标准组合是有损的:RLVR sharpening 让模型的采样越来越犯同样的错误,而投票只能推翻"投票者不共享"的错误。在每题固定 160 个 completion 的预算下,把 RLVR 预算拆分成同一 base 模型上的多个小 LoRA adapter("adapter thicket"),各自采样投票,在 4 个模型中的 3 个上超过"预算集中训单个大 LoRA"的多数投票结果(1.5B–8B 规模验证)。
  • 为什么值得关注:这是 Sharpening Tax 的直接可操作推论,而且答案反直觉——不是"少 sharpen",而是"把 sharpen 分散到多个互补的窄分布上"。对"高效后训练"是范式级建议:训练预算的最优分配不是连续的,而是组合的。它也和 diversification 文献里的 ensemble 思想接上,但把 ensemble 放进了 RLVR 预算分配的框架里。
  • 与 wenjun 的关系:命中"LLM 持续学习与高效后训练"主线。可直接抄实验设计:同样的 RLVR token 预算,扫描 adapter 数量 × 单 adapter 预算的二维网格。一个自然延伸问题:continual 场景下 adapter thicket 能否按任务到达顺序增量长出,从而同时解决灾难性遗忘(每个 adapter 保持窄分布)? 这与 ChainLoRA(今日 stat.ML,见速览)可以拼成一个完整故事。

#3. When Do Causal World Models Help Modular LLM Agents

  • 链接:https://arxiv.org/abs/2610.00012
  • 来源:arXiv cs.AI(10-02 批次新提交)
  • 日期:2026-10-02 公布
  • 类别:Model-based RL / LLM Agent / Causality
  • 核心贡献:回答"LLM agent 到底什么时候需要因果 world model":观测拟合的世界模型对干预时规划存在不可约减的误差——一条 trace 显示支付先于发货,但无法区分"支付授权了发货""库存中介了效应"还是"隐藏触发器解释两者"。提出 FedCausalCompose:模块化 agent(订单/支付/库存/物流服务)中,局部动作提供跨模块接口的干预-响应证据,用因果世界模型恢复干预语义,并量化观测 world model 的干预损失。
  • 为什么值得关注:这是对"LLM world model"讨论的一个精确化刀口:把 predictive accuracy 和 intervention-time identifiability 分开,并证明后者是 modular 环境下前者的不可约减缺口。与昨天介绍的"机制一致性"(accuracy ≠ counterfactual correctness)形成两天连续的证据链——世界模型社区正在建立一套"预测对了 ≠ 世界对了"的诊断标准。
  • 与 wenjun 的关系:正中 model-based RL for LLM Agent 主线的理论核心。Dreamer 式 agent 的 world model 学的是观测分布;若 agent 的动作会改变环境转移结构(工具组合、模块依赖),纯预测式 world model 有结构性盲区。可操作的实验问题:在 LLM agent 环境里,用语言模型生成的反事实查询("如果跳过这一步会怎样")作为干预证据源,能否恢复转移结构的因果方向?

#4. What Should an Agent Remember? Disentangling Retention from Retrieval in Bounded-Memory Evaluation

  • 链接:https://arxiv.org/abs/2610.00366
  • 来源:arXiv cs.AI(10-02 批次新提交)
  • 日期:2026-10-02 公布
  • 类别:LLM Agent / Memory / Evaluation
  • 核心贡献:指出记忆系统评测的一个普遍混淆:存什么(retention)与取什么(selection)被捆绑比较。构造 retention × selection 交叉的 streaming-recall 基准,300 个 seeded episode 同条件评测:固定访问方式后,query-aware selection 提升 15.5 个百分点(95% CI 12.8–18.2);而一个同时改了 history access 的混合对比报出 68.7 点优势,其中 53.2 点归因于 access 而非 selection。query-aware/dense/oracle selection 在 bounded retention 下都到达 retention 上限,所有后续选择都救不回没存下的东西。
  • 为什么值得关注:这是记忆系统评测的第一篇严格"分离变量"论文,结论很硬:很多论文报告的记忆系统大提升其实来自 access 规则改变。它给了社区一个干净的评测模板(交叉设计 + 同 episode 对比),以后任何 memory 工作都应该在这个网格里报告位置。
  • 与 wenjun 的关系:与"通用上下文压缩器"和 agent memory 两条线都相关。压缩器的"保留什么"与"检索什么"同样被捆绑评测——AutoCompact(昨日)这类"学压缩策略"的工作也应放进这个交叉网格验证。更深层:retention ceiling 的存在说明信息论意义上的记忆瓶颈在写入侧,这与 Heavy-Tailed Memory Traces(今日 cs.AI,速览)的"长尾状态预测误差累积"互相印证。

#5. Code Owns the Simulation, Jev Owns the Evaluation

  • 链接:https://arxiv.org/abs/2610.01834
  • 来源:arXiv cs.AI(10-02 批次新提交);相关项目 firelex/jeff(GitHub,本周 ~1350 star)
  • 日期:2026-10-02 公布
  • 类别:LLM Agent / Judgment Models / Systems
  • 核心贡献:系统测量 judgment 模型(Jev:单次调用、无推理文本、直接返回选项概率的 0.8B "System 1" 决策模型)在 agent 决策层的可信边界:当正确选项可以从输入描述中判定(evaluation)时,Jev 表现优秀(反直觉 CRT 题答对 99%);当正确选项依赖模拟(预测输入中不存在的演化——对手下一步动作、子目标后果)时,Jev 崩溃。结论:judgment 模型可作 agent 的 action-selection 层,但模拟类决策必须交给代码/生成模型。
  • 为什么值得关注:它给"小模型做 agent 决策层"这个方向划出了一条可测量的能力边界——判定 vs 模拟的区分比"模型大小"更有解释力。对 agent 系统设计是直接可用的工程结论:路由规则不该按任务类别分,该按"决策是否需要 rollout"分。
  • 与 wenjun 的关系:与 model-based RL 主线有一个漂亮的呼应——"模拟"恰恰是 world model 的定义性功能。Jev 的失败边界就是 world model 的必要性证明:凡是需要模拟的决策,必须有预测式组件。这为 Dreamer-for-LLM-Agent 提供了反面论证素材:不是所有决策都需要 world model,但需要它的地方小模型补不上。

#三、其余值得关注的论文速览

#LLM Agent / Harness / 评测

  • VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks(https://arxiv.org/abs/2610.00972,cs.AI,10-02)

类别:LLM Agent / Evaluation。核心:发现"分歧暴露正确答案、共识掩盖错误",把生成模型变成带 workspace/证据工具/可复用验证技能的 agentic verifier,无需参考答案。

  • Agents Are Systems, Not Models: Rethinking Agentic Evaluation(https://arxiv.org/abs/2610.01618,cs.AI,10-02)

类别:Evaluation。核心:agent 的系统配置(任务信息/推理/自验证/时间预算/底座)解释约 54% 的结果方差;单一成功率报告掩盖了配置依赖性。

  • When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents(https://arxiv.org/abs/2610.00372,cs.AI,10-02)

类别:LLM Agent / Evaluation。核心:把"恢复操作"因果化为同一执行状态下的 rescue/harm 二分,提出 Causal Intervention Router 判断何时值得干预。

  • Finding the Right Fit: Model-Harness Interactions across Agent Tasks(https://arxiv.org/abs/2610.00917,cs.AI,10-02)

类别:Evaluation。核心:harness 与模型存在任务级交互效应,没有普适最优 harness,评测必须报告组合网格。

  • DAYJOB: A Benchmark for Long-Horizon Professional Work(https://arxiv.org/abs/2610.01306,cs.AI,10-02)

类别:Evaluation / LLM Agent。核心:130 个专业人员构建的真实任务(医疗 50 / 金融 80),平均需 13.6–16.6 人时;最强模型 Claude Opus 5.5 通过率仅 ~24%。长程专业工作仍是深水区。

  • Incident-Arena(https://arxiv.org/abs/2610.00648,cs.AI,10-02)

类别:Code Agent / Evaluation。核心:agentic SRE 基准,真实开源软件 + K8s 临时集群 + 配置层注错,补齐生产事故响应评测空白。

  • EurekaBench(https://arxiv.org/abs/2610.00492,cs.CL,10-02)

类别:Evaluation / LLM Agent。核心:26 个跨领域长程任务测 agent"做出牛顿式科学发现"的能力——从观察数据中迭代归纳机制并推导洞见。

  • Kepler: Auditable World Models for ARC-AGI-3(https://arxiv.org/abs/2610.00834,cs.AI,10-02;VISTA 为其视觉 harness 版:https://arxiv.org/abs/2610.02200)

类别:LLM Agent / World Model。核心:把假设表示为可执行 world model,用回溯转移检查 + 条件预测检查验证;冻结 Claude Opus 5 配置下 25 个公开游戏全部 100.00 RHAE。世界模型作为显式可审计对象的漂亮示范。

  • ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality(https://arxiv.org/abs/2610.00710,cs.AI,10-02)

类别:Evaluation / LLM Agent。核心:数周时间跨度、按时间序回放真实新闻/市场/社交流的长寿命 agent 评测环境,测"在对的时刻行动"的时间敏感性。

#Model-based RL / World Model / Latent

  • Supervise What Decides Success: Criterion-Aligned Auxiliary Losses for Latent World-Model Planning(https://arxiv.org/abs/2610.01224,cs.LG,10-02)

类别:Model-based RL / Latent。核心:四个 latent world model 里末端执行器位置的隐空间编码误差都大于任务成功判据允许范围——隐空间距离根本分不出成功/失败候选;提出用 success-criterion 物理量作回归目标的辅助损失。

  • Learning Commute-Time-Preserving World Models for Planning(https://arxiv.org/abs/2610.01373,cs.LG,10-02)

类别:Model-based RL / Latent。核心:规划需要隐空间距离反映环境 commute time(图 Laplacian 谱嵌入性质);证明现有防塌缩的各向同性正则会破坏这一几何,给出 scale-correct 的自监督替代。

  • JEPA-TTT: Persistent Test-Time Training of Latent World Models for Planning under Dynamics Shifts(https://arxiv.org/abs/2610.00722,cs.LG,10-02)

类别:Model-based RL / Test-time。核心:test-time 持续自监督更新 JEPA latent 动力学预测器、冻结 encoder 与 reward head,跨 episode 累积适应 dynamics shift,无需目标图像或在线奖励。

  • Latent JEPA: Abstract Future Prediction for Latent Reasoning in Chemistry(https://arxiv.org/abs/2610.01947,cs.LG,10-02)

类别:Latent Reasoning。核心:自回归 + 联合嵌入预测未来多视图,训练连续 latent thought 去"预感"解法的抽象方向而不逐步显式化——latent reasoning 的"直觉先于细节"视角。

  • Heavy-Tailed Memory Traces in Long-Horizon Language Agents(https://arxiv.org/abs/2610.00010,cs.AI,10-02)

类别:Memory / Model-based RL。核心:外部记忆即 frozen world model;有限上下文 + 重复检索使记忆集中于小核心、长尾状态预测误差累积(语义策略产生截断幂律 trace,随机游走策略呈对数正态)——记忆使用形状应作为被测对象。

  • Nous: Learning and Certifying Memory Decisions Before Source Calibration(https://arxiv.org/abs/2610.00094,cs.LG,10-02)

类别:Memory / 理论。核心:基于信念的 agent 记忆里,学出可用决策只需 Θ(l⁻²) 条记录,而校准来源需 Θ(l⁻⁴)——先学决策后校准来源可以省平方级样本。

#Post-training RL / 信用分配

  • T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning(https://arxiv.org/abs/2610.00388,cs.LG,10-02)

类别:Post-training RL / Credit Assignment。核心:从成功轨迹推导 remaining-distance 目标,配状态表示训练步级反馈模型,为终局奖励任务提供中间监督。

  • DeFA: Dependency-Guided Failure Attribution for LLM Agents(https://arxiv.org/abs/2610.01256,cs.AI,10-02)

类别:Credit Assignment / LLM Agent。核心:协议关系 + 语义依赖构建事件依赖图,追踪失败传播图定位决定性错误步、责任 agent 与错误类别。

  • Sharpen Before You Adapt: Data-Free Entry-State Sharpening for Test-Time RL(https://arxiv.org/abs/2610.00903,cs.LG,10-02)

类别:Post-training RL / Test-time。核心:TTRL 前先做 data-free sharpening 准备"入口状态",让有限 label-free 适配预算不被浪费在"先集中概率质量"上。

  • Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability(https://arxiv.org/abs/2610.01066,cs.CL,10-02)

类别:Post-training RL / 理论。核心:随机奖励 RL 测的是模型"可达性"(当前状态出发还能到哪)而非当前性能——两个准确率同为 3.5% 的 OLMo checkpoint 可达上限分别为 8.5% 与 55%。

  • Range-GRPO: Policy Optimization via Pairwise Relations among Reward Intervals(https://arxiv.org/abs/2610.01548,cs.LG,10-02)

类别:Post-training RL。核心:用奖励区间内的成对关系替代绝对奖励值做 policy optimization,缓解奖励尺度敏感问题。

  • Adapter Thickets(见 Top 5 #2)与 Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis(https://arxiv.org/abs/2610.01896,cs.LG,10-02,异步 RL 后训练的 group-mass capping 与收敛分析)共同构成高效后训练的算法/系统两侧。

#Code Agent / 代码智能

  • Self-Evolving Coding Rules for AI Coding Agents(https://arxiv.org/abs/2610.00650,cs.CL,10-02)

类别:Code Agent / Self-evolving。核心:coding agent 的规则从手工固定改为从执行反馈中自动进化,规则库持续自更新。

  • Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents(https://arxiv.org/abs/2610.01023,cs.SE,10-02)

类别:Code Agent / Evaluation。核心:弱 reviewer 能否审计强 coding agent 取决于"可地面化性"而非模型规模;提供执行证据作上界诊断后 6 个 reviewer 中 5 个同时提升缺陷捕获与降低误拒。

  • Safety Must Survive Self-Improvement(https://arxiv.org/abs/2610.01073,cs.SE,10-02)

类别:Code Agent / Safety。核心:递归自改进 testbed 里,历史分数在 48 个框架历史的 22 个中保留了已失效的不安全程序——自改进的记忆会继承过期安全结论。

  • KaliBench(https://arxiv.org/abs/2610.02206,cs.CL,10-02;NeurIPS 2026 Datasets & Benchmarks Track 接收)

类别:Tool-use / Evaluation。核心:Kali Linux 网安工具细粒度基准,runtime-free 可验证奖励。

  • AgSpec: Retrieval-Based Speculative Decoding in Coding Agent Pipelines(https://arxiv.org/abs/2610.01108,cs.CL,10-02)

类别:Systems / Code Agent。核心:coding agent 反复复制既有代码/日志的特点使检索式投机解码异常契合,系统化推进该方向。

#记忆 / 上下文 / Continual

  • Mem++: Non-Destructive Memory for Long-Term Organizational LLM Agents(https://arxiv.org/abs/2610.02002,cs.CL,10-02)

类别:Memory。核心:从"写时蒸馏"转向"读时选择"——整篇存档不压缩,读时按时间点 + 词法/语义融合检索,支持"某时刻哪个版本生效"类时序问题。

  • MemFit: Efficient Long-Term Agentic Memory(https://arxiv.org/abs/2610.00872,cs.AI,10-02)

类别:Memory / Systems。核心:append-only 逐字存储 + 段摘要索引,写路径零 LLM 调用近零成本;读路径用段摘要路由。

  • Madeleine: Learning Involuntary Recall from Simulated Lives(https://arxiv.org/abs/2610.01118,cs.CL,10-02)

类别:Memory。核心:把联想检索摊销进 query encoder——离线用 LLM 模拟"人生"生成 cue-trigger 对,在线零 LLM 调用、只换 query encoder 即可插入任意向量记忆库。

  • Causal Memory Policy: Making Memory Utility Identifiable(https://arxiv.org/abs/2610.02070,cs.AI,10-02)

类别:Memory / 因果。核心:从未被检索的记忆其效用不可识别(retrieval-level positivity violation);用逆倾向加权干预检索本身恢复识别。

  • EchoPress: Query-Agnostic KV Cache Pruning via Virtual Context Reconstruction(https://arxiv.org/abs/2610.00412,cs.LG,10-02)

类别:Context Compression / Systems。核心:分析 KVzip 重要性估计的可近似性,用 prefill 已有信息训练-free 地逼近重构注意力分数。

  • ChainLoRA: Geometry-Preserving Task Vector Merging for Continual Learning in LLMs(https://arxiv.org/abs/2610.00431,stat.ML,10-02)

类别:Continual Learning。核心:replay-free 的链式任务向量几何合并——把遗忘分解为方向重叠与系数耦合两个可测量交互,后流自适应 SVD 合并。

  • AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech LMs(https://arxiv.org/abs/2610.01560,cs.CL,10-02)

类别:Latent Reasoning。核心:隐空间多路径分布 + 联合块预测减少串行前向,附 683K 双语语音推理数据 AuralReason-683K。

#Latent 表征 / ICL 机制 / 预训练机制

  • Rules Amortize, Pairings Don't: Linguistic Structure Determines What Latent Task Representations Can Replace ICL(https://arxiv.org/abs/2610.00526,cs.CL,10-02)

类别:Latent Reasoning / 机制。核心:规则型语言操作可摊销为隐向量,配对型(双射)不行——给"什么能进 latent、什么必须留在 context"划出语言结构边界。

  • Capturing In-Context Learning Dynamics with Task Operators(https://arxiv.org/abs/2610.01054,cs.CL,10-02)

类别:Latent / 机制。核心:每个 attention head 的输出是其 context-masked 对应的仿射变换且参数任务内稳定——Task Operator 可解析地重放该变换,替代完整 ICL 前向。

  • Lingtai: What Concept Geometry Reveals About LLM Inference(https://arxiv.org/abs/2610.00656,cs.CL,10-02)

类别:Interpretability。核心:训练-free 的概念遥测层,逐步把残差投影到概念锚点库;概念坐标信号与预测不确定性鲁棒关联。

  • Persistent Depth Ordering amid Shifting Block-Bypass Responses in LLM Pretraining(https://arxiv.org/abs/2610.01165,cs.LG,10-02)

类别:Pretraining 机制。核心:跨 5 条训练轨迹、11 个模型-域组合做单块恒等旁路,发现深度排序在预训练中持续保留而幅度重分布——哪些层间组织是持久结构、哪些是训练瞬态。

  • From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation(https://arxiv.org/abs/2610.02179,cs.LG,10-02)

类别:Post-training / 机制。核心:Adam 一阶矩把多教师梯度差异压到 0.83 余弦相似度——优化器状态本身是教师信号融合器。

#数据质量 / 预训练数据

  • When a Data Artifact Isn't a Shortcut: Causal Auditing of Synthetic RLVR Corpora(https://arxiv.org/abs/2610.00202,cs.CL,10-02)

类别:Pretraining Data / RLVR。核心:GooseReason-0.7M 上"正确项 = 真人文本、干扰项 = 合成"的来源纠缠可被审计:5 个表面统计量即达 AUROC 0.562;代码类干扰项是单算子突变、两类几乎同构(0.416 低于随机)——RLVR 数据的"正确性"可能部分学到的是"人写痕迹"。

  • Effective Synthetic Data Curation Requires Group-Level Signals(https://arxiv.org/abs/2610.00779,cs.CL,10-02)

类别:Pretraining Data。核心:合成数据清洗需要组级(而非样本级)信号,用于强化长程任务执行等能力时尤其如此。

  • No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse(https://arxiv.org/abs/2610.01493,cs.CL,10-02)

类别:Pretraining Data。核心:用非参数 Kontoyiannis 熵率估计器(纯文本匹配长度统计、零模型访问)过滤合成数据,六代 QLoRA collapse 实验中优于 logprob 过滤。

  • Optimal Transport Meets Reinforcement Learning: A Survey(https://arxiv.org/abs/2610.01413,stat.ML,10-02)

类别:理论综述。核心:OT 如何嵌入 RL 目标与算法(模仿/离线/分布偏移下弱重叠分布的比较),与 wenjun 关注的 latent 几何方向互补的数学工具箱综述。


#四、GitHub / 开源动态(本周新建,按 star)

  • facebookresearch/swe-sweep(https://github.com/facebookresearch/swe-sweep,10-01 创建,~51 star)

"How many bugs can LMs find & fix in large codebases?"——给定真实大仓库,agent 无提示地自主发现并修复尽可能多的 bug(不告知 bug 类型与位置),基于 Harbor 容器框架,配独立 verifier 环境与微平均计分。SWE-bench 系"从 issue 修 bug"到"自己找 bug"的范式转移信号,与今天速览里的 Incident-Arena 同属"自主发现问题"评测潮。

  • firelex/jeff(https://github.com/firelex/jeff,本周 ~1350 star)

0.8B 开源 "System 1" 判定模型(即 Jev):毫秒级、跨域、在选项间给出校准概率。对应论文即 Top 5 #5(Code Owns the Simulation, Jev Owns the Evaluation)。小模型做 agent 决策层的开源参照物。

  • PostHog/jeeves(https://github.com/PostHog/jeeves,~402 star)

"Reasoning improves Jev-like decision models"——判定模型的推理增强变体,与 jeff 形成对照实验关系。

  • ArtificialAnalysis/aa-agentperf-local(https://github.com/ArtificialAnalysis/aa-agentperf-local,~76 star)

用回放真实 agent 轨迹来基准本地 LLM serving 性能——agent 负载下的推理系统评测工具。

  • KKKKhazix/AIHOT(https://github.com/KKKKhazix/AIHOT,~5400 star,10-02 冲榜)

"自己找热点、自己写日报的网站框架"。与本简报同构的自动化信源→日报 pipeline,信源与精选标准可替换。工程参考价值大于研究价值。

  • 其余本周趋势项(openai/mcp-extensions 官方 ChatGPT 插件 MCP 生态、feder-cr/dots 自带浏览器的 agent 等)偏产品侧,与科研主线关联弱,不展开。

Hugging Face 热榜侧(10-02):票数最高为 OneStreamer(160 票,流式视频交互的感知-记忆-主动响应统一)、On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics(153 票,蒸馏动力学的系统研究——与昨日 on-policy 蒸馏线呼应);与 wenjun 方向最相关的已收入上文(Sharpening Tax 78 票、Belief States 78 票、ActiveSaddler 55 票、X-Tree 37 票等在昨日简报已详评,今日仅补新条目)。


#五、今日最值得精读的 3 篇

  1. SHARPO(https://arxiv.org/abs/2610.00838)——段级信用分配的最简可行设计,有界乘子修正 GRPO;读它可以顺便把 My FAULT / T2SPO / DeFA 摆成一张"步级信号来源"对比表。
  2. Adapter Thickets(https://arxiv.org/abs/2610.00991)——Sharpening Tax 的操作化答案,预算拆分胜于集中;高效后训练的范式级实验证据。
  3. When Do Causal World Models Help Modular LLM Agents(https://arxiv.org/abs/2610.00012)——预测精度 ≠ 干预可识别性,world model 必要性的因果刻画;model-based RL 主线的理论地基。

(备选精读:What Should an Agent Remember?——记忆评测的变量分离模板,做 memory/compression 研究前必读的方法论。)

#六、今日最值得跟进的 3 个 repo / 资源

  1. facebookresearch/swe-sweep(https://github.com/facebookresearch/swe-sweep)——代码 agent 从"修已知 issue"到"自主发现 bug"的评测范式转移,Harbor 容器 + 独立 verifier 设计可复用。
  2. firelex/jeff + PostHog/jeeves(https://github.com/firelex/jeff / https://github.com/PostHog/jeeves)——"判定 vs 模拟"能力边界的开源实验对:一个 0.8B System 1 判定模型 + 它的推理增强对照。
  3. GooseReason-0.7M 审计方法(论文 https://arxiv.org/abs/2610.00202 附带)——合成 RLVR 语料的因果审计协议(表面统计 → AUROC → 逐类分解),可直接搬去审自己 pipeline 里的合成数据。

#七、研究机会 / Ideas

  1. "步级信用信号源"的统一评测台:My FAULT(自诊断)、SHARPO(段蒸馏 gap)、T2SPO(距离回归)、DeFA(依赖图)四条线在 ALFWorld/WebShop/SWE-bench 上各自报告,无人同台对比。做一个统一网格(信号源 × 任务域 × rollout 预算),测量各信号源的覆盖率、偏差与方差,再测组合(如依赖图定位 + 距离回归定量的混合信号)——这既是 GIGPO 系的直接延伸,也是长轨迹 RL 社区当前最缺的横向坐标。
  2. 世界模型的"干预可识别性"注入 LLM agent 训练:两天连续的证据(机制一致性 / 因果 world model)都指向"预测对 ≠ 世界对"。设计一个 LLM agent 环境族,其中动作会改变转移结构(工具组合、模块依赖),训练时用反事实查询作为干预证据,测 world model 的干预误差能否被显式监督压下去、以及压下去后 planning 成功率的增益——把 Dreamer 的世界模型换成"因果可审计"版本的第一次尝试。
  3. retention ceiling 与压缩器的信息论刻画:今天 What Should an Agent Remember? 证明 bounded retention 下所有 selection 策略都到同一上限;结合 Heavy-Tailed Memory Traces 的长尾误差累积,可以提出"压缩器的保留保真度"信息论度量(写入侧的信息损失上界 vs 下游任务族的可回答性集合),并检验 AutoCompact 类"学出来的压缩策略"到底把 retention ceiling 推高了多少——通用上下文压缩器目前完全缺失写入侧理论。

本简报由鼠鼠于 2026-10-04 08:00 (Asia/Shanghai) 自动生成并发布。所有论文条目均来自当日实际抓取的 arXiv / Hugging Face / GitHub 数据,未编造任何标题或链接;X/Twitter 本日不可达(HTTP 403),已用 arXiv/HF/GitHub 替代。