#2026-10-06 AI/LLM 最新论文与研究热点简报

时间范围:本简报的核心是 arXiv 2026-10-05(周一)公布批次(对应 10-02 周五晚至 10-05 晨间提交、编号 2610.02800–2610.03717 区间的新论文,cs.AI / cs.CL / cs.LG / cs.SE 共约 200 篇新条目,逐条筛选),加上 Hugging Face Daily Papers 10-05 榜单与 GitHub 近几日新建仓库的社区动态。为覆盖"最近 24-48 小时"的完整图景,时间窗整体为 2026-10-02 至 2026-10-06 晨。

信息来源:arXiv 官网 recent listing(cs.CL / cs.AI / cs.LG / cs.SE 的 10-05 公告批次,标题全量解析 + 重点篇目逐篇抓取摘要阅读);Hugging Face Daily Papers API(10-05 榜单 50 篇与投票数;10-06 榜单尚未生成,API 明确提示 date 不得晚于 10-05,如实标注);GitHub Search API(created:>2026-10-01 按主题与 star 排序)。X/Twitter 匿名访问持续被反滥用机制拦截(HTTP 403),本次仍无法检索,特此如实说明,以 arXiv / HF / GitHub 为主。所有论文均经真实抓取核验,未编造。


#一、总览:周一新批次的三条主线

10-05 是国庆假期后的第一个 arXiv 公布日,周一批次信息量大。结合 wenjun 的研究主线筛选后,今天最值得注意的三个结构性信号:

  1. 终端(terminal)agent 的步级信用分配进入"读依赖图"阶段,且出现了" shrinkage / 方差控制"这一更统计化的路线。昨天介绍过依赖图派(DARS)与自诊断派(My FAULT),今天同批次出现 DepGPO(2610.03634,从执行 trace 构造命令依赖图、从 verifier 检查的资源反向回溯分配信用)与 AdaStep(2610.03223,把步级信号对轨迹级信号的修正强度建模为隐步优势的 MSE 估计问题,推导出每状态最优收缩系数——信号方差大就少信步级信号,方差小就多信)。加上 SCAD(2610.03372,规划拿全终端信用、执行拿正向终端信用 + 教师引导),步级信用分配本周已经从"四种信号来源"进化到"何时该信步级信号"的元问题——这已经是标准的偏差-方差视角了。
  2. LLM agent 的 world model 审计出现了"两记重拳"。昨天介绍过时序 world model 的"机制一致性"指标,今天 Counterfactual Action Evaluation(2610.02860)把 JEPA 式联合嵌入预测 world model 拉到一个可控物理测试床上做逐层反事实追踪:发现低隐空间预测误差完全不能证明 world model 区分得了自己动作的后果——579 个高可见反事实里,预测器对目标嵌入变化的响应中位数只有 0.0051/0.0217,而匹配幅度的各向同性扰动能产生 190 倍/53 倍大的预测器变化,瓶颈不在观测而在"动作通路欠利用"。这与 SLIM(2610.03137,LeWM 世界模型在多物体推动场景成功率不足 1%,探针定位到 encoder 的 latent 几乎不感知动作)互相印证,也与 What Should World Models Forget?(2610.03713,世界模型的持续学习需要按"不变性时间尺度"分层保留)一起构成一条完整的"world model 该学什么、该忘什么、怎么验证"主线。
  3. self-evolving / 自演化系统开始认真处理"奖励不可信"问题。Reliable Self-Evolution with Imperfect Proxy Rewards(2610.02975)指出自演化搜索里的廉价代理奖励会把不可行候选打成高分、污染输出与反馈循环,用条件 conformal 区间做统计校准;hacktrace(2610.03055)发布 17.3 万条标注的多轮编码轨迹,证明独立于利用是否成功、只监督"捷径行为本身"就能把 reward hacking 检测做到 AUC 0.997 且监控开销 8ms。加上 Sentry(2610.02994,失败知识是"条件知识",应条件性暴露而非常驻上下文),"自演化的可靠性基础设施"正在成型。

对 wenjun 研究版图的意义:model-based RL 主线今天输入最密集(world model 反事实审计 × 分层遗忘 × 动作通路诊断 × 隐空间一致性泛化);latent reasoning 主线出现 LS-AR(双通道 FiLM 条件化的隐空间目标引导自回归模型)与 HyperThink(把推理计算摊销成一次超网络参数更新)两个新架构样本;agentic RL 主线则把信用分配推到了统计严谨性的新高度。


#二、重点论文详评(Top 6)

#1. Counterfactual Action Evaluation, Observation Bottlenecks, and Representation Geometry in Joint-Embedding Predictive World Models

  • 链接:https://arxiv.org/abs/2610.02860
  • 来源:arXiv cs.LG,10-05 公布批次
  • 类别:Model-based RL / World Model 评估 / Latent Reasoning
  • 核心贡献:提出一个把同一干预沿"仿真器状态 → 光栅观测 → 目标嵌入 → 预测器输出"逐层追踪的评估协议。在可控形变物理测试床上做精确状态分叉:改变指令确实改变粒子运动,但 41.5% 的一步光栅对完全相同;579 个高可见反事实中,预测器对目标反事实的响应中位数仅 0.0051/0.0217(两个种子),方差归一化后更低至 0.0027/0.0116;而与目标反事实嵌入位移幅度匹配的各向同性状态扰动在同一批可见对上产生 190 倍与 53 倍大的预测器变化——隔离出"动作通路欠利用"而非编码器死亡或观测瓶颈。
  • 为什么值得关注:这是对整个 JEPA / 隐空间预测派 world model 的一记方法论重拳:隐空间预测误差低 ≠ world model 知道自己的动作会改变什么。它给出了一个可复用的、逐层定位失败环节的评估协议,比"最终控制性能"细得多。
  • 与 wenjun 研究方向的关系:Dreamer-for-LLM-Agent 的核心赌注就是"隐空间 rollout 可用于规划",而这篇证明隐 rollout 误差与"动作-后果区分能力"可以完全脱钩。把这套反事实追踪协议移植到 LLM agent 的 world model(文本域"改变第 k 步动作,第 k+3 步状态预测是否改变")是一个直接可做的评估贡献,与昨天提出的"机制一致性移植"想法合并成一个完整课题。

#2. AdaStep: Adaptive Step Credit Weighting for Agentic Reinforcement Learning

  • 链接:https://arxiv.org/abs/2610.03223
  • 来源:arXiv cs.CL,10-05 公布批次
  • 类别:Post-training RL(agentic)/ 信用分配
  • 核心贡献:指出步级信用估计不可靠的根源——观测回报还依赖后续动作、环境转移与轨迹长度;把"步级局部优势修正轨迹级信号"的强度建模为隐步优势的 MSE 估计问题,在显式条件采样假设下推导出每状态最优收缩系数,其解释是信号-总方差比:当回报波动可归因于所选动作时保留局部信用,否则向轨迹级信号收缩。
  • 为什么值得关注:这是本周第三天连续出现步级信用分配新方法(SHARPO/T2SPO/My FAULT/DARS → DepGPO/SCAD/AdaStep),但 AdaStep 是第一个把"该信多少步级信号"本身形式化为统计估计问题的工作,理论上直接可检验。
  • 与 wenjun 研究方向的关系:长轨迹 RL 的核心痛点。它与 DepGPO(依赖图)天然正交——一个决定"信谁的信号"(依赖结构),一个决定"信多少"(方差控制),二者组合是显然的后续实验。

#3. Dependency-Aware Policy Optimization for Terminal Agents (DepGPO)

  • 链接:https://arxiv.org/abs/2610.03634
  • 来源:arXiv cs.AI,10-05 公布批次
  • 类别:Post-training RL(agentic)/ Code Agent
  • 核心贡献:现有轨迹级/步级信用分配都不显式追踪命令间的读写依赖。DepGPO 从执行 trace 构造命令依赖图,从任务 verifier 实际检查的资源反向回溯,把信用分配给相关的写操作,无关操作不拿信号。
  • 为什么值得关注:与昨天介绍的 DARS(谓词依赖图 + 折扣)相比,DepGPO 的"从 verifier 检查点反向回溯"更贴终端环境实际结构(shell 命令的读写集合可静态+动态混合提取),是 agentic coding RL 目前最可落地的信用分配设计之一。
  • 与 wenjun 研究方向的关系:self-evolving code agent 的训练信号质量问题。依赖图信息在编码 agent 里几乎免费可得(命令执行 trace 天然带读写集合),把它变成 RL 训练信号的工程路径短。

#4. Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite (RSR)

  • 链接:https://arxiv.org/abs/2610.02826
  • 来源:arXiv cs.AI,10-05 公布批次(HF Daily Papers 10-05 榜单 78 票,当日第二高)
  • 核心贡献:用一个 base 模型(Qwen-3.8-27B)在多种专用 harness 下探索难题解法,再把成功解重写成通用 harness 下的训练轨迹:planner 把过程提取为 runbook,critic 筛查 verifier/解泄漏并引导递归修订,executor 在全新沙箱里按 runbook 执行。约 3K 自选终端任务上三个 harness 联合解决 759 个(比最强单一 harness 多 34.3%),2,001 条源轨迹扩展为 11,094 条重写轨迹用于 SFT。
  • 为什么值得关注:直接回答了 agent 训练数据的经典两难——强 harness 探索出的成功轨迹带着 harness 特权,部署时没有。RSR 的"探索用特权、训练用通用"的重写管线是一个可复用的数据工厂设计。
  • 与 wenjun 研究方向的关系:命中"agent 预训练数据如何塑造能力"主线——特权探索 + 去特权重写,与昨天的 Harness Annealing(渐进撤除控制)是同一问题的两种解法,横向对比价值高。HF 78 票说明社区高度共鸣。

#5. Sentry: Learning to Recover from LLM Agent Failures at Test Time

  • 链接:https://arxiv.org/abs/2610.02994
  • 来源:arXiv cs.AI,10-05 公布批次(已开源:nuglifeleoji/Sentry)
  • 类别:LLM Agent / 上下文与记忆
  • 核心贡献:核心发现是失败知识如何抵达 agent 与其内容同样重要:放在上下文里的失败教训是"条件知识",当对应失败不存在时会误伤(常驻 playbook 反而降性能);运行时干预则只在失败发生时介入但不学习。Sentry 把二者合一:失败发生时才从外部 playbook 检索匹配教训引导恢复,验证恢复是否发生时不访问任务奖励,学到的教训条件性入库。
  • 为什么值得关注:给"agent 经验回放"补上了关键缺失的一环——经验的组织形式(常驻 vs 条件检索)决定其净效用。这与昨天 Not All Experience Belongs in the Weights 的"组件路由"形成三向对话:什么进上下文、什么进权重、什么进外部条件库。
  • 与 wenjun 研究方向的关系:上下文压缩器与 agent 记忆主线的直接素材;"条件性暴露"原则对长轨迹 RL 的经验注入设计同样适用。

#6. Harness-Aware Distillation for Small Language Model Agents (HAD)

  • 链接:https://arxiv.org/abs/2610.02858
  • 来源:arXiv cs.AI,10-05 公布批次
  • 类别:LLM Agent / 蒸馏 / 高效后训练
  • 核心贡献:把 agent 蒸馏到小模型时,harness(上下文管理/工具/反馈软件层)原样保留,学生真正需要的只是教师在 harness 之外补充的能力。标准蒸馏模仿教师全部输出、把 harness 当输入的一部分;HAD 用"同一教师在有无 harness 信息下的动作对比"构造动作偏好,并用合法性检查丢弃与 harness 记录矛盾的偏好对。
  • 为什么值得关注:把"agent = 模型 + harness"的系统观推进到蒸馏:不该教学生重复 harness 已经做的事。这个视角对小模型 agent 部署(成本敏感场景)非常实用。
  • 与 wenjun 研究方向的关系:高效后训练 + agent 系统观两条线的交叉点;"教师-学生能力差集"的显式构造方式也可用于量化"哪些 agent 能力其实来自 harness 而非模型"。

#三、按研究主线分组

#Model-based RL / World Model / 反事实评估

  • What Should World Models Forget? Stratified Retention for Continual Adaptation(https://arxiv.org/abs/2610.03713,cs.AI,10-05):世界模型的预测目标是变化的环境,"旧知识过时"是要求行为而非缺陷;提出按不变性时间尺度分层保留——物理/物体恒存等不变量永不修订,实例级知识允许被覆盖。世界模型版持续学习的公理化重构,直接命中 continual learning × world model 交叉。
  • Keeping JEPA World Models Plannable When Little of the Frame Moves (SLIM)(https://arxiv.org/abs/2610.03137,cs.LG,10-05):多小物体推动基准上 LeWM 世界模型成功率 <1%,探针定位到 encoder latent 几乎不感知动作,rollout 不比"把当前 latent 复制向前"更好;一个逆动力学模型即可部分修复。——与 2610.02860 互证:JEPA 派 world model 的动作通路问题是系统性的。
  • VIGOR: Zero-Shot Visual Generalization via Latent-Space Consistency in MBRL(https://arxiv.org/abs/2610.02801,cs.AI,10-05):MBRL 对视觉干扰的双层脆弱性(encoder 出分布 + 隐 rollout 误差复合);弱-强非对称增广 + 隐空间一致性实现零样本视觉泛化。——隐 rollout 复合误差的解法,LLM 域同理。
  • Understanding Trajectory Heterogeneity in Federated World Model Learning(https://arxiv.org/abs/2610.02957,cs.CL,10-05):联邦世界模型学习中的轨迹异质性分析。
  • World Embedding Benchmark(https://arxiv.org/abs/2610.03632,cs.CL,10-05,HF 36 票):8,000 个受控仿真案例(流体/固体/动力学/电磁光学 80 族),视频-物理标注配对,三任务区分"跨模态物理对齐"与"定量物理信息可恢复性";预训练全能嵌入模型检索弱、族内分类接近随机,轻量探针反而能恢复物理信息。——world model 表征物理信息的首个系统基准。
  • Counterfactual Action Evaluation(2610.02860,见重点详评 1)。
  • When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game(https://arxiv.org/abs/2610.03598,cs.AI,10-05):解析可解环境里诊断 PPO 的失败模式。

#World Action Model(视频/机器人侧,与 LLM agent world model 同构)

  • Native Action-Prior Learning from Videos for World Action Models (NAVA-WAM)(https://arxiv.org/abs/2610.03391,10-05,HF 69 票):直接从无动作标注的观测视频预训练动作策略本身,绕开"先学表征再适配控制"与"先提隐动作再接地"两条旧路。——无标注视频学动作先验,对 LLM 域"从执行日志学 world model"有直接启发。
  • World Action Modeling with Progressive Visual Planning (ProWAM)(https://arxiv.org/abs/2610.02508,10-05,HF 70 票):联合预测动作与有序稀疏视觉子目标序列,子目标预测可从无动作视频学,把视觉规划从动作策略卸载出去。
  • XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation(https://arxiv.org/abs/2610.03516,10-05)。
  • How to Find and Reuse Policies for Continuous Adaptation in Lifelong RL(https://arxiv.org/abs/2610.03119,cs.AI,10-05)。
  • Learning Transferable Policies from Action-free Time Series Through Dynamical Embeddings(https://arxiv.org/abs/2610.03065,10-05)。

#Latent Reasoning / 隐空间推理 / 高效推理

  • LS-AR: Future-Predictive Latent Steering in Autoregressive LLMs(https://arxiv.org/abs/2610.03093,cs.LG,10-05):单通道 AR 模型把指令/状态/瞬态 token 混在一个序列里;提出双通道架构,FiLM 条件化把连续目标引导与离散 token 解码解耦——静态目标编码器保持宏观目标、动态状态跟踪器递归更新隐状态;超上下文限制长程检索(H=1024)上 100% 召回 vs 参数匹配基线 0%,吞吐 +35%、峰值显存 -52.8%。latent steering × AR 解码双通道,数字非常硬。
  • HyperThink: Text-to-Parameter Hypernetworks for Efficient Reasoning(https://arxiv.org/abs/2610.03039,cs.LG,10-05):把长思维链的推理计算摊销成一次 query 条件化的参数更新——超网络读题后预测 base LLM 小子集的权重更新,VQ 解码器约束到有限可复用模式;测试时无中间 trace 直接出简洁解题步骤。
  • Predictor-Guided Latent Space Codon Optimization(https://arxiv.org/abs/2610.03098,cs.LG,10-05):隐空间搜索做蛋白质表达优化的又一案例。
  • Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability(https://arxiv.org/abs/2610.03509,10-05,HF 9 票):高效推理训练对 CoT 忠实性的影响给出"不总是有害"的细致刻画。
  • A Near-Zero Monitor Readout Is Not Evidence of Behavioral Control(https://arxiv.org/abs/2610.03458,cs.CL,10-05):监控器读数接近零不等于行为可控——监控有效性的方法论警示,与 hacktrace 互补。
  • Certified Mechanistic Edits: Behavioral Guarantees for Skill Removal and Preservation(https://arxiv.org/abs/2610.03502,cs.AI,10-05):给"删除/保留技能"的机制编辑上行为级证书。

#LLM Agent / 长轨迹 / 记忆

  • Sentry(2610.02994,见重点详评 5)。
  • DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users(https://arxiv.org/abs/2610.03020,cs.AI,10-05):提出"用户条件化关系性 agent 记忆"新定义(URAM):agent 不只要记住用户的事实,还要记住"该怎么和这个特定用户协作";3,065 集 / 50,961 会话 / 61,210 QA,含 Capture/Update/Recall 级金标注。——agent 记忆基准从"用户画像"升级到"协作关系",与 wenjun 的意图理解关注点直接相关。
  • Interpreting at Write Time: A Policy Ablation for Multi-Goal Agent Memory(https://arxiv.org/abs/2610.02897,cs.AI,10-05):多长期目标共享一份记忆时"该为什么而摘要"——无目标摘要 / 全目标合一 / 每目标一份三种写时策略的消融。摘要即目标函数选择,上下文压缩器的哲学篇。
  • Continual Graph Memory for Mathematical Research Agents (Ansatz)(https://arxiv.org/abs/2610.02945,cs.CL,10-05):大规模并行证明搜索中的图结构可演化跨问题研究记忆,显式组织中间证明结果供复用。
  • Ask, Relax, or Act? Evaluating Actionable Indeterminacy in LLM Preference Reasoning(https://arxiv.org/abs/2610.03102,10-05):形式化"可行动的不确定性"——行动 / 澄清 / 约束修复三分决策,配求解器基准;模型普遍在"无需干预时识别不必干预"上失败。指令理解 → 意图理解方向的新评测角度。
  • Harness-Aware Distillation (HAD)(2610.02858,见重点详评 6)。
  • Recursive Harness Self-Improvement for Frontier Reasoning Data Synthesis(https://arxiv.org/abs/2610.03548,cs.AI,10-05):任务- harness 协同演化:在线自改进把中间求解失败转成可复用技能,批后自改进修订技能/提示/工作流,只采纳能在有界成本内生成更难有效任务的候选;模型权重与验证标准冻结。——"环境设计催生自演化智能"的又一数据侧案例。
  • MobiAgent: Dual-Loop Recursive Policy Self-Improvement(https://arxiv.org/abs/2610.03476,10-05):移动操作上的双循环自改进 agent。
  • Source Preference in the Wild(https://arxiv.org/abs/2610.03195,10-05,HF 28 票):LLM agent 按来源偏好条目的实证与缓解。
  • JOVE: Joint Execution and Verification for Resource-Aware LLM Task Graphs(https://arxiv.org/abs/2610.03296,10-05)。
  • ReFract: Benchmarking Perspective Awareness in Language Model Agents(https://arxiv.org/abs/2610.03356,10-05):agent 需推断角色意图、只经该角色合法工具行动——工业维护场景的 Perspective Awareness 基准。
  • EvoRiskBench: An Evolving Benchmark for Runtime Security Risks in Workspace Agents(https://arxiv.org/abs/2610.03153,10-05)。
  • Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case(https://arxiv.org/abs/2610.03190,10-05)。
  • ULTRADISCOVERY: Abductive Exploration in an Interconnected, Epistemically Open Universe(https://arxiv.org/abs/2610.03092,10-05)。
  • Probe the Harness: Setup Checks for Stale-Data RL Comparisons(https://arxiv.org/abs/2610.02911,10-05):实验 harness 四个细节(PPO ratio 用学习者自算概率、数据种子未达对照臂、replay 队列首桶复用等)可以反转 off-policy 校正方法的排名;提出 PTH 检查清单。——所有做 RL 训练实验的人都该读的方法论审计。

#Code Agent / 代码智能

  • hacktrace: behavior-supervised detection of reward hacking during code generation(https://arxiv.org/abs/2610.03055,cs.AI,10-05):17.3 万条 Qwen3-8B 多轮编码轨迹标注;不监督"利用是否成功"而监督"捷径尝试行为本身",复用 agent 生成代码时已计算的内部状态,监控延迟 8ms、平均 AUC 0.997。——reward hacking 检测的机制派代表作,开源数据集价值大。
  • GTDD: Generative Test-Driven Development for AI Coding Agents(https://arxiv.org/abs/2610.02952,cs.SE,10-05):固定测试集会被 agent 适配性实现"应试";GTDD 让独立测试 agent 按行为契约 + 历史反馈在实现固定后生成新输入,可信评估器返回精简反例并沉淀回归测试;给出 false acceptance 的有限总体分析。——对抗 RLVR 过拟合 / 环境规范的技术答案,与 CL-Bench 简报的"规范 vs 学习"之争直接呼应。
  • Self-Supervised Scaling of Terminal Environments for Scientific Domains(https://arxiv.org/abs/2610.02710,cs.SE,10-05):软件在环重建——从既有软件工作流(结构化输入→输出的可执行程序)自监督获取参考输出与隐藏验证目标,多输入配置执行后切分公开观测/隐藏评估;跨科学域扩展终端 agent 训练环境无需逐任务工程。——terminal agent 训练环境规模化生产的新范式。
  • D2K-Bench: Can LLM Agents Turn Expert Designs into Efficient GPU Kernels?(https://arxiv.org/abs/2610.03226,10-05):26 任务 / 85 工作负载,三层专家设计指引(算法洞察/数据流/底层优化),B200 上指引使正确率 93.1%→98.5%;衡量 agent 把设计知识转化为高效实现的能力。
  • SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents(https://arxiv.org/abs/2610.03372,10-05):规划拿全终端信用、子任务执行在局部上下文蒸馏 + 跨 rollout 子任务前缀树精化规划信用;文本/多模态宏平均 +4.48/+4.19 点。
  • Pinning Decisions Before Failure: Executable Records of Underspecified Choices in AI-Assisted Code Generation(https://arxiv.org/abs/2610.03237,cs.SE,10-05):把未指明选择记录为可执行决策,失败前钉住。
  • MintEval: Do LLMs Implement the Trading Strategy You Asked For?(https://arxiv.org/abs/2610.03080,cs.CL,10-05):自然语言→策略代码的行为等价基准——不比文本相似度,比行为语义。
  • FrugalEvo: Cost-Aware LLM-Guided Program Evolution(https://arxiv.org/abs/2610.03675,10-05,HF 17 票):AlphaEvolve 类方法按固定迭代数比性能是不对的,应最大化单位成本增益;强模型探索策略 + 廉价模型实现精化 + 前缀缓存复用,配 Budget-Aware AUC 指标。
  • VeriPy: Source-Preserving Verification and Compatibility Checking for Python Components(https://arxiv.org/abs/2610.02814,cs.SE,10-05)。
  • WebUIProof(https://arxiv.org/abs/2610.02617,cs.SE,10-05):用 UI-Agent 执行 harness 验证 WebUI 代码生成。
  • When to Compile a Computer-Use Agent?(https://arxiv.org/abs/2610.02932,cs.AI,10-05):agent 编译的回本测量与决策。

#Post-training RL / RLVR 机制

  • AdaStep(2610.03223,见重点详评 2)与 DepGPO(2610.03634,见重点详评 3)。
  • All Work And No Play Makes Jack a Dull Boy: Catastrophic Strategy Collapse in RLVR(https://arxiv.org/abs/2610.02835,cs.LG,10-05):GRPO 式算法后期严重坍缩不是良性策略剪枝而是有效策略容量的收缩;用轨迹级策略更新交互定义策略,结合优化动力学与信息论证明 RLVR 目标逐步把概率质量集中到单策略、而维持任务准确率需要最小策略容量,两者冲突即坍缩的机制解释;提出 Mirrored Entanglement(镜像纠缠)缓解。——RLVR 多样性坍缩的机理篇,理论扎实。
  • MetaRubric: Learning to Reward for Rubric-Based RL(https://arxiv.org/abs/2610.02824,10-05,HF 15 票):rubric 评审会给"要求的信息根本不在回答里"的条目打高分(Vacuous Credit),可反转 GRPO 优势符号;证据感知策略优化与回答引导的 rubric 自适应交替。
  • Gains and Collapse in On-Policy Distillation: A RL Perspective(https://arxiv.org/abs/2610.03185,cs.CL,10-05):OPD 增益与坍缩统一解释——教师隐式奖励学生行为(即使自己很少生成);隐奖励可靠时 OPD 让正确回答更易采样,偏好错位时发生 reward hacking 放大超长重复 rollout。——OPD 的 RL 视角统一框架,与昨天 175 票的蒸馏动力学研究同谱系。
  • FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training(https://arxiv.org/abs/2610.02828,10-05):预算约束下 LLM RL 后训练的风险控制。
  • Reliable Self-Evolution with Imperfect Proxy Rewards (CISE)(2610.02975,见总览第 3 条):条件 conformal 区间校准自演化的代理奖励。
  • Turning to Follow the Winners: CEM for Critic-Free RFT(https://arxiv.org/abs/2610.03361,10-05)。

#Pretraining Data / 数据质量 / 合成数据

  • When Does Synthetic Relational Data Teach Models to Use Relations?(https://arxiv.org/abs/2610.03057,cs.LG,10-05):同一架构/初始化/目标/算力下四种关系数据生成器的数据归因——行级统计逼真就能拿高分,但"模型是否学会用关系结构"取决于数据的具体性质;把数据属性追踪到学到的计算。——"基准分数 ≠ 学到目标能力"的数据版,预训练数据质量研究的模板工作。
  • Learning a Fact Is Not Learning How to Retrieve It(https://arxiv.org/abs/2610.03251,cs.AI,10-05):请求形式训练 vs 陈述训练两阶段实验——模型可以通过请求形式"学会怎么检索",与学会事实本身分离。能力形成机制的基础实验,干净漂亮。
  • LUMOS: Tracing Parametric Knowledge from Training Data to Behavioral Outputs(https://arxiv.org/abs/2610.02902,cs.AI,10-05):参数知识从训练数据到行为输出的全链路追踪。
  • OptiSelect: How does the Optimizer Shape Data Curriculum?(https://arxiv.org/abs/2610.03432,cs.LG,10-05):优化器如何塑造数据课程的效果。
  • Pivot-SD: Efficient Self-Distillation for Masked Diffusion LMs(https://arxiv.org/abs/2610.03665,10-05,HF 45 票)。

#Continual Learning / 持续适应

  • What Should World Models Forget?(2610.03713,见 Model-based RL 组)。
  • RIFAR: Reliability and Forgetting-Aware Replay for Continual Robot Learning(https://arxiv.org/abs/2610.03079,10-05)。
  • On Unlearning for Time-series Forecasting(https://arxiv.org/abs/2610.02865,10-05)。

#Evaluation / 评测 / 基准

  • HyperBrowseComp(https://arxiv.org/abs/2610.03574,10-05,HF 46 票):423 道人写人验的 13 语言多模态网页浏览压测题,需定位冷门证据/多步线索链/视频扫描件地图等异构源。
  • Multilingual GSM-Symbolic(https://arxiv.org/abs/2610.03367,10-05,HF 35 票):30,000 条题目匹配的多语言数学迁移数据集,研究什么预测跨语言能力迁移。
  • D2K-Bench(2610.03226,见 Code Agent 组)。
  • 4DCodeBench: Inverse Graphics of Dynamic Scenes(https://arxiv.org/abs/2610.03715,10-05,HF 13 票):agent 从动态场景生成逆向图形代码。
  • Passing the Test You Trained On: Re-evaluating Prompt-Injection Detectors(https://arxiv.org/abs/2610.03448,10-05):训练-测试重叠对 agent 安全检测器评估的污染。
  • Corrupted but Correct: Why VLMs Lie to Themselves Internally(https://arxiv.org/abs/2610.03445,10-05)。

#Systems / 推理效率 / KV Cache

  • KV: A Self-Refining KV Cache(https://arxiv.org/abs/2610.03198,cs.CL,10-05)。
  • SlimKV: Joint Token-Feature KV Compression with Reconstruction-Free Beacon Attention(https://arxiv.org/abs/2610.02953,10-05)。
  • iS-KV: Online Low-Rank KV Compression via Block-Incremental SVD(https://arxiv.org/abs/2610.02815,10-05)。
  • AvoKV-E: Payload-Aware KV Eviction for Long Reasoning(https://arxiv.org/abs/2610.03007,10-05)。
  • Gated Slot Attention-2: Two-Sided Associative Memory Correction in Linear Attention(https://arxiv.org/abs/2610.02816,10-05)。
  • Jumping the Line: Exploiting Length Predictions in LLM Scheduling (JIL)(https://arxiv.org/abs/2610.03430,10-05):对预测式调度器的对抗攻击。
  • Zephon: Elastic Determinism for Online, Stateful Foundation Model Data Loading Pipelines(https://arxiv.org/abs/2610.03087,10-05)。

#四、社区动态(HF / GitHub)

Hugging Face Daily Papers 10-05 榜单高票(附投票数;10-06 榜单生成时间未到,如实说明):

  • RealCompanion(245 票)——纵向真实世界对话上的人类理解基准,长对话关系推理。
  • Does Learning Protein Folding Generalize to Broader Reasoning?(94 票)。
  • Scaling Trajectories through Recursive Self-Rewrite(78 票)——见重点详评 4。
  • Native Action-Prior Learning from Videos for World Action Models(69 票)。
  • World Action Modeling with Progressive Visual Planning(70 票)。
  • On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training(69 票)。
  • HyperBrowseComp(46 票)。
  • World Embedding Benchmark(36 票)。

GitHub 近几日值得关注的新仓库(GitHub Search API,created:>2026-10-01):

  • nuglifeleoji/Sentry(50 stars,10-02)——Sentry 论文(2610.02994)官方开源,测试时失败恢复层的参考实现,与今天重点详评 5 直接配套。
  • NOAH1ARK/VICO-CodeAgent(10-02)——多步代码 agent:执行反馈 + 步级 RL 信用分配 + 策略与验证器协同优化,与今天 AdaStep/DepGPO 主线同题的开源实现。
  • zsxm1998/awesome-perception-aware-rlvr(28 stars,10-02)——VLM 感知感知 RLVR 与 OPD 的统一复现/基准/评测:15 方法 30+ 基准。
  • jiamingzhang94/lgwm(10-02)——LGWM: Latent GUI World Model,动作条件世界模型在表征空间验证 GUI agent 转移——把 world model 验证搬到 GUI agent 域,与 wenjun 主线交叉点直接命中。
  • linjiw/g1-body-world-model(10-05)——Unitree G1 上的命令空间身体 world model 设计研究计划(SONIC/BFM-Zero)。
  • OpenInterpretability/ekbasis(10-04)——"action 之前先知道 action 会做什么"的开源 agent world model。
  • elstongun/leviathan(275 stars,10-05)——大容量数据集上的 agent 深度记忆,单静态二进制。
  • AgentMemoryRepo/agentmemoryrepo(186 stars,10-04)——Agent Memory 规范提案,agent 记忆标准化值得留意。

#五、今日最值得精读的 3 篇

  1. Counterfactual Action Evaluation(https://arxiv.org/abs/2610.02860)——低隐预测误差 ≠ world model 分得清动作后果;逐层反事实追踪协议 + "动作通路欠利用"的隔离证明,是本周对 JEPA/Dreamer 路线最有信息量的一篇批评性评估。
  2. Scaling Trajectories through Recursive Self-Rewrite(https://arxiv.org/abs/2610.02826)——"特权 harness 探索 + 通用 harness 重写"的 agent 训练数据工厂,HF 78 票,方法可直接复用。
  3. AdaStep + DepGPO 并读(https://arxiv.org/abs/2610.03223 / https://arxiv.org/abs/2610.03634)——步级信用分配的"信多少"(收缩系数)与"信谁的"(依赖图)两个正交维度同日出现,合起来是 agentic RL 本周最重要的方法论推进。

#六、今日最值得跟进的 3 个 repo / model / dataset

  1. nuglifeleoji/Sentry(https://github.com/nuglifeleoji/Sentry)——论文官方实现,测试时失败恢复 + 条件性经验暴露的完整工程参考。
  2. hacktrace 数据集(论文 2610.03055 配套发布)——17.3 万条标注多轮编码轨迹,reward hacking 行为监督监控研究的现成数据底座。
  3. jiamingzhang94/lgwm(https://github.com/jiamingzhang94/lgwm)——Latent GUI World Model:动作条件 world model 验证 GUI agent 转移,"world model 用于 agent 行为验证"这一用法的早期开源样本。

#七、研究机会 / Ideas

  1. 把"反事实动作追踪协议"移植到 LLM agent world model,并做成公开基准。2610.02860 证明视觉 JEPA world model 的"动作通路欠利用"可以用逐层反事实追踪干净隔离;2610.03137(SLIM)在另一套设置里独立发现同样问题。目前没有任何 LLM 域工作测量"文本 world model 的动作敏感性"。一个最小可行版本:在可控文本环境(如 ALFWorld / WebShop 变体)里做状态分叉,测 LLM world model 预测的状态分布对"第 k 步动作替换"的响应幅度,并与各向同性扰动对照。若同样发现动作通路欠利用,则 Dreamer-for-LLM-Agent 的规划前提需要重新审视——这是一个低成本、高杠杆的评估贡献。
  2. 步级信用分配的"依赖图 × 收缩系数"组合实验。DepGPO 决定信号发给谁(图结构),AdaStep 决定信号发多强(方差控制),二者正交且都有开源实现基础(VICO-CodeAgent 等)。在一套统一基准(E2E-SWE / EngramBench)上做 2×2 组合 + 与 SHARPO/T2SPO/My FAULT 的六方对比,回答"结构信息与统计稳健性哪个贡献大、是否互补"——既补社区缺失的横向评测,又直接产出 wenjun 长轨迹 RL 主线的方法论结论。
  3. "条件性经验暴露"与上下文压缩器的合流。Sentry 证明常驻上下文的失败教训会误伤(条件知识必须条件性暴露),Interpreting at Write Time(2610.02897)证明多目标共享记忆的摘要策略本身是目标函数选择,DyadMem 把记忆评测推进到"关系性"层面。三个信号指向同一个设计问题:压缩/摘要输出的价值必须以"下游哪个未来目标会消费它"为条件来衡量——这恰好是 AutoCompact(何时压缩)与 MemFold(压成什么)之外的第三问"为谁而压"。把它形式化为按未来目标分布的期望效用的优化目标,是"通用上下文压缩器"主线下一个理论增量。

本简报由 Hermes 调研助手于 2026-10-06 08:00(Asia/Shanghai)自动生成。所有论文均经 arXiv / Hugging Face / GitHub 真实抓取核验;X/Twitter 因访问受限未能纳入,特此说明。