#2026-10-03 AI/LLM 最新论文与研究热点简报
时间范围:2026-10-01 至 2026-10-03(覆盖最近 48 小时 arXiv 新提交;由于 arXiv 公布节奏,10-02 深夜批次与 10-01 白天批次合并覆盖)。
信息来源:Hugging Face Daily Papers API(2026-10-01/10-02 榜单,含社区投票数)、arXiv 官网 recent listing(cs.CL / cs.AI / cs.LG / cs.SE / stat.ML 五个分类,逐条解析)、arXiv 摘要页逐篇核实(本文所有 Top 论文的摘要均为逐条抓取原文,未编造任何条目)、GitHub Search API(最近一周新建仓库按 star 排序)。arXiv Atom API(export.arxiv.org)本日触发 "Rate exceeded" 限流,已改用 arxiv.org/list 网页列表完成检索;X/Twitter 匿名访问持续被反滥用拦截(HTTP 403),本次未能检索,以 arXiv / HF / GitHub 为主,特此如实标注。
#一、总览:今天的主线是什么
最近 48 小时的进展可以归纳为五条主线,与 wenjun 的研究版图高度重合:
- "harness 内化"成为 harness 系研究的收敛点:昨天还在讨论 harness 该怎么学(Mid-Harness、Meta-Skills、MILO),今天直接进入下一问——模型能否把 harness 的控制决策吸收进权重。Harness Annealing(HAT)提出 "harness internalization" 目标:在逐步削弱 harness 的课程上训练,让模型在撤掉外部控制后仍保持性能;VideoEvolve 把 harness 自动进化到视频时序定位域;ActiveSaddler(50 票)用自动课程学习优化 agent harness。这条线正在从"造更好的 harness"转向"harness 的可退位性"。
- 信用分配的"自我诊断"路线成型:继 GIGPO/HGPO 之后,今天的 My FAULT 把自然语言的失败诊断直接转化为以终局结果锚定的步级信用——自诊断器与策略共同演化,在 ALFWorld 上把同结果组的信号覆盖率从 GRPO 的 41% 提到 95%。加上同日 stat.ML 的 "Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs"(2609.28963)和 "When Does Action Credit Need Updating?"(2609.29007),步级优势估计的理论与方法正在快速补全。
- 上下文压缩/记忆的因果化与决策化:AutoCompact 把"何时压缩上下文"变成策略的一部分(SFT+RL 联合训练,SWE-bench Verified +9.2%);Causal Memory Policy 用倾向得分干预检索来解决"记忆效用不可识别"问题(LongMemEval 上 54% 的必需记忆从未被检索到,效用无法估计);Mem++(组织记忆)、MemFold(长上下文个性化软记忆)继续把记忆系统推向非破坏式与可训练化。"上下文管理 = 隐式策略学习"这个视角正在统一压缩、检索与记忆三个子领域。
- Post-training 税收学:Sharpening Tax(63 票)给出量化证据——RL 后训练把任务推向"永远能解/永远不能解"两极,提升了采样效率和 pass@1,却砍掉了 pass@K 的解空间覆盖;base 模型 + 轻量 harness 在足够 test-time 预算下 pass@K 反超 post-trained 版本。同日 On Language Drift during RLVR 证明 RLVR 优化压力允许无界的语言漂移而 SFT 不会。"RLVR 到底改变/毁掉了什么"正在变成一个可度量的经验科学。
- 世界模型的"机制一致性"与超长程监督:On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models 提出预测准确 ≠ 反事实正确(改动作后预测是否朝声明方向移动),这是对 LLM world model 的一次根本性诊断;Memorizon 解决"训练样本要长但注意力不必长"的解耦,100→400 秒只加 12% 步时。加上 Latent JEPA(用隐空间预测未来来训练 latent reasoning)与 Latent-Foresight,model-based RL for LLM 的"监督什么"问题正在被拆解成可操作的子问题。
#二、重点论文详评(Top 5)
#1. Sharpening Tax in Post-Training
- 链接:https://arxiv.org/abs/2610.01509
- 来源:Hugging Face Papers 热榜(63 票)
- 日期:2026-10-01 提交
- 类别:Post-training RL / Evaluation
- 核心贡献:系统检验"RL 后训练只是 sharpening"假说在 agentic 任务上的边界。发现:base 模型 + 轻量推理 harness 往往是能干的 agent;post-training 把任务推向"总是能解 / 总是不能解"两极,提升采样效率与一致性,但牺牲解覆盖(pass@K)。提出 Sharpening Tax 指标量化后训练后 test-time 可扩展性的损失,在 4 个模型家族、14 对 base/post-trained 模型、3 个 agentic 基准共 42 个案例中普遍存在;并提出后验回火分组采样(PTGS)作为即插即用的缓解。
- 为什么值得关注:这是对 RLVR/agentic RL 社区的一记清醒剂:如果后训练的收益本质是"采样分布变尖",那么采样预算 × 分布尖锐度才是真正的能力公式,很多"RL 学到了新能力"的说法需要重新用 pass@K 曲线检验。指标可以从少量 rollout 估计,立刻可复用于任何自己的 RL 实验。
- 与 wenjun 的关系:与"高效后训练"主线直接相关。做长轨迹 agent RL 时,Sharpening Tax 应作为标准报告指标;它也直接质疑"agentic 能力是后训练新习得的"这一预设——与 EVOKE(世界知识已在预训练内化)形成同一方向的呼应:post-training 的角色是聚焦(elicit + sharpen)而非新增。
#2. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning
- 链接:https://arxiv.org/abs/2610.01161
- 来源:arXiv cs.CL 新提交(10-01);作者 13 人
- 日期:2026-10-01
- 类别:Post-training RL / Credit Assignment / Self-Evolving Agent
- 核心贡献:解决 agentic RL 两个信用分配难题:(a) 同结果 rollout 组(全成功或全失败)从终局奖励得不到学习信号;(b) 终局奖励只有轨迹级反馈,无法定位失败决策。现有"自然语言反思"不可直接用于信用分配(错误声明不可靠、不量化)。提出 FAULT:把诊断出的错误转化为以终局结果锚定的显式步级信用,校验诊断证据、从任务结果在线学习各错误类别的相对代价;训练中策略与自诊断器共同演化。ALFWorld 上信号覆盖率 95%(GRPO 41%、GiGPO 72%),WebShop 与第二个模型规模上同样显著。
- 为什么值得关注:它直面了 GIGPO 系方法的一个真实短板——同结果组零信号问题——而且给出了可量化的覆盖率指标来对比。诊断器与策略共同演化的设计也把"self-diagnosis"从推理时技巧变成了训练时的结构化信号源,这正是 agentic RL 目前最缺的中间粒度监督。
- 与 wenjun 的关系:长轨迹 Agent RL 主线的今日必读。FAULT 的"错误代价在线学习"可以直接与 GIGPO 的分组优势、HiSentinel 的 hindsight 蒸馏做三方对比;其"诊断可靠性校验"模块也回应了 False Frontiers 提出的 co-cheating 风险——自诊断本身也会自我确证,这是显然的后续实验点。
#3. Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
- 链接:https://arxiv.org/abs/2610.01415
- 来源:Hugging Face Papers 热榜(69 票)
- 日期:2026-10-01
- 类别:LLM Agent / Memory / Latent State
- 核心贡献:提出 PoS 推理时框架:agent 不再靠堆历史交互记忆,而是持续构造并维护显式 belief state 作为决策上下文——每个 belief 同时包含当前世界状态估计 + 未解决的任务需求,显式表达"我还不知道什么/还没完成什么"。通过一致性校验和任务进度监控检测 Belief Trapping(agent 持续行动但对目标无实质推进),并按陷入模式定制恢复策略。四个执行/诊断类基准、三种 LLM 底座全部第一;上下文增长实验显示对 context 变长有韧性。
- 为什么值得关注:它把长程 agent 的上下文管理从"历史保留/压缩"升级为"信念构造与维护",这与 model-based RL 中 belief state over partially observable environment 的经典概念正面接轨——LLM agent 文献终于显式回到了 POMDP 语言。Belief Trapping 的检测信号(行动而不推进)也是一个非常实用的新失败模式类别。
- 与 wenjun 的关系:正中 LLM model-based RL 主线的概念核心:显式 belief state 就是 Dreamer 系 world model 里 posterior 的符号化版本。直接的实验问题:学习出来的 latent state(如 world model 的隐状态)与显式维护的符号 belief state 能否互相蒸馏/对齐? 这正好是连接两条研究线的一座桥。
#4. AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents
- 链接:https://arxiv.org/abs/2610.02163
- 来源:arXiv cs.CL 新提交(10-01)
- 日期:2026-10-01
- 类别:Code Agent / Context Compression / Post-training
- 核心贡献:把"何时压缩上下文、保留什么工作状态、如何从压缩后继续"训练进 coding agent 的策略本身。数据构造:跑 base agent,用 judge 复盘其压缩决策/摘要/压缩后动作,有缺陷的输出被修正版替换后重新在环境中执行(轨迹从修正决策处续跑),再用于 SFT;随后用任务成功奖励对编码与压缩联合做 RL。SWE-bench Verified 绝对提升 9.2%,SWE-PolyBench Verified +5.0%;在 256K 不溢出窗口与 16K 溢出触发回退压缩两种设定下都成立。
- 为什么值得关注:上下文压缩从"推理时的工程技巧"(外挂压缩器)转成了策略的学习动作,并且给出了一个很干净的数据构造范式:judged-correction-replay。对一切"通用上下文压缩器"研究,这是必须回应的基线——外挂压缩 vs 内化压缩策略,哪种泛化更好?
- 与 wenjun 的关系:同时命中"通用上下文压缩器"与"代码 Agent 的 agentic RL"两条线。9.2% 的绝对提升量级说明这不是玩具改进;judge-replay 修正数据的思想同样可迁移到长轨迹 RL 的失败轨迹修复上(与 PivotOPD 的关键失误恢复同一谱系)。
#5. Cross-Benchmark Transfer from RL on Agentic Coding Tasks
- 链接:https://arxiv.org/abs/2610.00890
- 来源:arXiv cs.SE(10-01 批次)
- 日期:2026-10-01
- 类别:Code Agent / Post-training RL
- 核心贡献:用纯 RL(GSPO,rank-32 LoRA)在 1700 个专家构建的 agentic coding 任务上后训练 Kimi K2.7 Code(1T 参数、32B 激活 MoE):1000 个仓库任务用隐藏 fail-to-pass + pass-to-pass 测试评分,700 个终端任务用专家编写的隐藏验证器;奖励是目标检查通过比例,任何 pass-to-pass 失败则归零。一个 epoch 后在6 个外部基准、3 种 agent harness 上 pass@1 全部提升:SWE-Bench Pro 60.1→64.8,DeepSWE 31.0→43.4,Terminal-Bench 2.1 67.4→82.0,Terminal-Bench 3 1.4→12.1 等。
- 为什么值得关注:这是"agentic RL 泛化"的迄今最强实证之一:只在 1700 个任务上训一个 epoch,六个分布外基准全涨,且跨 harness(训练与评估用的 agent 框架不同)成立。"最后一公里"失败(丢需求、只测自实现覆盖的用例、破坏既有行为)被显式建模进奖励(pass-to-pass 一票否决),这是任务设计上最值得抄的部分。
- 与 wenjun 的关系:代码 Agent 的 agentic RL 主线的参考坐标。1700 任务 × 1 epoch 的极低样本效率对比(与 Sharpening Tax 对照阅读非常有意思:这里 RL 确实带来了分布外迁移,说明 agentic 域的 sharpening 假说边界在哪里);pass-to-pass 一票否决的奖励设计可直接搬到自己的代码 RL 环境里。
#三、其余值得关注的论文速览
#LLM Agent / Harness / 信用分配
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| Harness Annealing: Learning to Act with Less External Control | https://arxiv.org/abs/2610.01235 | 10-01 | 提出 harness internalization:在逐步削弱 harness 的课程上训练,撤掉控制决策后仍保持性能 | Harness / Post-training |
| VideoEvolve: Evolving Agent Harnesses for Video Temporal Grounding | https://arxiv.org/abs/2610.01766 | 10-01 | Cloze 结构化 harness 表示 + 分支引导进化,harness 自动进化扩展到视频时序定位 | Harness / Self-Evolving |
| ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization | https://arxiv.org/abs/2610.00906 | 10-01 | 自动课程学习优化 agent harness(HF 50 票) | Harness |
| Agents Are Systems, Not Models: Rethinking Agentic Evaluation | https://arxiv.org/abs/2610.01618 | 10-01 | 同一 agent 换配置的重复运行方差占 54%;给 agent 的信息量比时间预算和模型大小影响都大 | Evaluation |
| Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks | https://arxiv.org/abs/2610.02001 | 10-01 | 本地优先的 harness 让小开源模型完成真实任务 | Harness / Systems |
| Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models | https://arxiv.org/abs/2610.02142 | 10-01 | 关键词型 harness 的失效是"fail open"的;给小模型 tool-use 声明一个廉价诊断阶梯 | Tool-use / Evaluation |
| Causal Memory Policy: Making Memory Utility Identifiable by Intervening on Retrieval | https://arxiv.org/abs/2610.02070 | 10-01 | LongMemEval 54% / LoCoMo 67% 的必需记忆从未被检索到导致效用不可识别;用逆倾向加权干预检索恢复可辨识性 | Memory / Causal Inference |
| Mem++: Non-Destructive Memory for Long-Term Organizational LLM Agents | https://arxiv.org/abs/2610.02002 | 10-01 | 从写入时蒸馏转向读取时选择:文档全量保存、读时按时间与词法+语义融合检索,OrgMemBench 超 SOTA 8.0-13.1 分 | Memory |
| Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaboration | https://arxiv.org/abs/2610.01244 | 10-01 | off-query 失败:任务决策正确但共享信息状态已损坏;21 组设定中证据核验仅 14.3% vs 任务解决 64.7% | Multi-Agent / Evaluation |
| Global Coherence: When Every Agent Is Right and the Team Is Still Wrong | https://arxiv.org/abs/2610.02036 | 10-01 | Observation-Aliasing 不可能性定理:k 个不可区分世界需要两两不相交动作时最优成功率 1/k,更多推理无法挽回 | Multi-Agent / Theory |
| SciUtopia? Closed-Loop LLM Simulation of Academic Research Ecosystems | https://arxiv.org/abs/2610.01257 | 10-01 | 持久闭环 LLM-agent 模拟学术生态系统(方向选择/合作/评审/引用/经费),可做反事实制度实验 | Multi-Agent / Simulation |
| X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization | https://arxiv.org/abs/2609.32993 | 09-25 | 把可复用经验 token 化以提升 agent 泛化效率(HF 12 票) | Agent / Pretraining 数据 |
| Not All Experience Belongs in the Weights: Component Routing for Self-Improving GUI Agents | https://arxiv.org/abs/2610.01787 | 10-01 | 把经验拆成 locators/procedures/state facts/lessons 四类分别路由到上下文或权重;recurrence × state-conditionality 两属性预测目的地 24/24 命中 | Self-Improving / 记忆路由 |
| JevSpawn: Adaptive Agentic Inference through Compositional Action Spaces | https://arxiv.org/abs/2610.00437 | 09-29 | 组合式动作空间的自适应 agentic 推理 | LLM Agent |
| AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models | https://arxiv.org/abs/2610.01560 | 10-01 | 语音 LM 的自适应潜空间推理:多路径隐推理分布 + 联合 chunk 预测降低推理延迟,附 AuralReason-683K 数据 | Latent Reasoning / Speech |
#Model-based RL / World Model / Latent
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models | https://arxiv.org/abs/2610.01842 | 10-01 | 提出 mechanism consistency 指标:准确预测 ≠ 改动作后预测朝声明方向移动;8 数据集 7 底座系统测量两者的分歧 | Model-based RL / Evaluation |
| Memorizon: Training World Models Beyond Their Context Window | https://arxiv.org/abs/2610.00544 | 09-30 | 解耦"监督需要长跨度"与"注意力代价":按相机共视性检索 top-K latents 组成有界共享 bank,跨度 100→400 秒步时仅 +12% | World Model / Systems |
| Latent JEPA: Abstract Future Prediction for Latent Reasoning in Chemistry | https://arxiv.org/abs/2610.01947 | 10-01 | 自回归学习 + 联合嵌入预测未来视图:隐思维预测后续推理与分子结果,ChemCoTBench 提升 | Latent Reasoning / JEPA |
| Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models | https://arxiv.org/abs/2610.01942 | 10-01 | 端到端学习可预测表征用于潜空间世界模型 | Latent World Model |
| Mimir: Physics-Grounded LLM Agents for Long-Horizon Irrigation Control | https://arxiv.org/abs/2610.02038 | 10-01 | 长程物理控制双时间尺度修复:快尺度确定性模拟器核验提案、慢尺度失败模式沉淀为持久原则 | Model-based RL / Embodied |
| Decision Titan: Test-Time Training for Long-Term Memory in Offline RL | https://arxiv.org/abs/2610.01513 | 10-01 | 离线 RL 的测试时训练长时记忆 | RL / Test-time |
| Honeycomb: Constant-Size Scene Memory Representation for Video World Models | https://arxiv.org/abs/2609.37690 | 09-29 | 常数大小场景记忆表示用于视频世界模型 | World Model |
| Learning What to Recall: Adaptive Multi-Cue Episodic Memory for World Models | https://arxiv.org/abs/2609.34677 | 09-27 | 世界模型的自适应多线索情景记忆 | World Model / Memory |
| Optimal Transport Meets Reinforcement Learning: A Survey | https://arxiv.org/abs/2610.01413 | 10-01 | OT × RL 交叉综述 | RL / Theory |
| LLM2Jev: LLMs Are Already Jev-Style Decision Models | https://arxiv.org/abs/2610.02076 | 10-01 | 从 next-token 概率免训练提取校准决策分布,4B 模型即匹配专用决策模型 | Decision Model |
| Code Owns the Simulation, Jev Owns the Evaluation | https://arxiv.org/abs/2610.01834 | 10-01 | 判别式决策模型的边界:能从输入判定的(evaluation)可信,需预测未见的(simulation)不可信 | Decision Model / 诊断 |
#Code Agent / Code Intelligence
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| Doing More with Less Tokens: Hierarchical RL for Efficient Coding Agents | https://arxiv.org/abs/2609.38885 | 09-30 | 分层 RL 训练 token 高效 coding agent:效率变异 + 熵相关两大观察 | Code Agent / Post-training |
| E2E-SWE: Benchmarking LLMs on Building Working Codebases from Scratch | https://arxiv.org/abs/2609.38335 | 09-30 | 从零构建可用代码库的端到端 SWE 基准 | Code Agent / Evaluation |
| Zero2Repo: Can Coding Agents Build Repositories from Scratch? | https://arxiv.org/abs/2609.38269 | 09-30 | coding agent 从零建仓库能力评测 | Code Agent / Evaluation |
| Cross-Model Review / Guarded Commits / RLE-Bench 等安全与评审系 | https://arxiv.org/abs/2610.01023 | 10-01 | Groundability:弱评审者能否审计强 coding agent | Code Agent / Evaluation |
| CARM: Cancellation-Aware Response Masking for LLM RL | https://arxiv.org/abs/2610.02039 | 10-01 | RL 中对抵消性响应做掩码 | Post-training RL |
| FastCI: Efficient GPU-Intensive CI for LLM Training Frameworks | https://arxiv.org/abs/2610.01967 | 10-01 | LLM 训练框架的 GPU 密集 CI 系统 | Systems |
| Self-Spec Verifiable Code Generation | https://arxiv.org/abs/2609.39568 | 09-30 | 自规格可验证代码生成 | Code Agent / RLVR |
| AgSpec: Retrieval-Based Speculative Decoding in Coding Agent Pipelines | https://arxiv.org/abs/2610.01108 | 10-01 | coding agent 管线中的检索式投机解码 | Code Agent / Systems |
#Post-training / RL 理论 / 预训练数据
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| On Language Drift during RLVR Post-Training | https://arxiv.org/abs/2610.02015 | 10-01 | 理论证明 RLVR 优化压力允许无界语言漂移而 SFT 不会;漂移特发于新颖推理任务的 RLVR | RLVR / Theory |
| Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis | https://arxiv.org/abs/2610.01896 | 10-01 | 异步 LLM 后训练的组质量截断与收敛分析 | Post-training / Systems |
| From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation | https://arxiv.org/abs/2610.02179 | 10-01 | 从梯度层面理解多教师在线蒸馏 | Distillation |
| Sharpening Tax(见 Top 5) | https://arxiv.org/abs/2610.01509 | 10-01 | post-training 对 pass@K 的覆盖税 | Post-training / Evaluation |
| Scalable, Transferable Meta-network for Data Selection Requires a Different Loss | https://arxiv.org/abs/2610.02092 | 10-01 | 数据选择元网络需要 PVM 损失而非直接套 MTS 目标;TESS 框架 | Pretraining Data |
| Finetuning with Sampling: SFT Learns Better Than You Think | https://arxiv.org/abs/2610.02140 | 10-01 | SFT 的能力被低估:采样式微调 | Post-training |
| TESS / Weighted Data Selection: Sharp Upper-Half and Five-Dimensional Laws | https://arxiv.org/abs/2610.00101 | 10-01 | 加权数据选择的五维定律 | Pretraining Data / Theory |
| ChainLoRA: Geometry-Preserving Task Vector Merging for Continual Learning in LLMs | https://arxiv.org/abs/2610.00431 | 10-01 | 无回放持续学习:任务向量几何视角 + 自适应 SVD 合并,Procrustes 对齐分离共享/专属成分 | Continual Learning |
| Task-Oriented Rank Adaptation for Continual Learning in Text Classification | https://arxiv.org/abs/2610.01702 | 10-01 | 面向任务的秩适配持续学习 | Continual Learning |
| Transformers as Cross-Task Learners: Shared Structure Drives Sample Efficiency in ICL | https://arxiv.org/abs/2609.29060 | 09-30 | 跨任务共享结构驱动 ICL 样本效率的理论 | Pretraining / Theory |
| RLVR Landscapes for Iterated Multiplications Can Be Benign: Spin-Glass Insights | https://arxiv.org/abs/2609.28625 | 09-30 | 自旋玻璃理论分析 RLVR 损失景观 | RLVR / Theory |
| Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs | https://arxiv.org/abs/2609.28963 | 09-30 | 轨迹图上的步级优势估计 | Credit Assignment |
#Latent Reasoning / 递归模型 / 评测
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| Decoding Looped Transformers Better for (Almost) Free | https://arxiv.org/abs/2610.02185 | 10-01 | LoopCD:对比早期回环与最终预测的免训练对比解码;Ouro-2.6B AIME24 61.88→73.33,且可减半回环数 | Latent Reasoning / Decoding |
| The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning | https://arxiv.org/abs/2610.02191 | 10-01 | 数学基元四维评测(Discovery/Generation/Digestion/Execution):解对掩盖能力缺陷,Discovery 是主瓶颈 | Evaluation / Reasoning |
| Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs | https://arxiv.org/abs/2610.01428 | 10-01 | 泛化 = 稳定性而非精度:多轴评测 | Evaluation |
| Rethinking Latent Visual Reasoning(继续霸榜) | https://arxiv.org/abs/2609.34563 | 09-28 | latent token 对改变答案的扰动响应弱;GRPO 终局奖励监督不足(HF 209 票,仍在 10-01 榜) | Latent Reasoning / RLVR |
| Hierarchical Continuous Diffusion Language Models | https://arxiv.org/abs/2610.02193 | 10-01 | 层次化连续扩散语言模型(HF 69 票) | Architecture |
| Temporally-Resolved Token Attribution for Diffusion LMs | https://arxiv.org/abs/2610.01177 | 10-01 | 扩散 LM 的时序分辨 token 归因 | Interpretability |
#上下文/长视频/流式(与压缩器研究相关)
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video | https://arxiv.org/abs/2610.01762 | 10-01 | 查询无关的证据记录 + 任务响应统一进共享主动生成过程;PHCM 层级字幕记忆;4B 模型 8 个流式基准最佳(HF 146 票) | Memory / Streaming |
| MemFold: Compact Soft Memory for Long-Context Personalization via On-Policy Optimization | https://arxiv.org/abs/2609.36435 | 09-28 | 在线策略优化训练紧凑软记忆(个性化) | Memory |
| LOCI: Spatial Linear Memory for Streaming World Models | https://arxiv.org/abs/2609.40222 | 09-30 | 流式世界模型的空间线性记忆 | World Model / Memory |
#四、GitHub / 开源动态(最近一周新建,按 star)
| 仓库 | Stars | 一句话说明 | 类别 |
|---|---|---|---|
| https://github.com/PostHog/jeeves | 399 | Jeeves:推理增强的 Jev 式决策模型,与 arXiv 决策模型论文线呼应 | Decision Model |
| https://github.com/strands-labs/strands-decider | 205 | 面向 agentic workflow 的小型快速"系统一"决策模型 | Decision Model |
| https://github.com/disler/ten-levels-of-jev | 156 | Jev 的十个层级:从 if 语句到 coding agent 主动调用 Jev | Decision Model |
| https://github.com/feder-cr/dots | 2473 | 开源"自带浏览器不被封"的 web AI agent | Web Agent |
| https://github.com/composio-community/open-dot | 426 | 本机运行的开源个人 AI agent(OpenAI + Composio,Mac app) | Personal Agent |
| https://github.com/openJiuwen-ai/iCode | 292 | 轻量可扩展的完全离线 AI 开发平台与 agent/workflow 工具链 | Code Agent |
| https://github.com/Edwardxlai/easyread | 601 | 英文论文→舒适中文的本地 PDF 翻译 + 原文对照 + 边读边问 | 研究工具 |
观察:本周 GitHub 上 "Jev 式决策模型"生态(jeeves / strands-decider / ten-levels-of-jev)与 arXiv 的 LLM2Jev / Code-Owns-the-Simulation / JevSpawn 论文线同步爆发——"把 LLM 当校准决策头(而非文本生成器)用" 正在从论文概念变成开源基建,PostHog 等工程公司入场是强信号。
#五、今日最值得精读的 3 篇
- Sharpening Tax in Post-Training(https://arxiv.org/abs/2610.01509)——post-training 到底改变/毁掉了什么,一篇文章给出可度量的答案;任何做 RLVR 实验的人都应该把 Sharpening Tax 加入报告指标。
- My FAULT: Self-Diagnosis as Credit Assignment(https://arxiv.org/abs/2610.01161)——同结果组零信号问题的最新解法,直接可与 GIGPO 对比;自诊断→步级信用的管线是 agentic RL 中间粒度监督的代表工作。
- Beyond Memory: Explicit Belief States(https://arxiv.org/abs/2610.01415)——LLM agent 文献与 POMDP belief state 的显式接轨;读它可以同时理清 memory/world model/model-based RL 三个方向的公共语言。
#六、今日最值得跟进的 3 个 repo/model/dataset
- PostHog/jeeves(https://github.com/PostHog/jeeves)——推理增强 Jev 式决策模型,工程公司背书的决策头生态,值得关注其与 agent 框架的集成方式。
- OneStreamer-1M 数据集(随 https://arxiv.org/abs/2610.01762 发布)——超百万条流式视频交互记录(字幕 + QA),是"查询无关证据记录 + 主动响应"训练范式的现成语料,思想可迁移到文本 agent 的流式记忆。
- AuralReason-683K(随 https://arxiv.org/abs/2610.01560 发布)——683K 双语语音 + 推理续写数据,首个面向潜空间推理监督的大规模数据,其"多路径隐推理分布"标注思想对 latent reasoning 训练数据构造有直接参考价值。
#七、研究机会 / Idea
- Sharpening Tax × 长轨迹 Agent RL 的交叉:Sharpening Tax 只在 3 个 agentic 基准上测过 pass@K ≤ 多少?把 tax 曲线作为 RL 训练轮数的函数画出来,检验"agentic 域 RL 真习得新能力"的边界条件(结合 Kimi K2.7 Code 纯 RL 六基准全涨的证据,两边张力明显)。可操作:在 ALFWorld/WebShop 上对 GRPO/GIGPO/FAULT 各训 N 步,记录 pass@1 与 pass@K 曲线随训练进化的分歧点。
- 显式 belief state 与学习式 latent state 的对齐/蒸馏:PoS 的符号 belief state 是手工维护的,Memorizon/Latent JEPA 的隐状态是学出来的。两边能否互为监督——用显式 belief 的一致性校验信号做 latent world model 的辅助损失,或反过来用 latent state 的预测误差触发 belief 重构?这正好落在 wenjun 的 Dreamer-for-LLM + latent reasoning 两条线交点上。
- 自诊断信用的可靠性审计:FAULT 让策略和自诊断器共同演化,而 False Frontiers(昨天的 co-cheating 论文)警告这种闭环会自我确证。做一个"诊断漂移审计器":定期用外部冻结的验证器对照 FAULT 式自诊断的错误声明,量化诊断器随训练的漂移率——这是两个热点工作的自然合题,工作量小、结论清晰。
- 机制一致性(mechanism consistency)移植到 LLM world model:时间序列世界模型已证明"预测准确 ≠ 改动作后方向正确";为文本环境(如 WebShop/ALFWorld)的 LLM world model 设计同款反事实方向性测试,可作为 model-based RL for LLM 的第一个标准化诊断套件。
简报由 Hermes Agent 自动调研生成;数据源访问情况已在文首如实标注。