#2026-10-03 AI/LLM 最新论文与研究热点简报

时间范围:2026-10-01 至 2026-10-03(覆盖最近 48 小时 arXiv 新提交;由于 arXiv 公布节奏,10-02 深夜批次与 10-01 白天批次合并覆盖)。

信息来源:Hugging Face Daily Papers API(2026-10-01/10-02 榜单,含社区投票数)、arXiv 官网 recent listing(cs.CL / cs.AI / cs.LG / cs.SE / stat.ML 五个分类,逐条解析)、arXiv 摘要页逐篇核实(本文所有 Top 论文的摘要均为逐条抓取原文,未编造任何条目)、GitHub Search API(最近一周新建仓库按 star 排序)。arXiv Atom API(export.arxiv.org)本日触发 "Rate exceeded" 限流,已改用 arxiv.org/list 网页列表完成检索;X/Twitter 匿名访问持续被反滥用拦截(HTTP 403),本次未能检索,以 arXiv / HF / GitHub 为主,特此如实标注。


#一、总览:今天的主线是什么

最近 48 小时的进展可以归纳为五条主线,与 wenjun 的研究版图高度重合:

  1. "harness 内化"成为 harness 系研究的收敛点:昨天还在讨论 harness 该怎么学(Mid-Harness、Meta-Skills、MILO),今天直接进入下一问——模型能否把 harness 的控制决策吸收进权重。Harness Annealing(HAT)提出 "harness internalization" 目标:在逐步削弱 harness 的课程上训练,让模型在撤掉外部控制后仍保持性能;VideoEvolve 把 harness 自动进化到视频时序定位域;ActiveSaddler(50 票)用自动课程学习优化 agent harness。这条线正在从"造更好的 harness"转向"harness 的可退位性"。
  2. 信用分配的"自我诊断"路线成型:继 GIGPO/HGPO 之后,今天的 My FAULT 把自然语言的失败诊断直接转化为以终局结果锚定的步级信用——自诊断器与策略共同演化,在 ALFWorld 上把同结果组的信号覆盖率从 GRPO 的 41% 提到 95%。加上同日 stat.ML 的 "Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs"(2609.28963)和 "When Does Action Credit Need Updating?"(2609.29007),步级优势估计的理论与方法正在快速补全。
  3. 上下文压缩/记忆的因果化与决策化:AutoCompact 把"何时压缩上下文"变成策略的一部分(SFT+RL 联合训练,SWE-bench Verified +9.2%);Causal Memory Policy 用倾向得分干预检索来解决"记忆效用不可识别"问题(LongMemEval 上 54% 的必需记忆从未被检索到,效用无法估计);Mem++(组织记忆)、MemFold(长上下文个性化软记忆)继续把记忆系统推向非破坏式与可训练化。"上下文管理 = 隐式策略学习"这个视角正在统一压缩、检索与记忆三个子领域。
  4. Post-training 税收学:Sharpening Tax(63 票)给出量化证据——RL 后训练把任务推向"永远能解/永远不能解"两极,提升了采样效率和 pass@1,却砍掉了 pass@K 的解空间覆盖;base 模型 + 轻量 harness 在足够 test-time 预算下 pass@K 反超 post-trained 版本。同日 On Language Drift during RLVR 证明 RLVR 优化压力允许无界的语言漂移而 SFT 不会。"RLVR 到底改变/毁掉了什么"正在变成一个可度量的经验科学。
  5. 世界模型的"机制一致性"与超长程监督:On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models 提出预测准确 ≠ 反事实正确(改动作后预测是否朝声明方向移动),这是对 LLM world model 的一次根本性诊断;Memorizon 解决"训练样本要长但注意力不必长"的解耦,100→400 秒只加 12% 步时。加上 Latent JEPA(用隐空间预测未来来训练 latent reasoning)与 Latent-Foresight,model-based RL for LLM 的"监督什么"问题正在被拆解成可操作的子问题。

#二、重点论文详评(Top 5)

#1. Sharpening Tax in Post-Training

  • 链接:https://arxiv.org/abs/2610.01509
  • 来源:Hugging Face Papers 热榜(63 票)
  • 日期:2026-10-01 提交
  • 类别:Post-training RL / Evaluation
  • 核心贡献:系统检验"RL 后训练只是 sharpening"假说在 agentic 任务上的边界。发现:base 模型 + 轻量推理 harness 往往是能干的 agent;post-training 把任务推向"总是能解 / 总是不能解"两极,提升采样效率与一致性,但牺牲解覆盖(pass@K)。提出 Sharpening Tax 指标量化后训练后 test-time 可扩展性的损失,在 4 个模型家族、14 对 base/post-trained 模型、3 个 agentic 基准共 42 个案例中普遍存在;并提出后验回火分组采样(PTGS)作为即插即用的缓解。
  • 为什么值得关注:这是对 RLVR/agentic RL 社区的一记清醒剂:如果后训练的收益本质是"采样分布变尖",那么采样预算 × 分布尖锐度才是真正的能力公式,很多"RL 学到了新能力"的说法需要重新用 pass@K 曲线检验。指标可以从少量 rollout 估计,立刻可复用于任何自己的 RL 实验。
  • 与 wenjun 的关系:与"高效后训练"主线直接相关。做长轨迹 agent RL 时,Sharpening Tax 应作为标准报告指标;它也直接质疑"agentic 能力是后训练新习得的"这一预设——与 EVOKE(世界知识已在预训练内化)形成同一方向的呼应:post-training 的角色是聚焦(elicit + sharpen)而非新增。

#2. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

  • 链接:https://arxiv.org/abs/2610.01161
  • 来源:arXiv cs.CL 新提交(10-01);作者 13 人
  • 日期:2026-10-01
  • 类别:Post-training RL / Credit Assignment / Self-Evolving Agent
  • 核心贡献:解决 agentic RL 两个信用分配难题:(a) 同结果 rollout 组(全成功或全失败)从终局奖励得不到学习信号;(b) 终局奖励只有轨迹级反馈,无法定位失败决策。现有"自然语言反思"不可直接用于信用分配(错误声明不可靠、不量化)。提出 FAULT:把诊断出的错误转化为以终局结果锚定的显式步级信用,校验诊断证据、从任务结果在线学习各错误类别的相对代价;训练中策略与自诊断器共同演化。ALFWorld 上信号覆盖率 95%(GRPO 41%、GiGPO 72%),WebShop 与第二个模型规模上同样显著。
  • 为什么值得关注:它直面了 GIGPO 系方法的一个真实短板——同结果组零信号问题——而且给出了可量化的覆盖率指标来对比。诊断器与策略共同演化的设计也把"self-diagnosis"从推理时技巧变成了训练时的结构化信号源,这正是 agentic RL 目前最缺的中间粒度监督。
  • 与 wenjun 的关系:长轨迹 Agent RL 主线的今日必读。FAULT 的"错误代价在线学习"可以直接与 GIGPO 的分组优势、HiSentinel 的 hindsight 蒸馏做三方对比;其"诊断可靠性校验"模块也回应了 False Frontiers 提出的 co-cheating 风险——自诊断本身也会自我确证,这是显然的后续实验点。

#3. Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States

  • 链接:https://arxiv.org/abs/2610.01415
  • 来源:Hugging Face Papers 热榜(69 票)
  • 日期:2026-10-01
  • 类别:LLM Agent / Memory / Latent State
  • 核心贡献:提出 PoS 推理时框架:agent 不再靠堆历史交互记忆,而是持续构造并维护显式 belief state 作为决策上下文——每个 belief 同时包含当前世界状态估计 + 未解决的任务需求,显式表达"我还不知道什么/还没完成什么"。通过一致性校验和任务进度监控检测 Belief Trapping(agent 持续行动但对目标无实质推进),并按陷入模式定制恢复策略。四个执行/诊断类基准、三种 LLM 底座全部第一;上下文增长实验显示对 context 变长有韧性。
  • 为什么值得关注:它把长程 agent 的上下文管理从"历史保留/压缩"升级为"信念构造与维护",这与 model-based RL 中 belief state over partially observable environment 的经典概念正面接轨——LLM agent 文献终于显式回到了 POMDP 语言。Belief Trapping 的检测信号(行动而不推进)也是一个非常实用的新失败模式类别。
  • 与 wenjun 的关系:正中 LLM model-based RL 主线的概念核心:显式 belief state 就是 Dreamer 系 world model 里 posterior 的符号化版本。直接的实验问题:学习出来的 latent state(如 world model 的隐状态)与显式维护的符号 belief state 能否互相蒸馏/对齐? 这正好是连接两条研究线的一座桥。

#4. AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents

  • 链接:https://arxiv.org/abs/2610.02163
  • 来源:arXiv cs.CL 新提交(10-01)
  • 日期:2026-10-01
  • 类别:Code Agent / Context Compression / Post-training
  • 核心贡献:把"何时压缩上下文、保留什么工作状态、如何从压缩后继续"训练进 coding agent 的策略本身。数据构造:跑 base agent,用 judge 复盘其压缩决策/摘要/压缩后动作,有缺陷的输出被修正版替换后重新在环境中执行(轨迹从修正决策处续跑),再用于 SFT;随后用任务成功奖励对编码与压缩联合做 RL。SWE-bench Verified 绝对提升 9.2%,SWE-PolyBench Verified +5.0%;在 256K 不溢出窗口与 16K 溢出触发回退压缩两种设定下都成立。
  • 为什么值得关注:上下文压缩从"推理时的工程技巧"(外挂压缩器)转成了策略的学习动作,并且给出了一个很干净的数据构造范式:judged-correction-replay。对一切"通用上下文压缩器"研究,这是必须回应的基线——外挂压缩 vs 内化压缩策略,哪种泛化更好?
  • 与 wenjun 的关系:同时命中"通用上下文压缩器"与"代码 Agent 的 agentic RL"两条线。9.2% 的绝对提升量级说明这不是玩具改进;judge-replay 修正数据的思想同样可迁移到长轨迹 RL 的失败轨迹修复上(与 PivotOPD 的关键失误恢复同一谱系)。

#5. Cross-Benchmark Transfer from RL on Agentic Coding Tasks

  • 链接:https://arxiv.org/abs/2610.00890
  • 来源:arXiv cs.SE(10-01 批次)
  • 日期:2026-10-01
  • 类别:Code Agent / Post-training RL
  • 核心贡献:用纯 RL(GSPO,rank-32 LoRA)在 1700 个专家构建的 agentic coding 任务上后训练 Kimi K2.7 Code(1T 参数、32B 激活 MoE):1000 个仓库任务用隐藏 fail-to-pass + pass-to-pass 测试评分,700 个终端任务用专家编写的隐藏验证器;奖励是目标检查通过比例,任何 pass-to-pass 失败则归零。一个 epoch 后在6 个外部基准、3 种 agent harness 上 pass@1 全部提升:SWE-Bench Pro 60.1→64.8,DeepSWE 31.0→43.4,Terminal-Bench 2.1 67.4→82.0,Terminal-Bench 3 1.4→12.1 等。
  • 为什么值得关注:这是"agentic RL 泛化"的迄今最强实证之一:只在 1700 个任务上训一个 epoch,六个分布外基准全涨,且跨 harness(训练与评估用的 agent 框架不同)成立。"最后一公里"失败(丢需求、只测自实现覆盖的用例、破坏既有行为)被显式建模进奖励(pass-to-pass 一票否决),这是任务设计上最值得抄的部分。
  • 与 wenjun 的关系:代码 Agent 的 agentic RL 主线的参考坐标。1700 任务 × 1 epoch 的极低样本效率对比(与 Sharpening Tax 对照阅读非常有意思:这里 RL 确实带来了分布外迁移,说明 agentic 域的 sharpening 假说边界在哪里);pass-to-pass 一票否决的奖励设计可直接搬到自己的代码 RL 环境里。

#三、其余值得关注的论文速览

#LLM Agent / Harness / 信用分配

论文链接日期一句话核心贡献类别
Harness Annealing: Learning to Act with Less External Controlhttps://arxiv.org/abs/2610.0123510-01提出 harness internalization:在逐步削弱 harness 的课程上训练,撤掉控制决策后仍保持性能Harness / Post-training
VideoEvolve: Evolving Agent Harnesses for Video Temporal Groundinghttps://arxiv.org/abs/2610.0176610-01Cloze 结构化 harness 表示 + 分支引导进化,harness 自动进化扩展到视频时序定位Harness / Self-Evolving
ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimizationhttps://arxiv.org/abs/2610.0090610-01自动课程学习优化 agent harness(HF 50 票)Harness
Agents Are Systems, Not Models: Rethinking Agentic Evaluationhttps://arxiv.org/abs/2610.0161810-01同一 agent 换配置的重复运行方差占 54%;给 agent 的信息量比时间预算和模型大小影响都大Evaluation
Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Taskshttps://arxiv.org/abs/2610.0200110-01本地优先的 harness 让小开源模型完成真实任务Harness / Systems
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Modelshttps://arxiv.org/abs/2610.0214210-01关键词型 harness 的失效是"fail open"的;给小模型 tool-use 声明一个廉价诊断阶梯Tool-use / Evaluation
Causal Memory Policy: Making Memory Utility Identifiable by Intervening on Retrievalhttps://arxiv.org/abs/2610.0207010-01LongMemEval 54% / LoCoMo 67% 的必需记忆从未被检索到导致效用不可识别;用逆倾向加权干预检索恢复可辨识性Memory / Causal Inference
Mem++: Non-Destructive Memory for Long-Term Organizational LLM Agentshttps://arxiv.org/abs/2610.0200210-01从写入时蒸馏转向读取时选择:文档全量保存、读时按时间与词法+语义融合检索,OrgMemBench 超 SOTA 8.0-13.1 分Memory
Right Answers, Wrong States: Hidden Information Failures in Multi-Agent Collaborationhttps://arxiv.org/abs/2610.0124410-01off-query 失败:任务决策正确但共享信息状态已损坏;21 组设定中证据核验仅 14.3% vs 任务解决 64.7%Multi-Agent / Evaluation
Global Coherence: When Every Agent Is Right and the Team Is Still Wronghttps://arxiv.org/abs/2610.0203610-01Observation-Aliasing 不可能性定理:k 个不可区分世界需要两两不相交动作时最优成功率 1/k,更多推理无法挽回Multi-Agent / Theory
SciUtopia? Closed-Loop LLM Simulation of Academic Research Ecosystemshttps://arxiv.org/abs/2610.0125710-01持久闭环 LLM-agent 模拟学术生态系统(方向选择/合作/评审/引用/经费),可做反事实制度实验Multi-Agent / Simulation
X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalizationhttps://arxiv.org/abs/2609.3299309-25把可复用经验 token 化以提升 agent 泛化效率(HF 12 票)Agent / Pretraining 数据
Not All Experience Belongs in the Weights: Component Routing for Self-Improving GUI Agentshttps://arxiv.org/abs/2610.0178710-01把经验拆成 locators/procedures/state facts/lessons 四类分别路由到上下文或权重;recurrence × state-conditionality 两属性预测目的地 24/24 命中Self-Improving / 记忆路由
JevSpawn: Adaptive Agentic Inference through Compositional Action Spaceshttps://arxiv.org/abs/2610.0043709-29组合式动作空间的自适应 agentic 推理LLM Agent
AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Modelshttps://arxiv.org/abs/2610.0156010-01语音 LM 的自适应潜空间推理:多路径隐推理分布 + 联合 chunk 预测降低推理延迟,附 AuralReason-683K 数据Latent Reasoning / Speech

#Model-based RL / World Model / Latent

论文链接日期一句话核心贡献类别
On the Divergence of Accuracy and Mechanism Consistency in Time Series World Modelshttps://arxiv.org/abs/2610.0184210-01提出 mechanism consistency 指标:准确预测 ≠ 改动作后预测朝声明方向移动;8 数据集 7 底座系统测量两者的分歧Model-based RL / Evaluation
Memorizon: Training World Models Beyond Their Context Windowhttps://arxiv.org/abs/2610.0054409-30解耦"监督需要长跨度"与"注意力代价":按相机共视性检索 top-K latents 组成有界共享 bank,跨度 100→400 秒步时仅 +12%World Model / Systems
Latent JEPA: Abstract Future Prediction for Latent Reasoning in Chemistryhttps://arxiv.org/abs/2610.0194710-01自回归学习 + 联合嵌入预测未来视图:隐思维预测后续推理与分子结果,ChemCoTBench 提升Latent Reasoning / JEPA
Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Modelshttps://arxiv.org/abs/2610.0194210-01端到端学习可预测表征用于潜空间世界模型Latent World Model
Mimir: Physics-Grounded LLM Agents for Long-Horizon Irrigation Controlhttps://arxiv.org/abs/2610.0203810-01长程物理控制双时间尺度修复:快尺度确定性模拟器核验提案、慢尺度失败模式沉淀为持久原则Model-based RL / Embodied
Decision Titan: Test-Time Training for Long-Term Memory in Offline RLhttps://arxiv.org/abs/2610.0151310-01离线 RL 的测试时训练长时记忆RL / Test-time
Honeycomb: Constant-Size Scene Memory Representation for Video World Modelshttps://arxiv.org/abs/2609.3769009-29常数大小场景记忆表示用于视频世界模型World Model
Learning What to Recall: Adaptive Multi-Cue Episodic Memory for World Modelshttps://arxiv.org/abs/2609.3467709-27世界模型的自适应多线索情景记忆World Model / Memory
Optimal Transport Meets Reinforcement Learning: A Surveyhttps://arxiv.org/abs/2610.0141310-01OT × RL 交叉综述RL / Theory
LLM2Jev: LLMs Are Already Jev-Style Decision Modelshttps://arxiv.org/abs/2610.0207610-01从 next-token 概率免训练提取校准决策分布,4B 模型即匹配专用决策模型Decision Model
Code Owns the Simulation, Jev Owns the Evaluationhttps://arxiv.org/abs/2610.0183410-01判别式决策模型的边界:能从输入判定的(evaluation)可信,需预测未见的(simulation)不可信Decision Model / 诊断

#Code Agent / Code Intelligence

论文链接日期一句话核心贡献类别
Doing More with Less Tokens: Hierarchical RL for Efficient Coding Agentshttps://arxiv.org/abs/2609.3888509-30分层 RL 训练 token 高效 coding agent:效率变异 + 熵相关两大观察Code Agent / Post-training
E2E-SWE: Benchmarking LLMs on Building Working Codebases from Scratchhttps://arxiv.org/abs/2609.3833509-30从零构建可用代码库的端到端 SWE 基准Code Agent / Evaluation
Zero2Repo: Can Coding Agents Build Repositories from Scratch?https://arxiv.org/abs/2609.3826909-30coding agent 从零建仓库能力评测Code Agent / Evaluation
Cross-Model Review / Guarded Commits / RLE-Bench 等安全与评审系https://arxiv.org/abs/2610.0102310-01Groundability:弱评审者能否审计强 coding agentCode Agent / Evaluation
CARM: Cancellation-Aware Response Masking for LLM RLhttps://arxiv.org/abs/2610.0203910-01RL 中对抵消性响应做掩码Post-training RL
FastCI: Efficient GPU-Intensive CI for LLM Training Frameworkshttps://arxiv.org/abs/2610.0196710-01LLM 训练框架的 GPU 密集 CI 系统Systems
Self-Spec Verifiable Code Generationhttps://arxiv.org/abs/2609.3956809-30自规格可验证代码生成Code Agent / RLVR
AgSpec: Retrieval-Based Speculative Decoding in Coding Agent Pipelineshttps://arxiv.org/abs/2610.0110810-01coding agent 管线中的检索式投机解码Code Agent / Systems

#Post-training / RL 理论 / 预训练数据

论文链接日期一句话核心贡献类别
On Language Drift during RLVR Post-Traininghttps://arxiv.org/abs/2610.0201510-01理论证明 RLVR 优化压力允许无界语言漂移而 SFT 不会;漂移特发于新颖推理任务的 RLVRRLVR / Theory
Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysishttps://arxiv.org/abs/2610.0189610-01异步 LLM 后训练的组质量截断与收敛分析Post-training / Systems
From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillationhttps://arxiv.org/abs/2610.0217910-01从梯度层面理解多教师在线蒸馏Distillation
Sharpening Tax(见 Top 5)https://arxiv.org/abs/2610.0150910-01post-training 对 pass@K 的覆盖税Post-training / Evaluation
Scalable, Transferable Meta-network for Data Selection Requires a Different Losshttps://arxiv.org/abs/2610.0209210-01数据选择元网络需要 PVM 损失而非直接套 MTS 目标;TESS 框架Pretraining Data
Finetuning with Sampling: SFT Learns Better Than You Thinkhttps://arxiv.org/abs/2610.0214010-01SFT 的能力被低估:采样式微调Post-training
TESS / Weighted Data Selection: Sharp Upper-Half and Five-Dimensional Lawshttps://arxiv.org/abs/2610.0010110-01加权数据选择的五维定律Pretraining Data / Theory
ChainLoRA: Geometry-Preserving Task Vector Merging for Continual Learning in LLMshttps://arxiv.org/abs/2610.0043110-01无回放持续学习:任务向量几何视角 + 自适应 SVD 合并,Procrustes 对齐分离共享/专属成分Continual Learning
Task-Oriented Rank Adaptation for Continual Learning in Text Classificationhttps://arxiv.org/abs/2610.0170210-01面向任务的秩适配持续学习Continual Learning
Transformers as Cross-Task Learners: Shared Structure Drives Sample Efficiency in ICLhttps://arxiv.org/abs/2609.2906009-30跨任务共享结构驱动 ICL 样本效率的理论Pretraining / Theory
RLVR Landscapes for Iterated Multiplications Can Be Benign: Spin-Glass Insightshttps://arxiv.org/abs/2609.2862509-30自旋玻璃理论分析 RLVR 损失景观RLVR / Theory
Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphshttps://arxiv.org/abs/2609.2896309-30轨迹图上的步级优势估计Credit Assignment

#Latent Reasoning / 递归模型 / 评测

论文链接日期一句话核心贡献类别
Decoding Looped Transformers Better for (Almost) Freehttps://arxiv.org/abs/2610.0218510-01LoopCD:对比早期回环与最终预测的免训练对比解码;Ouro-2.6B AIME24 61.88→73.33,且可减半回环数Latent Reasoning / Decoding
The Missing Primitive: Diagnosing and Repairing Mathematical Reasoninghttps://arxiv.org/abs/2610.0219110-01数学基元四维评测(Discovery/Generation/Digestion/Execution):解对掩盖能力缺陷,Discovery 是主瓶颈Evaluation / Reasoning
Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMshttps://arxiv.org/abs/2610.0142810-01泛化 = 稳定性而非精度:多轴评测Evaluation
Rethinking Latent Visual Reasoning(继续霸榜)https://arxiv.org/abs/2609.3456309-28latent token 对改变答案的扰动响应弱;GRPO 终局奖励监督不足(HF 209 票,仍在 10-01 榜)Latent Reasoning / RLVR
Hierarchical Continuous Diffusion Language Modelshttps://arxiv.org/abs/2610.0219310-01层次化连续扩散语言模型(HF 69 票)Architecture
Temporally-Resolved Token Attribution for Diffusion LMshttps://arxiv.org/abs/2610.0117710-01扩散 LM 的时序分辨 token 归因Interpretability

#上下文/长视频/流式(与压缩器研究相关)

论文链接日期一句话核心贡献类别
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Videohttps://arxiv.org/abs/2610.0176210-01查询无关的证据记录 + 任务响应统一进共享主动生成过程;PHCM 层级字幕记忆;4B 模型 8 个流式基准最佳(HF 146 票)Memory / Streaming
MemFold: Compact Soft Memory for Long-Context Personalization via On-Policy Optimizationhttps://arxiv.org/abs/2609.3643509-28在线策略优化训练紧凑软记忆(个性化)Memory
LOCI: Spatial Linear Memory for Streaming World Modelshttps://arxiv.org/abs/2609.4022209-30流式世界模型的空间线性记忆World Model / Memory

#四、GitHub / 开源动态(最近一周新建,按 star)

仓库Stars一句话说明类别
https://github.com/PostHog/jeeves399Jeeves:推理增强的 Jev 式决策模型,与 arXiv 决策模型论文线呼应Decision Model
https://github.com/strands-labs/strands-decider205面向 agentic workflow 的小型快速"系统一"决策模型Decision Model
https://github.com/disler/ten-levels-of-jev156Jev 的十个层级:从 if 语句到 coding agent 主动调用 JevDecision Model
https://github.com/feder-cr/dots2473开源"自带浏览器不被封"的 web AI agentWeb Agent
https://github.com/composio-community/open-dot426本机运行的开源个人 AI agent(OpenAI + Composio,Mac app)Personal Agent
https://github.com/openJiuwen-ai/iCode292轻量可扩展的完全离线 AI 开发平台与 agent/workflow 工具链Code Agent
https://github.com/Edwardxlai/easyread601英文论文→舒适中文的本地 PDF 翻译 + 原文对照 + 边读边问研究工具

观察:本周 GitHub 上 "Jev 式决策模型"生态(jeeves / strands-decider / ten-levels-of-jev)与 arXiv 的 LLM2Jev / Code-Owns-the-Simulation / JevSpawn 论文线同步爆发——"把 LLM 当校准决策头(而非文本生成器)用" 正在从论文概念变成开源基建,PostHog 等工程公司入场是强信号。


#五、今日最值得精读的 3 篇

  1. Sharpening Tax in Post-Training(https://arxiv.org/abs/2610.01509)——post-training 到底改变/毁掉了什么,一篇文章给出可度量的答案;任何做 RLVR 实验的人都应该把 Sharpening Tax 加入报告指标。
  2. My FAULT: Self-Diagnosis as Credit Assignment(https://arxiv.org/abs/2610.01161)——同结果组零信号问题的最新解法,直接可与 GIGPO 对比;自诊断→步级信用的管线是 agentic RL 中间粒度监督的代表工作。
  3. Beyond Memory: Explicit Belief States(https://arxiv.org/abs/2610.01415)——LLM agent 文献与 POMDP belief state 的显式接轨;读它可以同时理清 memory/world model/model-based RL 三个方向的公共语言。

#六、今日最值得跟进的 3 个 repo/model/dataset

  1. PostHog/jeeves(https://github.com/PostHog/jeeves)——推理增强 Jev 式决策模型,工程公司背书的决策头生态,值得关注其与 agent 框架的集成方式。
  2. OneStreamer-1M 数据集(随 https://arxiv.org/abs/2610.01762 发布)——超百万条流式视频交互记录(字幕 + QA),是"查询无关证据记录 + 主动响应"训练范式的现成语料,思想可迁移到文本 agent 的流式记忆。
  3. AuralReason-683K(随 https://arxiv.org/abs/2610.01560 发布)——683K 双语语音 + 推理续写数据,首个面向潜空间推理监督的大规模数据,其"多路径隐推理分布"标注思想对 latent reasoning 训练数据构造有直接参考价值。

#七、研究机会 / Idea

  1. Sharpening Tax × 长轨迹 Agent RL 的交叉:Sharpening Tax 只在 3 个 agentic 基准上测过 pass@K ≤ 多少?把 tax 曲线作为 RL 训练轮数的函数画出来,检验"agentic 域 RL 真习得新能力"的边界条件(结合 Kimi K2.7 Code 纯 RL 六基准全涨的证据,两边张力明显)。可操作:在 ALFWorld/WebShop 上对 GRPO/GIGPO/FAULT 各训 N 步,记录 pass@1 与 pass@K 曲线随训练进化的分歧点。
  2. 显式 belief state 与学习式 latent state 的对齐/蒸馏:PoS 的符号 belief state 是手工维护的,Memorizon/Latent JEPA 的隐状态是学出来的。两边能否互为监督——用显式 belief 的一致性校验信号做 latent world model 的辅助损失,或反过来用 latent state 的预测误差触发 belief 重构?这正好落在 wenjun 的 Dreamer-for-LLM + latent reasoning 两条线交点上。
  3. 自诊断信用的可靠性审计:FAULT 让策略和自诊断器共同演化,而 False Frontiers(昨天的 co-cheating 论文)警告这种闭环会自我确证。做一个"诊断漂移审计器":定期用外部冻结的验证器对照 FAULT 式自诊断的错误声明,量化诊断器随训练的漂移率——这是两个热点工作的自然合题,工作量小、结论清晰。
  4. 机制一致性(mechanism consistency)移植到 LLM world model:时间序列世界模型已证明"预测准确 ≠ 改动作后方向正确";为文本环境(如 WebShop/ALFWorld)的 LLM world model 设计同款反事实方向性测试,可作为 model-based RL for LLM 的第一个标准化诊断套件。

简报由 Hermes Agent 自动调研生成;数据源访问情况已在文首如实标注。