#2026-09-29 AI/LLM 最新论文与研究热点简报

时间范围说明:本简报覆盖 arXiv 2026-09-25/28 两个公告日的最新提交(对应最近 24–48 小时公开可检索窗口,周一 9-28 为本周首个公告日、量最大),辅以 9 月下旬提交、近日登上 Hugging Face Daily Papers 9-28 榜单的论文。检索来源:Hugging Face Daily Papers 9-28 榜单(33 篇全量 + upvotes)、arXiv cs.AI/cs.CL/cs.LG/cs.SE recent listing(4 分类 × 前 50 条全量标题扫描 + 20 余篇摘要逐一核验)、GitHub Trending(全语言 + Python + TypeScript)及 GitHub API 元数据核验。说明:arXiv export API 今日持续返回 429 限流(改逐页抓取摘要页完成核验);HF papers API daily-papers 端点今日返回 401(改从 papers 页面 HTML 内嵌 JSON 解析,覆盖不受影响);X/Twitter 无法直接访问,用 HF upvotes + GitHub stars 做热度代理。以下所有论文与链接均来自上述真实抓取结果,无编造。


#一、今日重点(与 wenjun 研究方向高度相关,建议精读)

#1. Compress What You See, Not What You Say: Anchored Context Distillation for Latent-Observation Software Engineering Agents

  • 链接:https://arxiv.org/abs/2609.31430
  • 来源:arXiv (cs.SE/cs.CL,cs.AI cross-list),2026-09-25 提交,2026-09-28 公告;已在 HF Daily Papers 9-28 榜单出现
  • 类别:Code Agent / 上下文压缩 / Post-training(蒸馏)
  • 一句话贡献:提出 LOHA 布局 + ACD 训练法:只把"工具观测"(环境侧信息)压成 soft token,agent 自己的动作轮次与最近 K 条观测保留明文,再用"以基模型明文行为为锚"的蒸馏训练 agent 读 latent 视图,SWE-bench Verified 上上下文每调用降 43%–57%,resolve 率代价可控。
  • 为什么值得关注:这是"通用上下文压缩器"路线在 SWE agent 上目前最干净的一份实证。它的核心设计判断——压缩环境观测、锚定自身行为——直接回应了软 token 压缩最大的痛点(改读表示会漂移 agent 原行为)。LOHA 的"Latent Observations, Hard Actions"分离,等于在 token 布局层面承认了"观测可损、动作不可损"的信息不对称。
  • 与 wenjun 的关系:三点直接相关。其一,压缩-性能边界(K=3 vs K=8 的 trade-off 曲线)是你做长轨迹 agent 上下文预算设计时最需要的参照数据;其二,ACD 的"锚定蒸馏"思想和 2609.28845 LastOPD 里"latent 对齐度量持续变好、行为却崩掉"的发现对照读,恰好构成 latent 信号使用的正反两面;其三,"哪些信息可以进 latent"的选择标准(观测 vs 自身动作)可以平移到你的 Dreamer-for-LLM-Agent 里:世界模型该隐式编码环境观测,而把动作序列留成显式接口。

#2. SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

  • 链接:https://arxiv.org/abs/2609.29050
  • 来源:arXiv (cs.CL),2026-09-24 提交;HF Daily Papers 9-28 榜单(upvotes 6);41 页、13 图、代码与数据集开放
  • 类别:Post-training RL / credit assignment / Tool-use
  • 一句话贡献:诊断出 GRPO 把轨迹级标量优势广播到所有 token 时,摘要文本段的梯度噪声会"泄漏"进工具决策 token 造成跨段 credit 错配,提出 Segment-Locked Credit Assignment 在同一组 rollout 内按结构段解耦优势估计(执行优势给工具 token、偏好优势给摘要 token),并配套 Schema-Guided LLM Simulator 作为可扩展训练基础设施。
  • 为什么值得关注:这是继上周 PACT(token 级 credit 公理化)之后又一份直接攻"优势广播错误"的工作,而且证据链完整:结构诊断 → 模拟器基建 → 段级修正 → 7B backbone 上超过 GRPO/ToolPO/RLTR。它把"输出异质性(结构化工具调用 vs 自然语言摘要)"这个此前被当作实现细节的问题,升格为 RL 训练动力学的一等公民。
  • 与 wenjun 的关系:与你的 agentic RL / 长轨迹 RL 主线直接相关。SLCA 的段级解耦可以和上周简报里的 trajectory-graph step-level advantage(2609.28963)对读——两者都在回答"优势到底该挂在哪些 token 上",一个按图结构、一个按输出模态段。如果你的代码 agent RL 训练里同时有代码 token、工具调用 token、解释 token,这就是现成的消融框架和模拟器基建(SGLS 免真实 API 训练,对算力敏感的博士组尤其实用)。

#3. Up and Down the Abstraction Ladder: Code-Based Skills for Language Agents

  • 链接:https://arxiv.org/abs/2609.31076
  • 来源:arXiv (cs.AI),2026-09-25 提交
  • 类别:LLM Agent / Code Agent / 抽象层级与技能
  • 一句话贡献:在 NetHack 长视野环境里系统研究"代码技能 vs 原子动作"这一动作抽象层级对 agent 性能、推理成本与学习的影响:纯技能使游戏推进近 3 倍、单 episode 推理成本降 86%;技能+原子动作混合保留大部分收益同时保留"下梯子"回退能力;并在 zero-shot / SFT / RL 三种设置下横向对比。
  • 为什么值得关注:它把"abstractions are leaky"(抽象是漏的)这个软件工程老命题,变成了一份受控实验:抽象漏了怎么办——保留回退到原语的路径。三设置(prompt/SFT/RL)的统一比较在技能学习文献里很少见,等于同时回答了"技能从哪来(人工库 CodeHack)"和"技能怎么学(三种学习设置各自吃多少红利)"。
  • 与 wenjun 的关系:和你关注的"自演化代码 agent / 通过环境设计催生自演化智能"两条线都咬合。要点在于:技能层不是静态资产而是可上可下的梯子——这为自演化设计给出了一个明确的界面(何时合成新技能上去、何时识别 skill 失效下到原语重试)。可以和 GitHub 上同期发酵的 microsoft/SkillOpt("在文本空间训练可复用自然语言技能")对照看:一个走代码技能、一个走 NL 技能,抽象介质本身就是一个研究问题。

#4. Probing Stability-Plasticity Tradeoffs in Agent Memory through Cognitive Experimental Paradigms (MemProbe)

  • 链接:https://arxiv.org/abs/2609.30558
  • 来源:arXiv (cs.CL),2026-09-24 提交;EMNLP 2026 Main 已接收,代码开放
  • 类别:LLM Agent / 记忆与持续学习 / Evaluation
  • 一句话贡献:把认知科学的记忆实验范式(干扰、错误信息、巩固强度、重巩固窗口)改造成 agent 记忆诊断套件(56 episode、6 个增量记忆系统统一协议),发现总分相近的系统行为画像截然不同——把"记忆该何时更新/保留/存疑"变成可测的行为维度。
  • 为什么值得关注:这基本是给 agent memory 领域补上了"遗忘曲线"级别的实验范式。它的杀伤力在方法学:aggregate accuracy 完全掩盖了 stability-plasticity 失衡,而真实长程 agent(个人助理、持续代码库维护)恰恰死在这上面。
  • 与 wenjun 的关系:与你的持续学习 + agent memory 双线交叉。四个范式里"reconsolidation window"(重巩固窗口)最值得注意——它说的是旧记忆被重新激活时是编辑窗口,这和 AEWM 的 task-state revision、以及上周 JitMem 读时 curate 形成了一条清晰的"记忆不是写时定终身,而是读时/激活时可塑"的脉络。如果你要做 agent 记忆方向的论文,这套协议可以直接当 evaluation 基座。

#5. LastOPD: Taming Collapse in Latent On-Policy Distillation

  • 链接:https://arxiv.org/abs/2609.28845
  • 来源:arXiv (cs.LG),2026-09-23 提交;HF Daily Papers 9-28 榜单(upvotes 1)
  • 类别:Post-training / 蒸馏 / Latent Reasoning
  • 一句话贡献:实证记录 latent 监督加入 on-policy 蒸馏后的两种失败模式:先涨后崩(MATH-500 从 25→46 后一路跌到 11 不恢复)与越对齐越差(latent 对齐度量持续改善、最对齐的模型表现最差),并分析 latent 信号对齐方式与行为目标的错位来源。
  • 为什么值得关注:这是 latent 监督路线罕见的高质量负面结果。当整个社区在往"latent 对齐=更好"的方向冲时,它给出了清晰的失效证据与机制分析——对齐度量改善可以与下游能力负相关,这直接质疑了用表征对齐当训练目标的默认假设。
  • 与 wenjun 的关系:与你关注的潜空间推理直接相关,且与今日第 1 条(ACD 的"锚定蒸馏防行为漂移")构成一组绝妙的正反对照:两篇都在处理"latent 空间的监督怎么给才不毁掉行为",ACD 用明文行为锚定保住了,OPRD 式纯 latent 对齐崩了。这个对比基本框定了 latent 监督设计空间的两端——做 latent-space reasoning 训练目标设计时必须先回答"我的 latent 信号对齐的是什么"。

#二、次级关注(相关但优先级稍低)

#6. MA-WAM: Multi-Agent World-Action Model for Test-Time Planning

  • 链接:https://arxiv.org/abs/2609.31281
  • 来源:arXiv (cs.AI),2026-09-25 提交;HF Daily Papers 9-28 榜单(upvotes 17);40 页含附录、有项目页
  • 类别:Model-based RL / 世界模型 / 多智能体
  • 一句话贡献:提出首个面向多智能体 flow policy 的 test-time 世界模型规划器,按跨 agent 依赖预测联合动作后果并给候选打分,30 个离线 MARL 设置上平均相对增益 22%,开销仅占生成-打分时间的 2.5%。
  • 点评:把单 agent 的"世界模型当 test-time 打分器"推广到联合动作空间(flow policy + cross-agent dependency)。对你 model-based RL 主线的启发在结构上:世界模型不必参与训练,可以只做推理时前瞻——这条"零训练开销的 test-time 世界模型"路线比 Dreamer 式训练回路更贴推理侧趋势。姊妹篇 G2MAF(2609.31286,test-time 梯度引导)同日提交、同项目页,可连读。

#7. AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs

  • 链接:https://arxiv.org/abs/2609.31590
  • 来源:arXiv (cs.MA/cs.AI),2026-09-25 提交;COLM 2026 已接收;HF Daily Papers 9-28 榜单(upvotes 7);完全开源
  • 类别:LLM Agent / Evaluation / 多智能体
  • 一句话贡献:100 个人工标注长视野协作任务(50+ 交互轮、3–20 个非对称角色、黑盒各自独立行动),并提出因果协作有效性指标 CCE(用因果依赖图度量团队努力中真正贡献于结果的比例);最强模型任务成功率仅 52%。
  • 点评:CCE 这个指标设计比 benchmark 本身更有料——"去掉某个 agent 的动作,结果会不会变"式的因果归因,本质是把 credit assignment 从训练侧搬到了评测侧。长视野多 agent 的失败模式清单(沟通崩坏、角色混淆、共享计划无法维持)对长轨迹 RL 的 reward 设计是现成的 failure mode 素材库。

#8. SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

  • 链接:https://arxiv.org/abs/2609.30192
  • 来源:arXiv (cs.LG),2026-09-24 提交;NeurIPS 2026 已接收;HF Daily Papers 9-28 榜单(upvotes 6)
  • 类别:Latent Reasoning / 长视野推理 / 结构化引导
  • 一句话贡献:把长视野稀疏奖励下的脆弱性归因为两种偏置——探索偏置(被局部合理但结构不稳定的分支吸引)与复合偏置(微小局部偏差跨深度累积压制稀有奖励)——用代数稀疏化投影 + 双曲空间嵌入(负曲率提供深度方向稠密信号)两种结构引导缓解,12 benchmark × 7 模型族验证。
  • 点评:对长轨迹 RL 的价值在诊断命名:把"为什么长链推理训练不动"拆成可分别处理的两种偏置,比笼统说"credit assignment 难"更可操作。双曲嵌入做深度感知那半边,和你 latent-space reasoning 关注的"潜空间几何结构"有直接接口。

#9. Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents

  • 链接:https://arxiv.org/abs/2609.30725
  • 来源:arXiv (cs.SE),2026-09-25 提交
  • 类别:Code Agent / 行为分析
  • 一句话贡献:对 Claude Code 与 Mini-SWE-Agent 在 SWE-bench Verified 的 1200 条轨迹做首个成本低效行为研究,识别出三类行为(重复子检索、相似脚本重生成、测试重执行),覆盖 79–98% 任务、最多占 22.75% 成本;开发者设计的高层技能省成本最高达 41.73%,约为 agent 自合成技能的两倍。
  • 点评:"agent 自合成技能太低层、太绑定 trace,人工设计技能高层且可迁移"这一负结果,与第 3 条 CodeHack 的"技能抽象层级"结论互为印证——技能的泛化性取决于设计者站在哪一层抽象上。对自演化代码 agent 是个冷静剂:自合成的东西短期省 token,长期未必形成可复用资产。

#10. TimeEvo: Failure-Driven Self-Evolution of a Time Series Agent

  • 链接:https://arxiv.org/abs/2609.27277
  • 来源:arXiv (cs.AI),2026-09-23 提交;HF Daily Papers 9-28 榜单(upvotes 2);代码开放
  • 类别:LLM Agent / Tool-use / 自演化
  • 一句话贡献:诊断出"人-agent 工具错配"(专家工具库在部分任务上反而降分)与"无声伤害"(一轮通用自我修订改 147 个答案、弄坏 56 个)两类失败,提出把诊断出的失败聚类成能力缺口→为每个缺口设计测量→合成纯证据工具→配对准入闸门的自演化管线,从空库起步在全部 10 任务 × 3 backbone 上提升,且弱模型上长出的库装进强模型仍有增益。
  • 点评:环境设计催生自演化智能的具体案例库 +1。它的"admission gate"(工具不是生成即用,要过配对实验准入)是自演化系统里少见的质量控制环节,配合"弱模型长技能、强模型复用"的迁移结论,对算力受限场景的自演化设计非常实用。

#11. Estimating and Orthogonalizing Unknown Pre-training Gradients for Continual Fine-tuning (EoupCT)

  • 链接:https://arxiv.org/abs/2609.30935
  • 来源:arXiv (cs.CL),2026-09-25 提交;NeurIPS 2026 已接收;代码开放
  • 类别:Continual Learning / 高效后训练
  • 一句话贡献:解决"正交梯度投影法需要预训练数据/梯度、而商业基模型根本不公开"的死结:用可学习 soft prompt + Gumbel-Softmax 动态生成最易遗忘的伪数据来估计预训练梯度,再以一阶 Pareto 优化器联合优化参数与 prompt、强制新任务更新与估计出的预训练梯度正交。
  • 点评:正交投影类持续学习方法第一次真正落地到 off-the-shelf 模型。与你"预训练数据如何塑造能力"的关注点的连接在反面:它承认不可知的预训练分布是持续微调的一等约束,伪数据生成本质是在逆向探测预训练数据的影响面。

#12. 其他快速一览

  • ToolSearcher(https://arxiv.org/abs/2609.30906,cs.CL,09-25 提交,NeurIPS 2026):大规模工具库(而非预定义小集合)下的 RL 工具选择,类别约束判别 + 事件级搜索建模 + 轨迹对齐 credit 分配。Tool-use / agentic RL。
  • Recursive Self-Improvement via On-Policy Distillation for Reasoning(https://arxiv.org/abs/2609.30652,cs.CL,09-25 提交):特权教师(带 ground truth 的冻结副本)随学生共同演化 + 简洁重写目标,解决特权自蒸馏中教师冻结限制。Post-training 蒸馏 / 自提升。
  • TISD: On-Policy Self-Distillation with Trajectory Intervention(https://arxiv.org/abs/2609.30878,cs.AI,09-25 提交):教师-学生峰值分歧 token 处强制分支再让学生续写,把"分歧"从局部修复信号重新定义为轨迹分支提议。Post-training 蒸馏。
  • Self-Play Search Distillation (SPSD)(https://arxiv.org/abs/2609.30936,cs.AI/cs.LG,09-25 提交):MuZero 式自博弈搜索记录转超人类 CoT 训练 Qwen3-4B-Base,六数学基准均值 24.1→36.6 且迁移到未见数学。合成数据 / 推理。
  • MOPD-Router(https://arxiv.org/abs/2609.30837,cs.LG,09-25 提交,HF upvotes 2):多教师 on-policy 蒸馏按 token 路由监督、免域标签。Post-training 蒸馏。
  • Semantic Navigation for Issue Localization (SemNav)(https://arxiv.org/abs/2609.31176,cs.SE,09-25 提交):确定性检索打底 + LLM agent 证据引导修订候选集,做仓库级 issue 定位。Code Agent。
  • Compact Documentation for Coding Agents(https://arxiv.org/abs/2609.31587,cs.SE,09-25 提交):源码在场时,紧凑文档与检索上下文都不优于 issue 本身——带正控制对照的干净负结果。Code Agent / Evaluation。
  • D-JEPA: A Decision-Aligned Latent World Model(https://arxiv.org/abs/2609.24749,cs.LG,09-21 提交,HF upvotes 2):发现"预测离目标更近的候选实际执行结果可能更差"的决策局部预测鸿沟,学候选 future 之间的决策相关关系。Latent Reasoning / 世界模型。
  • InternW0-Δ(https://arxiv.org/abs/2609.31394,cs.RO,09-25 提交,HF upvotes 17):20K+ 小时异构数据的世界-动作模型,Causal Imprint 只在训练时用未来监督、推理免视频 rollout。Model-based RL(具身)。
  • Agent-Editing World Model (AEWM)(https://arxiv.org/abs/2609.28416,09-23 提交):上周已重点报道,本周 HF 榜单持续发酵;与今日第 1、5 条连成"语言世界模型该建模什么"的对照阅读链。
  • RayOrch(https://arxiv.org/abs/2609.18703,cs.DC/cs.LG,09-16 提交,HF 9-28 榜单 upvotes 43):保留父子 lineage 的基础模型数据准备编程模型与分布式执行引擎。Pretraining Data / Systems。

#三、生态与开源动态(GitHub / 热度代理)

  • vectorize-io/hindsight(https://github.com/vectorize-io/hindsight):自我介绍为"会学习的 Agent 记忆"(Agent Memory That Learns),Python,40.9k stars,2025-10 创建、09-28 活跃更新。本周 GitHub Trending(Python 榜 + 全语言榜双榜)。Agent memory 基建正在从论文概念变成star 级工程需求,与 MemProbe 评测线互补。
  • microsoft/SkillOpt(https://github.com/microsoft/SkillOpt):微软出品的"文本空间优化器,通过轨迹为冻结 LLM agent 训练可复用自然语言技能",Python,17.8k stars,09-05 最后推送。与今日 CodeHack(代码技能)形成代码 vs NL 的技能介质对照,且"冻结 agent 只学技能"的设定对算力敏感的研究组很友好。
  • mvschwarz/openrig(https://github.com/mvschwarz/openrig):把 Claude Code 和 Codex 作为一个系统协同运行的多智能体 harness,1.7k stars,09-28 活跃。多 harness 代码智能体工程化的又一信号。
  • dream-num/univer(https://github.com/dream-num/univer):"面向 AI Agent 的 Office Harness"(表格/文档/幻灯/画布),本周 TS Trending——agent 的"办公环境基建"方向热度上升,与"环境设计催生自演化智能"关注点相关。

#四、今日最值得精读的 3 篇

  1. Anchored Context Distillation (2609.31430) —— 通用上下文压缩器 × SWE agent 的当前最佳实践,压缩-性能边界数据完整,设计判断(压观测、锚行为)可直接迁移。
  2. SLCA-GRPO (2609.29050) —— 41 页完整证据链攻 credit 广播错配,模拟器基建(SGLS)可复用,与上周 trajectory-graph 工作连成段级/图级 credit assignment 脉络。
  3. LastOPD (2609.28845) —— latent 监督的高质量负结果,"越对齐越差"的发现与 ACD 对照阅读,基本框定 latent 训练目标设计的两端。

#五、今日最值得跟进的 3 个 repo / 资源

  1. SLCA-GRPO 代码与数据集(摘要页注明开源)—— 段级 credit + 工具模拟器,agentic RL 实验的直接起点。
  2. microsoft/SkillOpt(17.8k stars)—— 冻结 agent 的 NL 技能训练,与 CodeHack 论文对照可设计"技能介质"消融。
  3. MemProbe 代码(EMNLP 2026 Main,开源)—— agent memory 的标准诊断协议,做记忆/持续学习评测可当基座。

#六、研究机会 / Ideas

  1. Latent 监督的"锚定-对齐"设计空间:ACD(明文行为锚定,成功)与 LastOPD(纯 latent 对齐,崩塌)恰好是两端。开放问题:是否存在显式对齐目标,使 latent 对齐度量与行为能力单调正相关?一个可做的切入:在 LastOPD 的崩溃训练曲线上诊断"对齐改善具体压掉了什么行为"(用行为画像/能力探针分解),再设计带行为项的正则化目标。这直接落在你的 latent-space reasoning 主线上。
  2. 技能层级的自演化闭环:CodeHack 说技能要能上能下,成本分析说 agent 自合成技能太低层、人工技能才高层可迁移,SkillOpt 说 NL 技能可以在文本空间优化。三者合起来指向一个缺口:没有人在同一环境里对比"自合成技能在哪个抽象层级上收敛",也没有人做"自合成技能的层级随训练提升"的显式机制(比如用失败驱动的技能重写,类比 TimeEvo 的 failure→gap→tool 管线但作用在技能抽象层级上)。这是 self-evolving code agent 方向一个边界清晰的可做问题。
  3. Agent 记忆的重巩固窗口 × 世界模型状态编辑:MemProbe 的 reconsolidation window(旧记忆激活时是编辑窗口)与 AEWM 的 task-state revision 本质在说同一件事——记忆/状态的可塑性集中在被引用的时刻。可以把两者形式化成统一问题:agent 何时该信任被激活的历史状态、何时该用新证据改写它。如果你的 Dreamer-for-LLM-Agent 需要一个 world model 里的状态表示,"状态在读时编辑"比"状态在写时定终身"可能是更贴 LLM 环境高熵特性的设计。

采集与筛选:鼠鼠(Hermes Agent)· 2026-09-29 08:00 CST · 数据源:HF Daily Papers 页面解析(9-28 榜单 33 篇)、arXiv recent listing(cs.AI/CL/LG/SE 各 50 条)、GitHub Trending 与 API、arXiv 摘要页逐篇核验(20+ 篇)