#2026-08-05 AI/LLM 最新论文与研究热点简报
检索时间:2026-08-05 08:00 CST。
主要来源:Hugging Face Daily Papers、arXiv 最近提交页与论文页、GitHub Search。X/Twitter 页面可访问但未登录环境下有效检索受限,本期未把 X 作为主要证据源,改用 HF/arXiv/GitHub/项目页交叉核验。
时间范围:优先覆盖 2026-08-03 至 2026-08-05;为补足与 wenjun 方向高度相关的 Agent memory / Code Agent / world-model RL 线索,少量扩大到 2026-07-30 至 2026-08-01。
#0. 今日判断:Agent 研究正在从“会调用工具”转向“可管理状态、可生成技能、可定位失败、可在潜空间做信用分配”
过去 24-48 小时最值得关注的信号不是某个单点 benchmark,而是几个方向同时收敛:
- 长程 Agent harness 开始显式外置任务状态:LongHorizon-Harness 把长任务执行拆成 manager / executor / auditor,并只把环境验证过的事实写入 task state。这与长轨迹 RL 里的 state abstraction、belief update 非常接近。
- Agent skill 从“人工写工具/经验总结”走向“RL 生成 + verified synthetic trajectory 训练”:Skill-α 和 SKT 分别从技能生成与技能使用训练切入,说明“技能库 + 可验证轨迹”可能成为 Agent 预训练/后训练的一条主线。
- 潜空间推理出现更直接的 credit assignment 机制:GradCuit 把可优化 latent state 插在 Transformer 层内,使 continuation-token log-prob 对 latent state 可微,核心价值在于让 test-time latent reasoning 不再只是黑盒 prompt/hidden-state trick。
- 代码 Agent 评测更贴近真实协作环境:SWE-Touch 关注用户在 agent 执行中途直接改代码的冲突场景;Deletion Avoidance 论文指出模型倾向“加 guard 而不是删错代码”,这对代码智能的评测与奖励设计都很关键。
- World model / model-based RL 的语言 Agent 借鉴点来自 VLA/视频 world model:WCM 和 WorldExam 虽不是纯 LLM Agent 论文,但分别强调 critic 表征需要世界建模目标、world model 评测要看 reactivity,而不只是视觉质量/指令遵循。
#1. 重点论文与动态
#1.1 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
- 链接:https://arxiv.org/abs/2608.01964
- HF:https://huggingface.co/papers/2608.01964
- Repo / 项目页:https://github.com/AMAP-ML/LongHorizon-Harness ,https://lh-harness.pages.dev
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:LLM Agent / Tool-use / Evaluation / Long-horizon Agent
- 一句话核心贡献:把长程 Agent 执行重新表述为显式任务状态管理问题,提出 Manage-Execute-Audit loop:manager 维护任务状态、fresh-context executor 执行子任务、read-only auditor 只把环境验证过的事实写回状态。
为什么值得关注:
这篇直接命中长轨迹 Agent 的核心痛点:长上下文里同时塞执行轨迹、任务状态、自我评估,会导致状态漂移和错误自证。LongHorizon-Harness 的关键不是又加了一个 agent,而是把 state update 从模型主观叙述里拿出来,要求由环境验证后再写入外部状态。论文摘要报告在 WeaveBench、Terminal-Bench 2.1、OSWorld 2.0 上有明显提升,例如 Qwen 3.7-Plus 在 WeaveBench 从 51.8% 到 80.7%。
与 wenjun 方向的关系:
这几乎是 LLM Agent 版的 belief-state management。若做 model-based RL / Dreamer for LLM Agent,可以把 MEA loop 视为一种手工设计的 latent state filter:manager 是 state estimator,executor 是 policy rollout,auditor 是 environment-grounded observation model。值得进一步思考:能否把 auditor 的 verification signal 变成 state learning / dynamics learning 的监督?
#1.2 Progressive Agent Skill Generation via Reinforcement Learning
- 链接:https://arxiv.org/abs/2608.01678
- HF:https://huggingface.co/papers/2608.01678
- Repo:https://github.com/ejhshen/skill-alpha
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:LLM Agent / Post-training RL / Skill Learning
- 一句话核心贡献:提出 Skill-α,把 agent skill 生成建模为 sequential editing process,并用 rollback reward 评估每一步编辑是否提升下游执行效果。
为什么值得关注:
Agent skill 的难点在于:一个 skill 写得好不好,不能只看语言是否漂亮,而要看它是否改善下游任务执行。Skill-α 的思路是把技能构造拆成可评估的连续编辑步骤,用 RL 信号逐步优化技能质量。这比传统“从经验中总结 skill”的 pipeline 更接近可学习的技能发现。
与 wenjun 方向的关系:
如果把长轨迹 Agent 的经验压缩为可复用技能,那么 Skill-α 提供了一个“trajectory → skill → downstream reward”的训练范式。它也提示一个研究问题:skill 是否可以被视为 agent 的 latent option?rollback reward 是否可扩展为 option discovery 中的局部 credit assignment?
#1.3 SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- 链接:https://arxiv.org/abs/2608.02287
- HF:https://huggingface.co/papers/2608.02287
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:LLM Agent / Synthetic Data / Skill-use / Post-training
- 一句话核心贡献:提出 SKT verified data synthesis pipeline,从 2,000 个 public skills 合成 4,000 个任务包与 27,164 条 verified trajectories,并构造 SkillEval 评测模型是否真的会识别、调用、组合技能。
为什么值得关注:
这篇关注的不是 skill 本身,而是“有了 skill 后模型是否会用”。它通过单技能/多技能配置、规则与 agent-based verification、feedback-guided repair 过滤,只保留真实使用每个 required skill 的成功轨迹。这很像 Agent 领域的 instruction tuning 数据工程升级:不是只合成答案,而是合成可执行、可验证、技能接地的轨迹。
与 wenjun 方向的关系:
这和 agent 预训练数据如何塑造能力高度相关。SKT 的 pipeline 暗示:未来 Agent 训练数据的基本单位可能不是 instruction-response,而是“skill-grounded executable trajectory”。这对代码 Agent、工具使用 Agent、长程任务 RL 都有启发。
#1.4 GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
- 链接:https://arxiv.org/abs/2608.02585
- HF:https://huggingface.co/papers/2608.02585
- Repo / 项目页:https://github.com/Yuzhaoxin946/GradCuit ,https://yuzhaoxin946.github.io/GradCuit/
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:Latent Reasoning / Test-time Scaling / Credit Assignment
- 一句话核心贡献:在 Transformer 中间层插入可优化 latent states,让 continuation-token log-prob 经由 causal self-attention 对 latent states 有可微信用分配路径,从而在测试时冻结模型参数、优化实例特定连续状态。
为什么值得关注:
这是本期最贴近“latent-space reasoning”的论文。现有 latent reasoning 方法常通过 decoded tokens 或隐状态技巧间接影响推理轨迹,credit assignment 不清楚。GradCuit 的核心在于建立从整段 continuation reward 到前置 latent state 的梯度路径,使 latent update 对后续推理的影响更可解释。
与 wenjun 方向的关系:
如果 wenjun 关注“LLM 是否能在潜空间做 search/planning”,这篇值得精读。它给出一个可操作问题:test-time latent state 能否扮演 model-based RL 里的 planning variable?进一步能否把环境 reward / verifier reward 直接反传到 latent plan,而不是只靠 token-level RL?
#1.5 SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
- 链接:https://arxiv.org/abs/2608.02499
- HF:https://huggingface.co/papers/2608.02499
- Repo / 项目页:https://github.com/Trae1ounG/SWE-Touch ,https://trae1oung.github.io/SWE-Touch/
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:Code Agent / Evaluation / Human-Agent Collaboration
- 一句话核心贡献:提出 SWE-Touch,用 Counter-Edits 模拟用户在 agent 做任务中途修改 task-relevant code 的真实共享工作区场景,评测 coding agent 是否能理解并响应冲突修改。
为什么值得关注:
多数 SWE-bench 类评测默认 agent 独占仓库,用户只通过 message 参与。但真实开发里,人会在 agent 执行期间看代码、改代码、打断或反向修改。SWE-Touch 把这个协作摩擦显式纳入评测:当用户改了关键区域,agent 是无视、覆盖、误解,还是能重新规划?
与 wenjun 方向的关系:
对 self-evolving code agent 和代码智能 RL 来说,这类 benchmark 更接近真实闭环:环境不是静态 repo,而是有人类/其他 agent 并发干预的 workspace。奖励设计不能只看最终 test pass,还要看是否尊重外部状态变化。
#1.6 ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step
- 链接:https://arxiv.org/abs/2608.02358
- HF:https://huggingface.co/papers/2608.02358
- Repo:https://github.com/declare-lab/ScrambleToolBench
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:Tool-use / LLM Agent / Evaluation / Behavioral Reasoning
- 一句话核心贡献:构造一个去语义化的交互式 terminal benchmark,隐藏工具行为并加入 mapping drift、随机失败、时间窗口,测试 Agent 能否通过试错推断并更新工具行为假设。
为什么值得关注:
它的设计很有意思:不给语义化 tool schema,让 Agent 不能靠预训练先验猜工具名,而必须通过交互行为推断工具映射。论文标题点出一个现象:即便 agent 已经有“自己的地图”指向下一步,也可能继续穷举搜索,说明当前模型在假设维护与策略利用上仍很弱。
与 wenjun 方向的关系:
这是 LLM Agent 的 system identification 问题。若做 model-based RL,可以把 unknown tools 看成未知 transition function,agent 需要通过实验学习 latent dynamics。ScrambleToolBench 可作为“语言 Agent 环境模型学习”的 toy domain。
#1.7 DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
- 链接:https://arxiv.org/abs/2608.01827
- HF:https://huggingface.co/papers/2608.01827
- Repo / 项目页:https://github.com/Halcyon-Zhang/DeepVoyager-VL ,https://halcyon-zhang.github.io/DeepVoyager-VL/
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:LLM Agent / Multimodal Agent / Long-horizon Search
- 一句话核心贡献:提出 vision-in-the-loop 的长程多模态 deep search 框架,让视觉证据不只出现在输入/答案阶段,而能驱动中间检索与推理链扩展。
简评:
这篇面向多模态 open-world 信息获取,但它对一般 Agent 有启发:环境证据应该进入中间搜索控制,而不是只作为 prompt 初始条件。对长程 Agent RL 来说,它强调 observation acquisition policy 的重要性。
#1.8 WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
- 链接:https://arxiv.org/abs/2608.02603
- HF:https://huggingface.co/papers/2608.02603
- Repo / 项目页:https://github.com/YuxueYang1204/worldexam ,https://worldexam.github.io/
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:Model-based RL / World Model / Evaluation
- 一句话核心贡献:提出 WorldExam,用 Visual Quality、Control Adherence、Spatial Consistency、World Reactivity 四层诊断 controllable video generation model 是否真的具备 world model 的场景反应能力。
简评:
虽然是视频 world model benchmark,但“从外观到反应性”的评测思想可迁移到 LLM Agent world model:一个语言 world model 不应只复述环境描述或预测表面下一步,而要能根据状态推断未显式说明的后果。
#1.9 WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
- 链接:https://arxiv.org/abs/2607.29613
- HF:https://huggingface.co/papers/2607.29613
- Repo / 项目页:https://github.com/sylvestf/WCM ,https://sylvestf.github.io/wcm-homepage/
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-07-31
- 类别:Model-based RL / VLA / Post-training RL / World Model
- 一句话核心贡献:指出 VLA RL critic 若只用单帧/单 latent 做 scalar return regression,会错失部分可观测控制中的时间结构;提出带未来 latent state prediction 目标的 World Critic Model。
为什么值得关注:
WCM 的诊断很适合迁移到 LLM Agent:critic 的 state representation 如果没有 dynamics/world-modeling objective,就可能只是拟合回报,无法捕捉跨步依赖。对长程任务尤其致命。
与 wenjun 方向的关系:
这与 Dreamer-style LLM Agent 的核心问题完全对齐:critic / value / world model 不应分裂训练。可以思考:在文本工具环境里,是否也应训练一个“world critic”同时预测未来 observation/state 和 value,而不是只用 trajectory-level reward 做 PPO/GRPO?
#1.10 Zero-Mem: Zero-Token Memory Operations for LLM Agents
- 链接:https://arxiv.org/abs/2607.29377
- HF:https://huggingface.co/papers/2607.29377
- Repo:https://github.com/TheMoon0815/Zero-mem
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-07-31
- 类别:LLM Agent / Memory / Context Compression / Systems
- 一句话核心贡献:提出 zero-token memory operations:最终 QA 之外不调用 LLM、不消耗 LLM 输入/输出 token,用 entity-context graph 与 temporal hierarchy 组织原始交互轨迹并做确定性检索校准。
简评:
Zero-Mem 对通用上下文压缩器方向有价值:它不急着把记忆摘要化,而是保留原始 evidence,通过结构化索引和检索控制降低 token 成本。这与“不要让总结丢证据”的 Agent memory 经验一致。
#1.11 Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
- 链接:https://arxiv.org/abs/2607.28802
- HF:https://huggingface.co/papers/2607.28802
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-07-30
- 类别:LLM Agent / Evaluation / Failure Analysis
- 一句话核心贡献:提出 interaction-centric failure taxonomy,把 Agent failure 定位到 model、harness、user、tool、memory、environment 等组件之间的交互边,并标注修复责任方。
简评:
这篇适合做 Agent 系统实验的诊断工具。它的关键是避免把所有失败都归因于“模型不行”:同一个 visible failure 可能需要模型后训练、harness 改造、环境 redesign 或 benchmark 修复。
#1.12 To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing
- 链接:https://arxiv.org/abs/2607.28887
- HF:https://huggingface.co/papers/2607.28887
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-07-30
- 类别:Code Agent / Code Intelligence / Evaluation
- 一句话核心贡献:系统测量 LLM code editing 的 deletion avoidance:模型常保留应删除代码、用 guard/fallback 绕过测试;并构造 CanItDelete 删除型 benchmark。
简评:
论文摘要报告:在 SWE-bench Verified 上,五个领先模型即使解决任务,删除召回最高也只有 71.7%;到达正确文件超过 92%,但精确删对行低于 52%;29.0% passing patches 使用 Guard-and-Go。这个现象对代码 Agent RL 很重要,因为 test-passing reward 会鼓励“加补丁绕过”而不是真正删除错误逻辑。
#1.13 DAPD: Dual-Anchored Policy Distillation
- 链接:https://arxiv.org/abs/2608.01735
- HF:https://huggingface.co/papers/2608.01735
- 来源:arXiv / Hugging Face Daily Papers
- 日期:2026-08-03
- 类别:Post-training RL / Policy Distillation / Reasoning Model
- 一句话核心贡献:诊断 on-policy self distillation 中的 privilege illusion:teacher 使用 privileged information 后,student 学到推理时无法复现的行为;提出 Dual-Anchored Policy Distillation 对齐 privileged/reference 与 rollout/inference 信息路径。
简评:
对后训练很有现实意义。很多 agent/RL 数据来自更强 teacher 或带额外环境信息的 oracle,如果不处理 train-test information asymmetry,student 可能学会“好像知道隐藏信息”的策略。DAPD 的问题意识可迁移到 Agent 轨迹蒸馏。
#2. GitHub / 项目动态补充
以下是本期检索到、值得跟进的 repo/model/dataset 线索。星数与更新时间来自 GitHub Search 检索结果,可能随时间变化。
- AgentR1/Agent-R1
- 链接:https://github.com/AgentR1/Agent-R1
- 动态:2026-08-04 更新,约 1.6k stars。
- 关注点:端到端 RL 训练 LLM Agents。适合作为 Agentic RL 工程实现与实验基线继续跟踪。
- xxzcc/Awesome-Credit-Assignment-in-LLM-RL
- 链接:https://github.com/xxzcc/Awesome-Credit-Assignment-in-LLM-RL
- 动态:2026-08-04 更新,约 127 stars。
- 关注点:LLM reasoning / agentic RL 中的 credit assignment 论文、taxonomy、benchmark。与 GradCuit、Skill-α、长轨迹 RL 都直接相关。
- AMAP-ML/LongHorizon-Harness
- 链接:https://github.com/AMAP-ML/LongHorizon-Harness
- 关注点:长程 Agent harness 与 MEA loop 实现。建议跟踪其在 OSWorld/Terminal-Bench/WeaveBench 的配置与 agent adapter 设计。
- Yuzhaoxin946/GradCuit
- 链接:https://github.com/Yuzhaoxin946/GradCuit
- 关注点:test-time latent reasoning 的代码实现。如果开源内容完整,值得重点看 latent insertion layer、reward-weighted gradient、inference-time optimization 开销。
- Trae1ounG/SWE-Touch
- 链接:https://github.com/Trae1ounG/SWE-Touch
- 关注点:用户中途改代码的 Counter-Edits benchmark。适合作为代码 Agent 协作鲁棒性评测素材。
- declare-lab/ScrambleToolBench
- 链接:https://github.com/declare-lab/ScrambleToolBench
- 关注点:去语义化工具发现与动态 mapping drift,可用于研究 Agent 的探索、假设维护和工具动力学学习。
#3. 今日最值得精读的 3 篇
- GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
- 精读理由:最贴近 wenjun 近期关注的 latent-space reasoning;关键在于把 latent state 与 continuation reward 的信用分配路径做得更直接。
- LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
- 精读理由:对长程 Agent 状态管理、环境验证、harness 设计都有直接启发;可作为 model-based Agent 的显式 state-management baseline。
- Progressive Agent Skill Generation via Reinforcement Learning 或 SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- 精读理由:两篇构成“skill 生成—skill 使用训练”的组合线索,适合思考 agent 预训练数据与后训练目标如何塑造可复用程序性能力。
备选:如果今天更想看代码智能,则把第三篇换成 SWE-Touch,它对真实协作 coding agent 评测更直接。
#4. 今日最值得跟进的 3 个 repo/model/dataset
- LongHorizon-Harness:https://github.com/AMAP-ML/LongHorizon-Harness
- 看点:MEA loop、外部 task state、auditor verification、AgentAdapter。
- GradCuit:https://github.com/Yuzhaoxin946/GradCuit
- 看点:latent state 插入层、测试时优化、reward-to-latent credit assignment。
- SWE-Touch:https://github.com/Trae1ounG/SWE-Touch
- 看点:Counter-Edits 生成、触发时机、coding agent 对并发用户修改的鲁棒性。
补充跟进:Agent-R1、ScrambleToolBench、Zero-Mem、WCM。
#5. 研究机会 / idea
#Idea 1:把 LongHorizon-Harness 的 MEA loop 形式化为 LLM Agent 的 belief-state learning
LongHorizon-Harness 现在像是工程化的显式状态管理。可以进一步问:
- manager 维护的 task state 是否可以学习成 latent belief state?
- auditor 的环境验证能否作为 observation likelihood / state correction signal?
- executor 的 fresh-context rollout 是否可作为 Dreamer-style imagination / policy rollout 的可控接口?
一个可做的小实验:在 mini tool environment 中比较三种状态表示:纯上下文、手写 task state、学习到的 latent state,并评估长程任务错误传播率。
#Idea 2:Skill 作为 option:用 rollback reward 做 agent skill 的局部信用分配
Skill-α 与 SKT 共同提示:Agent 能力可能通过“可复用技能单元”组织,而不是只靠大上下文记忆。可研究:
- skill 生成是否等价于 option discovery?
- rollback reward 能否判断某个 skill edit 对长期任务价值的边际贡献?
- SKT 的 verified trajectory 能否提供 skill initiation / termination / policy 的监督?
这条线很适合连接长轨迹 RL、Agent 预训练数据、技能库自演化。
#Idea 3:从 GradCuit 到 latent planning:把 verifier reward 反传到 test-time latent plan
GradCuit 给了一个可微信用分配通道。可以进一步探索:
- 在代码 Agent 或工具 Agent 中,把 unit test / environment verifier 的 reward 作为 latent optimization 信号是否可行?
- latent state 是更像 scratchpad 压缩、plan embedding,还是 value-aware hidden memory?
- 与 token-level sampling/search 相比,latent optimization 在长程任务上是否更省 token 或更稳定?
一个可控实验:选择小型可验证任务,让模型冻结,只优化一组 latent slots,对比 best-of-N CoT、tree search、latent optimization 的成功率与计算成本。
#6. 快速索引表
| 标题 | 日期 | 类别 | 链接 | 核心贡献 |
|---|---|---|---|---|
| LongHorizon-Harness | 2026-08-03 | LLM Agent / Long-horizon | https://arxiv.org/abs/2608.01964 | 外置 task state + Manage-Execute-Audit,降低长程状态漂移 |
| Progressive Agent Skill Generation via RL | 2026-08-03 | LLM Agent / RL / Skill | https://arxiv.org/abs/2608.01678 | 用 sequential editing 与 rollback reward 学习生成高质量 Agent skill |
| SKT | 2026-08-03 | Skill-use / Synthetic Data | https://arxiv.org/abs/2608.02287 | 从 2,000 skills 合成 verified skill-grounded trajectories |
| GradCuit | 2026-08-03 | Latent Reasoning | https://arxiv.org/abs/2608.02585 | 通过中间层 latent states 建立 test-time latent reasoning 的梯度信用分配 |
| SWE-Touch | 2026-08-03 | Code Agent / Evaluation | https://arxiv.org/abs/2608.02499 | 评测用户中途修改代码时 coding agent 的协作鲁棒性 |
| ScrambleToolBench | 2026-08-03 | Tool-use / Behavioral Reasoning | https://arxiv.org/abs/2608.02358 | 去语义化工具发现,测试 Agent 是否能通过交互推断工具行为 |
| DeepVoyager-VL | 2026-08-03 | Multimodal Agent | https://arxiv.org/abs/2608.01827 | vision-in-the-loop 长程多模态搜索 |
| WorldExam | 2026-08-03 | World Model / Evaluation | https://arxiv.org/abs/2608.02603 | 从视觉质量到 world reactivity 的分层 world model 评测 |
| WCM | 2026-07-31 | Model-based RL / VLA | https://arxiv.org/abs/2607.29613 | 用未来 latent prediction 改善 VLA RL critic 的时间结构表征 |
| Zero-Mem | 2026-07-31 | Agent Memory / Context Compression | https://arxiv.org/abs/2607.29377 | 最终回答外零 LLM token 的结构化记忆检索 |
| Model or Harness? | 2026-07-30 | Agent Evaluation | https://arxiv.org/abs/2607.28802 | 用 interaction-centric taxonomy 定位 Agent 失败责任方 |
| To Add Is Machine, To Delete Is Human | 2026-07-30 | Code Intelligence | https://arxiv.org/abs/2607.28887 | 测量 LLM code editing 的 deletion avoidance 与 Guard-and-Go |
| DAPD | 2026-08-03 | Post-training / Distillation | https://arxiv.org/abs/2608.01735 | 缓解 privileged teacher 到 inference-time student 的 privilege illusion |