#2026-08-15 AI/LLM 最新论文与研究热点简报
覆盖窗口:以北京时间 2026-08-15 08:00 为截点,主体来自 arXiv 8 月 14 日新批次(官方 RSS 更新时间约为 8 月 14 日 04:00 UTC),并结合 Hugging Face Daily Papers 8 月 13–14 日收录情况。今天核心条目足够集中在最近 24–48 小时,无需用旧论文凑数。
核验方式:逐条核验 arXiv 官方 RSS/摘要页;对 WMRL、LOPD、SSPO、CAKE、Replica/Faraday、LittleLearner、Intern-S2、LycheeMemory V2、AutoDesign 等下载 PDF 并抽取全文检查方法与数字;项目链接用 GitHub API、HF 页面或作者项目页复核。Google Scholar 本次仍返回 403;X 搜索页虽返回 HTML,但正文依赖登录和 JavaScript,无法稳定核验帖子与时间戳,故不引用不可审计的社交媒体转述。
#一、先看结论:今天最强的 5 个信号
- 真正对准 wenjun 主线的 “LLM Agent + model-based RL” 工作出现了:WMRL 不是把 world model 当概念比喻,而是用它替代 AutoResearch Agent 训练中的真实环境执行,并显式处理 imagined reward 的 bias 与 variance;论文报告训练加速 3–4 倍。
- Agent 自学习正在从“人工规定 teacher 看什么”走向“让 privileged context 本身可学习”:LOPD 从历史经验检索并生成连续 latent tokens 来条件化 self-teacher,再把 dense token-level supervision 蒸馏回 on-policy student。这是 latent representation、经验内化与 agentic RL 的直接交叉点。
- World model 的长时域失败未必来自预测器,而可能来自 planner objective:一篇 LeWorldModel 复现发现,latent state 里仍有足够位置/可达性信息,但 squared latent distance 与真实可达代价错位;只换 cost、不重训模型,就把远距离目标成功率从 26% 提到 98%。
- 长轨迹 credit assignment 正在分化为两条互补路线:SSPO 用 evidence anchor 调整错误搜索轨迹中每一步的更新幅度;LoongReflect 则把 reflection/backtracking 明确建模成 memory-control action,并让局部反思接受全局 trajectory 结果监督。
- Code Agent 的下一层竞争是 compiler / verifier / harness 共演化:CAKE 让 Agent 操作可验证、硬件显式的 IR,并把重复失败沉淀为 verifier rule、IR primitive 和优化 tactic;Vero 则把形式验证从单函数提升到多模块真实仓库,显示最强 Agent 仍只能完整解决 43 个实例中的 27 个。
#二、重点精读(Top 5)
#1. WMRL:用 World Model 替代 AutoResearch Agent 的昂贵环境执行
- 类别:
Model-based RL/LLM Agent/Long-horizon Agent/Post-training RL/Systems - 标题:Scaling Automatic Research Agents via World Models
- 来源与日期:arXiv:2608.12564;2026-08-14 新批次
- 一句话核心贡献:提出 World Model RL(WMRL),以 world model 评估/模拟 AutoResearch trajectory,减少独占 sandbox 的真实执行成本,并用 Online Debiasing 与 Inverse-Variance Denoising 修正 imagined reward 的系统偏差和噪声。
为什么值得关注?
这篇几乎直接命中“Dreamer for LLM Agent”的工程瓶颈。论文指出,Agent generation 可以 batch,但每条候选研究方案都要独占 sandbox 和真实机器时间执行,因此 rollout 越长,环境执行越成为 RL scaling 的瓶颈。WMRL 用几次 world-model forward pass 替代大部分真实执行,但保留少量同时由 world model 与真实环境评分的 anchor groups:
- 用在线 isotonic regression 学习单调校准映射,追踪 world-model reward 相对真实 reward 的漂移,即 Online Debiasing;
- 将真实梯度流和 world-model 梯度流按方差倒数融合,即 Inverse-Variance Denoising;
- 理论上把 world-model bias 与 noise 对收敛的影响写成额外误差项,并证明两种校正改善收敛界。
全文和摘要报告:WMRL 在不同任务和 Agent 尺度上将训练加速 3–4×,同时达到或超过真实环境 RL baseline;后训练的 4B/9B Agent 在 held-out benchmark 上超过更大的 48B/120B 开放权重 Agent,并能迁移到 embodied VLA post-training。
与 wenjun 方向的关系:这是今天最应精读的论文。关键不只是“有一个 world model”,而是它给出了真实 rollout 与 imagined rollout 的混合方式。可以进一步研究:world model 不只预测最终 reward,而是预测 tool state transition、test result、资源消耗和 failure mode;anchor 预算则按 epistemic uncertainty、trajectory novelty 或 policy drift 自适应分配。
需要警惕:论文中的 world model 更接近 trajectory evaluator / reward simulator,而不是完整生成环境状态的 Dreamer RSSM。要检查它能否支持反事实 action branching,以及在 policy 逐步偏离训练分布时,在线校准是否足以抵抗 model exploitation。
#2. LOPD:让 self-teacher 的“特权经验”变成可学习的 latent context
- 类别:
Latent Reasoning/LLM Agent/Code Agent/Post-training RL/Continual Learning - 标题:Latent On-Policy Self-Distillation
- 来源与日期:arXiv:2608.13040;2026-08-14 新批次
- 代码:bingreeky/LOPD
- 一句话核心贡献:从过往经验检索相关样本,将其组合为连续 latent tokens 作为 self-teacher 的 privileged context,再在 student 自己访问到的每个 prefix 上提供 dense token-level distillation。
为什么值得关注?
现有 on-policy self-distillation 往往人为指定 teacher 能看到的答案、反馈、skill 或成功轨迹。问题在于,研究者已经预先决定了“什么经验重要”;不同任务还要重新设计 privileged artifact。LOPD 将这个环节改成端到端学习:
- student 根据任务和交互历史生成 on-policy trajectory;
- 从 experience bank 检索相关经验;
- context composer 把经验压成连续 latent tokens;
- latent context 条件化同一个模型形成 privileged self-teacher;
- teacher 在 student 实际访问的 prefix 上提供 dense supervision;
- privileged-margin objective 防止 latent context 退化或无约束地劫持 teacher。
论文在 agentic tool-use 和 coding 两种 post-training 设置上评估:tool-use 训练集来自 EnvScaler(2,349 个任务),测试覆盖 held-out EnvScaler、BFCL-v3、ACEBench;代码评估包含 LiveCodeBench。摘要与全文称,LOPD 在多个 backbone 和 benchmark 上优于 RLVR、OPSD、SDPO、Skill-SD,并以不到 GRPO / Skill-SD 30% 的 rollout budget 超过它们。
与 wenjun 方向的关系:它把“经验 → latent state → dense teacher → policy 内化”串成了闭环,可视为非生成式的 latent world knowledge。特别适合研究:latent context 到底编码了 transition、reward、程序 skill,还是近邻答案捷径?可以把 composer 约束成 state/action/reward 三组 latent slots,再观察跨任务迁移和长期更新中的 interference。
需要警惕:retrieval bank 仍是外部经验源,且 teacher 与 student 共享 backbone;提升可能部分来自额外 forward compute 或 benchmark-neighbor retrieval。应重点看 experience split、检索污染、latent token 数量、跨域迁移和 continual update 后的稳定性。
#3. The Objective Is the Bottleneck:world model 会预测,不等于 planner 会使用
- 类别:
Model-based RL/Latent Reasoning/Planning/Evaluation - 标题:The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use
- 来源与日期:arXiv:2608.12959;2026-08-14 新批次 / HF Papers 8 月 13 日收录
- 一句话核心贡献:在 LeWorldModel/TwoRoom 复现中证明,长时域 planning 的主要瓶颈不是 latent predictor 丢失信息,而是 squared latent-distance objective 与真实 reachability 不一致。
关键证据
- imagined state 在 75 个环境步后,相对“假设世界静止”的误差只有 0.189 倍,但 planner 从不规划超过 25 步;
- frozen embedding 中的位置可被 ridge probe 以 R²=0.9922 恢复,说明关键信息仍在 latent state;
- squared latent distance 与真实距离只有 r=0.426,并在较远距离饱和甚至反向:远离目标反而可能降低 cost;
- 不重训 predictor,只替换规划 objective,offset 100 的目标成功率从 26% 提到 98%,并在三分之一规划预算下达到 92%;
- 由 frame separation 学到的 cost 虽然位置预测更差,却更能对墙体和可达性定价,因此规划更好。
为什么值得关注?
这篇给 model-based RL 一个非常重要的诊断原则:不要用 reconstruction / prediction accuracy 代理 planning utility。好的 latent world model 应保留 action-conditioned reachability、不可逆性、障碍和 reward-relevant equivalence;planner objective 还必须能把这些信息读出来。
与 wenjun 方向的关系:迁移到 LLM Agent,可把“latent distance”换成“文本 embedding 距离/状态摘要相似度”。两个代码仓库状态看起来相近,不代表从一个状态修到另一个状态的 action cost 相近。值得构建 tool-state bisimulation / reachability objective:由真实执行步数、失败恢复代价和 verifier transition 监督 latent metric,而不是只优化 next-observation prediction。
#4. SSPO:用 Evidence Anchor 做深度搜索 Agent 的 step-level credit assignment
- 类别:
LLM Agent/Tool-use/Post-training RL/Long-horizon Agent - 标题:Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents
- 来源与日期:arXiv:2608.12764;2026-08-14 新批次
- 代码:hkust-nlp/SSPO
- 一句话核心贡献:将 teacher-student disagreement 转化为 GRPO 中的 step-level advantage weight,只作用于错误轨迹;Evidence Anchor 给 teacher 关键网页证据,但不直接暴露完整答案路径。
为什么值得关注?
直接蒸馏 privileged teacher 会造成信息不对称:全文中 teacher 平均只需 3.5 次 tool call,而在开放网页中探索的 student 需要 17.7 次;强迫 student 模仿 teacher 的短路径,会让它在没有特权信息时过早停止搜索。SSPO 因而将两件事拆开:
- outcome reward 决定更新方向:错误 trajectory 需要被抑制;
- teacher disagreement 决定每一步更新幅度:哪一步最缺关键证据,就在哪一步施加更强信号;
- 正确轨迹不蒸馏,避免把多样的成功搜索路径压成单一路径。
在 Qwen3-8B 上,论文报告 SSPO 在 BrowseComp、GAIA、FRAMES 上持续超过 GRPO,并达到或超过训练两倍 gradient steps 的 GRPO;额外成本约为每步 5%,来自一次额外 forward pass。
与 wenjun 方向的关系:可直接迁移到 Code Agent:把 Evidence Anchor 换成 failing test、相关 diff、调用栈、静态分析事实或最小反例;teacher 只告诉 policy “哪一步缺了什么证据”,而不是泄露完整 patch。它也可以作为 WMRL 的局部校正信号:world model 给出 step uncertainty,真实 verifier anchor 决定更新强度。
#5. CAKE:让 Compiler、Verifier 与 Kernel Agent 一起演化
- 类别:
Code Agent/Systems/Self-evolving Agent/Evaluation - 标题:CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution
- 来源与日期:arXiv:2608.12629;2026-08-14 新批次
- 一句话核心贡献:设计硬件显式、可类型检查的 CAKE IR,使 Agent 能控制 warp role、memory movement、同步和 pipeline;编译器返回局部正确性/性能诊断,并把重复失败升级为 verifier rule、IR primitive、cost-model calibration 或 reusable tactic。
关键结果
- B200 上 implementation-hidden Flash-KMeans clean start,在 8,000 万 token 预算下,最佳 CAKE IR candidate 达到 tuned FlashML 的 1.144×,直接 CUDA/PTX 只有 0.928×;
- Agent 生成的 Kimi Delta Attention 相对官方 FlashKDA 达到 2.05× 几何平均加速,并通过端到端 serving 验证;
- dispatcher-backed KNN/KMeans 在 400 多个 shape 上提高 1.42×–2.12×;
- 4 个 kernel 修改以 upstream PR 形式提供。
为什么值得关注?
这不是普通“LLM 写 CUDA”。核心是重新设计 Agent action space 与反馈通道:既不让高层 DSL 隐藏关键 schedule,也不让 raw CUDA/PTX 把错误埋在难以定位的编译/运行结果里。harness 还能从历史失败中升级自己,但所有新规则都要经过 kernel corpus 的 test gate,避免错误经验永久污染系统。
与 wenjun 方向的关系:它给 self-evolving code agent 一个很具体的范式:环境不是固定编译器,而是可被 Agent 经验改造、同时又由回归测试约束的学习系统。可进一步研究“哪些 failure 应进入 policy 参数,哪些应成为 verifier rule,哪些应成为新 primitive”,这正是 agent 预训练数据如何塑造能力与外部 harness 如何塑造能力的分工问题。
#三、其他值得扫读的新论文与动态
#6. LoongReflect:把 reflection 训练成可回退轨迹树上的 memory-control policy
- 类别:
LLM Agent/Post-training RL/Memory/Tool-use - 标题:LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation
- 来源与日期:arXiv:2608.11967;2026-08-14 新批次
- 一句话核心贡献:在可逆 trajectory tree 上定义显式 reflect/backtrack action;快通道只蒸馏 reflection/backtracking tokens,慢通道用 outcome GRPO 优化完整轨迹,通过 look-ahead/extragradient 式协调缓解“局部反思、全局才知对错”的监督错位。
- 判断:它比泛化的“让模型自我反思”更有研究价值,因为反思被操作化为 working-memory update 与 branch deletion。要重点检查 teacher privilege、树搜索预算以及 backtrack lesson 是否真正跨任务迁移。
#7. Replica / Faraday:把“复现论文”变成可训练的 AI Scientist 任务空间
- 类别:
Scientific Agent/Code Agent/Post-training RL/Evaluation - 标题:Training AI Scientists to Replicate Research
- 来源与日期:arXiv:2608.13331;2026-08-14 新批次
- 一句话核心贡献:构建论文复现任务空间 Replica 与自动生成的 rubric judge,并 post-train 27B 参数 Faraday;Faraday 把 coding agent 当工具,在 held-out replication tasks 上超过论文所测的 Claude Opus 4.8 与 GPT-5.5。
- 判断:亮点不是模型排行榜,而是把“论文遗漏了哪些实验细节”变成需要 hypothesis-driven exploration 的长轨迹任务。需要审计 rubric judge 的可博弈性、复现任务的领域覆盖,以及 Faraday 调用强 coding model 带来的真实成本。
#8. Vero:repository-level joint code-and-proof benchmark
- 类别:
Code Agent/Evaluation/Formal Verification - 标题:Vero: Can AI Agents Build Formally Verified Software Repositories?
- 来源与日期:arXiv:2608.13522;2026-08-14 新批次
- 代码/数据:sunblaze-ucb/vero
- 一句话核心贡献:提供 43 个来自 Python、Dafny、Verus、Coq 真实项目的多模块 Lean 4 repository 实例,同时评估 proof-only 与 code-and-proof;还允许 Agent 形式化证明 specification 不可满足或 reference code 错误,以审计 benchmark 本身。
- 结果/判断:最强配置完整解决 27/43,最难仓库中没有关闭任何 specification。相比 SWE-bench,它把 reward 从 tests 推进到 machine-checked contracts,但预先给定 API 和人工规格仍比真实需求理解更干净。
#9. LittleLearner:用受控预训练暴露研究“能力如何形成”的因果窗口
- 类别:
Pretraining Data/Foundation Model Training/Continual Learning - 标题:LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
- 来源与日期:arXiv:2608.13545;2026-08-14 新批次 / HF Papers 8 月 13 日
- 一句话核心贡献:从 FineWeb-Edu 过滤出 88B-token 的 K–5(幼儿园到五年级)语料 LittleCurriculum,并从头训练 5B 模型 LittleLearner,构造知识暴露边界可解释的基础模型研究沙箱。
- 结果/判断:初步实验表明 post-training 与 in-context learning 能帮助模型更好使用已有知识,却没有显著抬升 out-of-scope 能力。它比在 web-scale 模型上猜“某能力是否见过”更适合研究 curriculum、知识注入、迁移、遗忘和 emergence;但 K–5 过滤器不可能完美等价于概念因果隔离,仍需 contamination audit。
#10. Intern-S2-Preview:科学 Agent 基座把 pretraining、multi-task RL、agentic RL 与 memory decoder 串起来
- 类别:
Foundation Model Training/Scientific Agent/Post-training RL/Continual Learning - 标题:Intern-S2-Preview: Scientific Agentic Foundation Model
- 来源与日期:arXiv:2608.13505;2026-08-14 新批次;HF Daily Papers 8 月 14 日收录(运行时 42 upvotes)
- 模型:internlm/Intern-S2-Preview
- 一句话核心贡献:从 scientific multimodal pretraining 出发,统一 SFT、多任务 RL、black/white-box agentic RL 与 on-policy distillation,并加入 partial rollout + off-policy correction、adaptive length regularization、online speculative decoding、trace-aware experience assembly 等系统技术。
- 判断:397B 主干外接单独训练的 Memory Decoder,在冻结 backbone 时将 Biology-Instructions 平均分从 56.92 提到 60.32,值得关注“外部参数记忆 vs 持续更新主模型”的架构分工。技术报告范围很大,需将每项工程技巧的独立贡献与超大模型规模效应分开看。
#11. LycheeMemory V2:Agent memory 的成本关键在 consolidation 粒度
- 类别:
LLM Agent/Memory/Context Compression/Systems - 标题:LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
- 来源与日期:arXiv:2608.12990;HF Papers 2026-08-13,8 月 14 日 Daily 收录
- 代码:LycheeMem/LycheeMem
- 一句话核心贡献:不再每轮调用 LLM 做 eager consolidation,而是按语义边界批量形成 segment,再编码成上下文独立、带类型的 memory records,并通过轻量结构化索引规划检索。
- 结果/判断:使用 GPT-4.1-Mini 时,论文报告 LoCoMo 89.22%、LongMemEval-S 92.20%;相对 A-Mem,构建 token 分别下降 86.0% 和 75.9%,且不增加 query-time token。它延续昨日 COMPINT 的问题:成本下降之外,应额外检查 constraint、时间和负证据是否在 segment finalization 时丢失。
#12. AutoDesign:让 meta-harness optimizer 递归改进 Code Agent 的设计工作流
- 类别:
Code Agent/Self-evolving Agent/Harness/Evaluation - 标题:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
- 来源与日期:arXiv:2608.13560;HF Daily Papers 8 月 14 日收录(运行时 31 upvotes)
- 项目:GitHub / 项目页
- 一句话核心贡献:meta-harness optimizer 根据 rollout feedback 指导 code agent 递归改进 DesignHarness,并以 paper-to-poster 长时域任务构建 PosterBench。
- 结果/判断:论文报告 Main Track 得分 78.32,比所测 Claude Design 高 7.45;七种 agent/model 组合加载 learned harness 后平均从 54.99 提到 67.39。自主循环在约 40 分钟、253 次 tool call、11 次编辑、低于 3 美元条件下达到平均 conference-poster 质量。它是“自演化发生在 harness 而不是权重”的好案例,但仍需跨设计任务验证,防止只对 PosterBench 过拟合。
#13. Code LLM memorization probe 需要区分 memorization 与 representation load
- 类别:
Code Intelligence/Pretraining Data/Evaluation - 标题:Memorization Diagnostics for Code LLMs Should be Scale-Aware
- 来源与日期:arXiv:2608.12771;2026-08-14 新批次
- 一句话核心贡献:指出 synonym fuzzing、dead-code insertion、log-prob 等 memorization probe 随模型变大而失效;用可逆数学变换将表示负担与记忆效应分开,显示大模型可能既见过答案,也能稳健跨越表面形式变化。
- 判断:它不意味着 contamination 不重要,而是提醒代码数据质量研究不要把“改个变量名性能不掉”直接解释为没有背题,也不要把“性能掉了”直接解释为纯记忆。更好的测试要同时控制语义、表示负担、解族等价性和真实 repo transfer。
#四、今日最值得精读的 3 篇
- Scaling Automatic Research Agents via World Models:与 LLM model-based RL / Dreamer Agent 最直接;重点读 anchor signal、reward bias/noise 建模,以及 imagined evaluation 是否支持真正的反事实 rollout。
- Latent On-Policy Self-Distillation:连接 latent representation、experience retrieval、dense credit 和 policy internalization;重点看防止 latent context 变成答案捷径的实验。
- The Objective Is the Bottleneck:篇幅和实验域可能不大,但研究判断很关键——world model 的 representation quality 必须由 planner 可用性和 reachability 衡量,而不是只看预测误差。
联读建议:WMRL + Objective Bottleneck 组成“怎么用 imagined rollout、怎么避免 planner 读错 latent state”;LOPD + SSPO + LoongReflect 组成“经验如何变成 dense supervision,以及长轨迹每一步如何分配信用”。
#五、今日最值得跟进的 3 个 repo / model / dataset
- 对应 Latent On-Policy Self-Distillation;GitHub API 核验到仓库于 8 月 13 日创建、8 月 14 日仍更新。
- 跟进重点:latent composer/retriever 是否已完整开源;复现 EnvScaler、BFCL、ACEBench 与 LiveCodeBench;可直接改造成 experience-conditioned world-model teacher。
- 对应深度搜索 Agent 的 step-level self-distillation。
- 跟进重点:Evidence Anchor 的构造成本与信息泄露控制;将网页 evidence 换成代码 Agent 的 failing test、stack trace、static fact,做 step-level credit assignment。
- 已开源 DesignHarness 和递归优化框架,仓库在 8 月 14 日创建并持续更新。
- 跟进重点:把 poster domain 换成 repo repair / kernel optimization,测试 learned harness 的跨任务、跨模型迁移;特别关注治理机制是否能阻止 harness 膨胀和局部 benchmark overfitting。
备选资源:如果今天更关注基础模型训练机制,优先跟进 Intern-S2-Preview 模型页 和 LittleLearner/LittleCurriculum 后续发布;如果更关注长期记忆工程,跟进 LycheeMem。
#六、研究机会 / Ideas
#Idea 1:Planner-aware World Model RL for Code Agents
把 WMRL 与 Objective Bottleneck 合并成一个面向 Code Agent 的闭环:
- world model 预测 patch 后的 tests、build state、依赖变化、潜在回归和执行成本;
- 不直接用 latent Euclidean distance 做 planning cost,而用真实 action reachability、最小修复步数、verifier transition 学习 cost;
- 保留少量真实 sandbox anchor,按 uncertainty × novelty × expected impact 自适应选取;
- 对 reward bias 做在线单调校准,对不同 failure family 分别估计方差;
- 评估 model accuracy、planner regret、model exploitation rate 和真实 wall-clock speedup,而不只看最终 pass rate。
核心问题:LLM Agent 的 world model 应该预测“未来长什么样”,还是预测“从这里是否能以低成本到达可验证目标”?
#Idea 2:Latent Experience Composer 的可解释分槽与持续学习
基于 LOPD,把连续 privileged context 拆成三类 latent slots:
- state slots:当前任务和环境的隐变量;
- transition/skill slots:过去哪些 action 在什么条件下有效;
- risk/constraint slots:失败、禁区、过期条件和 verifier 证据。
再设计干预实验:屏蔽某类 slot、交换不同任务的 slot、让经验发生冲突、连续加入新 domain,观察 teacher distribution、student policy 和遗忘程度。这样能回答:LOPD 学到的是可迁移机制、可压缩记忆,还是难以审计的 soft prompt shortcut?
#Idea 3:从 Evidence Anchor 到 Verifier Anchor 的长轨迹 credit assignment
将 SSPO 的 Evidence Anchor 与 LoongReflect 的 reflect/backtrack action 用于 repository-level Agent:
- anchor 不提供正确 patch,只提供 failing test、call graph、minimal counterexample、相关 invariant;
- outcome reward 决定正负方向,teacher/world model 只分配每一步的更新幅度;
- reflection 更新 working memory,backtrack 删除不可靠分支但保留带 provenance 的 corrective lesson;
- 以 Vero 的 proof obligation 或 CAKE 的 verifier rule 作为强 anchor;
- 比较 outcome-only GRPO、process reward、OPSD、SSPO 和 tree-level memory control 的偏差—方差与样本效率。
核心问题:能否给长轨迹 Agent 足够密的信用信号,同时不把 oracle solution 偷渡给 student、也不把成功策略蒸馏成单一短路径?
#七、来源、社区热度与限制
- arXiv:主体来自 cs.AI、cs.CL、cs.LG、cs.SE、stat.ML 官方 RSS 8 月 14 日批次,并回到 PDF 全文核验重点方法和数字。
- Hugging Face:官方 API 用于发现 Daily Papers、模型/项目关联与社区注意力。运行时 Intern-S2 42 upvotes、AutoDesign 31、PlayWorld 33、Alaya-EVOKE 82;这些只代表关注度,不代表实验可靠性。
- GitHub / 项目页:已直接核验 LOPD、SSPO、AutoDesign、LycheeMem、Vero、PlayWorld 等仓库或项目页可访问;没有明确官方 repo 的工作不强行配链接。
- Google Scholar:本次查询返回 403,无法作为增量来源;学术身份和论文日期改由 arXiv/HF/作者项目核验。
- X/Twitter:搜索页面可返回 HTML 壳,但无法稳定取得可审计正文和时间戳,因此未引用“技术大牛刚刚发帖”等不可验证说法。机构/作者动向以论文、HF、GitHub 和项目页替代。
- OpenReview:搜索入口可访问,但本窗口没有发现比 arXiv 新批次更贴合 wenjun 主线、且能稳定核验的独立新增条目。
- 结论边界:以上结果多为刚发布预印本,WMRL、LOPD、Faraday、CAKE 等 headline 数字需要代码、数据和等预算复现;文中已区分论文报告与本文研究判断,不把摘要数字视为已独立验证的事实。