#2026-08-15 AI/LLM 最新论文与研究热点简报

覆盖窗口:以北京时间 2026-08-15 08:00 为截点,主体来自 arXiv 8 月 14 日新批次(官方 RSS 更新时间约为 8 月 14 日 04:00 UTC),并结合 Hugging Face Daily Papers 8 月 13–14 日收录情况。今天核心条目足够集中在最近 24–48 小时,无需用旧论文凑数。

核验方式:逐条核验 arXiv 官方 RSS/摘要页;对 WMRL、LOPD、SSPO、CAKE、Replica/Faraday、LittleLearner、Intern-S2、LycheeMemory V2、AutoDesign 等下载 PDF 并抽取全文检查方法与数字;项目链接用 GitHub API、HF 页面或作者项目页复核。Google Scholar 本次仍返回 403;X 搜索页虽返回 HTML,但正文依赖登录和 JavaScript,无法稳定核验帖子与时间戳,故不引用不可审计的社交媒体转述。

#一、先看结论:今天最强的 5 个信号

  1. 真正对准 wenjun 主线的 “LLM Agent + model-based RL” 工作出现了:WMRL 不是把 world model 当概念比喻,而是用它替代 AutoResearch Agent 训练中的真实环境执行,并显式处理 imagined reward 的 bias 与 variance;论文报告训练加速 3–4 倍。
  2. Agent 自学习正在从“人工规定 teacher 看什么”走向“让 privileged context 本身可学习”:LOPD 从历史经验检索并生成连续 latent tokens 来条件化 self-teacher,再把 dense token-level supervision 蒸馏回 on-policy student。这是 latent representation、经验内化与 agentic RL 的直接交叉点。
  3. World model 的长时域失败未必来自预测器,而可能来自 planner objective:一篇 LeWorldModel 复现发现,latent state 里仍有足够位置/可达性信息,但 squared latent distance 与真实可达代价错位;只换 cost、不重训模型,就把远距离目标成功率从 26% 提到 98%。
  4. 长轨迹 credit assignment 正在分化为两条互补路线:SSPO 用 evidence anchor 调整错误搜索轨迹中每一步的更新幅度;LoongReflect 则把 reflection/backtracking 明确建模成 memory-control action,并让局部反思接受全局 trajectory 结果监督。
  5. Code Agent 的下一层竞争是 compiler / verifier / harness 共演化:CAKE 让 Agent 操作可验证、硬件显式的 IR,并把重复失败沉淀为 verifier rule、IR primitive 和优化 tactic;Vero 则把形式验证从单函数提升到多模块真实仓库,显示最强 Agent 仍只能完整解决 43 个实例中的 27 个。

#二、重点精读(Top 5)

#1. WMRL:用 World Model 替代 AutoResearch Agent 的昂贵环境执行

  • 类别Model-based RL / LLM Agent / Long-horizon Agent / Post-training RL / Systems
  • 标题Scaling Automatic Research Agents via World Models
  • 来源与日期:arXiv:2608.12564;2026-08-14 新批次
  • 一句话核心贡献:提出 World Model RL(WMRL),以 world model 评估/模拟 AutoResearch trajectory,减少独占 sandbox 的真实执行成本,并用 Online Debiasing 与 Inverse-Variance Denoising 修正 imagined reward 的系统偏差和噪声。

为什么值得关注?

这篇几乎直接命中“Dreamer for LLM Agent”的工程瓶颈。论文指出,Agent generation 可以 batch,但每条候选研究方案都要独占 sandbox 和真实机器时间执行,因此 rollout 越长,环境执行越成为 RL scaling 的瓶颈。WMRL 用几次 world-model forward pass 替代大部分真实执行,但保留少量同时由 world model 与真实环境评分的 anchor groups

  • 用在线 isotonic regression 学习单调校准映射,追踪 world-model reward 相对真实 reward 的漂移,即 Online Debiasing
  • 将真实梯度流和 world-model 梯度流按方差倒数融合,即 Inverse-Variance Denoising
  • 理论上把 world-model bias 与 noise 对收敛的影响写成额外误差项,并证明两种校正改善收敛界。

全文和摘要报告:WMRL 在不同任务和 Agent 尺度上将训练加速 3–4×,同时达到或超过真实环境 RL baseline;后训练的 4B/9B Agent 在 held-out benchmark 上超过更大的 48B/120B 开放权重 Agent,并能迁移到 embodied VLA post-training。

与 wenjun 方向的关系:这是今天最应精读的论文。关键不只是“有一个 world model”,而是它给出了真实 rollout 与 imagined rollout 的混合方式。可以进一步研究:world model 不只预测最终 reward,而是预测 tool state transition、test result、资源消耗和 failure mode;anchor 预算则按 epistemic uncertainty、trajectory novelty 或 policy drift 自适应分配。

需要警惕:论文中的 world model 更接近 trajectory evaluator / reward simulator,而不是完整生成环境状态的 Dreamer RSSM。要检查它能否支持反事实 action branching,以及在 policy 逐步偏离训练分布时,在线校准是否足以抵抗 model exploitation。


#2. LOPD:让 self-teacher 的“特权经验”变成可学习的 latent context

  • 类别Latent Reasoning / LLM Agent / Code Agent / Post-training RL / Continual Learning
  • 标题Latent On-Policy Self-Distillation
  • 来源与日期:arXiv:2608.13040;2026-08-14 新批次
  • 代码bingreeky/LOPD
  • 一句话核心贡献:从过往经验检索相关样本,将其组合为连续 latent tokens 作为 self-teacher 的 privileged context,再在 student 自己访问到的每个 prefix 上提供 dense token-level distillation。

为什么值得关注?

现有 on-policy self-distillation 往往人为指定 teacher 能看到的答案、反馈、skill 或成功轨迹。问题在于,研究者已经预先决定了“什么经验重要”;不同任务还要重新设计 privileged artifact。LOPD 将这个环节改成端到端学习:

  1. student 根据任务和交互历史生成 on-policy trajectory;
  2. 从 experience bank 检索相关经验;
  3. context composer 把经验压成连续 latent tokens;
  4. latent context 条件化同一个模型形成 privileged self-teacher;
  5. teacher 在 student 实际访问的 prefix 上提供 dense supervision;
  6. privileged-margin objective 防止 latent context 退化或无约束地劫持 teacher。

论文在 agentic tool-use 和 coding 两种 post-training 设置上评估:tool-use 训练集来自 EnvScaler(2,349 个任务),测试覆盖 held-out EnvScaler、BFCL-v3、ACEBench;代码评估包含 LiveCodeBench。摘要与全文称,LOPD 在多个 backbone 和 benchmark 上优于 RLVR、OPSD、SDPO、Skill-SD,并以不到 GRPO / Skill-SD 30% 的 rollout budget 超过它们。

与 wenjun 方向的关系:它把“经验 → latent state → dense teacher → policy 内化”串成了闭环,可视为非生成式的 latent world knowledge。特别适合研究:latent context 到底编码了 transition、reward、程序 skill,还是近邻答案捷径?可以把 composer 约束成 state/action/reward 三组 latent slots,再观察跨任务迁移和长期更新中的 interference。

需要警惕:retrieval bank 仍是外部经验源,且 teacher 与 student 共享 backbone;提升可能部分来自额外 forward compute 或 benchmark-neighbor retrieval。应重点看 experience split、检索污染、latent token 数量、跨域迁移和 continual update 后的稳定性。


#3. The Objective Is the Bottleneck:world model 会预测,不等于 planner 会使用

  • 类别Model-based RL / Latent Reasoning / Planning / Evaluation
  • 标题The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use
  • 来源与日期:arXiv:2608.12959;2026-08-14 新批次 / HF Papers 8 月 13 日收录
  • 一句话核心贡献:在 LeWorldModel/TwoRoom 复现中证明,长时域 planning 的主要瓶颈不是 latent predictor 丢失信息,而是 squared latent-distance objective 与真实 reachability 不一致。

关键证据

  • imagined state 在 75 个环境步后,相对“假设世界静止”的误差只有 0.189 倍,但 planner 从不规划超过 25 步;
  • frozen embedding 中的位置可被 ridge probe 以 R²=0.9922 恢复,说明关键信息仍在 latent state;
  • squared latent distance 与真实距离只有 r=0.426,并在较远距离饱和甚至反向:远离目标反而可能降低 cost;
  • 不重训 predictor,只替换规划 objective,offset 100 的目标成功率从 26% 提到 98%,并在三分之一规划预算下达到 92%;
  • 由 frame separation 学到的 cost 虽然位置预测更差,却更能对墙体和可达性定价,因此规划更好。

为什么值得关注?

这篇给 model-based RL 一个非常重要的诊断原则:不要用 reconstruction / prediction accuracy 代理 planning utility。好的 latent world model 应保留 action-conditioned reachability、不可逆性、障碍和 reward-relevant equivalence;planner objective 还必须能把这些信息读出来。

与 wenjun 方向的关系:迁移到 LLM Agent,可把“latent distance”换成“文本 embedding 距离/状态摘要相似度”。两个代码仓库状态看起来相近,不代表从一个状态修到另一个状态的 action cost 相近。值得构建 tool-state bisimulation / reachability objective:由真实执行步数、失败恢复代价和 verifier transition 监督 latent metric,而不是只优化 next-observation prediction。


#4. SSPO:用 Evidence Anchor 做深度搜索 Agent 的 step-level credit assignment

为什么值得关注?

直接蒸馏 privileged teacher 会造成信息不对称:全文中 teacher 平均只需 3.5 次 tool call,而在开放网页中探索的 student 需要 17.7 次;强迫 student 模仿 teacher 的短路径,会让它在没有特权信息时过早停止搜索。SSPO 因而将两件事拆开:

  • outcome reward 决定更新方向:错误 trajectory 需要被抑制;
  • teacher disagreement 决定每一步更新幅度:哪一步最缺关键证据,就在哪一步施加更强信号;
  • 正确轨迹不蒸馏,避免把多样的成功搜索路径压成单一路径。

在 Qwen3-8B 上,论文报告 SSPO 在 BrowseComp、GAIA、FRAMES 上持续超过 GRPO,并达到或超过训练两倍 gradient steps 的 GRPO;额外成本约为每步 5%,来自一次额外 forward pass。

与 wenjun 方向的关系:可直接迁移到 Code Agent:把 Evidence Anchor 换成 failing test、相关 diff、调用栈、静态分析事实或最小反例;teacher 只告诉 policy “哪一步缺了什么证据”,而不是泄露完整 patch。它也可以作为 WMRL 的局部校正信号:world model 给出 step uncertainty,真实 verifier anchor 决定更新强度。


#5. CAKE:让 Compiler、Verifier 与 Kernel Agent 一起演化

  • 类别Code Agent / Systems / Self-evolving Agent / Evaluation
  • 标题CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution
  • 来源与日期:arXiv:2608.12629;2026-08-14 新批次
  • 一句话核心贡献:设计硬件显式、可类型检查的 CAKE IR,使 Agent 能控制 warp role、memory movement、同步和 pipeline;编译器返回局部正确性/性能诊断,并把重复失败升级为 verifier rule、IR primitive、cost-model calibration 或 reusable tactic。

关键结果

  • B200 上 implementation-hidden Flash-KMeans clean start,在 8,000 万 token 预算下,最佳 CAKE IR candidate 达到 tuned FlashML 的 1.144×,直接 CUDA/PTX 只有 0.928×;
  • Agent 生成的 Kimi Delta Attention 相对官方 FlashKDA 达到 2.05× 几何平均加速,并通过端到端 serving 验证;
  • dispatcher-backed KNN/KMeans 在 400 多个 shape 上提高 1.42×–2.12×
  • 4 个 kernel 修改以 upstream PR 形式提供。

为什么值得关注?

这不是普通“LLM 写 CUDA”。核心是重新设计 Agent action space 与反馈通道:既不让高层 DSL 隐藏关键 schedule,也不让 raw CUDA/PTX 把错误埋在难以定位的编译/运行结果里。harness 还能从历史失败中升级自己,但所有新规则都要经过 kernel corpus 的 test gate,避免错误经验永久污染系统。

与 wenjun 方向的关系:它给 self-evolving code agent 一个很具体的范式:环境不是固定编译器,而是可被 Agent 经验改造、同时又由回归测试约束的学习系统。可进一步研究“哪些 failure 应进入 policy 参数,哪些应成为 verifier rule,哪些应成为新 primitive”,这正是 agent 预训练数据如何塑造能力与外部 harness 如何塑造能力的分工问题。


#三、其他值得扫读的新论文与动态

#6. LoongReflect:把 reflection 训练成可回退轨迹树上的 memory-control policy

  • 类别LLM Agent / Post-training RL / Memory / Tool-use
  • 标题LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation
  • 来源与日期:arXiv:2608.11967;2026-08-14 新批次
  • 一句话核心贡献:在可逆 trajectory tree 上定义显式 reflect/backtrack action;快通道只蒸馏 reflection/backtracking tokens,慢通道用 outcome GRPO 优化完整轨迹,通过 look-ahead/extragradient 式协调缓解“局部反思、全局才知对错”的监督错位。
  • 判断:它比泛化的“让模型自我反思”更有研究价值,因为反思被操作化为 working-memory update 与 branch deletion。要重点检查 teacher privilege、树搜索预算以及 backtrack lesson 是否真正跨任务迁移。

#7. Replica / Faraday:把“复现论文”变成可训练的 AI Scientist 任务空间

  • 类别Scientific Agent / Code Agent / Post-training RL / Evaluation
  • 标题Training AI Scientists to Replicate Research
  • 来源与日期:arXiv:2608.13331;2026-08-14 新批次
  • 一句话核心贡献:构建论文复现任务空间 Replica 与自动生成的 rubric judge,并 post-train 27B 参数 Faraday;Faraday 把 coding agent 当工具,在 held-out replication tasks 上超过论文所测的 Claude Opus 4.8 与 GPT-5.5。
  • 判断:亮点不是模型排行榜,而是把“论文遗漏了哪些实验细节”变成需要 hypothesis-driven exploration 的长轨迹任务。需要审计 rubric judge 的可博弈性、复现任务的领域覆盖,以及 Faraday 调用强 coding model 带来的真实成本。

#8. Vero:repository-level joint code-and-proof benchmark

  • 类别Code Agent / Evaluation / Formal Verification
  • 标题Vero: Can AI Agents Build Formally Verified Software Repositories?
  • 来源与日期:arXiv:2608.13522;2026-08-14 新批次
  • 代码/数据sunblaze-ucb/vero
  • 一句话核心贡献:提供 43 个来自 Python、Dafny、Verus、Coq 真实项目的多模块 Lean 4 repository 实例,同时评估 proof-only 与 code-and-proof;还允许 Agent 形式化证明 specification 不可满足或 reference code 错误,以审计 benchmark 本身。
  • 结果/判断:最强配置完整解决 27/43,最难仓库中没有关闭任何 specification。相比 SWE-bench,它把 reward 从 tests 推进到 machine-checked contracts,但预先给定 API 和人工规格仍比真实需求理解更干净。

#9. LittleLearner:用受控预训练暴露研究“能力如何形成”的因果窗口

  • 类别Pretraining Data / Foundation Model Training / Continual Learning
  • 标题LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
  • 来源与日期:arXiv:2608.13545;2026-08-14 新批次 / HF Papers 8 月 13 日
  • 一句话核心贡献:从 FineWeb-Edu 过滤出 88B-token 的 K–5(幼儿园到五年级)语料 LittleCurriculum,并从头训练 5B 模型 LittleLearner,构造知识暴露边界可解释的基础模型研究沙箱。
  • 结果/判断:初步实验表明 post-training 与 in-context learning 能帮助模型更好使用已有知识,却没有显著抬升 out-of-scope 能力。它比在 web-scale 模型上猜“某能力是否见过”更适合研究 curriculum、知识注入、迁移、遗忘和 emergence;但 K–5 过滤器不可能完美等价于概念因果隔离,仍需 contamination audit。

#10. Intern-S2-Preview:科学 Agent 基座把 pretraining、multi-task RL、agentic RL 与 memory decoder 串起来

  • 类别Foundation Model Training / Scientific Agent / Post-training RL / Continual Learning
  • 标题Intern-S2-Preview: Scientific Agentic Foundation Model
  • 来源与日期:arXiv:2608.13505;2026-08-14 新批次;HF Daily Papers 8 月 14 日收录(运行时 42 upvotes)
  • 模型internlm/Intern-S2-Preview
  • 一句话核心贡献:从 scientific multimodal pretraining 出发,统一 SFT、多任务 RL、black/white-box agentic RL 与 on-policy distillation,并加入 partial rollout + off-policy correction、adaptive length regularization、online speculative decoding、trace-aware experience assembly 等系统技术。
  • 判断:397B 主干外接单独训练的 Memory Decoder,在冻结 backbone 时将 Biology-Instructions 平均分从 56.92 提到 60.32,值得关注“外部参数记忆 vs 持续更新主模型”的架构分工。技术报告范围很大,需将每项工程技巧的独立贡献与超大模型规模效应分开看。

#11. LycheeMemory V2:Agent memory 的成本关键在 consolidation 粒度

  • 类别LLM Agent / Memory / Context Compression / Systems
  • 标题LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
  • 来源与日期:arXiv:2608.12990;HF Papers 2026-08-13,8 月 14 日 Daily 收录
  • 代码LycheeMem/LycheeMem
  • 一句话核心贡献:不再每轮调用 LLM 做 eager consolidation,而是按语义边界批量形成 segment,再编码成上下文独立、带类型的 memory records,并通过轻量结构化索引规划检索。
  • 结果/判断:使用 GPT-4.1-Mini 时,论文报告 LoCoMo 89.22%、LongMemEval-S 92.20%;相对 A-Mem,构建 token 分别下降 86.0% 和 75.9%,且不增加 query-time token。它延续昨日 COMPINT 的问题:成本下降之外,应额外检查 constraint、时间和负证据是否在 segment finalization 时丢失。

#12. AutoDesign:让 meta-harness optimizer 递归改进 Code Agent 的设计工作流

  • 类别Code Agent / Self-evolving Agent / Harness / Evaluation
  • 标题AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
  • 来源与日期:arXiv:2608.13560;HF Daily Papers 8 月 14 日收录(运行时 31 upvotes)
  • 项目GitHub / 项目页
  • 一句话核心贡献:meta-harness optimizer 根据 rollout feedback 指导 code agent 递归改进 DesignHarness,并以 paper-to-poster 长时域任务构建 PosterBench。
  • 结果/判断:论文报告 Main Track 得分 78.32,比所测 Claude Design 高 7.45;七种 agent/model 组合加载 learned harness 后平均从 54.99 提到 67.39。自主循环在约 40 分钟、253 次 tool call、11 次编辑、低于 3 美元条件下达到平均 conference-poster 质量。它是“自演化发生在 harness 而不是权重”的好案例,但仍需跨设计任务验证,防止只对 PosterBench 过拟合。

#13. Code LLM memorization probe 需要区分 memorization 与 representation load

  • 类别Code Intelligence / Pretraining Data / Evaluation
  • 标题Memorization Diagnostics for Code LLMs Should be Scale-Aware
  • 来源与日期:arXiv:2608.12771;2026-08-14 新批次
  • 一句话核心贡献:指出 synonym fuzzing、dead-code insertion、log-prob 等 memorization probe 随模型变大而失效;用可逆数学变换将表示负担与记忆效应分开,显示大模型可能既见过答案,也能稳健跨越表面形式变化。
  • 判断:它不意味着 contamination 不重要,而是提醒代码数据质量研究不要把“改个变量名性能不掉”直接解释为没有背题,也不要把“性能掉了”直接解释为纯记忆。更好的测试要同时控制语义、表示负担、解族等价性和真实 repo transfer。

#四、今日最值得精读的 3 篇

  1. Scaling Automatic Research Agents via World Models:与 LLM model-based RL / Dreamer Agent 最直接;重点读 anchor signal、reward bias/noise 建模,以及 imagined evaluation 是否支持真正的反事实 rollout。
  2. Latent On-Policy Self-Distillation:连接 latent representation、experience retrieval、dense credit 和 policy internalization;重点看防止 latent context 变成答案捷径的实验。
  3. The Objective Is the Bottleneck:篇幅和实验域可能不大,但研究判断很关键——world model 的 representation quality 必须由 planner 可用性和 reachability 衡量,而不是只看预测误差。

联读建议:WMRL + Objective Bottleneck 组成“怎么用 imagined rollout、怎么避免 planner 读错 latent state”;LOPD + SSPO + LoongReflect 组成“经验如何变成 dense supervision,以及长轨迹每一步如何分配信用”。


#五、今日最值得跟进的 3 个 repo / model / dataset

  1. bingreeky/LOPD

- 对应 Latent On-Policy Self-Distillation;GitHub API 核验到仓库于 8 月 13 日创建、8 月 14 日仍更新。

- 跟进重点:latent composer/retriever 是否已完整开源;复现 EnvScaler、BFCL、ACEBench 与 LiveCodeBench;可直接改造成 experience-conditioned world-model teacher。

  1. hkust-nlp/SSPO

- 对应深度搜索 Agent 的 step-level self-distillation。

- 跟进重点:Evidence Anchor 的构造成本与信息泄露控制;将网页 evidence 换成代码 Agent 的 failing test、stack trace、static fact,做 step-level credit assignment。

  1. Yaxin9Luo/AutoDesign

- 已开源 DesignHarness 和递归优化框架,仓库在 8 月 14 日创建并持续更新。

- 跟进重点:把 poster domain 换成 repo repair / kernel optimization,测试 learned harness 的跨任务、跨模型迁移;特别关注治理机制是否能阻止 harness 膨胀和局部 benchmark overfitting。

备选资源:如果今天更关注基础模型训练机制,优先跟进 Intern-S2-Preview 模型页 和 LittleLearner/LittleCurriculum 后续发布;如果更关注长期记忆工程,跟进 LycheeMem


#六、研究机会 / Ideas

#Idea 1:Planner-aware World Model RL for Code Agents

把 WMRL 与 Objective Bottleneck 合并成一个面向 Code Agent 的闭环:

  • world model 预测 patch 后的 tests、build state、依赖变化、潜在回归和执行成本;
  • 不直接用 latent Euclidean distance 做 planning cost,而用真实 action reachability、最小修复步数、verifier transition 学习 cost;
  • 保留少量真实 sandbox anchor,按 uncertainty × novelty × expected impact 自适应选取;
  • 对 reward bias 做在线单调校准,对不同 failure family 分别估计方差;
  • 评估 model accuracy、planner regret、model exploitation rate 和真实 wall-clock speedup,而不只看最终 pass rate。

核心问题:LLM Agent 的 world model 应该预测“未来长什么样”,还是预测“从这里是否能以低成本到达可验证目标”?

#Idea 2:Latent Experience Composer 的可解释分槽与持续学习

基于 LOPD,把连续 privileged context 拆成三类 latent slots:

  1. state slots:当前任务和环境的隐变量;
  2. transition/skill slots:过去哪些 action 在什么条件下有效;
  3. risk/constraint slots:失败、禁区、过期条件和 verifier 证据。

再设计干预实验:屏蔽某类 slot、交换不同任务的 slot、让经验发生冲突、连续加入新 domain,观察 teacher distribution、student policy 和遗忘程度。这样能回答:LOPD 学到的是可迁移机制、可压缩记忆,还是难以审计的 soft prompt shortcut?

#Idea 3:从 Evidence Anchor 到 Verifier Anchor 的长轨迹 credit assignment

将 SSPO 的 Evidence Anchor 与 LoongReflect 的 reflect/backtrack action 用于 repository-level Agent:

  • anchor 不提供正确 patch,只提供 failing test、call graph、minimal counterexample、相关 invariant;
  • outcome reward 决定正负方向,teacher/world model 只分配每一步的更新幅度;
  • reflection 更新 working memory,backtrack 删除不可靠分支但保留带 provenance 的 corrective lesson;
  • 以 Vero 的 proof obligation 或 CAKE 的 verifier rule 作为强 anchor;
  • 比较 outcome-only GRPO、process reward、OPSD、SSPO 和 tree-level memory control 的偏差—方差与样本效率。

核心问题:能否给长轨迹 Agent 足够密的信用信号,同时不把 oracle solution 偷渡给 student、也不把成功策略蒸馏成单一短路径?


#七、来源、社区热度与限制

  • arXiv:主体来自 cs.AI、cs.CL、cs.LG、cs.SE、stat.ML 官方 RSS 8 月 14 日批次,并回到 PDF 全文核验重点方法和数字。
  • Hugging Face:官方 API 用于发现 Daily Papers、模型/项目关联与社区注意力。运行时 Intern-S2 42 upvotes、AutoDesign 31、PlayWorld 33、Alaya-EVOKE 82;这些只代表关注度,不代表实验可靠性。
  • GitHub / 项目页:已直接核验 LOPD、SSPO、AutoDesign、LycheeMem、Vero、PlayWorld 等仓库或项目页可访问;没有明确官方 repo 的工作不强行配链接。
  • Google Scholar:本次查询返回 403,无法作为增量来源;学术身份和论文日期改由 arXiv/HF/作者项目核验。
  • X/Twitter:搜索页面可返回 HTML 壳,但无法稳定取得可审计正文和时间戳,因此未引用“技术大牛刚刚发帖”等不可验证说法。机构/作者动向以论文、HF、GitHub 和项目页替代。
  • OpenReview:搜索入口可访问,但本窗口没有发现比 arXiv 新批次更贴合 wenjun 主线、且能稳定核验的独立新增条目。
  • 结论边界:以上结果多为刚发布预印本,WMRL、LOPD、Faraday、CAKE 等 headline 数字需要代码、数据和等预算复现;文中已区分论文报告与本文研究判断,不把摘要数字视为已独立验证的事实。