#2026-08-05 AI/LLM 最新论文与研究热点简报

检索时间:2026-08-05 08:00 CST。

主要来源:Hugging Face Daily Papers、arXiv 最近提交页与论文页、GitHub Search。X/Twitter 页面可访问但未登录环境下有效检索受限,本期未把 X 作为主要证据源,改用 HF/arXiv/GitHub/项目页交叉核验。

时间范围:优先覆盖 2026-08-03 至 2026-08-05;为补足与 wenjun 方向高度相关的 Agent memory / Code Agent / world-model RL 线索,少量扩大到 2026-07-30 至 2026-08-01。

#0. 今日判断:Agent 研究正在从“会调用工具”转向“可管理状态、可生成技能、可定位失败、可在潜空间做信用分配”

过去 24-48 小时最值得关注的信号不是某个单点 benchmark,而是几个方向同时收敛:

  1. 长程 Agent harness 开始显式外置任务状态:LongHorizon-Harness 把长任务执行拆成 manager / executor / auditor,并只把环境验证过的事实写入 task state。这与长轨迹 RL 里的 state abstraction、belief update 非常接近。
  2. Agent skill 从“人工写工具/经验总结”走向“RL 生成 + verified synthetic trajectory 训练”:Skill-α 和 SKT 分别从技能生成与技能使用训练切入,说明“技能库 + 可验证轨迹”可能成为 Agent 预训练/后训练的一条主线。
  3. 潜空间推理出现更直接的 credit assignment 机制:GradCuit 把可优化 latent state 插在 Transformer 层内,使 continuation-token log-prob 对 latent state 可微,核心价值在于让 test-time latent reasoning 不再只是黑盒 prompt/hidden-state trick。
  4. 代码 Agent 评测更贴近真实协作环境:SWE-Touch 关注用户在 agent 执行中途直接改代码的冲突场景;Deletion Avoidance 论文指出模型倾向“加 guard 而不是删错代码”,这对代码智能的评测与奖励设计都很关键。
  5. World model / model-based RL 的语言 Agent 借鉴点来自 VLA/视频 world model:WCM 和 WorldExam 虽不是纯 LLM Agent 论文,但分别强调 critic 表征需要世界建模目标、world model 评测要看 reactivity,而不只是视觉质量/指令遵循。

#1. 重点论文与动态

#1.1 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

  • 链接:https://arxiv.org/abs/2608.01964
  • HF:https://huggingface.co/papers/2608.01964
  • Repo / 项目页:https://github.com/AMAP-ML/LongHorizon-Harness ,https://lh-harness.pages.dev
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:LLM Agent / Tool-use / Evaluation / Long-horizon Agent
  • 一句话核心贡献:把长程 Agent 执行重新表述为显式任务状态管理问题,提出 Manage-Execute-Audit loop:manager 维护任务状态、fresh-context executor 执行子任务、read-only auditor 只把环境验证过的事实写回状态。

为什么值得关注

这篇直接命中长轨迹 Agent 的核心痛点:长上下文里同时塞执行轨迹、任务状态、自我评估,会导致状态漂移和错误自证。LongHorizon-Harness 的关键不是又加了一个 agent,而是把 state update 从模型主观叙述里拿出来,要求由环境验证后再写入外部状态。论文摘要报告在 WeaveBench、Terminal-Bench 2.1、OSWorld 2.0 上有明显提升,例如 Qwen 3.7-Plus 在 WeaveBench 从 51.8% 到 80.7%。

与 wenjun 方向的关系

这几乎是 LLM Agent 版的 belief-state management。若做 model-based RL / Dreamer for LLM Agent,可以把 MEA loop 视为一种手工设计的 latent state filter:manager 是 state estimator,executor 是 policy rollout,auditor 是 environment-grounded observation model。值得进一步思考:能否把 auditor 的 verification signal 变成 state learning / dynamics learning 的监督?


#1.2 Progressive Agent Skill Generation via Reinforcement Learning

  • 链接:https://arxiv.org/abs/2608.01678
  • HF:https://huggingface.co/papers/2608.01678
  • Repo:https://github.com/ejhshen/skill-alpha
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:LLM Agent / Post-training RL / Skill Learning
  • 一句话核心贡献:提出 Skill-α,把 agent skill 生成建模为 sequential editing process,并用 rollback reward 评估每一步编辑是否提升下游执行效果。

为什么值得关注

Agent skill 的难点在于:一个 skill 写得好不好,不能只看语言是否漂亮,而要看它是否改善下游任务执行。Skill-α 的思路是把技能构造拆成可评估的连续编辑步骤,用 RL 信号逐步优化技能质量。这比传统“从经验中总结 skill”的 pipeline 更接近可学习的技能发现。

与 wenjun 方向的关系

如果把长轨迹 Agent 的经验压缩为可复用技能,那么 Skill-α 提供了一个“trajectory → skill → downstream reward”的训练范式。它也提示一个研究问题:skill 是否可以被视为 agent 的 latent option?rollback reward 是否可扩展为 option discovery 中的局部 credit assignment?


#1.3 SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

  • 链接:https://arxiv.org/abs/2608.02287
  • HF:https://huggingface.co/papers/2608.02287
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:LLM Agent / Synthetic Data / Skill-use / Post-training
  • 一句话核心贡献:提出 SKT verified data synthesis pipeline,从 2,000 个 public skills 合成 4,000 个任务包与 27,164 条 verified trajectories,并构造 SkillEval 评测模型是否真的会识别、调用、组合技能。

为什么值得关注

这篇关注的不是 skill 本身,而是“有了 skill 后模型是否会用”。它通过单技能/多技能配置、规则与 agent-based verification、feedback-guided repair 过滤,只保留真实使用每个 required skill 的成功轨迹。这很像 Agent 领域的 instruction tuning 数据工程升级:不是只合成答案,而是合成可执行、可验证、技能接地的轨迹。

与 wenjun 方向的关系

这和 agent 预训练数据如何塑造能力高度相关。SKT 的 pipeline 暗示:未来 Agent 训练数据的基本单位可能不是 instruction-response,而是“skill-grounded executable trajectory”。这对代码 Agent、工具使用 Agent、长程任务 RL 都有启发。


#1.4 GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

  • 链接:https://arxiv.org/abs/2608.02585
  • HF:https://huggingface.co/papers/2608.02585
  • Repo / 项目页:https://github.com/Yuzhaoxin946/GradCuit ,https://yuzhaoxin946.github.io/GradCuit/
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:Latent Reasoning / Test-time Scaling / Credit Assignment
  • 一句话核心贡献:在 Transformer 中间层插入可优化 latent states,让 continuation-token log-prob 经由 causal self-attention 对 latent states 有可微信用分配路径,从而在测试时冻结模型参数、优化实例特定连续状态。

为什么值得关注

这是本期最贴近“latent-space reasoning”的论文。现有 latent reasoning 方法常通过 decoded tokens 或隐状态技巧间接影响推理轨迹,credit assignment 不清楚。GradCuit 的核心在于建立从整段 continuation reward 到前置 latent state 的梯度路径,使 latent update 对后续推理的影响更可解释。

与 wenjun 方向的关系

如果 wenjun 关注“LLM 是否能在潜空间做 search/planning”,这篇值得精读。它给出一个可操作问题:test-time latent state 能否扮演 model-based RL 里的 planning variable?进一步能否把环境 reward / verifier reward 直接反传到 latent plan,而不是只靠 token-level RL?


#1.5 SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

  • 链接:https://arxiv.org/abs/2608.02499
  • HF:https://huggingface.co/papers/2608.02499
  • Repo / 项目页:https://github.com/Trae1ounG/SWE-Touch ,https://trae1oung.github.io/SWE-Touch/
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:Code Agent / Evaluation / Human-Agent Collaboration
  • 一句话核心贡献:提出 SWE-Touch,用 Counter-Edits 模拟用户在 agent 做任务中途修改 task-relevant code 的真实共享工作区场景,评测 coding agent 是否能理解并响应冲突修改。

为什么值得关注

多数 SWE-bench 类评测默认 agent 独占仓库,用户只通过 message 参与。但真实开发里,人会在 agent 执行期间看代码、改代码、打断或反向修改。SWE-Touch 把这个协作摩擦显式纳入评测:当用户改了关键区域,agent 是无视、覆盖、误解,还是能重新规划?

与 wenjun 方向的关系

对 self-evolving code agent 和代码智能 RL 来说,这类 benchmark 更接近真实闭环:环境不是静态 repo,而是有人类/其他 agent 并发干预的 workspace。奖励设计不能只看最终 test pass,还要看是否尊重外部状态变化。


#1.6 ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

  • 链接:https://arxiv.org/abs/2608.02358
  • HF:https://huggingface.co/papers/2608.02358
  • Repo:https://github.com/declare-lab/ScrambleToolBench
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:Tool-use / LLM Agent / Evaluation / Behavioral Reasoning
  • 一句话核心贡献:构造一个去语义化的交互式 terminal benchmark,隐藏工具行为并加入 mapping drift、随机失败、时间窗口,测试 Agent 能否通过试错推断并更新工具行为假设。

为什么值得关注

它的设计很有意思:不给语义化 tool schema,让 Agent 不能靠预训练先验猜工具名,而必须通过交互行为推断工具映射。论文标题点出一个现象:即便 agent 已经有“自己的地图”指向下一步,也可能继续穷举搜索,说明当前模型在假设维护与策略利用上仍很弱。

与 wenjun 方向的关系

这是 LLM Agent 的 system identification 问题。若做 model-based RL,可以把 unknown tools 看成未知 transition function,agent 需要通过实验学习 latent dynamics。ScrambleToolBench 可作为“语言 Agent 环境模型学习”的 toy domain。


#1.7 DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

  • 链接:https://arxiv.org/abs/2608.01827
  • HF:https://huggingface.co/papers/2608.01827
  • Repo / 项目页:https://github.com/Halcyon-Zhang/DeepVoyager-VL ,https://halcyon-zhang.github.io/DeepVoyager-VL/
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:LLM Agent / Multimodal Agent / Long-horizon Search
  • 一句话核心贡献:提出 vision-in-the-loop 的长程多模态 deep search 框架,让视觉证据不只出现在输入/答案阶段,而能驱动中间检索与推理链扩展。

简评

这篇面向多模态 open-world 信息获取,但它对一般 Agent 有启发:环境证据应该进入中间搜索控制,而不是只作为 prompt 初始条件。对长程 Agent RL 来说,它强调 observation acquisition policy 的重要性。


#1.8 WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

  • 链接:https://arxiv.org/abs/2608.02603
  • HF:https://huggingface.co/papers/2608.02603
  • Repo / 项目页:https://github.com/YuxueYang1204/worldexam ,https://worldexam.github.io/
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:Model-based RL / World Model / Evaluation
  • 一句话核心贡献:提出 WorldExam,用 Visual Quality、Control Adherence、Spatial Consistency、World Reactivity 四层诊断 controllable video generation model 是否真的具备 world model 的场景反应能力。

简评

虽然是视频 world model benchmark,但“从外观到反应性”的评测思想可迁移到 LLM Agent world model:一个语言 world model 不应只复述环境描述或预测表面下一步,而要能根据状态推断未显式说明的后果。


#1.9 WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

  • 链接:https://arxiv.org/abs/2607.29613
  • HF:https://huggingface.co/papers/2607.29613
  • Repo / 项目页:https://github.com/sylvestf/WCM ,https://sylvestf.github.io/wcm-homepage/
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-07-31
  • 类别:Model-based RL / VLA / Post-training RL / World Model
  • 一句话核心贡献:指出 VLA RL critic 若只用单帧/单 latent 做 scalar return regression,会错失部分可观测控制中的时间结构;提出带未来 latent state prediction 目标的 World Critic Model。

为什么值得关注

WCM 的诊断很适合迁移到 LLM Agent:critic 的 state representation 如果没有 dynamics/world-modeling objective,就可能只是拟合回报,无法捕捉跨步依赖。对长程任务尤其致命。

与 wenjun 方向的关系

这与 Dreamer-style LLM Agent 的核心问题完全对齐:critic / value / world model 不应分裂训练。可以思考:在文本工具环境里,是否也应训练一个“world critic”同时预测未来 observation/state 和 value,而不是只用 trajectory-level reward 做 PPO/GRPO?


#1.10 Zero-Mem: Zero-Token Memory Operations for LLM Agents

  • 链接:https://arxiv.org/abs/2607.29377
  • HF:https://huggingface.co/papers/2607.29377
  • Repo:https://github.com/TheMoon0815/Zero-mem
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-07-31
  • 类别:LLM Agent / Memory / Context Compression / Systems
  • 一句话核心贡献:提出 zero-token memory operations:最终 QA 之外不调用 LLM、不消耗 LLM 输入/输出 token,用 entity-context graph 与 temporal hierarchy 组织原始交互轨迹并做确定性检索校准。

简评

Zero-Mem 对通用上下文压缩器方向有价值:它不急着把记忆摘要化,而是保留原始 evidence,通过结构化索引和检索控制降低 token 成本。这与“不要让总结丢证据”的 Agent memory 经验一致。


#1.11 Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

  • 链接:https://arxiv.org/abs/2607.28802
  • HF:https://huggingface.co/papers/2607.28802
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-07-30
  • 类别:LLM Agent / Evaluation / Failure Analysis
  • 一句话核心贡献:提出 interaction-centric failure taxonomy,把 Agent failure 定位到 model、harness、user、tool、memory、environment 等组件之间的交互边,并标注修复责任方。

简评

这篇适合做 Agent 系统实验的诊断工具。它的关键是避免把所有失败都归因于“模型不行”:同一个 visible failure 可能需要模型后训练、harness 改造、环境 redesign 或 benchmark 修复。


#1.12 To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

  • 链接:https://arxiv.org/abs/2607.28887
  • HF:https://huggingface.co/papers/2607.28887
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-07-30
  • 类别:Code Agent / Code Intelligence / Evaluation
  • 一句话核心贡献:系统测量 LLM code editing 的 deletion avoidance:模型常保留应删除代码、用 guard/fallback 绕过测试;并构造 CanItDelete 删除型 benchmark。

简评

论文摘要报告:在 SWE-bench Verified 上,五个领先模型即使解决任务,删除召回最高也只有 71.7%;到达正确文件超过 92%,但精确删对行低于 52%;29.0% passing patches 使用 Guard-and-Go。这个现象对代码 Agent RL 很重要,因为 test-passing reward 会鼓励“加补丁绕过”而不是真正删除错误逻辑。


#1.13 DAPD: Dual-Anchored Policy Distillation

  • 链接:https://arxiv.org/abs/2608.01735
  • HF:https://huggingface.co/papers/2608.01735
  • 来源:arXiv / Hugging Face Daily Papers
  • 日期:2026-08-03
  • 类别:Post-training RL / Policy Distillation / Reasoning Model
  • 一句话核心贡献:诊断 on-policy self distillation 中的 privilege illusion:teacher 使用 privileged information 后,student 学到推理时无法复现的行为;提出 Dual-Anchored Policy Distillation 对齐 privileged/reference 与 rollout/inference 信息路径。

简评

对后训练很有现实意义。很多 agent/RL 数据来自更强 teacher 或带额外环境信息的 oracle,如果不处理 train-test information asymmetry,student 可能学会“好像知道隐藏信息”的策略。DAPD 的问题意识可迁移到 Agent 轨迹蒸馏。


#2. GitHub / 项目动态补充

以下是本期检索到、值得跟进的 repo/model/dataset 线索。星数与更新时间来自 GitHub Search 检索结果,可能随时间变化。

  1. AgentR1/Agent-R1

- 链接:https://github.com/AgentR1/Agent-R1

- 动态:2026-08-04 更新,约 1.6k stars。

- 关注点:端到端 RL 训练 LLM Agents。适合作为 Agentic RL 工程实现与实验基线继续跟踪。

  1. xxzcc/Awesome-Credit-Assignment-in-LLM-RL

- 链接:https://github.com/xxzcc/Awesome-Credit-Assignment-in-LLM-RL

- 动态:2026-08-04 更新,约 127 stars。

- 关注点:LLM reasoning / agentic RL 中的 credit assignment 论文、taxonomy、benchmark。与 GradCuit、Skill-α、长轨迹 RL 都直接相关。

  1. AMAP-ML/LongHorizon-Harness

- 链接:https://github.com/AMAP-ML/LongHorizon-Harness

- 关注点:长程 Agent harness 与 MEA loop 实现。建议跟踪其在 OSWorld/Terminal-Bench/WeaveBench 的配置与 agent adapter 设计。

  1. Yuzhaoxin946/GradCuit

- 链接:https://github.com/Yuzhaoxin946/GradCuit

- 关注点:test-time latent reasoning 的代码实现。如果开源内容完整,值得重点看 latent insertion layer、reward-weighted gradient、inference-time optimization 开销。

  1. Trae1ounG/SWE-Touch

- 链接:https://github.com/Trae1ounG/SWE-Touch

- 关注点:用户中途改代码的 Counter-Edits benchmark。适合作为代码 Agent 协作鲁棒性评测素材。

  1. declare-lab/ScrambleToolBench

- 链接:https://github.com/declare-lab/ScrambleToolBench

- 关注点:去语义化工具发现与动态 mapping drift,可用于研究 Agent 的探索、假设维护和工具动力学学习。


#3. 今日最值得精读的 3 篇

  1. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

- 精读理由:最贴近 wenjun 近期关注的 latent-space reasoning;关键在于把 latent state 与 continuation reward 的信用分配路径做得更直接。

  1. LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

- 精读理由:对长程 Agent 状态管理、环境验证、harness 设计都有直接启发;可作为 model-based Agent 的显式 state-management baseline。

  1. Progressive Agent Skill Generation via Reinforcement LearningSKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

- 精读理由:两篇构成“skill 生成—skill 使用训练”的组合线索,适合思考 agent 预训练数据与后训练目标如何塑造可复用程序性能力。

备选:如果今天更想看代码智能,则把第三篇换成 SWE-Touch,它对真实协作 coding agent 评测更直接。


#4. 今日最值得跟进的 3 个 repo/model/dataset

  1. LongHorizon-Harness:https://github.com/AMAP-ML/LongHorizon-Harness

- 看点:MEA loop、外部 task state、auditor verification、AgentAdapter。

  1. GradCuit:https://github.com/Yuzhaoxin946/GradCuit

- 看点:latent state 插入层、测试时优化、reward-to-latent credit assignment。

  1. SWE-Touch:https://github.com/Trae1ounG/SWE-Touch

- 看点:Counter-Edits 生成、触发时机、coding agent 对并发用户修改的鲁棒性。

补充跟进:Agent-R1、ScrambleToolBench、Zero-Mem、WCM。


#5. 研究机会 / idea

#Idea 1:把 LongHorizon-Harness 的 MEA loop 形式化为 LLM Agent 的 belief-state learning

LongHorizon-Harness 现在像是工程化的显式状态管理。可以进一步问:

  • manager 维护的 task state 是否可以学习成 latent belief state?
  • auditor 的环境验证能否作为 observation likelihood / state correction signal?
  • executor 的 fresh-context rollout 是否可作为 Dreamer-style imagination / policy rollout 的可控接口?

一个可做的小实验:在 mini tool environment 中比较三种状态表示:纯上下文、手写 task state、学习到的 latent state,并评估长程任务错误传播率。

#Idea 2:Skill 作为 option:用 rollback reward 做 agent skill 的局部信用分配

Skill-α 与 SKT 共同提示:Agent 能力可能通过“可复用技能单元”组织,而不是只靠大上下文记忆。可研究:

  • skill 生成是否等价于 option discovery?
  • rollback reward 能否判断某个 skill edit 对长期任务价值的边际贡献?
  • SKT 的 verified trajectory 能否提供 skill initiation / termination / policy 的监督?

这条线很适合连接长轨迹 RL、Agent 预训练数据、技能库自演化。

#Idea 3:从 GradCuit 到 latent planning:把 verifier reward 反传到 test-time latent plan

GradCuit 给了一个可微信用分配通道。可以进一步探索:

  • 在代码 Agent 或工具 Agent 中,把 unit test / environment verifier 的 reward 作为 latent optimization 信号是否可行?
  • latent state 是更像 scratchpad 压缩、plan embedding,还是 value-aware hidden memory?
  • 与 token-level sampling/search 相比,latent optimization 在长程任务上是否更省 token 或更稳定?

一个可控实验:选择小型可验证任务,让模型冻结,只优化一组 latent slots,对比 best-of-N CoT、tree search、latent optimization 的成功率与计算成本。


#6. 快速索引表

标题日期类别链接核心贡献
LongHorizon-Harness2026-08-03LLM Agent / Long-horizonhttps://arxiv.org/abs/2608.01964外置 task state + Manage-Execute-Audit,降低长程状态漂移
Progressive Agent Skill Generation via RL2026-08-03LLM Agent / RL / Skillhttps://arxiv.org/abs/2608.01678用 sequential editing 与 rollback reward 学习生成高质量 Agent skill
SKT2026-08-03Skill-use / Synthetic Datahttps://arxiv.org/abs/2608.02287从 2,000 skills 合成 verified skill-grounded trajectories
GradCuit2026-08-03Latent Reasoninghttps://arxiv.org/abs/2608.02585通过中间层 latent states 建立 test-time latent reasoning 的梯度信用分配
SWE-Touch2026-08-03Code Agent / Evaluationhttps://arxiv.org/abs/2608.02499评测用户中途修改代码时 coding agent 的协作鲁棒性
ScrambleToolBench2026-08-03Tool-use / Behavioral Reasoninghttps://arxiv.org/abs/2608.02358去语义化工具发现,测试 Agent 是否能通过交互推断工具行为
DeepVoyager-VL2026-08-03Multimodal Agenthttps://arxiv.org/abs/2608.01827vision-in-the-loop 长程多模态搜索
WorldExam2026-08-03World Model / Evaluationhttps://arxiv.org/abs/2608.02603从视觉质量到 world reactivity 的分层 world model 评测
WCM2026-07-31Model-based RL / VLAhttps://arxiv.org/abs/2607.29613用未来 latent prediction 改善 VLA RL critic 的时间结构表征
Zero-Mem2026-07-31Agent Memory / Context Compressionhttps://arxiv.org/abs/2607.29377最终回答外零 LLM token 的结构化记忆检索
Model or Harness?2026-07-30Agent Evaluationhttps://arxiv.org/abs/2607.28802用 interaction-centric taxonomy 定位 Agent 失败责任方
To Add Is Machine, To Delete Is Human2026-07-30Code Intelligencehttps://arxiv.org/abs/2607.28887测量 LLM code editing 的 deletion avoidance 与 Guard-and-Go
DAPD2026-08-03Post-training / Distillationhttps://arxiv.org/abs/2608.01735缓解 privileged teacher 到 inference-time student 的 privilege illusion