主题归档 · 2026-08-01
讲解 CL-Bench / CL-bench 这个新 benchmark 的核心思想、任务例子、评测方式,以及围绕它展开的上下文学习、规格归纳、技能抽取、持续学习和参数化记忆研究。
论文精读 · 2026-06-15
详解 Just-In-Time Reinforcement Learning 如何把历史轨迹记忆转成 advantage,在推理时直接加到候选动作 logits 上,从而在不更新参数的情况下实现类似 KL 约束策略优化的 agent 持续学习。
主题归档 · 2026-05-10
面向初学者和研究选题,系统解释长上下文退化的现象、机制、评测、模型与系统方案,以及它如何连接 RAG、上下文压缩、KV cache、Agent memory、代码智能、长轨迹 RL 和 latent-space reasoning。