#2026-08-19 AI/LLM 最新论文与研究热点简报

覆盖窗口:截至北京时间 2026-08-19 08:00,重点覆盖 arXiv 在 8 月 18 日公开的周二批次(论文版本多标为 8 月 17 日),并结合 Hugging Face Papers、GitHub 与项目页核验。

检索与限制:逐项扫描 arXiv cs.AI / cs.CL / cs.LG / cs.SE / stat.ML recent 页面;下载并全文抽取 21 篇候选论文,核对方法、实验、数字和代码链接;同时查询 Hugging Face Papers API 与 GitHub API。arXiv API 本次超时,但 recent 页面和 PDF 均可访问;OpenAlex 搜索返回 503;Google Scholar 返回 403;X/Twitter 搜索没有稳定、可审计的公开时间线,因此不引用无法核验的社交帖子。HF 的 8 月 17 日榜单中,ClawGym II、HarnessEval-W、τ0-VLA 与 SA-MRPO 也进入可见热点。

#一、早读结论:今天最重要的 7 个信号

  1. Agentic RL 正从“针对一种环境训练”走向“穿过黑盒 harness 训练”:ClawGym II 不改 OpenClaw / Claude Code 内部控制流,在模型服务边界截获调用、还原 prefix tree,再用 PPO/GRPO 优化;这是把生产级 Agent runtime 纳入 RL 的关键工程抽象。
  2. 长轨迹 credit assignment 开始认真利用失败轨迹:TRCA 不等成功样本出现,而是从每个 action 引起的 evidence / execution / invalidity 状态转移中构造局部奖励;作者发现早期失败轨迹里 72.2% 的动作仍带可用 transition signal。
  3. “可回滚 Agent”必须同时回滚 transcript、环境与模型推理态:昨天 AgentRewind 强调 context/environment 对齐,今天 KV rollback audit 进一步证明,仅删除日志却保留旧 KV cache,会让被拒绝分支继续影响模型甚至造成敏感信息外泄。
  4. 通用上下文压缩器不能只看成功率和 token 数:压掉执行状态后,Agent 可能通过额外工具调用重新找回信息;任务成功率不变,却付出数倍 retrieval cost。压缩评估必须加入 state reacquisition cost。
  5. Code Agent 的 context engineering 出现统一解释:edit-time working set。不是“读得越多越好”,而是写入瞬间是否同时拥有这一修改依赖的耦合事实;错误规范文件甚至比没有规范更糟。
  6. Latent world model 的重点从“状态可解码”转向“状态是否影响规划几何”:SCALE 说明 latent 里含有任务状态还不够;若这些维度在 planner 的距离度量里权重太小,仍不会改变候选动作排序。
  7. OPD / OPSD 的老师影响比 prompt routing 更宽:同源 teacher 可跨语言、推理长度和领域迁移 reasoning behavior;这既解释 OPD 的泛化,也说明多教师能力会发生 seesaw,不能假设按领域路由就能隔离影响。

#二、重点精读(Top 5)

#1. ClawGym II:把 OpenClaw / Claude Code 当黑盒 rollout engine 做 Agentic RL

  • 类别LLM Agent / Code Agent / Agentic RL / Post-training RL / Systems
  • 标题ClawGym II: Exploring Black-Box RL on Agent Harness
  • 来源与日期:arXiv:2608.16798;v1 2026-08-17,进入 8 月 18 日 recent;Hugging Face Papers 8 月 17 日榜单(本次核验时 34 upvotes)
  • 一句话核心贡献:把复杂 harness 视为不透明执行器,在模型 serving boundary 代理并捕获所有调用,将碎片化、分叉调用恢复成 prefix tree,再适配 PPO/GRPO 做稳定的单 harness 与 mix-harness 训练。

为什么值得关注?

Agent RL 的真实 rollout 并不是干净的 (obs, action, reward) 串:Harness 会做 context compaction、重试、子代理分叉、工具编排,训练端看到的是大量碎片调用。ClawGym II 的工程路径是:

  1. 每个 task + harness 放入临时 sandbox,并发运行、结束销毁;
  2. Harness 保持原生黑盒逻辑,只把所有模型调用经 serving proxy 截获;
  3. 按共享前缀把调用恢复成树,复用重复 prefix,保留分支结构;
  4. 在树上适配 critic-based PPO 和 critic-free GRPO;
  5. 通过 token-in/token-out 与 token-level importance-sampling correction 控制训练/推理引擎偏差;
  6. 把不同 task–harness pair 混合训练同一 policy。

以 Qwen3-30A3B 为底模,通过 OpenClaw / Claude Code 训练后,ClawGym-Bench Pass@1 分别提升 9.98 / 14.81 个点,PinchBench 提升 11.71 / 17.28 个点;训练可稳定持续 200–400 optimization steps,mix-harness 模型匹配或超过单 harness 版本,并在 JobBench、OfficeQA 上继续有增益。

与 wenjun 方向的关系

  • 这是 Agentic RL 从 benchmark wrapper 走向生产 runtime 的直接方案;
  • prefix tree 正好提供共享前缀下 sibling branches,可用于 branch-level advantage 与 model-based counterfactual;
  • mix-harness 触及一个关键问题:模型究竟学到通用环境交互能力,还是学会某个 harness 的协议与恢复习惯?

研究判断与边界:论文解决的是黑盒 harness 的轨迹采集与训练稳定性,不等于解决长时域 credit assignment;所有分叉最终仍主要由 terminal / rubric outcome 驱动。下一步应把 tree node 的 state delta、局部 verifier 与世界模型预测误差接入 advantage。


#2. TRCA:成功轨迹稀缺时,从 action 引起的状态转移里分配 credit

  • 类别LLM Agent / Post-training RL / Credit Assignment / Long-horizon
  • 标题TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents
  • 来源与日期:arXiv:2608.16156;v1 2026-08-17,进入 8 月 18 日 recent;Beihang / Tsinghua / BAAI
  • 一句话核心贡献:不训练 PRM、也不依赖成功 anchor,直接根据 action 前后的状态转移评估 Evidence、Execution、Invalidity 三类 rubric,并把局部质量与“首次取得的新进展”转成 step-level advantage。

为什么值得关注?

早期 Agent RL 最棘手的阶段恰恰是 success-scarce:只有 terminal reward 时,绝大多数 rollout 都是同一个 0;而依赖成功轨迹构树或做 hindsight credit 的方法也无从启动。TRCA 把失败 rollout 拆开看,作者人工和 frontier judge 分析发现其中 72.2% 的动作仍包含 rubric-grounded 有效信号

TRCA 区分两种奖励:

  • Foundational Rubric Reward:对当前 transition 的证据获取、有效执行和无效/重复/倒退行为做带符号打分;
  • Breakthrough Rubric Reward:累计跟踪正向 Evidence / Execution 条件覆盖,只在新条件首次成立时奖励,避免同一进展反复刷分;
  • 再与 terminal outcome 合并,分别表达 local quality、incremental progress 与 final completion。

在 ALFWorld、WebShop 和 7 个 SearchQA benchmark 上,TRCA 均优于论文比较的基线;Qwen2.5-7B-Instruct 的 WebShop score 提升 6.0%–12.6%,Qwen2.5-3B 的 SearchQA 平均提升 1.9%–18.3%

与 wenjun 方向的关系:这与昨天 RGLT 的“transition utility”形成很强呼应:latent update、tool action 和 environment transition 都不该只模仿成功轨迹,而应回答“这一步新获取了什么证据、改变了什么可执行状态、是否让世界更接近目标”。对 Dreamer-like LLM Agent,可把 rubric 进一步替换为 learned world model 中的 state novelty、goal reachability 和 uncertainty reduction。

研究判断与边界:Rubric 本身仍依赖任务可形式化程度;如果 Evidence / Execution 条件由人工模板定义,扩到开放式 coding/research 会有维护成本。值得研究的是从 acceptance tests、state-delta telemetry 和 branch comparisons 自动归纳 rubric。


#3. Aborted but Not Forgotten:删掉回滚分支的文本,不代表模型忘了它

  • 类别LLM Agent / Systems / Security / KV Cache / Rollback
  • 标题Aborted but Not Forgotten: KV-Cache Retention Breaks Rollback Consistency in Language Agents
  • 来源与日期:arXiv:2608.15939;v1 2026-08-17,进入 8 月 18 日 recent;HKUST
  • 一句话核心贡献:形式化 rollback consistency,并用 same-token/different-cache 审计证明:若逻辑 abort 后复用旧 session KV,已从 transcript 删除的分支仍可影响后续决策;从 committed transcript 重建 cache 可关闭该通道。

为什么值得关注?

这篇与昨天的 AgentRewind 几乎是连续剧。AgentRewind 说恢复点必须对齐语言上下文和 workspace;本篇再补第三层:model-attended inference state。应用看到的 transcript 已回滚,serving engine 看到的 KV 却还包含旧分支,两层状态发生 silent divergence。

作者固定决策步骤的输入 token 完全相同,只改变 cache 是“保留 rejected branch”还是“从 committed transcript 重建”。在 7 个 3.8B–36B open-weight model family、63 个配对单元中,旧 KV 单独导致 25/63 单元发生受保护决策翻转,把敏感 artifact 发往攻击者 endpoint;请求 token 中均没有攻击者字符串。Fresh-cache rebuild 与 cold restart 为 0/63。LangGraph time-travel 的逻辑回滚也复现了 stale KV 问题(25/45)。

边界也很重要:问题要求复用 session/KV handle;只重用“请求中实际存在的 prefix”的 content-addressed automatic prefix cache(如论文所述的 vLLM 路径)不属于该攻击面。作者建议 transaction-local cache snapshot/restore,而不是全局 flush。

与 wenjun 方向的关系:长轨迹 Agent 的 state 应至少写成:

S_t = (environment, transcript, external memory, inference state/KV, harness control state)

任何 rewind、branch、counterfactual replay 或 model-based rollout,如果只恢复其中部分,都可能训练或评估在一个不存在的混合状态上。


#4. What Does Context Compression Cost an Agent?:压缩后的隐形成本是重新向环境要一遍

为什么值得关注?

常见压缩评测是“token 少了,任务成功率没掉”,于是称 near-lossless。但 Agent 与普通 QA 不同:它可以重查文件、重读页面、重拉状态来补救。论文在固定 24 turns 的可控 planning 环境中,分解 retrieval 与 execution calls:

  • 六个 model–regime 比较中 retrieval calls 全部增加,五个经 Holm 校正后仍显著;
  • execution calls 基本不变;
  • 5× 压缩时六格的 completion 变化均不显著;
  • 最典型的 GPT-5.5:completion 80% → 85%(p=1.0),但 retrieval 21.0 → 63.9,约增三倍;
  • 恢复被删 state 可移除约一半额外 retrieval;同压缩率下 fact-preserving operator 避免了大部分代价;
  • ALFWorld 中同一 operator 没有 retrieval surge,说明成本取决于环境能否便宜地重新观察状态,而不是压缩本身必然有害。

与 wenjun 方向的关系:通用 context compressor 的目标函数不应只有 task reward - λ·context tokens,至少还应加入 tool calls、wall time、irreversible actions、re-observation availability。对于 model-based Agent,最该保留的是昂贵或不可逆获取的 state,而不是词面上“信息量最大”的句子。

研究判断与边界:论文环境仍较可控,三种模型、两个 regime 不能给出通用数值结论;但它给出了一个很强的评测原则:压缩损失应通过 Agent 为修复缺失状态采取的行为来测,而不只通过最终是否成功来测。


#5. SCALE:Latent 里“有状态信息”不等于 planner 真会用它

  • 类别Model-based RL / Latent Reasoning / World Model / Planning
  • 标题SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry
  • 来源与日期:arXiv:2608.16287;v1 2026-08-17,进入 8 月 18 日 recent;Boston University / Unity Technologies
  • 一句话核心贡献:让样本对的 latent distance 与标准化 task-state distance 相关,从而把任务状态放进 planner 实际使用的距离几何;只提高 state decodability 的辅助回归并不能稳定带来同等规划增益。

为什么值得关注?

JEPA world model 用 predicted terminal embedding 到 goal embedding 的距离给候选计划打分。问题是:任务状态即使能从整个 embedding 解码,也可能藏在低方差方向;欧氏距离主要由高方差方向支配,于是 planner 的候选排序几乎不受这些状态维度影响。

SCALE 的核心概念是 metric leverage:一个 latent direction 对 planner-facing cost 的权重。在 squared Euclidean 下,它恰好由该方向的方差决定。SCALE 在训练时加入轻量 regularizer,使 pairwise latent distance 与 privileged task-state distance 对齐,不替换 learned encoder,也不增加规划时开销。

跨 5 个任务、3 种 planning solver、5 档 compute budget,SCALE 对 LeWM 的 15 个 task–solver 平均项全部提升。Latent-to-state regression control 在可解码性上可匹配甚至超过 SCALE,却没有同样稳定的 planning gain,支持“信息存在”和“信息影响决策”是两件事。

与 wenjun 方向的关系:这对 LLM latent-space reasoning / latent world model 是直接警告:probe 能读出 goal、belief 或 transition,不代表 decoder、value head 或 action selector 真正利用了它。应测 latent intervention 对 action ranking / rollout choice 的因果影响,并直接训练 planner-facing geometry。


#三、其他高相关论文与热点动态

#6. The Working Set of a Coding Agent:Repository task 的瓶颈是 edit-time coherence debt

  • 类别Code Agent / Context Engineering / Repository-scale
  • 标题The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks
  • 来源与日期:arXiv:2608.16630;v1 2026-08-17;MPI-SWS / EPFL / Apple / Aarhus
  • 一句话贡献:把一次 edit 所依赖的测试、import、配置、迁移规则等建模为 coupled-fact graph;recent context 与 parametric memory 都没覆盖的部分即 coherence debt。

七个模型、五种 harness 的干预显示:facts 在 edit 时是否可用比总 context 长度更关键;供给的 fact 放在 128k 字符上下文远端仍能稳定使用。不同 harness 在都通过测试时 token 成本可差 12.8×。但 conflicting standard 与 working code 同时出现时,Agent 在 39/39 次实验中都追随 written standard,即使它更差——所以 stale rules 比缺失 rules 更危险。论文也诚实指出,在公开 SWE-bench 上 parametric memory 可替代读取,read behavior 不再预测成功。

#7. Every Coin Has Two Sides:OPD 迁移的是 reasoning behavior,且多教师会互相串味

值得注意的是,teacher 从不解对的题也和总能解对的题一样可用于 OPD;只在英文短数学题上训练,也会改善中文和长链数学。Same-origin teacher/student 可跨 domain 把学生拉向老师,而 cross-origin pair 更多只拟合训练分布。多教师 OPD 因此不是“数学老师管数学、代码老师管代码”的独立拼装,而会随 mixture 产生 capability seesaw。

#8. ICSD:可信 teacher token 不一定服务于当前 RL objective

Frozen-batch 分析中,trust-only 方法把 60.1% teacher-supported mass 放在与 RL objective 相反的 token 上,ICSD 降到 37.8%,与 RL gradient 的 cosine compatibility 增加 0.192;7B 模型达到 ALFWorld 96.1%、WebShop 93.1。需注意 companion repo 当前只有 README/CITATION,尚无实现代码。

#9. Evo-Harness:把一次性 execution context 编译成可持续演化的 general/topic skills

  • 类别LLM Agent / Continual Learning / Self-evolution / Harness
  • 标题Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
  • 来源与日期:arXiv:2608.15071;v1 2026-08-14,进入 8 月 18 日 recent
  • 一句话贡献:solver 从单次 execution context 反思候选 skills,evolver 更新 general 与 topic-level harness,把 noisy one-shot trajectory 编译成后续任务可执行的外部策略。

论文覆盖 TerminalBench2、SWE-bench、CL-Bench、τ-bench、WebArena-Infinity。它的重要性不只在某个分数,而在明确区分“检索过去案例”与“修改以后怎么行动的 harness”。这与 HELIX 的 sibling portfolio、AutoMem 的模块化搜索构成同一趋势:冻结模型后,持续学习对象正在转向可版本化、可审计的 runtime policy。

#10. AutoMem:Memory 不是一个 retriever,而是 Encode × Store × Retrieve × Manage 的架构搜索

GAIA、WebWalkerQA、xBench-DeepSearch × 两种 backbone 的六个组合中,AutoMem 比最强人工 memory baseline 平均高 2.8 点;在 Qwen3.5-122B-A10B 下 token cost 低 14.3%。GitHub API 核验仓库含 src / configs / tests / examples,不是空壳。

#11. Harness the Memory:广泛检索适合 QA,却会把 Agent 注意力从当前 observation 拉走

  • 类别Memory / Evaluation / LLM Agent
  • 标题Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents
  • 来源与日期:arXiv:2608.15008;v1 2026-08-14,进入 8 月 18 日 recent;论文注明代码录用后公开
  • 一句话贡献:统一评测 11 种方法、7 类 memory substrate、3 个 backbone、4 套 benchmark 和 26 项质量/效率指标,发现不存在通用最优 substrate。

结构化 graph 在 dialogue QA 领先,却在 agentic task 上被 Pareto dominate;refinement memory 在 embodied planning 更好、在 QA 更差。深检索对 QA 有利,但对 sequential decision 会让 attention 从当前任务 observation 偏向 memory block。结论是 memory router 不应只按 query 相似度选内容,还应按任务 regime 选 substrate 与 retrieval depth。

#12. Intent-Driven Situation States:从“压缩历史”转为显式维护当前意图与可执行状态

  • 类别Intent Understanding / LLM Agent / Tool-use / Memory
  • 标题Intent-Driven Situation Tracking for User-Centric Multi-Turn Agents
  • 来源与日期:arXiv:2608.15755;v1 2026-08-17
  • 一句话贡献:训练免费地维护 provenance-aware facts、active/completed intents、required variables、constraints 与 execution status,让新工具事实直接传播到约束满足和动作可执行性。

这比“把聊天总结一下”更贴近 wenjun 关心的从指令理解到意图理解:用户目标可变化、可依赖前置任务、可因新事实变得不可执行;Agent 需要的是 situation model,不只是语义摘要。

#13. Agentic Kernel Optimization:约 19 亿 Agent token 换来 B200 上的竞赛级 kernel

在 B200 上,相对 PyTorch reference 的 Fused MoE / DSA TopK / DSA Sparse Attention 加速分别为 92.68× / 1101.02× / 181.35×;Fused MoE 相对 FlashInfer baseline 为 1.71×,略高于竞赛 agent-assisted track 的 1.68×。但代价约 1.9B agent tokens,说明应同时研究 best performance 与 search efficiency / reusable optimization skill。

#14. The Recall Trap:Code RAG 的 gold-file recall 更高,修复率反而更低

Dedup-ON 的 gold file present 为 0.878,OFF 为 0.806;但 gpt-5.6-sol resolve 为 39.2% vs 46.8%(OFF +7.6pp,p=0.0003),Qwen3.6-27B 复现 +3.6pp。边界明确:BM25 上反转;允许 unrestricted Read 的 Agent 中效果不显著。实践结论是 context pack 应按 execution success A/B,而不是只优化 retrieval recall。

#15. LENS:不预先切 chunk,在动态原始文档上做预算化 evidence exploration

  • 类别Tool-use / Context Engineering / Retrieval / Latent Search
  • 标题LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents
  • 来源与日期:arXiv:2608.16185;v1 2026-08-17;Alibaba
  • 一句话贡献:不建立持久 index,维护 query-conditioned evidence belief,用 lexical/local/exploratory proposal 和 LLM relevance oracle 在 variable-boundary raw documents 中逐步定位证据。

500 问控制集上 LENS 的 EM 62.4%、evidence recall 84.8%,ReAct 为 65.2% / 50.4%;在 150 问 fullwiki raw dump 上两者 EM 43.3% / 42.7%,但 grounding 84.0% / 70.7%。它不是 LLM 内部 latent reasoning,而是把“尚未确定边界的 evidence region”当 latent search space,适合频繁变化、来不及重建 index 的代码/文档 workspace。

#16. SA-MRPO:多奖励 RL 不应继续给已饱和目标同样的梯度预算

相比 GDPO,数学任务 15 个比较中 12 个提升,AIME24 最高 +5%;adaptive reasoning 五榜全部提升,平均 +3.8%、AMC23 +9.2%;代码任务 joint optimize executability + test pass 时最高 +2.3%,同时维持已饱和的易目标。

#17. τ0-VLA:world-model-guided test-time search 进入真实长轨迹机器人

最值得借鉴的是把 test-time compute 放在“子任务承诺”而非每个低层 action:低层动作再精准也救不了错误的高层步骤。论文报告额外 compute 提升 next-subtask accuracy,并转化为最长 12 分钟真实机器人任务的闭环成功率提升。

#18. HarnessEval-W:World model 的评测输出不再只是一个分数,而是一棵 evidence tree

在 18 个 world model、330 个 case 上,论文称判断与人类偏好高度一致,并开放 live benchmark。GitHub API 核验仓库已包含 benchmark / src / tools / examples / runs,本次查询为 151 stars,不是只有 README 的预告项目。


#四、今日最值得精读的 3 篇

  1. ClawGym II:最贴近 LLM Agent / Code Agent 的 agentic RL 系统论文;重点看黑盒调用如何恢复成 prefix tree、训练/推理一致性和 mix-harness transfer。
  2. TRCA:重点看 success-scarce 阶段如何从 failed transitions 构造 step credit,以及 foundational / breakthrough reward 的区别。
  3. SCALE:今天最适合 latent-space reasoning + model-based RL 交叉阅读的论文;重点抓“decodable ≠ planner-influential”。

强烈候补:做 Agent runtime 的话,把第 3 篇换成 Aborted but Not Forgotten;做通用 context compressor,换成 What Does Context Compression Cost an Agent?

#五、今日最值得跟进的 3 个 repo / model / dataset

  1. Repo — ECNU-ICALK/AutoMem:已有完整 src/configs/tests/examples,适合直接检查 5×5×6×4 memory search space、失败模块诊断与 text-gradient 更新。
  2. Repo / Live benchmark — MirroS-Lab/HarnessEval-W:适合研究可解释 world-model evaluator、skill routing、sub-agent evidence aggregation;仓库结构已完整开放。
  3. Repo / Framework — igamenovoer/houmao:可复用的异构 CLI Agent 编排框架;结合 FlashInfer solution 看 long-horizon code search 如何组织 planner/coder/synthesizer/profiler。

额外热点,但暂不列科研 Top 3browser-use/macos-harness 是过去两天 GitHub 新项目中增长明显的一项(API 核验 2026-08-17 创建、本次 401 stars),主打让 LLM 通过原生 macOS automation 全面操作 Mac。它更像快速增长的 Agent runtime 工程动态,尚不是经论文验证的研究结论。


#六、研究机会 / Idea

#Idea 1:Transactional Agent State——把 rollback 从 prompt 技巧升级为跨层事务协议

统一 AgentRewind 与 stale-KV audit,把 checkpoint 定义为:

C_t = (workspace snapshot, transcript, external memory version, KV/session state, harness branch state, tool-side effects)

研究三个问题:

  • 哪些状态支持 exact restore,哪些只能 compensating action;
  • 如何对每次 rollback 做 same-token/different-state consistency audit;
  • RL rollout fork 是否必须从 cache snapshot 恢复,才能避免 sibling branches 互相污染。

可先在 Code Agent 上做:git/worktree + test process + tool log + KV transaction,测 recovery success、state leakage、额外 latency。

#Idea 2:World-Model-Grounded Transition Credit——把 TRCA 的 rubric 变成 learned progress model

TRCA 依赖 Evidence / Execution / Invalidity 模板,SCALE 强调 planner-facing geometry。可以训练一个 latent world model:

  1. 根据 (state, action, next state) 预测 goal-relevant state delta;
  2. 对每个 transition 估计 information gain、reachability gain、constraint satisfaction、irreversibility risk
  3. 用真实 acceptance tests / branch comparisons 校准;
  4. 将其同时作为 step reward 和 latent-distance shaping signal。

核心对比:人工 rubric、LLM judge、learned world-model credit,谁在 success-scarce 早期最稳,谁最容易被 reward hacking。

#Idea 3:Regime-Routed Context & Memory——决定“保留、重查、结构化、写入参数”的控制器

把今天四个信号合并:compression reacquisition cost、working-set coherence debt、memory substrate reversal、Recall Trap。让 router 对每条 state 判断:

  • Keep in context:下一编辑马上需要、重获昂贵;
  • Store structurally:有 lifecycle / relation / provenance;
  • Retrieve on demand:便宜可重查且任务阶段不敏感;
  • Compile to skill/harness:跨任务重复出现的 procedure;
  • Drop:低价值且可恢复。

训练目标用真实总成本:task failure + tokens + retrieval calls + latency + stale-state errors + irreversible recovery cost,而不是只优化 QA recall 或最终 success。


#七、今日研究判断

今天最连贯的主线是:Agent 学习的对象正在从“模型输出文本”扩展成“模型 + harness + state transaction + planner-facing representation”的联合系统。

  • ClawGym II 让 RL 穿过黑盒 harness;
  • TRCA 从 failed transition 中取 credit;
  • KV rollback audit 要求推理态与逻辑态一致;
  • compression / working-set 论文要求把重新获取状态的行为成本算进目标;
  • SCALE 则要求 latent state 不仅可 probe,还必须真正改变 planner 的 metric 与选择。

对 wenjun 当前的 model-based RL / latent reasoning 主线,我认为最值得下注的交叉问题是:

在可回滚、可分支的真实 Agent runtime 中,学习一个对 planner 有因果作用的 latent state,并用真实 state delta 给每个分支和 transition 分配 credit。

这比单独做“更长 context”“更强 memory”“更漂亮的 latent probe”或“只有 terminal reward 的 GRPO”更接近可训练、可验证的 Dreamer-for-LLM-Agent。