#2026-08-19 AI/LLM 最新论文与研究热点简报
覆盖窗口:截至北京时间 2026-08-19 08:00,重点覆盖 arXiv 在 8 月 18 日公开的周二批次(论文版本多标为 8 月 17 日),并结合 Hugging Face Papers、GitHub 与项目页核验。
检索与限制:逐项扫描 arXiv
cs.AI / cs.CL / cs.LG / cs.SE / stat.MLrecent 页面;下载并全文抽取 21 篇候选论文,核对方法、实验、数字和代码链接;同时查询 Hugging Face Papers API 与 GitHub API。arXiv API 本次超时,但 recent 页面和 PDF 均可访问;OpenAlex 搜索返回 503;Google Scholar 返回 403;X/Twitter 搜索没有稳定、可审计的公开时间线,因此不引用无法核验的社交帖子。HF 的 8 月 17 日榜单中,ClawGym II、HarnessEval-W、τ0-VLA 与 SA-MRPO 也进入可见热点。
#一、早读结论:今天最重要的 7 个信号
- Agentic RL 正从“针对一种环境训练”走向“穿过黑盒 harness 训练”:ClawGym II 不改 OpenClaw / Claude Code 内部控制流,在模型服务边界截获调用、还原 prefix tree,再用 PPO/GRPO 优化;这是把生产级 Agent runtime 纳入 RL 的关键工程抽象。
- 长轨迹 credit assignment 开始认真利用失败轨迹:TRCA 不等成功样本出现,而是从每个 action 引起的
evidence / execution / invalidity状态转移中构造局部奖励;作者发现早期失败轨迹里 72.2% 的动作仍带可用 transition signal。 - “可回滚 Agent”必须同时回滚 transcript、环境与模型推理态:昨天 AgentRewind 强调 context/environment 对齐,今天 KV rollback audit 进一步证明,仅删除日志却保留旧 KV cache,会让被拒绝分支继续影响模型甚至造成敏感信息外泄。
- 通用上下文压缩器不能只看成功率和 token 数:压掉执行状态后,Agent 可能通过额外工具调用重新找回信息;任务成功率不变,却付出数倍 retrieval cost。压缩评估必须加入 state reacquisition cost。
- Code Agent 的 context engineering 出现统一解释:edit-time working set。不是“读得越多越好”,而是写入瞬间是否同时拥有这一修改依赖的耦合事实;错误规范文件甚至比没有规范更糟。
- Latent world model 的重点从“状态可解码”转向“状态是否影响规划几何”:SCALE 说明 latent 里含有任务状态还不够;若这些维度在 planner 的距离度量里权重太小,仍不会改变候选动作排序。
- OPD / OPSD 的老师影响比 prompt routing 更宽:同源 teacher 可跨语言、推理长度和领域迁移 reasoning behavior;这既解释 OPD 的泛化,也说明多教师能力会发生 seesaw,不能假设按领域路由就能隔离影响。
#二、重点精读(Top 5)
#1. ClawGym II:把 OpenClaw / Claude Code 当黑盒 rollout engine 做 Agentic RL
- 类别:
LLM Agent/Code Agent/Agentic RL/Post-training RL/Systems - 标题:ClawGym II: Exploring Black-Box RL on Agent Harness
- 来源与日期:arXiv:2608.16798;v1 2026-08-17,进入 8 月 18 日 recent;Hugging Face Papers 8 月 17 日榜单(本次核验时 34 upvotes)
- 一句话核心贡献:把复杂 harness 视为不透明执行器,在模型 serving boundary 代理并捕获所有调用,将碎片化、分叉调用恢复成 prefix tree,再适配 PPO/GRPO 做稳定的单 harness 与 mix-harness 训练。
为什么值得关注?
Agent RL 的真实 rollout 并不是干净的 (obs, action, reward) 串:Harness 会做 context compaction、重试、子代理分叉、工具编排,训练端看到的是大量碎片调用。ClawGym II 的工程路径是:
- 每个 task + harness 放入临时 sandbox,并发运行、结束销毁;
- Harness 保持原生黑盒逻辑,只把所有模型调用经 serving proxy 截获;
- 按共享前缀把调用恢复成树,复用重复 prefix,保留分支结构;
- 在树上适配 critic-based PPO 和 critic-free GRPO;
- 通过 token-in/token-out 与 token-level importance-sampling correction 控制训练/推理引擎偏差;
- 把不同 task–harness pair 混合训练同一 policy。
以 Qwen3-30A3B 为底模,通过 OpenClaw / Claude Code 训练后,ClawGym-Bench Pass@1 分别提升 9.98 / 14.81 个点,PinchBench 提升 11.71 / 17.28 个点;训练可稳定持续 200–400 optimization steps,mix-harness 模型匹配或超过单 harness 版本,并在 JobBench、OfficeQA 上继续有增益。
与 wenjun 方向的关系:
- 这是 Agentic RL 从 benchmark wrapper 走向生产 runtime 的直接方案;
- prefix tree 正好提供共享前缀下 sibling branches,可用于 branch-level advantage 与 model-based counterfactual;
- mix-harness 触及一个关键问题:模型究竟学到通用环境交互能力,还是学会某个 harness 的协议与恢复习惯?
研究判断与边界:论文解决的是黑盒 harness 的轨迹采集与训练稳定性,不等于解决长时域 credit assignment;所有分叉最终仍主要由 terminal / rubric outcome 驱动。下一步应把 tree node 的 state delta、局部 verifier 与世界模型预测误差接入 advantage。
#2. TRCA:成功轨迹稀缺时,从 action 引起的状态转移里分配 credit
- 类别:
LLM Agent/Post-training RL/Credit Assignment/Long-horizon - 标题:TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents
- 来源与日期:arXiv:2608.16156;v1 2026-08-17,进入 8 月 18 日 recent;Beihang / Tsinghua / BAAI
- 一句话核心贡献:不训练 PRM、也不依赖成功 anchor,直接根据 action 前后的状态转移评估 Evidence、Execution、Invalidity 三类 rubric,并把局部质量与“首次取得的新进展”转成 step-level advantage。
为什么值得关注?
早期 Agent RL 最棘手的阶段恰恰是 success-scarce:只有 terminal reward 时,绝大多数 rollout 都是同一个 0;而依赖成功轨迹构树或做 hindsight credit 的方法也无从启动。TRCA 把失败 rollout 拆开看,作者人工和 frontier judge 分析发现其中 72.2% 的动作仍包含 rubric-grounded 有效信号。
TRCA 区分两种奖励:
- Foundational Rubric Reward:对当前 transition 的证据获取、有效执行和无效/重复/倒退行为做带符号打分;
- Breakthrough Rubric Reward:累计跟踪正向 Evidence / Execution 条件覆盖,只在新条件首次成立时奖励,避免同一进展反复刷分;
- 再与 terminal outcome 合并,分别表达 local quality、incremental progress 与 final completion。
在 ALFWorld、WebShop 和 7 个 SearchQA benchmark 上,TRCA 均优于论文比较的基线;Qwen2.5-7B-Instruct 的 WebShop score 提升 6.0%–12.6%,Qwen2.5-3B 的 SearchQA 平均提升 1.9%–18.3%。
与 wenjun 方向的关系:这与昨天 RGLT 的“transition utility”形成很强呼应:latent update、tool action 和 environment transition 都不该只模仿成功轨迹,而应回答“这一步新获取了什么证据、改变了什么可执行状态、是否让世界更接近目标”。对 Dreamer-like LLM Agent,可把 rubric 进一步替换为 learned world model 中的 state novelty、goal reachability 和 uncertainty reduction。
研究判断与边界:Rubric 本身仍依赖任务可形式化程度;如果 Evidence / Execution 条件由人工模板定义,扩到开放式 coding/research 会有维护成本。值得研究的是从 acceptance tests、state-delta telemetry 和 branch comparisons 自动归纳 rubric。
#3. Aborted but Not Forgotten:删掉回滚分支的文本,不代表模型忘了它
- 类别:
LLM Agent/Systems/Security/KV Cache/Rollback - 标题:Aborted but Not Forgotten: KV-Cache Retention Breaks Rollback Consistency in Language Agents
- 来源与日期:arXiv:2608.15939;v1 2026-08-17,进入 8 月 18 日 recent;HKUST
- 一句话核心贡献:形式化 rollback consistency,并用 same-token/different-cache 审计证明:若逻辑 abort 后复用旧 session KV,已从 transcript 删除的分支仍可影响后续决策;从 committed transcript 重建 cache 可关闭该通道。
为什么值得关注?
这篇与昨天的 AgentRewind 几乎是连续剧。AgentRewind 说恢复点必须对齐语言上下文和 workspace;本篇再补第三层:model-attended inference state。应用看到的 transcript 已回滚,serving engine 看到的 KV 却还包含旧分支,两层状态发生 silent divergence。
作者固定决策步骤的输入 token 完全相同,只改变 cache 是“保留 rejected branch”还是“从 committed transcript 重建”。在 7 个 3.8B–36B open-weight model family、63 个配对单元中,旧 KV 单独导致 25/63 单元发生受保护决策翻转,把敏感 artifact 发往攻击者 endpoint;请求 token 中均没有攻击者字符串。Fresh-cache rebuild 与 cold restart 为 0/63。LangGraph time-travel 的逻辑回滚也复现了 stale KV 问题(25/45)。
边界也很重要:问题要求复用 session/KV handle;只重用“请求中实际存在的 prefix”的 content-addressed automatic prefix cache(如论文所述的 vLLM 路径)不属于该攻击面。作者建议 transaction-local cache snapshot/restore,而不是全局 flush。
与 wenjun 方向的关系:长轨迹 Agent 的 state 应至少写成:
S_t = (environment, transcript, external memory, inference state/KV, harness control state)。
任何 rewind、branch、counterfactual replay 或 model-based rollout,如果只恢复其中部分,都可能训练或评估在一个不存在的混合状态上。
#4. What Does Context Compression Cost an Agent?:压缩后的隐形成本是重新向环境要一遍
- 类别:
Context Compression/LLM Agent/Memory/Evaluation - 标题:What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics
- 来源与日期:arXiv:2608.16370;v1 2026-08-17,进入 8 月 18 日 recent;早期版本已被 COLM 2026 Efficient Reasoning Workshop 接收
- 一句话核心贡献:把压缩后重新获取被删状态的工具调用定义为 reacquisition cost,并证明 completion-only evaluation 无法识别这类成本。
为什么值得关注?
常见压缩评测是“token 少了,任务成功率没掉”,于是称 near-lossless。但 Agent 与普通 QA 不同:它可以重查文件、重读页面、重拉状态来补救。论文在固定 24 turns 的可控 planning 环境中,分解 retrieval 与 execution calls:
- 六个 model–regime 比较中 retrieval calls 全部增加,五个经 Holm 校正后仍显著;
- execution calls 基本不变;
- 5× 压缩时六格的 completion 变化均不显著;
- 最典型的 GPT-5.5:completion 80% → 85%(p=1.0),但 retrieval 21.0 → 63.9,约增三倍;
- 恢复被删 state 可移除约一半额外 retrieval;同压缩率下 fact-preserving operator 避免了大部分代价;
- ALFWorld 中同一 operator 没有 retrieval surge,说明成本取决于环境能否便宜地重新观察状态,而不是压缩本身必然有害。
与 wenjun 方向的关系:通用 context compressor 的目标函数不应只有 task reward - λ·context tokens,至少还应加入 tool calls、wall time、irreversible actions、re-observation availability。对于 model-based Agent,最该保留的是昂贵或不可逆获取的 state,而不是词面上“信息量最大”的句子。
研究判断与边界:论文环境仍较可控,三种模型、两个 regime 不能给出通用数值结论;但它给出了一个很强的评测原则:压缩损失应通过 Agent 为修复缺失状态采取的行为来测,而不只通过最终是否成功来测。
#5. SCALE:Latent 里“有状态信息”不等于 planner 真会用它
- 类别:
Model-based RL/Latent Reasoning/World Model/Planning - 标题:SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry
- 来源与日期:arXiv:2608.16287;v1 2026-08-17,进入 8 月 18 日 recent;Boston University / Unity Technologies
- 一句话核心贡献:让样本对的 latent distance 与标准化 task-state distance 相关,从而把任务状态放进 planner 实际使用的距离几何;只提高 state decodability 的辅助回归并不能稳定带来同等规划增益。
为什么值得关注?
JEPA world model 用 predicted terminal embedding 到 goal embedding 的距离给候选计划打分。问题是:任务状态即使能从整个 embedding 解码,也可能藏在低方差方向;欧氏距离主要由高方差方向支配,于是 planner 的候选排序几乎不受这些状态维度影响。
SCALE 的核心概念是 metric leverage:一个 latent direction 对 planner-facing cost 的权重。在 squared Euclidean 下,它恰好由该方向的方差决定。SCALE 在训练时加入轻量 regularizer,使 pairwise latent distance 与 privileged task-state distance 对齐,不替换 learned encoder,也不增加规划时开销。
跨 5 个任务、3 种 planning solver、5 档 compute budget,SCALE 对 LeWM 的 15 个 task–solver 平均项全部提升。Latent-to-state regression control 在可解码性上可匹配甚至超过 SCALE,却没有同样稳定的 planning gain,支持“信息存在”和“信息影响决策”是两件事。
与 wenjun 方向的关系:这对 LLM latent-space reasoning / latent world model 是直接警告:probe 能读出 goal、belief 或 transition,不代表 decoder、value head 或 action selector 真正利用了它。应测 latent intervention 对 action ranking / rollout choice 的因果影响,并直接训练 planner-facing geometry。
#三、其他高相关论文与热点动态
#6. The Working Set of a Coding Agent:Repository task 的瓶颈是 edit-time coherence debt
- 类别:
Code Agent/Context Engineering/Repository-scale - 标题:The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks
- 来源与日期:arXiv:2608.16630;v1 2026-08-17;MPI-SWS / EPFL / Apple / Aarhus
- 一句话贡献:把一次 edit 所依赖的测试、import、配置、迁移规则等建模为 coupled-fact graph;recent context 与 parametric memory 都没覆盖的部分即 coherence debt。
七个模型、五种 harness 的干预显示:facts 在 edit 时是否可用比总 context 长度更关键;供给的 fact 放在 128k 字符上下文远端仍能稳定使用。不同 harness 在都通过测试时 token 成本可差 12.8×。但 conflicting standard 与 working code 同时出现时,Agent 在 39/39 次实验中都追随 written standard,即使它更差——所以 stale rules 比缺失 rules 更危险。论文也诚实指出,在公开 SWE-bench 上 parametric memory 可替代读取,read behavior 不再预测成功。
#7. Every Coin Has Two Sides:OPD 迁移的是 reasoning behavior,且多教师会互相串味
- 类别:
Post-training RL/On-policy Distillation/Generalization - 标题:Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
- 来源与日期:arXiv:2608.16647;v1 2026-08-17;IQuest Research 等
- 一句话贡献:控制研究 OPD 的同域、跨语言/长度、跨领域和多教师泛化,发现同源 teacher 的 reasoning behavior 可广泛迁移,而 prompt routing 无法隔离每个 teacher 的跨域影响。
值得注意的是,teacher 从不解对的题也和总能解对的题一样可用于 OPD;只在英文短数学题上训练,也会改善中文和长链数学。Same-origin teacher/student 可跨 domain 把学生拉向老师,而 cross-origin pair 更多只拟合训练分布。多教师 OPD 因此不是“数学老师管数学、代码老师管代码”的独立拼装,而会随 mixture 产生 capability seesaw。
#8. ICSD:可信 teacher token 不一定服务于当前 RL objective
- 类别:
Agentic RL/On-policy Self-distillation/Credit Assignment - 标题:Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- 来源与日期:arXiv:2608.14945;v1 2026-08-14,8 月 18 日 recent 交叉列表可见
- 代码:lanqz7766/Influence-Calibration-for-On-Policy-Self-Distillation-in-Agentic-RL
- 一句话贡献:用 token 对 RL surrogate 的一阶影响校准 OPSD 权重,在不增加 forward pass、保持 action-turn auxiliary mass 不变的前提下,把 teacher supervision 从 objective-opposed token 移开。
Frozen-batch 分析中,trust-only 方法把 60.1% teacher-supported mass 放在与 RL objective 相反的 token 上,ICSD 降到 37.8%,与 RL gradient 的 cosine compatibility 增加 0.192;7B 模型达到 ALFWorld 96.1%、WebShop 93.1。需注意 companion repo 当前只有 README/CITATION,尚无实现代码。
#9. Evo-Harness:把一次性 execution context 编译成可持续演化的 general/topic skills
- 类别:
LLM Agent/Continual Learning/Self-evolution/Harness - 标题:Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
- 来源与日期:arXiv:2608.15071;v1 2026-08-14,进入 8 月 18 日 recent
- 一句话贡献:solver 从单次 execution context 反思候选 skills,evolver 更新 general 与 topic-level harness,把 noisy one-shot trajectory 编译成后续任务可执行的外部策略。
论文覆盖 TerminalBench2、SWE-bench、CL-Bench、τ-bench、WebArena-Infinity。它的重要性不只在某个分数,而在明确区分“检索过去案例”与“修改以后怎么行动的 harness”。这与 HELIX 的 sibling portfolio、AutoMem 的模块化搜索构成同一趋势:冻结模型后,持续学习对象正在转向可版本化、可审计的 runtime policy。
#10. AutoMem:Memory 不是一个 retriever,而是 Encode × Store × Retrieve × Manage 的架构搜索
- 类别:
LLM Agent/Memory/Continual Learning/Self-improvement - 标题:AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search
- 来源与日期:arXiv:2608.14621;v1 2026-07-14,本次 8 月 18 日 recent 更新;ECNU / Shanghai AI Laboratory
- 代码:ECNU-ICALK/AutoMem
- 一句话贡献:在 5 encoders × 5 stores × 6 retrievers × 4 managers 的离散空间,用历史搜索经验提案、失败模块诊断产生 text gradient,迭代搜索 task-adaptive memory architecture。
GAIA、WebWalkerQA、xBench-DeepSearch × 两种 backbone 的六个组合中,AutoMem 比最强人工 memory baseline 平均高 2.8 点;在 Qwen3.5-122B-A10B 下 token cost 低 14.3%。GitHub API 核验仓库含 src / configs / tests / examples,不是空壳。
#11. Harness the Memory:广泛检索适合 QA,却会把 Agent 注意力从当前 observation 拉走
- 类别:
Memory/Evaluation/LLM Agent - 标题:Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents
- 来源与日期:arXiv:2608.15008;v1 2026-08-14,进入 8 月 18 日 recent;论文注明代码录用后公开
- 一句话贡献:统一评测 11 种方法、7 类 memory substrate、3 个 backbone、4 套 benchmark 和 26 项质量/效率指标,发现不存在通用最优 substrate。
结构化 graph 在 dialogue QA 领先,却在 agentic task 上被 Pareto dominate;refinement memory 在 embodied planning 更好、在 QA 更差。深检索对 QA 有利,但对 sequential decision 会让 attention 从当前任务 observation 偏向 memory block。结论是 memory router 不应只按 query 相似度选内容,还应按任务 regime 选 substrate 与 retrieval depth。
#12. Intent-Driven Situation States:从“压缩历史”转为显式维护当前意图与可执行状态
- 类别:
Intent Understanding/LLM Agent/Tool-use/Memory - 标题:Intent-Driven Situation Tracking for User-Centric Multi-Turn Agents
- 来源与日期:arXiv:2608.15755;v1 2026-08-17
- 一句话贡献:训练免费地维护 provenance-aware facts、active/completed intents、required variables、constraints 与 execution status,让新工具事实直接传播到约束满足和动作可执行性。
这比“把聊天总结一下”更贴近 wenjun 关心的从指令理解到意图理解:用户目标可变化、可依赖前置任务、可因新事实变得不可执行;Agent 需要的是 situation model,不只是语义摘要。
#13. Agentic Kernel Optimization:约 19 亿 Agent token 换来 B200 上的竞赛级 kernel
- 类别:
Code Agent/Systems/Self-evolution - 标题:Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA
- 来源与日期:arXiv:2608.14560;版本记录为 2026-05-25,本次 8 月 18 日 recent 交叉列表出现
- 框架:igamenovoer/houmao
- 结果代码:CodeGandee/flashinfer-bench-starter-kit/solution/cuda
- 一句话贡献:Planner、并行 CUDA Coders、Synthesizer、NCU Profiler 与按需 Researcher 组成 correctness-first 搜索流程;人只做编排、不编辑 kernel。
在 B200 上,相对 PyTorch reference 的 Fused MoE / DSA TopK / DSA Sparse Attention 加速分别为 92.68× / 1101.02× / 181.35×;Fused MoE 相对 FlashInfer baseline 为 1.71×,略高于竞赛 agent-assisted track 的 1.68×。但代价约 1.9B agent tokens,说明应同时研究 best performance 与 search efficiency / reusable optimization skill。
#14. The Recall Trap:Code RAG 的 gold-file recall 更高,修复率反而更低
- 类别:
Code Agent/Context Engineering/Retrieval/Evaluation - 标题:The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context
- 来源与日期:arXiv:2608.14838;v1 2026-08-17
- 一句话贡献:在固定 12-slot、无搜索工具的 SWE-bench Verified context pack 中,一文件一 chunk 的 hard dedup 提高 gold-file coverage,却因牺牲文件内深度降低实际 resolve rate。
Dedup-ON 的 gold file present 为 0.878,OFF 为 0.806;但 gpt-5.6-sol resolve 为 39.2% vs 46.8%(OFF +7.6pp,p=0.0003),Qwen3.6-27B 复现 +3.6pp。边界明确:BM25 上反转;允许 unrestricted Read 的 Agent 中效果不显著。实践结论是 context pack 应按 execution success A/B,而不是只优化 retrieval recall。
#15. LENS:不预先切 chunk,在动态原始文档上做预算化 evidence exploration
- 类别:
Tool-use/Context Engineering/Retrieval/Latent Search - 标题:LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents
- 来源与日期:arXiv:2608.16185;v1 2026-08-17;Alibaba
- 一句话贡献:不建立持久 index,维护 query-conditioned evidence belief,用 lexical/local/exploratory proposal 和 LLM relevance oracle 在 variable-boundary raw documents 中逐步定位证据。
500 问控制集上 LENS 的 EM 62.4%、evidence recall 84.8%,ReAct 为 65.2% / 50.4%;在 150 问 fullwiki raw dump 上两者 EM 43.3% / 42.7%,但 grounding 84.0% / 70.7%。它不是 LLM 内部 latent reasoning,而是把“尚未确定边界的 evidence region”当 latent search space,适合频繁变化、来不及重建 index 的代码/文档 workspace。
#16. SA-MRPO:多奖励 RL 不应继续给已饱和目标同样的梯度预算
- 类别:
Post-training RL/RLVR/Code Reasoning - 标题:Learn What’s Left, Not What’s Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
- 来源与日期:arXiv:2608.16072;v1 2026-08-17;HF Papers 榜单本次核验 44 upvotes
- 一句话贡献:各 reward objective 独立标准化,再按 batch-level saturation 自适应降权已解决目标,把训练预算转向剩余 headroom,且可能改变 advantage 符号而不只缩放梯度。
相比 GDPO,数学任务 15 个比较中 12 个提升,AIME24 最高 +5%;adaptive reasoning 五榜全部提升,平均 +3.8%、AMC23 +9.2%;代码任务 joint optimize executability + test pass 时最高 +2.3%,同时维持已饱和的易目标。
#17. τ0-VLA:world-model-guided test-time search 进入真实长轨迹机器人
- 类别:
Model-based RL/World Model/Test-time Scaling/Embodied Agent - 标题:τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
- 来源与日期:arXiv:2608.16885;v1 2026-08-17;项目页
- 一句话贡献:VLM 提议高层 subtask,world model 预测视觉结果,value model 评分、beam search 扩展,再由 reflection model 提交下一子任务;低层 VLA 在 40,115 小时异构真实数据上训练。
最值得借鉴的是把 test-time compute 放在“子任务承诺”而非每个低层 action:低层动作再精准也救不了错误的高层步骤。论文报告额外 compute 提升 next-subtask accuracy,并转化为最长 12 分钟真实机器人任务的闭环成功率提升。
#18. HarnessEval-W:World model 的评测输出不再只是一个分数,而是一棵 evidence tree
- 类别:
World Model/Evaluation/Multi-Agent - 标题:HarnessEval-W: Agentifying the Evaluation of Visual Worlds
- 来源与日期:arXiv:2608.16859;v1 2026-08-17;论文标注 2026-08-18
- 代码:MirroS-Lab/HarnessEval-W;项目页
- 一句话贡献:父 Agent 按 case 路由 skills、拆出可测子问题,专门 sub-agents 用诊断工具检查物理、因果和状态变化,再汇总为可追溯 evidence tree。
在 18 个 world model、330 个 case 上,论文称判断与人类偏好高度一致,并开放 live benchmark。GitHub API 核验仓库已包含 benchmark / src / tools / examples / runs,本次查询为 151 stars,不是只有 README 的预告项目。
#四、今日最值得精读的 3 篇
- ClawGym II:最贴近 LLM Agent / Code Agent 的 agentic RL 系统论文;重点看黑盒调用如何恢复成 prefix tree、训练/推理一致性和 mix-harness transfer。
- TRCA:重点看 success-scarce 阶段如何从 failed transitions 构造 step credit,以及 foundational / breakthrough reward 的区别。
- SCALE:今天最适合 latent-space reasoning + model-based RL 交叉阅读的论文;重点抓“decodable ≠ planner-influential”。
强烈候补:做 Agent runtime 的话,把第 3 篇换成 Aborted but Not Forgotten;做通用 context compressor,换成 What Does Context Compression Cost an Agent?。
#五、今日最值得跟进的 3 个 repo / model / dataset
- Repo — ECNU-ICALK/AutoMem:已有完整
src/configs/tests/examples,适合直接检查 5×5×6×4 memory search space、失败模块诊断与 text-gradient 更新。 - Repo / Live benchmark — MirroS-Lab/HarnessEval-W:适合研究可解释 world-model evaluator、skill routing、sub-agent evidence aggregation;仓库结构已完整开放。
- Repo / Framework — igamenovoer/houmao:可复用的异构 CLI Agent 编排框架;结合 FlashInfer solution 看 long-horizon code search 如何组织 planner/coder/synthesizer/profiler。
额外热点,但暂不列科研 Top 3:browser-use/macos-harness 是过去两天 GitHub 新项目中增长明显的一项(API 核验 2026-08-17 创建、本次 401 stars),主打让 LLM 通过原生 macOS automation 全面操作 Mac。它更像快速增长的 Agent runtime 工程动态,尚不是经论文验证的研究结论。
#六、研究机会 / Idea
#Idea 1:Transactional Agent State——把 rollback 从 prompt 技巧升级为跨层事务协议
统一 AgentRewind 与 stale-KV audit,把 checkpoint 定义为:
C_t = (workspace snapshot, transcript, external memory version, KV/session state, harness branch state, tool-side effects)。
研究三个问题:
- 哪些状态支持 exact restore,哪些只能 compensating action;
- 如何对每次 rollback 做 same-token/different-state consistency audit;
- RL rollout fork 是否必须从 cache snapshot 恢复,才能避免 sibling branches 互相污染。
可先在 Code Agent 上做:git/worktree + test process + tool log + KV transaction,测 recovery success、state leakage、额外 latency。
#Idea 2:World-Model-Grounded Transition Credit——把 TRCA 的 rubric 变成 learned progress model
TRCA 依赖 Evidence / Execution / Invalidity 模板,SCALE 强调 planner-facing geometry。可以训练一个 latent world model:
- 根据
(state, action, next state)预测 goal-relevant state delta; - 对每个 transition 估计
information gain、reachability gain、constraint satisfaction、irreversibility risk; - 用真实 acceptance tests / branch comparisons 校准;
- 将其同时作为 step reward 和 latent-distance shaping signal。
核心对比:人工 rubric、LLM judge、learned world-model credit,谁在 success-scarce 早期最稳,谁最容易被 reward hacking。
#Idea 3:Regime-Routed Context & Memory——决定“保留、重查、结构化、写入参数”的控制器
把今天四个信号合并:compression reacquisition cost、working-set coherence debt、memory substrate reversal、Recall Trap。让 router 对每条 state 判断:
- Keep in context:下一编辑马上需要、重获昂贵;
- Store structurally:有 lifecycle / relation / provenance;
- Retrieve on demand:便宜可重查且任务阶段不敏感;
- Compile to skill/harness:跨任务重复出现的 procedure;
- Drop:低价值且可恢复。
训练目标用真实总成本:task failure + tokens + retrieval calls + latency + stale-state errors + irreversible recovery cost,而不是只优化 QA recall 或最终 success。
#七、今日研究判断
今天最连贯的主线是:Agent 学习的对象正在从“模型输出文本”扩展成“模型 + harness + state transaction + planner-facing representation”的联合系统。
- ClawGym II 让 RL 穿过黑盒 harness;
- TRCA 从 failed transition 中取 credit;
- KV rollback audit 要求推理态与逻辑态一致;
- compression / working-set 论文要求把重新获取状态的行为成本算进目标;
- SCALE 则要求 latent state 不仅可 probe,还必须真正改变 planner 的 metric 与选择。
对 wenjun 当前的 model-based RL / latent reasoning 主线,我认为最值得下注的交叉问题是:
在可回滚、可分支的真实 Agent runtime 中,学习一个对 planner 有因果作用的 latent state,并用真实 state delta 给每个分支和 transition 分配 credit。
这比单独做“更长 context”“更强 memory”“更漂亮的 latent probe”或“只有 terminal reward 的 GRPO”更接近可训练、可验证的 Dreamer-for-LLM-Agent。