#2026-08-27 AI/LLM 最新论文与研究热点简报
覆盖窗口:截至北京时间 2026-08-27 08:00,主体为 arXiv 2026-08-25 首次提交、8 月 26 日进入 recent / Hugging Face Papers 的新作;对高度相关但榜单收录较晚的 8 月 24 日论文做少量补充。
检索与核验:扫描 Hugging Face Daily Papers 2026-08-26 API(25 篇)、arXiv
cs.AI / cs.CL / cs.LG / cs.SE / stat.MLrecent 页面与 Atom API;下载并全文抽取 14 篇重点候选 PDF,核验 GitHub API 与 Hugging Face model/dataset API。OpenAlex 本次返回 429,Google Scholar 返回 403;X 网页只有动态应用外壳,recent-search API 需要授权,因此不引用无法稳定审计的社交帖子,以论文项目页、GitHub 和 HF 替代。
#一、早读结论:今天最值得抓住的 7 个信号
- 长轨迹 Agent 的“自我改进”越来越像双记忆系统的工程化闭环:Recuris 用 Working Memory 管当前任务状态、Experiential Memory 管可复用 skill,再用结构化失败证据局部更新 skill,而不是让整段历史无限增长。
- 静态 critic 会被不断改善的 policy 甩开:CAFE 让 search agent 与 feedback critic 交替更新;关键不是“有没有批评”,而是 critic 是否持续覆盖 policy 当前会访问的失败状态。
- tool creation 与 tool use 应由同一 policy 联合训练:SMITH 让“写工具的人”承担“自己能否从 schema 正确调用”的后果,把工具接口质量变成可执行 reward。
- Dreamer / WAM 的未来想象不必生成完整未来观察:LAWA 把未来压进 latent action / intention,保留 future-aware 泛化,同时显著降低观察空间生成的延迟。
- 基础模型训练机制出现一个值得复现实验的宏观规律:若 learning rate 与参数范数之比(ELR)匹配,不同 LR / norm-control 配置的 loss curve 会在约
10^-3误差上重合;weight decay 的部分效果可能只是改变了 ELR schedule。 - 上下文压缩必须从“语义保真”升级为“意图与操作状态保真”:Paritok-4B 用 extractive + intent-conditioned compression 保留 Code Agent 需要的精确标识符;Constraint Weakening 则表明摘要即使保留了事实,也可能把“必须满足”偷偷弱化成“可以考虑”。
- 训练数据 mixture 不是若干来源价值的线性加和:统计 mixture experiment 分析显示,一些单独看价值较弱的域会通过 pairwise interaction 变得有益;proxy mixture 本身也应按 optimal design 选择,而不是只随机采样再拟合黑箱模型。
#二、重点精读(Top 5)
#1. Recuris:把工作记忆与经验技能耦合,形成有边界的递归 memory evolution
- 类别:
LLM Agent/Continual Learning/Long-horizon Agent/Self-evolution - 标题:Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses
- 来源与日期:arXiv:2608.24876,2026-08-25;Hugging Face Papers 2026-08-26
- 代码:Gen-Verse/Recuris
- 一句话核心贡献:Working Memory 显式跟踪当前进度并按需选择 Experiential Memory 中的 skill;执行轨迹被结构化为组件级失败证据,再由固定 Meta-Agent 做局部、validation-gated skill patch,形成有边界的递归改进环。
为什么值得关注?
多数 Agent memory 把“长历史压缩”和“经验积累”混成一件事:上下文越长,当前 state 越模糊;skill 越多,调用越容易错位。Recuris 将两种时间尺度拆开:
- Working Memory 只回答当前目标、进度、阻塞、下一步需要什么;
- Experiential Memory 保存跨任务可复用技能;
- skill 调用被当前 WM need grounding,而不是对整段 history 做相似度检索;
- 失败被定位到 WM 更新、skill selection、skill content 等具体组件;
- patch 只有通过验证才进入 memory,递归轮数也有上限。
论文在 4 个长轨迹 benchmark、10 个模型的 37 个完成配对中提升了 35 个;在 τ2-Bench 上给 GPT-5.6 Sol / Claude Opus 5 分别带来 +17.8 / +15.6 points,Claude Opus 5 达 87.9%;SkillFlow 上 Qwen3.6-27B/35B 分别 +16.6 / +13.5 points。最长任务上的优势扩大到 +32.2 points,常见长轨迹失败最多下降约 80%。
与 wenjun 方向的关系:
- 对 model-based RL,可把 WM 视为 belief state,把 skill 视为 temporally extended action;world model 不必直接预测全文,而是预测 skill 对 WM state 的转移;
- 对 self-evolving Code Agent,可将 repo/test/issue 状态放进 WM,将成功 workflow 放进 EM,再用失败定位决定修改 planner、tool schema 还是 skill;
- 对持续学习,它强调“更新什么 memory component”比“存更多经验”更重要。
研究判断与边界:结果非常强,但 harness 自身增加了多次模型调用和手工设计结构。需要 matched-token / matched-call baseline、不同 task-order,以及 memory patch 在新任务族上的负迁移审计,才能确认收益不是额外 test-time compute 与 benchmark-specific skill accumulation。
#2. CAFE:Search Agent 和 feedback critic 必须共同进化
- 类别:
LLM Agent/Agentic RL/Credit Assignment/Search Agent - 标题:CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
- 来源与日期:arXiv:2608.24794,2026-08-25;Hugging Face Papers 2026-08-26
- 一句话核心贡献:同一共享参数模型交替扮演 search policy 与 critic;online RL 学何时请求/使用反馈,offline preference optimization 用最新 rollout 的 prefix-matched 成败对更新反馈生成器。
为什么值得关注?
CAFE 直接指出 static critic 的 distribution shift:policy 改善后会访问新的状态、暴露新的失败模式,旧 critic 即使原来有效也会逐渐失配。其训练闭环包括:
- 保留 base policy 的错误前缀,插入纠错反馈并连接成功后续,初始化“被救回”的 recovery behavior;
- 用同 prompt 的 call-vs-skip 成功差估计反馈调用的边际价值;
- 在反馈前后重分配 token advantage,区分“原本就走对”和“靠反馈救回”;
- 从最新 rollout 构造 prefix-matched 成功/失败 pair,离线更新 critic;
- agent 与 critic 交替更新,避免只优化一侧早早 plateau。
在 7 个 agentic search benchmark 上,Qwen2.5-7B 的平均结果比最强 RL search baseline 高 2.1 EM / 1.3 F1,提升覆盖全部 6 个 OOD benchmark;answer-level hallucination 从 17.6% 降至 12.6%。只更新 agent 或只更新 critic 的单侧消融会停滞,交替更新继续提升。
与 wenjun 方向的关系:这与 Dreamer / actor–critic 的核心问题一致:预测器必须随 policy-induced state distribution 更新。对 Code Agent,可让 critic 在 active trajectory 中指出下一步要运行的 diagnostic test / inspect target,而不只是任务结束后写总结。
研究判断与边界:call-vs-skip 是 prompt-level group estimate,不是 same-state executed causal effect;共享参数也可能发生角色干扰。建议用 checkpointed environment 做真实反馈介入对照,并测试旧 critic × 新 policy 的 cross-play calibration。
#3. SMITH:模型不仅学会用工具,还要学会造出“自己真正会用”的工具
- 类别:
Tool-use/LLM Agent/Post-training RL/Self-evolution - 标题:Joint Optimization of Tool Creation and Use for Large Language Model Agents
- 来源与日期:arXiv:2608.24571,2026-08-25
- 代码:appier-research/smith
- 一句话核心贡献:SMITH 在单一 policy 内交替训练 build task(从少量例子生成 Python 工具与 JSON schema)和 use task(仅凭 schema 调用 pooled tool),以 schema、代码执行、任务 outcome 三轴 reward 联合优化。
为什么值得关注?
以往 dynamic tool creation 常由强模型写工具、弱模型用工具,创建者并不为接口是否清晰、参数是否可落地负责。SMITH 强迫同一模型承担完整因果链:
- tool backend 是否能执行;
- schema 是否格式正确、语义清楚;
- 只看 schema 的调用者是否能解决 held-out harder query;
- 工具是否是可复用抽象,而不是记住训练样例的 shortcut。
Qwen3-4B 在 13 个 Reasoning-Gym procedural family 上取得 held-out 79.8% macro accuracy,超过论文评测中的 prompting/distillation 工具写作方法及未训练 30B-A3B writer;零样本 TabMWP-Hard 达 40.4,GQA 达 42.6,比同 backbone inference-time baseline 高 7.6 points。4B 写出的工具还能让 frozen 350M 使用者接近 30B tool writer 的效果。
与 wenjun 方向的关系:这为 self-evolving Agent 提供了比文本 skill 更强的可验证单位:skill = executable backend + typed schema + downstream-use evidence。对 model-based RL,可将 tool schema 当作 action abstraction,并预测它对调用错误率、horizon 与跨任务 transfer 的影响。
研究判断与边界:训练任务主要是 exact-verifier procedural reasoning,距离真实 repo/world 的有状态工具、权限、副作用和版本迁移还有明显距离;周期同步的 evaluator 也不能完全排除 self-evaluation 的共适应。
#4. LAWA:把“未来想象”压缩成 latent intention,而不是生成未来视频
- 类别:
Model-based RL/Latent Reasoning/World Action Model/Embodied Agent - 标题:Latent Action as Intention Enables Efficient Future Imagination for World Action Models
- 来源与日期:arXiv:2608.24882,2026-08-25;Hugging Face Papers 2026-08-26
- 项目页:LAWA
- 一句话核心贡献:用 action-free pretraining 得到 manipulation-centric 离散 codebook,把未来任务转移编码成 latent action sequence;推理时联合去噪 latent intention 与 action chunk,不再生成未来观察。
为什么值得关注?
这篇给出了 Dreamer-like system 的重要中间答案:未来模型的价值可能来自“显式预测任务相关 transition”,而不是“像素级还原未来”。
- Joint-WAM:训练和推理都生成未来视频,泛化好但慢;
- Fast-WAM:训练时预测未来、推理时删掉 future branch,快但 few-shot/OOD 泛化下降;
- LAWA:保留一个可供 action expert 读取的 compact latent future,删除昂贵视觉生成。
RoboCasa few-shot / full-data 平均成功率为 65.6% / 80.8%,比 matched Fast-WAM 高 9.6 / 4.5 points;效果接近 matched Joint-WAM,但 inference latency 低 42.9%,并报告 LIBERO-Plus zero-shot 与真实任务结果。
与 wenjun 方向的关系:这是 latent-space reasoning + model-based Agent 的直接交叉。迁移到 LLM/Code Agent 时,latent intention 可以不是未来文本,而是预期的 state delta:测试由 fail→pass、依赖图变化、约束解除、信息增益或 subgoal completion。
研究判断与边界:latent action 被称为 intention,但语义主要由动作与任务进展间接决定;还需 intervention / decoding 分析证明 policy 确实使用了 latent future,而不是把它当额外容量。代码与模型目前标注为“将发布”。
#5. Effective Learning Rate:LR 与参数范数可能不是两个独立的训练控制量
- 类别:
Foundation Model Training/Optimization/Scaling Law/Training Mechanism - 标题:Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
- 来源与日期:arXiv:2608.24814,2026-08-25;北京大学 / 蚂蚁集团
- 一句话核心贡献:系统控制 LR 与参数范数轨迹后发现,若
ELR = LR / ||W||的 schedule 匹配,不同 LR、weight decay、Hyperball 等配置的训练 loss trajectory 会近乎重合,且 ELR 能让 functional scaling law 跨 norm-control 方法迁移。
为什么值得关注?
很多训练经验把 learning rate、weight decay、参数范数控制视为相互独立的 knob。论文做的是更强的 intervention:人为构造不同 LR 与 norm trajectory,但让二者比值保持同一 ELR schedule。结果在 Llama-124M、Qwen3-MoE-586M 等多种 architecture / optimizer / dataset / scale 上,平均 loss discrepancy 通常只有几乘 10^-3,小于代表性配置约 10^-2 的 seed variation。
对实际 norm-control,匹配 weight decay / Hyperball 所诱导的 ELR 后,loss collapse error 分别约 4.8×10^-3 / 1.2×10^-3。论文还用 ELR 替代 LR,使拟合的 functional scaling law 在未参与拟合的 Hyperball runs 上迁移,并解释 norm control 常见的 delayed acceleration。
与 wenjun 方向的关系:
- 对基础模型训练机制,这是把多个 optimizer/norm trick 映射到共同宏观坐标的候选规律;
- 对模型增长、持续预训练、跨规模超参迁移,可比较保持 nominal LR、μP rule 与保持 ELR 哪个更稳;
- 对数据 mixture 实验,可避免不同 mixture 导致 norm trajectory 不同、进而把优化动态误判为数据能力差异。
研究判断与边界:证据集中在小/中型 proxy pretraining 与 loss dynamics;loss curve 重合不保证 representation、下游能力或更大规模稳定性相同。最值得做的是在 billion-scale、Muon/AdamW、多数据配比下同时测 loss collapse 与 capability divergence。
#三、其他高相关论文与动态
#6. SkillForge:skill bank 不能 append-only,必须显式调用、跟踪证据并持续修订
- 类别:
LLM Agent/Continual Learning/Skill Learning/Post-training RL - 标题:SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents
- 来源与日期:arXiv:2608.24747,2026-08-25;阿里高德
- 一句话贡献:让 Agent 用结构化 tag 按需调用 skill,使每次调用成为可观测事件;按 success rate / usage count 识别低效 skill 并反思修订,同时从成功、失败和 contrastive outcome 多路径生成新 skill。
它解决的是 skill attribution 的最小前提:如果 skill 被整批塞进 prompt,就无法知道某个成功是否真的使用了某条 skill。论文在 ALFWorld、WebShop、AppWorld 上持续超过 SKILLRL,但 success correlation 仍不等同因果贡献;下一步应做 skill-call intervention 或同状态分支执行。
#7. Paritok-4B:面向 Code Agent 的 extractive、intent-conditioned context compressor
- 类别:
Code Agent/Context Compression/Intent Understanding/Systems - 标题:Paritok-4B: Intent-Conditioned Context Compression for Coding Agents
- 来源与日期:arXiv:2608.24188,2026-08-24;PDF 更新标注 2026-08-26
- 模型 / 代码:HF paritok/paritok-4b-v1 · Paritok-official/paritok-4b-v1
- 一句话贡献:从 67,074 条 OpenHands 轨迹蒸馏出 40,606 个验证样本,用 Qwen3-4B LoRA 按 typed segment 抽取关键 span,并以当前任务意图决定哪些行保留。
OOD intrinsic holdout 压到输入的 23.7%;300 个 SWE-bench Lite 单轮 comprehension 设置中压到 25.7%,保留 uncompressed solve quality 的 86.5%;在更贴近真实 Agent 的 cat -n 格式下,压到 27.8% 并保留 89.3%,McNemar p=0.079。需注意作者明确说这不是完整多轮 Agent cost/success 评测。
#8. Constraint Weakening:摘要保留了“事实”,却可能丢掉“必须服从的约束力”
- 类别:
LLM Agent/Context Compression/Intent Understanding/Safety - 标题:When “Must” Becomes “Maybe”: Constraint Weakening in LLM Agent Workflows
- 来源与日期:arXiv:2608.24569,2026-08-25;Hugging Face Papers 2026-08-26
- 一句话贡献:定义 operational state preservation;在 1,296 个受控 episode 中,常见 handoff compression 会保留 blocker 的话题内容,却把 prerequisite / authority / fallback / execution consequence 的 action-binding role 弱化。
普通 artifact-only compression 出现 100% blocker deactivation、54.2% forbidden action;恢复四个状态字段后 preservation 100%、forbidden action 0%。更重要的是 downstream verifier 能阻止违规,但 artifact deactivation 仍 95.3%:containment 不等于 state 被正确传递。
#9. OPDVR:用 outcome sign gate 把 dense teacher guidance 与 RLVR 合成一个 reward
- 类别:
Post-training RL/RLVR/On-policy Distillation/Reasoning - 标题:On-policy Distillation with Verifiable Reward
- 来源与日期:arXiv:2608.24696,2026-08-25;Hugging Face Papers 2026-08-26
- 代码:LeapLabTHU/OPDVR
- 一句话贡献:对 sampled-token OPD 的 teacher/student log-ratio 做 ReLU gate,使正确轨迹 token 获非负 reward、错误轨迹获非正 reward,在不增加 trade-off hyperparameter 的前提下兼容 GRPO(形成 GRPD)。
六个 reasoning benchmark 上 OPDVR / GRPD 均持续超过标准 OPD。方法简洁,但“整条正确轨迹所有 token 都应非负”的假设仍很强:最终答对不代表每一步都有正因果贡献,应和 executed-replay credit audit 联读。
#10. SPO++:异步 Agent RL 不只要处理 policy staleness,还要对齐 event time 与 token measure
- 类别:
Agentic RL/Systems/Long-horizon Agent/Optimization - 标题:SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
- 来源与日期:arXiv:2608.24870,2026-08-25
- 一句话贡献:保留 one-rollout-per-prompt 的 SPO dependency graph,但在 dispatch 时冻结 prompt value、按生成该 rollout 的 policy event 记录证据,并在 actor 真正消费的 action-token measure 下标准化 advantage。
关键诊断是:trajectory-level whitening 后再用 token-mean actor loss,长度与 advantage 的相关会造成非零中心;异步返回顺序也不等于生成事件顺序。ALFWorld 两个规模与 Math-TIR 的 matched runs 中,SPO++ 比 SPO 更快获得 reward,action-token normalization 是最强消融组件。论文偏机制/系统修正,当前 benchmark 范围仍较窄。
#11. Data Mixing as Mixture Experiment:预训练数据域的价值来自交互,不只是单域质量
- 类别:
Pretraining Data/Foundation Model Training/Data Mixture/Evaluation - 标题:Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining
- 来源与日期:arXiv:2608.23922,2026-08-24
- 一句话贡献:把 domain token shares 视为 simplex 上的 mixture components,用稀疏二阶 Scheffé response surface 分解 additive / pairwise effect,并用 model-robust I-optimal design 选择更有信息量的 proxy mixtures。
在 RegMix 数据的重分析中,若干 additive effect 弱的 domain 因与 web text 配合而变得有益;结构化模型能跨 scale 保留 mixture ranking,并在 calibrated simulation 中删掉约 25% proxy runs 后仍恢复相关排序。证据目前是对 RegMix 的二次分析与 simulation,尚未重新训练 frontier-scale 模型验证最终 mixture。
#12. AutoSaddler:把 harness 当代码,用失败 trace 做离线 patch learning
- 类别:
LLM Agent/Code Agent/Harness Evolution/Long-horizon Agent - 标题:AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
- 来源与日期:arXiv:2608.23041,2026-08-24;Hugging Face Papers 2026-08-26;Microsoft
- 代码:microsoft/AutoSaddler
- 一句话贡献:对 mini-batch failure trace 做深度诊断,生成 targeted harness code patch,并用 validation-aware selection 接纳可泛化更新。
GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 分别提升 9.0 / 9.6 / 10.0 points;GAIA2 达到 72.3% dev accuracy 约需 1,000 次 task execution,而 GEPA/Meta-Harness 约 2,800 次仍停在 64.6/61.5。它与 StarHarness/Recuris 共同说明“模型外参数”正在成为 Agent 持续学习的重要载体。
#13. RobustTests:Code RL 的 reward 质量取决于能否主动寻找“近乎正确代码”的区分性测试
- 类别:
Code Agent/Code RL/RLVR/Pretraining Data - 标题:Robust Code RL via Faulty-Code-Driven Test Case Synthesis and Dense Reward Shaping
- 来源与日期:arXiv:2608.24135,2026-08-24
- 一句话贡献:从 near-correct faulty code 的行为差异生成测试,用 validator agents + behavioral feature clustering 去无效/冗余 case,并用 pass-rate 构造 step-wise dense reward。
基于增强 CodeContests+ 对 Qwen3-32B 做 RL,LiveCodeBench 获得 +3% absolute gain。核心意义不是幅度,而是把 test generation 从“覆盖 specification”改成“区分当前 policy 常见错误”,与 environment design / adversarial curriculum 相连。
#四、今日最值得精读的 3 篇
- Recuris:最贴近 long-horizon self-evolving Agent;重点看 EM–WM coupling、failure localization、validation-gated skill patch 与 horizon scaling。
- LAWA:最贴近
Dreamer + latent-space reasoning;重点看 latent action tokenizer、action-free pretraining、future branch 的 matched comparison 与 latent intervention。 - Effective Learning Rate Governs Loss Dynamics:最贴近基础模型训练机制;重点看 prescribed norm intervention、collapse precision、normalization 边界以及 ELR-based scaling-law transfer。
强烈候补:做 Agent critic / credit assignment 读 CAFE;做 self-evolving tool/skill 读 SMITH;做 Code Agent context 读 Paritok-4B 与 Constraint Weakening 联读。
#五、今日最值得跟进的 3 个 repo / model / dataset
- Repo — Gen-Verse/Recuris:GitHub API 核验含
src/、configs/、scripts/、skill_memories/、splits/、integrity/与文档,2026-08-26 仍有 push;适合直接拆解 working/experiential memory 与 gated evolution。 - Model + Repo — paritok/paritok-4b-v1 / Paritok-official/paritok-4b-v1:公开 264MB LoRA、训练/评测与 extractiveness audit;适合在真实多轮 Code Agent 上做 context budget–success–cost 曲线。
- Repo — microsoft/AutoSaddler:GitHub API 核验含
src/、configs/、scripts/、tests/、文档和 Microsoft 开源治理文件;适合研究 failure trace 如何变成 durable harness patch。
额外推荐:appier-research/smith 已于 8 月 26 日更新,可跟进 tool build/use 联合 RL;LeapLabTHU/OPDVR 已有训练脚本、数据与 VERL fork;ServiceNow/StarHarness 目前 GitHub API 只显示 README,暂不列 Top 3。
#六、研究机会 / Idea
#Idea 1:Latent Skill-Outcome Model:不预测未来文本,预测 skill 对 belief state 的可执行变化
把 Recuris、SMITH 与 LAWA 合起来:
- 用 Working Memory 表示当前
goal / progress / blocker / uncertainty; - 把 executable skill/tool 作为高层 action;
- world model 预测 compact latent intention:skill 执行后哪些状态字段应改变;
- 不生成完整未来 observation,只解码必要的 state delta 与 verifier prediction;
- sandbox 执行 skill,比较 predicted vs actual delta;
- prediction error 同时更新 world model、skill validity 与 skill router。
核心问题是:对 LLM/Code Agent,未来想象的充分统计量是否只是“任务相关状态变化”,而非完整下一段文本或完整环境观察?
#Idea 2:Constraint-Carrying Context Compression:压缩器必须保留 action set,而不只保留答案信息
把 Paritok 的 extractive intent conditioning 与 Constraint Weakening 的四字段 state 结合:
- 将上下文切成 evidence、candidate plan、binding constraint、authority、fallback、execution consequence;
- 对代码标识符和错误字符串保持 extractive;
- 对 binding state 生成 typed artifact,不允许自由摘要;
- 用 intervention 测压缩前后 allowed action set 是否一致;
- 评测同时报告 token ratio、solve rate、constraint preservation、forbidden action 与 recovery ability。
这可形成一个更通用的 Agent compression benchmark:压缩是否保持决策等价(decision equivalence),而不仅是问答保真。
#Idea 3:World-Model-Guided Data Mixture Experiment for Agent Pretraining
把 mixture optimal design 与 agent capability mechanism 结合:
- components 不只设为 web/code/PDF,而设为
tool schema / successful rollout / failure-recovery / world transition / working note / executable verifier; - 用 Scheffé interaction 显式估计哪些数据组合才形成 affordance、state tracking、recovery、planning;
- 用 I-optimal design 选择最有信息的 proxy mixtures,减少小模型预实验;
- 同步跟踪参数 norm 与 ELR,避免把 optimizer dynamics 当数据效应;
- 跨 scale 检查 mixture ranking 与 capability ranking 是否同时保持。
关键问题是:agent-native 数据是否存在强 pairwise synergy,例如“工具文档 × 失败恢复轨迹”远强于两者单独加入?
#七、今日研究判断
今天最连贯的主线是:
Agent 的可持续改进正在从“把更多轨迹塞回 prompt”转向“把经验转成有状态、可执行、可验证、可局部更新的结构”。
- Recuris 把长期经验与当前工作状态拆开;
- CAFE 让 critic 随 policy 访问分布共同演化;
- SMITH 让 skill/tool 的创建质量由实际调用结果约束;
- LAWA 表明 future-aware planning 可以发生在 compact latent intention 中;
- Paritok 与 Constraint Weakening 提醒 context 系统既要保留意图相关精确 span,也要保留约束对 action set 的绑定力;
- ELR 与 mixture experiment 则从训练机制侧说明:超参和数据域的“独立贡献”都可能是假象,共同坐标与交互效应更值得研究。
对 wenjun 当前主线,我最看好的一条组合路线是:
以 Working Memory 作为 Agent belief state,以 executable skill/tool 作为高层 action,以 latent intention 预测任务相关 state delta;所有 skill、critic、memory 与 context compression 更新,都由 sandbox execution、operational constraints 和 held-out transfer 共同验证。
这条路线能把 model-based RL、latent-space reasoning、self-evolving Code Agent、持续学习、context compression 与 agent pretraining data 统一到同一个可做因果干预的实验框架里。