#2026-08-18 AI/LLM 最新论文与研究热点简报
覆盖窗口:截至北京时间 2026-08-18 08:00,重点覆盖 arXiv 在 8 月 17 日公开的周一批次。由于论文版本页统一标为 8 月 14 日、周末后才进入 recent 列表,本文把它们视为最近 24 小时可发现的新工作;Hugging Face Daily Papers 最新完整榜单仍主要停留在 8 月 14 日。
核验方式与限制:逐条检查 arXiv
cs.AIrecent 页面,并下载本文涉及论文的 PDF、抽取全文核验方法与数字;同时通过 Hugging Face API 和 GitHub API 核验模型或代码仓库。arXiv API 本次持续返回 429,但 recent 页面与 PDF 可访问;Google Scholar 返回 403;OpenAlex 搜索临时返回 503;X 搜索页只返回动态应用外壳,没有可审计的时间线内容,因此不引用无法核验的社交帖子。GitHub 最近 48 小时关键词搜索以低星应用项目为主,未把它当作论文发现主源。
#一、先看结论:今天最重要的 6 个信号
- 最接近“LLM Agent 版 Dreamer”的新信号不是再训练一个神经视频模型,而是让 Code Agent 在测试时写出可执行 digital twin:Twin 对未知游戏从交互中归纳 transition program,要求每次真实行动前先通过全部历史转移的 replay validation,再在模型内规划。
- 长轨迹 Agent 的关键抽象正在从“更长上下文”转为“可恢复状态”:AgentRewind 同时 checkpoint 语言上下文与环境;ScienceFlow 则把整个可执行研究 workspace 变成可分支、可回退、可重新锚定的研究状态。
- 潜空间推理开始被要求对“任务增益”逐步负责:RGLT 不只让 latent state 模仿显式 CoT,而是把每一阶段对检索排序的实际增益分给对应 latent transition。这是比 representation alignment 更接近 credit assignment 的训练目标。
- 基础模型架构在尝试显式拆开 knowledge storage 与 reasoning operator:Mobius 共享 FFN memory、循环使用轻量 Self-Attention reasoner;报告中既有 latent recurrence,也有 continual pretraining 迁移实验,值得关注但需要独立复现。
- 高质量数据“重复几轮”不能脱离 scaling regime 讨论:固定总 token 与固定 tokens-per-parameter 会得到相反结论。实际按模型规模同步扩训练预算时,最优重复次数反而随模型规模轻微上升;domain learnability 比独特数据量更能预测可重复性。
- 自演化 Agent 的训练单元正在从单条成功轨迹变成可归因的 sibling portfolio:HELIX 把 harness intervention 显式化,并保留成功、失败、near miss、替代解及 provenance,目标是同时优化当前执行和下一轮模型训练数据。
#二、重点精读(Top 5)
#1. Twin:让 Code Agent 在测试时写出可执行世界模型,再在“数字孪生”里规划
- 类别:
Model-based RL/LLM Agent/World Model/Test-time Learning/Code Agent - 标题:Twin: Playing an Unknown Game with a Test-Time Digital Twin
- 来源与日期:arXiv:2608.14490;v1 2026-08-14,进入 8 月 17 日 recent 批次
- 代码:Alexyskoutnev/TWIN-ARC-AGI-3
- 一句话核心贡献:frontier coding agent 从真实交互中持续编写和修复一个 Python transition model;只有当它能精确 replay 所有历史转移后,才允许在该模型中搜索计划并逐步提交到真实环境。
为什么值得关注?
这篇非常接近 wenjun 关注的“LLM Agent world model / model-based RL”,而且给出了一条不同于 Dreamer 的实现路线:世界模型不一定是端到端 latent dynamics,也可以是测试时归纳出的可执行程序。
Twin 的闭环是:
- Observe:把每次
(previous state, action, next state)写入 append-only log; - Induce / Repair:Code Agent 根据新反例改写 Python digital twin;
- Validate:新版本必须重新跑过全部历史转移,不能只解释最新 observation;
- Explore:若当前模型或目标假说不够,选择信息增益更高的真实行动;
- Plan:只在通过验证的 twin 内搜索最短路径;
- ExecuteChecked:计划逐步落地,任一 mismatch 立即变成修补 world model 的反例。
在 ARC-AGI-3 未知游戏上,论文报告清除 183 个 level 中的 179 个(97.8%);在清除的 level 中有 158 个行动数优于首次玩的真人。相同 base model 直接行动只得 7.8%,放进普通 coding harness 是 61.1%,加入 test-time twin 后是 93.3%。更有意思的是,transition dynamics 在几乎所有 level 上可以恢复,但真正更难的是发现环境未明说的 goal:156 个已清除 level 在奖励出现前推断出目标,其余靠搜索发现。
与 wenjun 方向的关系:
- 这是一个可直接抽象到 Web/Code Agent 的 model-based loop:把 repo、测试、依赖、外部服务抽象成可执行 transition model;
- “全部历史转移 replay 一致”对应 world-model training 中的 consistency constraint,比只拟合下一步平均 loss 更不容易静默遗忘旧规则;
- 它把 epistemic exploration 和 goal inference 分开:先问“世界怎么变”,再问“到底什么算成功”。这也非常贴近“从指令理解到意图理解”。
研究判断与边界:ARC-AGI-3 是小型、确定性、离散、可精确比较的世界;真实软件环境包含网络、副作用、随机测试和隐藏服务,程序模型很难精确 replay。真正值得做的扩展不是简单复制 benchmark,而是研究 partial digital twin + uncertainty + selective real execution。
#2. AgentRewind:长轨迹失败后,不要只反思;同时回滚 context 与 environment
- 类别:
LLM Agent/Code Agent/Long-horizon/Recovery/Evaluation - 标题:AgentRewind: Recoverable Execution for Long-Horizon LLM Agents
- 来源与日期:arXiv:2608.14380;v1 2026-08-14,进入 8 月 17 日 recent 批次
- 代码:Futuresis/replay-agent-recorder
- 数据集:MettleBench
- 一句话核心贡献:在每个 LLM decision boundary 对齐记录
(agent context, workspace state);陷入死路时,由 Agent 选 checkpoint、恢复两种状态,并把失败假说和替代策略作为 rewind memory 注回旧上下文。
为什么值得关注?
现有 Reflexion 类方法常做两件事之一:保持已经污染的环境继续修,或者把环境完全重置后从头再来。AgentRewind 提供第三种更合理的语义:保留正确前缀,删除失败后缀,但保留从失败中学到的信息。
论文的 recovery boundary 是工作目录文件树:能恢复被删文件、回退修改、移除新建文件;但网络请求、外部服务调用和 workspace 外状态不能撤销。这一边界说明,“rollback”不是一句 prompt,而是运行时事务语义。
作者还提出含 82 个长时域工程任务的 MettleBench,用有顺序的 acceptance checklist 同时测完整成功与部分进展。Terminal-Bench 2.0 上,论文报告:
- Continue:成功率 78.7%,平均满足条件 88.7%;
- Restart with Experiences:70.8% / 79.2%;
- AgentRewind:83.1% / 90.2%。
更关键的趋势是:相对 strongest baseline 的优势在短任务上不大,在中长 horizon 上明显增大。这比单个平均分更符合方法动机。
与 wenjun 方向的关系:
- 对 long-horizon Agent RL,state 应包括
language state + environment state + learned failure memory,三者不能错位; - 对 Code Agent,git commit 只是文件 checkpoint,不等于恢复模型上下文、测试进度和已证伪假说;
- 对 model-based RL,可把 rewind 看成从过去 state 重新展开新 suffix,形成天然的 branch comparison 数据,用于训练 value、failure detector 或 branch selector。
研究判断与边界:如果 rewind 由同一个模型自由触发和选点,可能出现“反复回滚却不改变策略”。下一步应学习 continue / rewind-to-k / restart / abort 的 option policy,并把回滚代价、不可逆副作用和 checkpoint 密度写进目标。
#3. Intern-S2-Mobius:共享知识 Memory + 循环 Reasoner,试图从架构上拆开知识与推理
- 类别:
Foundation Model/Latent Reasoning/Continual Pretraining/Architecture/Systems - 标题:Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
- 来源与日期:arXiv:2608.14290;v1 2026-08-14,进入 8 月 17 日 recent 批次;Shanghai AI Laboratory
- 模型:internlm/Intern-S2-Mobius
- 一句话核心贡献:把 FFN 组织成多个 reasoning stage 都可访问的全局 shared knowledge Memory,把 Self-Attention 作为循环 Reasoner,并让 hidden state 在 latent space 中多次检索、组合知识后再并行解码。
为什么值得关注?
标准 Transformer 把 FFN 与 attention 逐层绑定,深层 reasoning operator 很难重新访问浅层未激活的知识。Mobius 的核心假说是:
- Knowledge 主要存于共享 FFN vector memory;
- Reasoning 由多个轻量 Self-Attention operator 执行;
- hidden state 作为 carrier,循环查询同一知识库;
- 多次 latent refinement 后,不必把所有中间计算展开成长 CoT token。
技术报告给出两组结果:
- 两个 7B-A1B MoE 从头训练实验中,以 Transformer 在 1T token 时的 MMLU 为参照,Mobius 用 62.6% 数据达到相同分数,即作者所称 1.6× data efficiency;
- 从 Qwen3.5-35B-A3B 切换架构并继续预训练 1T token,再做 SFT/RL,作者报告相似或更高下游分数以及接近 4× 的端到端推理加速。报告表中,Mobius/Qwen3.5 的 general-task 平均为 67.88/65.05,但也存在 UGD-hard、HLE 等单项下降。
与 wenjun 方向的关系:
它把 latent-space reasoning 从“加几个 silent token”推进到 architecture-native recurrence,也把持续预训练变成结构迁移问题:如何从已有 Transformer checkpoint 继承知识,同时重新组织 reasoning path。对 Agent world model,还可以问共享 Memory 中是否能形成可复用的 transition primitives。
研究判断与边界:这是团队技术报告,训练配方、baseline 公平性、真实吞吐组成和迁移成本都需要独立审计;“FFN=知识、attention=推理”也是工作假说而非严格机制证明。HF 权重已可访问(本次 API 核验到 Apache-2.0、非 gated),但论文数字不应在未复现前视为定论。
#4. Scaling Domain Data Repetition:固定 TPP 时,大模型反而可以多看几轮高质量数据
- 类别:
Pretraining Data/Scaling Law/Code Data/Foundation Model Training - 标题:Scaling Domain Data Repetition in LLM Pretraining
- 来源与日期:arXiv:2608.14071;v1 2026-08-14,PDF 标注 2026-08-17;Tsinghua University / ByteDance Seed
- 一句话核心贡献:在总训练 token 随参数量同比增长、即固定 tokens-per-parameter(TPP)的实际 scaling 设置中,最优 domain repetition 随模型规模轻微增加,而其主要预测变量是该 domain 的最低验证 loss,不是独特 token 数量。
为什么值得关注?
“模型越大,重复数据越容易过拟合”并不总错,但它通常来自固定总数据预算的比较:参数变多、数据不变,大模型当然更快记住重复样本。实际大模型训练往往同步增加总 token;此时重复的 domain 数据也被更多通用 web token 正则化,结论可能反转。
论文在 code、math、Wikipedia、medical 四个 domain 中,令 unique high-quality fraction 为 1/40、1/20、1/10,repetition count 从 1 扫到 7,并固定每个模型的总预算。主要观察是:
- Math 的最佳点约在 5 次;Wiki、Code、Medical 更早达到最低 loss;
- 最优 repetition 与最低验证 loss 的 Pearson 相关为 -0.944:越容易建模、噪声越低的 domain,越能承受重复;
- 与模型规模相关为 0.400:固定 TPP 时,大模型偏好略多重复;
- 与 unique high-quality fraction 的相关仅 0.018;
- 固定 domain token 占比、用重复样本替代同量 unique 数据时,Math 重复 1→4 次损失很小,Wiki 超过 2 次后明显恶化;Code 和 Medical 也有退化,只是程度不同。
与 wenjun 方向的关系:
这直接影响 code pretraining / continual pretraining 配比:不要只按“代码 unique token 有多少”决定 epoch,而应先用同 TPP proxy model 测 domain validation loss × repetition 曲线。对 agent trajectory data 也有启发:高重复不是天然有害,关键是轨迹是否低噪、是否提供稳定可学习结构,以及重复是否稀释了环境多样性。
研究判断与边界:论文只分别混一个高质量 domain 与 web data,没有测 code+math+agent 多域交互,也没有把 exact duplicate 与 semantic near-duplicate 分开。对代码数据,license、模板化 boilerplate、仓库级泄漏和 benchmark contamination 仍需独立控制。
#5. RGLT:让每一步 latent reasoning 都对检索排序增益负责
- 类别:
Latent Reasoning/Retrieval/Credit Assignment/Context Engineering - 标题:Retrieval Grounding Latent Reasoning for Dense Retrieval
- 来源与日期:arXiv:2608.14107;v1 2026-08-14,进入 8 月 17 日 recent 批次;BUPT / Meituan LongCat / CASIA
- 一句话核心贡献:在 query 后附加固定 silent tokens,非自回归形成 latent trajectory;把显式 CoT 每阶段带来的正负文档排序增益,作为 retrieval-effect credit 分配给相应 latent transition。
为什么值得关注?
许多 latent reasoning 方法只要求中间 hidden state 与显式 CoT 表征相似,或只优化最终答案。这存在一个漏洞:中间状态可能“看起来像推理”,但对任务决策没有任何增量作用。RGLT 将监督改成:第 k 段显式 reasoning 让正文档相对 hard negative 改善了多少,latent transition 也应恢复对应 ranking effect。
其训练包含三层约束:
- 把显式 CoT 切成 stages,做 stage-wise reconstruction / implicit distillation;
- 每个 stage 维持对正负文档的 contrastive discriminability;
- 按显式 stage 的 ranking gain 做 transition-level credit assignment。
使用 16 个 silent tokens 时,BRIGHT 上 nDCG@10 从 base representation 的 26.39,沿 ST4/ST8/ST12/ST16 逐步变为 32.25/32.48/33.56/34.20;最终 Recall@10 为 39.97。作者报告相对 LaSER 的 nDCG@10 和 Recall@10 分别提升 14.4% 和 16.6%。A100、batch 8 的 query latency 为 24.0 ms/query,仅比 base retriever 高 12%;显式 Rewrite-then-Retrieve 则有 186× latency overhead。latent budget 增到 24 反而下降,说明更多 silent compute 不自动等于更好。
与 wenjun 方向的关系:
它给 latent-space reasoning 一个很重要的训练原则:不要只监督 state resemblance,要监督 transition utility。迁移到 Agent RL,可以把每段 latent update 对 action ranking、value calibration、world-model prediction 或 verifier margin 的增益作为局部 credit,而不是强迫 hidden state 模仿自然语言 CoT。
研究判断与边界:当前任务是一次性 dense retrieval,latent trajectory 不接收真实环境 observation;它证明了 transition-grounded supervision 的价值,但还不是交互式 latent planning。真正关键的扩展是 observation-conditioned latent recurrence 和跨 turn 的 credit conservation。
#三、其他值得跟进的新论文与动态
#6. ScienceFlow:把研究进展存成可恢复的 executable workspace
- 类别:
LLM Agent/AI Scientist/Long-horizon/Systems - 标题:ScienceFlow: A Long-horizon Agent for ML Research, Scientific Discovery and Beyond
- 来源与日期:arXiv:2608.14354;v1 2026-08-14,进入 8 月 17 日 recent 批次;Huawei Noah’s Ark Lab
- 项目页:ScienceFlow
- 一句话核心贡献:把长时域研究拆成带可执行 workspace checkpoint 的 segments;ESTRA 在 live state 与 archived state 之间选择下一锚点,execution controller 再按资源、预算和已验证进展分配任务。
论文报告在完整 75-task MLE-bench、24 小时预算下达到 70.22% Any-Medal,较先前报告结果高 4.92 个百分点。对 wenjun 最重要的不是排行榜,而是它把 code、data、checkpoint、solver state、evaluation output 看成一等研究状态;文本 summary 只用于跨 worker 交流,不能代替可执行恢复。
#7. HELIX:模型和 Harness 必须共同进化
- 类别:
Code Agent/Agentic RL/Self-evolution/Training Data - 标题:HELIX: Model-Harness Co-evolution for Recursive Self-Improvement
- 来源与日期:arXiv:2608.13951;v1 2026-08-14;HKU In3 Lab
- 代码:HKUDS/HELIX
- 一句话核心贡献:把 OpenCode、Pi Mono、Nanobot、Hermes Agent 拆成 typed ports、atoms、recipes、shells 和 runtime policies,使 harness intervention 可枚举、可审计,并把 sibling outcomes 转成 SFT/critic/filter/preference 数据。
65-candidate evolution round 找到比 Pi task coverage 高 4.0% 的固定 harness;完整 portfolio 暴露最多 58.0% 额外 coverage。200-slot sibling slice 产生 438 条经验证训练记录。论文真正提出的是 build harness → 收集带 provenance 的 sibling trajectories → update model → 为新模型 rebuild harness,而不是把 harness optimization 当一次性 prompt search。
#8. SAFARI:专家成功轨迹会删掉探索,导致 SFT 后的 Agent 不会主动找信息
- 类别:
LLM Agent/Post-training RL/Exploration/Long-horizon - 标题:Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents
- 来源与日期:arXiv:2608.14339;v1 2026-08-14;Sichuan University / NUS / University of Leeds
- 代码:GuanZhizhao/SAFARI
- 一句话核心贡献:先合成保留分支和回溯的 exploration-rich trajectories,修正 SFT hindsight bias;再用同一 interaction state 上的候选 action 与参考 action做 Monte Carlo 对比,为 RL 提供 productive exploration 信号。
作者报告 task success 平均提高约 10%–15%,exploration efficiency 提高约 8%–18%。它与 Twin 的 goal discovery 遥相呼应:成功 demo 往往看似知道该去哪,但 Agent 真正需要学习的是何时当前信息不足、下一步探索值不值得。
#9. Second Thought:把工具等待时间变成并行推理窗口
- 类别:
Code Agent/Tool-use/Inference-time Scaling/Systems - 标题:Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
- 来源与日期:arXiv:2608.13667;v1 2026-08-13;Singapore Management University
- 代码:匿名审稿仓库
- 一句话核心贡献:主线程发出 action 后,启动 assumption check、next-step rehearsal、context recall、contingency plan 四个并行分支;observation 返回时立刻中断并收集已经完成的 atomic thoughts,供下一轮使用。
在 3 个 benchmark × 3 个模型的 9 组实验中,平均 turn 数全部下降;6 组主线程 decoding 下降,最高 43%,这些组平均约 20%;wall-clock replay 的 median per-task latency 降 10.9%。它提示 agent systems 的 inference scaling 不必全部放在 critical path,但总 GPU token 成本并未消失,部署时必须同时报告 latency、main-thread tokens 和 total tokens。
#10. Demystifying Agent Skills:Skill 主要是程序锚点,不是知识注射包
- 类别:
LLM Agent/Continual Learning/Skill/Evaluation - 标题:Demystifying Agent Skills: Why They Work-Until They Don’t
- 来源与日期:arXiv:2608.14036;v1 2026-08-14
- 一句话核心贡献:通过 8,135 次受控 trial 和 paired trajectory analysis,发现 skill 的主要价值是稳定过程而非补充事实;skill pool 扩大后,真正被使用的精度急剧下降。
论文报告 skill 相比 Workflow Memory 的 matched comparison 高 6.06 分;65.7% 的有效案例来自 procedural anchoring,显式知识注入仅 4.5%。候选池从 5 增到 100 时 actual-use precision 从 29.6% 降到 3.3%。这意味着 self-evolving Agent 的核心瓶颈可能不是“再写更多 SKILL.md”,而是 skill applicability、adaptation 和 retrieval calibration。
#11. MOOSEDev:代码 Agent 的项目记忆应记录 supersession、negation 和 provenance
- 类别:
Code Agent/Memory/Continual Learning/Knowledge Graph - 标题:Ontology-Grounded Project Memory for Coding Agents
- 来源与日期:arXiv:2608.13662;v1 2026-08-13
- 代码:Trivyn/moosedev
- 一句话核心贡献:把 architecture decision、constraint、rationale、lesson、anti-pattern 存成带 lifecycle status、provenance 和 supersession link 的 typed graph,并通过 MCP 暴露给 Coding Agent。
在 835 条 typed records 的公开 corpus 上,MOOSEDev 对 supersession、set completeness、negation 问题返回预期集合的 0.98–1.00,而 vector-memory baseline 的 top-k 仅覆盖 6%–27%;普通相关性检索与 token 成本则大致相当。它支持一个重要判断:语义相似检索解决不了“旧决策已被撤销”和“是否枚举完整”这类逻辑问题。不过 MOOSE engine 是 proprietary,结果更适合作为研究问题而非立即可复现的最终答案。
#12. Handover of ICL State:上下文交接不是摘要相似,而是保留后续任务的 predictive sufficiency
- 类别:
Context Compression/LLM Agent/Theory/Memory - 标题:Handover of In-Context Learning State Across Session Boundaries
- 来源与日期:arXiv:2608.14528;v1 2026-08-14,论文标注 2026-08-17
- 一句话核心贡献:把跨 session handover 形式化为 pre-query state coding:writer 在不知道未来 query 时,必须保留对 continuation target 分布充分的信息,而不是复述旧文本。
论文建议三部分记录:决策和约束精确保留;重复证据在有任务保证时存充分统计量;不能证明统计量保留作用时,保留原始 observation。它没有大型 Agent 实验,但理论上澄清了通用 context compressor 的关键误区:handover writer 不知道未来会问什么,因此比 query-aware compression 更难;文件和外部数据库只要携带旧 session 信息,也必须计入总 memory budget。
#四、今日最值得精读的 3 篇
- Twin:今天与 LLM Agent model-based RL 最贴近的论文;重点看 validate–explore–plan loop、transition replay consistency 和 goal inference failure。
- AgentRewind:重点看 context/environment 对齐 checkpoint、rewind memory 以及 MettleBench 的 ordered checklist 设计。
- Scaling Domain Data Repetition:重点看 fixed-data 与 fixed-TPP 结论为何反转,以及 code/math/wiki/medical 的 domain difference。
候补:若今天更想沿 latent reasoning 深挖,把第 3 篇换成 RGLT;若更关注基础架构,换成 Intern-S2-Mobius。
#五、今日最值得跟进的 3 个 repo / model / dataset
- Repo — TWIN-ARC-AGI-3:优先看 world-model Python representation、全历史 replay validator、real/twin action boundary。
- Model — Intern-S2-Mobius:HF API 核验为公开、非 gated、Apache-2.0;适合检查 custom architecture、实际 generation loop 与吞吐。
- Dataset — MettleBench:82 个带系列 acceptance requirements 的长时域工程任务,可用于测 rollback、partial progress 和 branch recovery。
额外高优先级 repo:HKUDS/HELIX,因为它直接提供 harness decomposition 与 sibling-data 生成框架。
#六、研究机会 / Idea
#Idea 1:Programmatic Dreamer for Code Agent——部分可执行世界模型 + 不确定性驱动真实行动
把 Twin 从确定性游戏迁移到 repository:
- world state:文件、AST、dependency graph、test state、build artifacts;
- learned transition:patch 对编译、单测、接口和性能的预测;
- exact component:可静态执行或 sandbox replay 的 deterministic rules;
- uncertain component:外部依赖、flaky test、hidden test,用 calibrated uncertainty 表示;
- planner:优先在 twin 内 rollout,只在模型分歧或 goal uncertainty 高时调用昂贵真实工具。
核心实验不是“能否预测下一段日志”,而是 真实 tool calls 减少多少、model exploitation 有多少、planner regret 是否下降。
#Idea 2:Rewind-aware Agent RL——把失败后缀变成 branch-level counterfactual credit
AgentRewind 会自然产生共享前缀、不同后缀的 sibling trajectories。可以训练:
- checkpoint value:从哪个历史 state 重开最有价值;
- option policy:continue / rewind / restart / abort;
- failure memory writer:什么经验应跨分支保留,什么污染应删除;
- counterfactual advantage:同一 checkpoint 下,新 suffix 相对失败 suffix 改善了多少。
这比只对最终 success 做 trajectory-level GRPO 更适合 long-horizon credit assignment,也能与 HELIX 的 sibling data provenance 对接。
#Idea 3:Transition-grounded Latent World Reasoning——从“latent state 对齐”转向“每次隐状态更新改变了什么决策”
沿 RGLT 的思路,给 Agent latent recurrence 设计 task-grounded local objectives:
- 每个 latent transition 对候选 action ranking margin 的增益;
- 对 world-model next-state calibration 的增益;
- 对 constraint violation probability 的下降;
- 对 information-gain action 的识别提升。
再与 Mobius 类 shared memory / recurrent reasoner 对比:固定 silent tokens、显式 recurrent depth、共享 knowledge memory,哪种结构能让 utility 沿 latent depth 单调增加?这可以形成一个比“最终准确率 + probe”更强的 latent reasoning benchmark。
#七、今日研究判断
今天最连贯的主线是:长轨迹智能不再等价于把历史塞进更长 prompt,而是在可验证状态上做模型学习、分支探索和可恢复执行。
- Twin 把 world model 变成受反例约束的可执行程序;
- AgentRewind / ScienceFlow 把 history 变成可恢复的 state graph;
- RGLT 把 latent computation 变成对任务增益负责的 transition;
- HELIX 把 harness 差异变成可归因训练数据;
- Handover theory 则说明,压缩目标必须由未来 continuation task 定义。
对 wenjun 当前主线,最值得下注的交叉点不是单独再做一个 memory、world model 或 rollback 模块,而是把三者统一成:
外部可验证状态 + 内部 latent state + 可恢复分支 + transition-level credit assignment。
这会比单纯扩 context、单纯做结果奖励或单纯存经验更接近真正的 model-based long-horizon Agent learning。