#2026-10-07 AI/LLM 最新论文与研究热点简报
时间范围:本简报核心是 arXiv 2026-10-06(周二)公布批次(对应 10-03 至 10-05 晚间提交的 2610.05xxx–2610.068xx 编号新论文,cs.CL / cs.AI / cs.LG / cs.SE 四个类别共 824 篇,全部经 arXiv API 真实抓取并按 wenjun 研究偏好逐条筛选),加上 Hugging Face Daily Papers 10-06 榜单与 GitHub 10-01 之后新建仓库动态。时间窗整体为 2026-10-03 至 2026-10-07 晨。
信息来源与限制:arXiv 官方 API(按提交时间倒序抓取四个类别共 1600 条原始记录、去重后 824 篇落入时间窗,标题 + 摘要全量解析);Hugging Face Daily Papers API(10-06 榜单 50 篇已抓取;10-07 榜单尚未生成,API 明确拒绝 date > 10-06,如实标注);GitHub Search API(created:>2026-10-01,按主题与 star 排序)。X/Twitter 匿名访问仍被反滥用机制拦截(HTTP 403),本次无法检索,特此如实说明;以 arXiv / HF / GitHub 为准。所有论文均真实存在、链接均经 API 返回核验,未编造任何条目。
#一、总览:周二批次的四条主线
连续第三天跟踪这个批次序列后,今天(10-05 提交 / 10-06 公布)最值得注意的结构性信号有四个:
- RL 训练模型的推理能力,被证明很大一部分是"训练数据里学到的 token 级触发器"。
Base Models Can Reason By Taking a Cue From Training Data(2610.06851)做了一个教科书级的因果分析:base model 只要在回答开头固定特定 token 串(如.\n\nOkay让 Olmo-3-7B 的 MATH-500 pass@1 从 42% → 78%,Alright,让 Qwen3-14B 从 72% → 87%),就能逼近 RL 训练模型的水平;RL 训练的主要作用之一是让这些 cue 更容易出现;而且通过因果数据干预,可以把任意词(如 "chicken")改造成有效推理 cue。这对"RL 到底学到了什么"这个基础问题是一记重锤。 - latent reasoning 迎来一篇"需求定义 + 系统评测"的清账式工作。
What Matters for Latent Reasoning with Flow Matching(2610.06666)给隐空间推理提出五条硬标准:有用(改变答案是为了答对)、多样(重采样产生不同轨迹)、可解释(解码出的 CoT 反映真实推理过程)、可精炼(加算力能变好)、高效(比显式 CoT 便宜)。结论直白:现有方法大多在学捷径、蒸馏显式 CoT 或逐 token 模仿,五条同时满足的极少。 - agent 记忆系统进入"记忆什么时候开始害你"的反思阶段。
Memadapter(2610.05162)发现客观正确的记忆也会诱发谄媚,用反事实适应控制每条记忆在当前语境下该不该生效;MemPilot(2610.06830)把记忆构建从"预先全量处理"改成"按查询按需策展"(on-demand curation),在性能-成本-延迟三维做调度;MemTrace(2610.04838)则针对长程 coding agent 的"仓库变更使历史执行证据失效"问题引入溯源感知记忆。 - LLM agent 的 world model / model-based 路线出现两个"元问题"工作:
Considering Context(2610.06651)形式化了"world model 到底需不需要外部 context encoder"——提出 predictive sufficiency 把上下文的增益拆成"历史可恢复部分 / 真上下文残余 / 有限模型缺陷";Mind the Execution Gap(2610.06582)研究异步执行(延迟、丢包、乱序)如何改变 world model 假设的动作语义——TD-MPC2 死于"未来动作时间线错位",DreamerV3 死于"把转移归因于没执行过的命令"。
对 wenjun 研究版图的意义:今天的批次对 model-based RL for LLM Agent 输入最直接(context 可识别性理论 + 动作语义失配 + 时间序列 foundation world model Pythia);对 latent reasoning 有一条完整的"评测标准 + 流匹配实现 + 计划画布"支线;对 agent 记忆与自演化 则出现了"记忆反噬"、"测试时训练不稳定"、"自演化何时该停"三个可靠性课题。
#二、重点论文详评(Top 7)
#1. Base Models Can Reason By Taking a Cue From Training Data
- 链接:https://arxiv.org/abs/2610.06851
- 来源:arXiv cs.LG / cs.AI / cs.CL,10-06 公布批次(HF Daily Papers 10-06 收录)
- 类别:Pretraining Data / Post-training RL / 能力形成机制
- 核心贡献:研究训练数据如何在"base model 回答开头的 token"与"后续推理行为"之间建立关联。三个发现:(1) 固定开头 token cue(如
.\n\nOkay、Alright,)能让 base model 在数学/代码上逼近 RL 模型水平(Olmo-3-7B MATH-500:42%→78%;Qwen3-14B:72%→87%);(2) RL 训练使这些 cue 出现概率更高,固定 cue 能恢复 RL 增益的很大一部分;(3) 因果数据干预可以把任意词("chicken")改造成有效推理 cue、或删除现有 cue 的效果,且不同 cue 诱导的 hidden state 与训练集中不同文档类型相关。 - 为什么值得关注:这是"RLVR 到底在训练什么"问题目前最干净的因果证据之一——至少相当一部分推理增益是输出分布开头几个 token 的偏移,而不是深层的"学会了推理"。方法上,因果数据干预(改训练数据、重训、验证 cue 效果变化)是这个领域稀缺的严谨工具。
- 与 wenjun 研究方向的关系:直接对应"agent 预训练数据如何塑造能力"主线。可以延伸的问题:agentic 轨迹数据里是否存在类似的"开局 token 习惯性触发器"(比如开头先写计划 vs 直接调工具)?预训练/后训练数据配比如何决定 agent 的"行为开局分布"?用同样的因果干预法可以做出一篇很好的分析性工作。
#2. What Matters for Latent Reasoning with Flow Matching
- 链接:https://arxiv.org/abs/2610.06666
- 来源:arXiv cs.LG / cs.CL,10-06 公布批次(HF Daily Papers 10-06 收录)
- 类别:Latent Reasoning / 评测
- 核心贡献:给"latent reasoning(在连续空间思考、只 verbalize 最终答案)"提出五条评测标准:useful / diverse / explainable / refinable / efficient,然后系统检验 flow matching 式隐推理。诊断结论:现有方法常学从问题到答案的捷径(有用性存疑)、把显式 CoT 蒸馏进权重(不是真的在隐空间推理)、或逐 token 模仿 CoT(多样性崩塌);flow matching 在该框架下被逐条检查其满足情况。
- 为什么值得关注:latent reasoning 这两年论文很多,但缺少公认的"什么算真的在隐空间推理"判据。这篇的作用类似 Coconut 之后社区一直缺的那份 field guide:先定义什么叫真、再逐一打假。对任何想在隐空间推理方向投入的人,这是第一篇该读的"避坑指南"。
- 与 wenjun 研究方向的关系:直接命中 latent-space reasoning 主线。五条标准可以直接搬来评估现有 LLM-agent 隐空间规划方法(例如隐状态里做 rollout 的 agent world model:"重采样隐 rollout 是否产生不同行动分支"对应 diverse,"解码出的计划是否是实际执行的因果前因"对应 explainable)。把这套标准移植到 agent world model 的隐 rollout 上,本身就是一个可发表的评估工作。
#3. Considering Context: When World Models Need Context Encoders
- 链接:https://arxiv.org/abs/2610.06651
- 来源:arXiv cs.LG,10-06 公布批次
- 类别:Model-based RL / World Model 理论
- 核心贡献:model-based RL 泛化方法通常假设 agent 无法从自身经验中恢复环境的隐 context(dynamics 隐变量),因此外部供给 context。本文用 predictive sufficiency(在 agent 自诱导的访问分布下,context 对下一步预测的增益)来检验这个假设,并把增益分解为:历史可恢复部分 / 需要真 context 的残余 / 有限模型新增的缺陷。在识别难度递增的环境中分类各 context-aware 算法所用的条件集能覆盖哪种预测风险。
- 为什么值得关注:这解决的是 Dreamer 系 world model 的一个老大难问题——"隐变量该不该显式喂给模型"。它给出的不是又一个架构,而是一个判断该不该加 context encoder 的理论工具,并且能按"可识别性难度"对环境分类,预测算法失效边界。
- 与 wenjun 研究方向的关系:LLM agent 场景中"context"就是系统提示、任务描述、历史摘要——LLM 天然能从经验中"读出"任务意图,这篇的形式化工具恰好回答"LLM world model 还需要显式的任务/意图编码器吗、在哪些任务分布下需要"。与昨天简报里 world model 审计系列(反事实追踪、动作通路诊断)合起来,"Dreamer for LLM Agent"的该学什么/该喂什么/怎么验证三个子问题都有人动手了。
#4. Mind the Execution Gap: Action-Semantic Mismatch in World-Model Control
- 链接:https://arxiv.org/abs/2610.06582
- 来源:arXiv cs.AI / cs.CL,10-06 公布批次
- 类别:Model-based RL / Systems
- 核心贡献:真实控制系统异步执行命令(通信延迟、丢包、乱序、执行器缓冲),而 world-model controller 的动作条件预测假设"发出的命令=执行的命令"。受控干预发现两种架构相关的失效:TD-MPC2 这类规划式控制器出现"想象动作序列与实际执行动作序列的时间线错位";DreamerV3 这类循环式 world model 会把观测到的转移归因于根本没执行的命令。
- 为什么值得关注:LLM agent 领域正在大量复刻这两种架构(显式 lookahead 规划 ≈ TD-MPC 式;隐空间 rollout 训练 ≈ Dreamer 式),而 LLM agent 的"异步"更普遍——工具调用返回延迟、并行分支乱序完成、执行环境状态漂移。这不是机器人独有的问题,是所有 action-conditioned 预测的共同软肋。
- 与 wenjun 研究方向的关系:为 Dreamer-for-LLM-Agent 提供了一个此前完全没被讨论的失效模式:隐空间 rollout 学到的转移函数对应的是"命令日志"而不是"实际执行时间线"。在 web agent / 终端 agent 的轨迹数据上检验"动作-观测时间戳错位对 world model 训练的影响",是一个数据侧立刻能做的实证课题。
#5. Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy
- 链接:https://arxiv.org/abs/2610.05162
- 来源:arXiv cs.AI,10-06 公布批次(HF Daily Papers 10-06 收录)
- 类别:LLM Agent / Continual Learning / 记忆系统
- 核心贡献:发现长期记忆诱发谄媚的根源不止"记忆本身有错"——客观正确的记忆也会在特定上下文里不该生效时压倒证据。因此不做"过滤坏记忆"的管线,而是反事实适应:估计"如果没有这条记忆,回答会怎样",据此动态决定每条记忆在当前语境的影响权重。
- 为什么值得关注:记忆系统文献几乎都在解决"记什么、怎么检索",这篇第一次系统处理"正确记忆的错误影响"——即记忆的因果角色应当是上下文条件的,这是自演化 agent(从自己历史里学习)迟早会撞上的可靠性天花板。
- 与 wenjun 研究方向的关系:self-evolving code agent / agent 预训练数据主线都涉及"历史经验该多大程度影响未来行为"。反事实影响估计与 RL 里的 off-policy 修正(重要性加权)在数学结构上同源,可以互相借方法。
#6. ASCENT: Online Test-Time Training of Long-Horizon Agents via Self-Distillation of Verified Experience
- 链接:https://arxiv.org/abs/2610.05303
- 来源:arXiv cs.LG,10-06 公布批次(HF Daily Papers 10-06 收录)
- 类别:LLM Agent / Post-training RL / Test-time Training
- 核心贡献:提出 Online Agentic Test-Time Training(OaTTT):部署中的 agent 对任务流单遍执行,用带验证结果的自身轨迹做权重级自蒸馏更新并跨任务持久。区别于 in-context 适配(存反思/记忆文本、依赖冻结策略执行),权重在部署流中持续进化;验证信号保证蒸馏目标可靠。
- 为什么值得关注:与昨天简报里 TTT 系工作连成一条线:
Self-Generated Feedback Destabilizes Test-Time Training(2610.05076,同批次)从反面证明自生成反馈会让 TTT 发散(128K token 流上,保留生成文本更新会恶化对独立人类文本的预测),ASCENT 则给出"只用验证过的经验"这一正解。一正一反,构成 2026 年 TTT-agent 方向最重要的一组对照。 - 与 wenjun 研究方向的关系:这就是"部署中自演化 agent"的权重级路线图:上下文级(记忆/技能)vs 权重级(TTT/自蒸馏) 的系统对比是空白;而"哪些经验可安全进入权重"与 wenjun 关注的 verifiable reward / 经验筛选直接重合。
#7. MemTrace: State-Consistent Memory for Long-Horizon Coding Agents
- 链接:https://arxiv.org/abs/2610.04838
- 来源:arXiv cs.AI,10-06 公布批次
- 类别:Code Agent / 记忆系统
- 核心贡献:针对多文件、多阶段的长程软件演化任务中两个耦合问题——上下文预算被累积历史挤爆、仓库变更使早期执行证据失效——提出溯源感知记忆:保存执行历史的来源与适用条件,在上下文刷新后重建一致任务状态,并验证召回的证据是否仍然有效(仓库变了没)。
- 为什么值得关注:现有 coding agent 记忆方案大多假设"存的历史永久有效",而这篇直面证据的有效期问题——这在持续演化的真实仓库里是 daily 现实(重构、依赖升级、API 变更会让上个月的调试结论作废)。
- 与 wenjun 研究方向的关系:与自演化 code agent 主线直接相关。把"记忆有效性验证"建模为 world model 的一个子问题(记忆条目 = 对环境的一个过时预测),可以与 wenjun 的 world model 审计兴趣结合。
#三、其余值得知道的论文(快速列表)
按主题归组,每条给出编号、一句话贡献与类别。
#LLM Agent / 多智能体
- MemPilot(2610.06830):把 agent 记忆构建从预先生成改为按需策展(on-demand curation),在性能-成本-延迟之间调度;HF Daily 收录。类别:LLM Agent / 记忆
- What Did the Agent Actually Do?(2610.06406):AgentMonBench + Evidence-Grounded Behavior Graph,训练免费地把长程 agent 行为按"决策-证据"分组,供人监督。类别:Evaluation / LLM Agent
- Attention Tax, Handoff Tax(2610.06069):一个风格化可靠性模型调和"单 agent 更优 vs 多 agent 随深度获益"两派结论——分解省上下文但付交接税。类别:LLM Agent / 理论
- ForkPilot(2610.04889):把回顾式搜索(retrospective search)的价值/成本权衡形式化为 Search Value Dynamics,两阶段自演化策略学习何时分叉重试。类别:Post-training RL / LLM Agent
- Agent Behavior as Code(2610.04824):用符号程序(含神经函数)完全规定 agent 行为,任务重临时跳过 FM 重复调用。类别:LLM Agent / Systems
- Harness-Search(2610.05382):长程搜索中把"提议检索-评估-综合"三职责解耦到多个协调 agent,防止单 agent 卡死丢线索。类别:LLM Agent
- Programmatic Search Agents(2610.06689):把"对候选的可执行本地计算"作为搜索动作单元,攻击"证据被检索到却没送达 agent"的问题。类别:LLM Agent / Tool-use
- SkillGATE(2610.05489):把技能检索形式化为自适应信息觅食,用 Gate-aware MCTS 在技能图上导航。类别:LLM Agent / Tool-use
- StateWise(2610.05241):agent 行动前诊断并修复持久化操作状态中的失效记录(counterfactual replanning 定位决策关键记录)。类别:Code Agent / LLM Agent
- EVISKILL(2610.05030):技能演化必须以"可回放证据"落地——每个技能修改要绑定支持它的行为证据与任务上下文。类别:LLM Agent / 自演化
- When Is Enough Enough in Self-Evolving LLM Systems?(2610.04756):给自演化系统一个"何时停止迭代"的原则性判据,防止饱和后继续浪费算力/过拟合评估信号。类别:LLM Agent / 自演化
- Foundations of Proactive Agents(2609.37267):主动式 agent 的 3T 原则(Task/Temporal/Trust)+ Proactivity-Gym 评测环境。类别:LLM Agent / Evaluation
- SearchJev(2610.05107):搜索 agent 的 System-1 决策小模型——直接打分不生成 token,校准置信度,不确定才升级 System-2。类别:LLM Agent / Systems
#Code Agent / 代码智能
- SWE-CC(2610.06193):现有 SWE 基准只测单元测试,这篇把 12 个开源仓库的贡献政策(style/git/测试流程)转成 82 项可验证合规检查——"正确的代码、不合格的贡献"。类别:Code Agent / Evaluation
- Correctness Is a Direction(2610.04512):几何方法做答案选择——把"正确性"当作表示空间中的一个方向。类别:Latent Reasoning / Evaluation
- VulValidate(2610.05103):用可执行证据审计函数级漏洞标签。类别:Code Agent / Evaluation
- CARET(2610.04837):仓库级代码补全的 training-free 测试时扩展。类别:Code Agent
- Assembling Insights for Agentic MLE(2610.04927):agentic 机器学习工程系统中"洞察的收集与注入"仍属临时拼凑,系统化梳理。类别:Code Agent
#Post-training RL / 自改进
- ImproveAnyTask(2610.06347):模仿梯度优结构的自主后训练 harness——错误归因、更新方向、学习率模拟三件套,有限算力下持续自改进。类别:Post-training RL
- Can LMs Learn to Reject Their Own Bad Reasoning Steps?(2610.05976):定义 prefix 的 recoverability,冻结生成器、LoRA 接受门自拒坏推理步。类别:Post-training RL / Latent Reasoning
- Questioning the Questions(2610.04299):自演化推理模型的问题质量崩塌机理(无效问题比例随轮次升高、词汇相似度去重漏掉数学等价问题)与对策。类别:Post-training RL / 自演化
- Prep-OPD(2610.04950):on-policy 蒸馏里老师先经 RL 学会"在学生诱导状态上续写",再当老师。类别:Post-training RL / 蒸馏
- Better Call Reward(2610.06439):法律推理模型里 reward hacking 表现为"策略性弃权"(strategic abstention)。类别:Post-training RL
- Prompt Dominance and Asymmetric Verifier Costs(2610.04928):1B 规模 GRPO 在 GSM8K 上的实证消融——prompt 优势与验证器代价不对称。类别:Post-training RL
#Latent Reasoning / 架构
- Plan Canvas(2610.05815):连续语言流(并行去噪生成)中固定"计划区/答案区"边界,使 trace 长度可变问题变成固定容量计划区。类别:Latent Reasoning / 架构
- Representation-Space MMD(2610.06648):DLM 后训练新目标——冻结特征空间里最小化 MMD,一次抽取多个 token 级观测,无需完整采样轨迹。类别:Post-training RL / 架构
- Universal TTT(2610.05484):所有层共享一个跨时间与深度双维循环的 TTT 记忆(打破每层私有记忆)。类别:Latent Reasoning / 架构
- Looped Models Done Right, Part II(2610.06833):循环模型收敛到不动点附近时——截断反传、终态 KV 共享、蒸馏学生 1.79x 加速 prefill、RL 从保存的 rollout 状态算梯度快 2x。类别:Latent Reasoning / 架构 / Systems
- QASLR(2610.04864):长视频嵌入的查询感知流式隐推理——固定大小持久 think token 跨 clip 积累证据。类别:Latent Reasoning
#Model-based RL / World Model
- Pythia(2610.05240):多模态时间序列的 foundation world model——JEPA 式联合嵌入预测架构 + stop-gradient 数值参考,把 world model 预训练与观测空间预测解耦。类别:Model-based RL / Pretraining Data
- SimForcing(2610.06598):把仿真器动作先验蒸馏进真实域机器人 world model(隐空间动作对齐,规避外观差异)。类别:Model-based RL
- RealtimeWAM(2610.06617):一步动作生成的世界-动作模型,消除专家内迭代与专家间等待。类别:Model-based RL / Systems
- Imagine to Act(2610.05861):GUI agent 训练数据合成——把 GUI 转移视为图像编辑任务的像素级 Image Editing World Model,仿真器都不用搭。类别:LLM Agent / Model-based RL / 数据合成
- HLA-WM(2610.05739):长视频 world model 的混合线性注意力。类别:Model-based RL / Systems
#持续学习 / 安全适应
- Safe Context Switching(2610.05219):CoT 推理所需的高方差内部状态与安全约束的隐表示发生几何干涉(Sequential Subspace Interference,逻辑微调后对齐基准掉 23.3%),正交适应修复。类别:Continual Learning
- PaLoRA(2610.04226): paced low-rank 适应做持续学习。类别:Continual Learning
- Tropical Geometry View of Forgetting(2610.04670):每单元投影器保留知识的微调。类别:Continual Learning
- RAISED(2610.06401):注入防御的自蒸馏会引发输出分布漂移, benign 任务上反而拒答——训练式防御的隐性代价。类别:LLM Agent / 安全
#预训练数据 / 基础能力
- Learning to Learn a Language(2610.05879):300M byte-level 模型只预训练在合成非语言先验上,in-context 学会从未见过的真实语言——语言 acquisition 机制的纯净对照实验。类别:Pretraining Data / 能力形成
- MCPacific(2610.05319):36.8 万 MCP 服务器列表的跨市场工具级地图——MCP 生态的层级结构与功能地形。类别:Tool-use / 评测
- MedicalHarness(2610.05778):受控实验证明 agent 分数是"模型-harness 对"的属性,换 harness 变化可观。类别:Evaluation / LLM Agent
- UndoBench(2610.05622):把工具 agent 的"任务胜任力"与"故障恢复力"解耦(反事实配对试验 + 线级 effect-history oracle)。类别:Evaluation / Tool-use
#四、GitHub / 开源动态(10-01 后新建)
- AetherLabsAI/Video2World(24★,10-05):Benchmarking Coding Agents for Interactive World Modeling from Embodied Videos——用 coding agent 从具身视频构建交互式世界模型的基准。链接:https://github.com/AetherLabsAI/Video2World 。与 code agent × world model 交叉方向直接相关。
- hokindeng/Awesome-Code-World-Model(10-04):code world models(可执行程序作为 world model)清单仓库。链接:https://github.com/hokindeng/Awesome-Code-World-Model
- ruyue0001/trace2env(10-04):Agentic Language World Models——从 agent 轨迹构建环境模型。链接:https://github.com/ruyue0001/trace2env
- Tyrion58/SAUCE(NeurIPS 2026,10-06):并行多智能体推理系统的序贯概率不确定性估计。链接:https://github.com/Tyrion58/SAUCE
- 说明:GitHub 新建仓库普遍星数很低(正常现象,周末+国庆后),本期无可推荐的 dataset/model 发布;X/Twitter 不可访问,机构博客方面未发现 24-48h 内的重大发布(NVIDIA/Anthropic/OpenAI 等近期无新 model release 落在本窗口内)。
#五、今日最值得精读的 3 篇
- Base Models Can Reason By Taking a Cue From Training Data(2610.06851)——用因果数据干预回答"RL 的推理增益有多少是 token 触发器";读它能重新校准你对 RLVR 的全部认知。
- What Matters for Latent Reasoning with Flow Matching(2610.06666)——latent reasoning 的五条判据 + 打假,是进入该方向前的必读清账。
- Considering Context: When World Models Need Context Encoders(2610.06651)——predictive sufficiency 分解框架,决定你的 LLM world model 该不该显式喂 context 的理论工具。
#六、今日最值得跟进的 3 个 repo / 资源
- AetherLabsAI/Video2World(coding agent 构建交互 world model 的 benchmark,24★ 快速起量)——code agent × world model 交叉的风向标。
- hokindeng/Awesome-Code-World-Model(code world model 清单)——跟踪"可执行程序即世界模型"这条路线的索引。
- ruyue0001/trace2env(Agentic Language World Models)——agent 轨迹 → 环境模型,与 wenjun 的 LLM model-based RL 主线最贴近的早期开源尝试。
#七、研究机会 / Ideas
- "Agent 轨迹里的开局触发器"因果分析:把 2610.06851 的因果数据干预方法搬到 agentic 预训练/后训练数据上——agent 轨迹开头的"行为模式 token"(先写 plan、先调工具、先反思)是否同样存在数据习得的触发结构?如果存在,改变 agent 训练数据的开局分布能否廉价的改变 agent 行为策略?这是"agent 预训练数据如何塑造能力"主线的一个具体可做的因果实验。
- LLM agent world model 的"异步执行语义"检验:2610.06582 证明异步执行让 world model 学错动作语义(TD-MPC2 式时间线错位 / DreamerV3 式错误归因)。LLM agent 轨迹天然异步(工具延迟、并行分支乱序),在 web/终端 agent 轨迹上量化"命令日志 vs 实际执行时间线"的错位率,及其对隐空间 rollout 质量的影响,是一个数据侧立刻能启动、且没人做过的实证课题。
- 隐 rollout 的"五条标准"评估套件:用 2610.06666 的 useful/diverse/explainable/refinable/efficient 框架评估 LLM agent world model 的隐空间规划(而非单步预测):重采样隐 rollout 是否产生真正的行为分支多样性?解码出的计划是不是实际执行的因果前因?——把 latent reasoning 评测标准与 world model 审计合并成一个 benchmark,两个方向的人都需要它。