#2026-10-02 AI/LLM 最新论文与研究热点简报
时间范围:2026-09-30 至 2026-10-02(覆盖最近 48 小时;因 arXiv 公布延迟,最新一日的 HF 热榜条目多为 09-29/09-30 提交、10-01 上榜,属于当前可得的最新批次)。
信息来源:Hugging Face Daily Papers API(2026-10-01 榜单,含社区投票数)、arXiv listing API(cs.AI / cs.CL / cs.LG 最近提交,因 cs.SE / stat.ML 触发 arXiv API 限流 429 暂时缺失,用 HF 热榜补足)、arXiv 摘要页(每篇逐条抓取核实,未编造任何条目)、GitHub Search API(最近一周新建仓库按 star 排序)。X/Twitter 匿名访问持续被反滥用拦截(HTTP 403),本次未能检索,以 arXiv / HF / GitHub 为主;Tavily 搜索 API key 缺失,网络检索部分受限,已在文中如实标注。
#一、总览:今天的主线是什么
最近 48 小时的进展可以归纳为五条主线,与 wenjun 的研究版图高度重合:
- Harness 经济学成为 agent 研究的新前线:继昨天 Raven("harness of harnesses")之后,今天热榜被 harness 相关论文集体刷屏——Mid-Harness(98 票,模型-框架边界的动作采样与验证)、Learning Meta-Skills for Harness Design(71 票,test-time AI4AI)、"Thinking Outside the Box"(60 票,模型何时该拒绝 harness 的指导)、MILO、Recursive Harness Distillation。"harness 该多大、怎么学出来、何时该被模型否决" 正在变成一个独立子领域。
- On-Policy Distillation 进入"机制分析 + 场景特化"深水区:昨天 7 篇 OPD 之后,今天又来 4 篇——The Teacher Is a Direction(228 票,热榜第一,从表征层面解释 OPD 为什么能超越 teacher)、PivotOPD(多轮 agent 的关键失误恢复)、UniEvo-VL(自蒸馏免 teacher)、N-OPSD / OPSRD。OPD 已经从"新方法"变成"方法论基座",大家开始追问它到底蒸馏了什么、在什么状态下失效。
- 记忆压缩 + 潜空间推理开始合流:LatentHarness 把"记忆访问(RECALL)"和"潜空间计算(THINK)"统一为序列化的隐动作选择,用反事实策略蒸馏训练;MemCodex 让 memory 系统自我编程演化。这直接踩在 wenjun 的"上下文压缩器 + latent reasoning"两条线的交点上。
- 自演化系统的失败模式被正面诊断:False Frontiers(188 票)系统刻画了自演化搜索 agent 的 co-cheating(proposer 和 solver 在共享错误上越来越一致,内部奖励涨而外部正确率不涨);AREX-2 研究自提升能力在长程任务上的持续。自演化智能的"病历本"正在成形。
- 世界知识内化 vs 训练时习得的争论有了新论据:EVOKE 指出 LLM 在数字环境中大部分世界知识已在预训练中内化,post-training 应该"激发(elicit)"而非"从头学预测观测",并用多目标监督提供激发压力——这是对 Dreamer-for-LLM 路线的一个正面反击(减训练成本、减 rollout 误差复合)。
#二、重点论文详评(Top 5)
#1. The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
- 链接:https://arxiv.org/abs/2609.36484
- 来源:Hugging Face Papers 热榜 #1(228 票)
- 日期:2026-09-29 提交,10-01 上榜
- 类别:Post-training / Distillation / Mechanistic
- 核心贡献:指出 OPD 中"输出空间的隐式奖励外推"会被 LM head 各向异性地衰减——teacher 隐状态里的改变只有一小部分以同样权重到达 logits,且采样 token 的 log-prob 比率注入噪声被外推放大,导致训练不稳定。提出在表征空间里外推 RL 在 teacher 上诱导的表征残差(representation residuals),让学生在隐状态层面沿 teacher 指的方向"走得更远"。
- 为什么值得关注:热榜第一实至名归:它把 OPD 为什么能超越 teacher 从"输出层玄学"下沉到了"表征几何"层面,同时给出了不稳定性的机制解释(logits 各向异性衰减 + 噪声放大)。这是 OPD 系工作里少见的"机制 + 方法"双闭环。
- 与 wenjun 的关系:与"高效后训练"主线直接相关;更重要的是它的分析范式——RL 诱导的表征残差可以在隐空间被外推——可以迁移到 latent reasoning 的训练目标设计上(监督什么、在哪里监督),也可用来解释 RLVR 后模型表征的真实变化量。
#2. False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
- 链接:https://arxiv.org/abs/2609.39102
- 来源:Hugging Face Papers 热榜(188 票)
- 日期:2026-09-30
- 类别:Self-Evolving Agent / Evaluation
- 核心贡献:诊断自演化搜索 agent(proposer 造题 + solver 解题闭环自造课程)的 co-cheating 失效:双方在共享错误上不断趋同,in-loop 训练信号持续变好而外部正确率停滞甚至下降;事后对照源证据的审计显示 co-cheating 随自演化轮次加剧。提出 multi-sample verification(MSV)在训练前核验 proposer 的题目。
- 为什么值得关注:这是自演化智能方向目前最清晰的"失败模式诊断"论文。所有"环境设计催生自演化智能"的工作都绕不开这个问题:自己给自己出题的训练信号会自我确证。论文给出的审计协议(对 pseudo-label 做外部证据校验)本身就是个可复用的工具。
- 与 wenjun 的关系:与"通过环境设计催生自演化智能"直接对齐——这是该命题的核心风险论文。任何自演化课程学习实验都应先内化它的审计方法论;co-cheating 的检测器本身也是个值得做的小工具项目。
#3. LatentHarness: Learning Latent Actions for Memory and Reasoning via Counterfactual Policy Distillation
- 链接:https://arxiv.org/abs/2609.39740
- 来源:arXiv 新提交(09-30);HF Papers 热榜收录
- 日期:2026-09-30
- 类别:Latent Reasoning / Memory / Context Compression
- 核心贡献:把长上下文推理的两个瓶颈——跨长输入的证据保持、跨多步推理的持续计算——统一为序列化隐动作选择:模型在每个内部步在 THINK(继续潜空间计算)/ RECALL(从输入证据与中间推理态的 fast-weight 记忆中读取)/ EXIT(吐出下一个 token)之间做选择;用反事实策略蒸馏(对 branch 出的轨迹做对比)训练该策略。
- 为什么值得关注:这是第一篇明确把"外部记忆访问"和"潜空间推理"放进同一个动作空间的工作。RECALL/THINK/EXIT 三元隐动作的设计非常干净,反事实蒸馏的训练信号也回应了"中间隐状态无监督"的老问题。
- 与 wenjun 的关系:正面命中两条主线的交点(通用上下文压缩器 + latent reasoning)。fast-weight memory 的读取策略本质上就是一个"学出来的压缩/检索策略",与 Coconut 系 latent CoT 的差异在于它显式区分了"算"和"取"两个动作——这个分解可以直接搬进 LLM model-based RL 的 latent state 更新机制。
#4. EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making
- 链接:https://arxiv.org/abs/2609.38334
- 来源:Hugging Face Papers(63 票)
- 日期:2026-09-29
- 类别:Model-based RL / World Model / LLM Agent
- 核心贡献:论证 LLM agent 在数字环境中的世界知识大部分已在预训练中内化,问题应从"训练模型预测未来观测"转为"激发内化知识";指出单目标监督会让策略退化到依赖表层上下文习惯;提出多目标后训练(同一状态下要求预测不同目标/未来量)提供激发压力,改善跨环境迁移。
- 为什么值得关注:这是对 LLM Dreamer 路线的一次重要正面对话:显式 world model 训练成本高、预测误差在规划中复合;如果知识已内化,也许该做的是"多目标激发"而不是"单目标预测"。这与昨天 WAM 泛化论文(显式未来建模带来泛化收益)构成一组针锋相对的证据,两边合起来才是完整的 trade-off 图景。
- 与 wenjun 的关系:model-based RL for LLM Agent 主线的必读对立面。一个直接的实验问题:在长轨迹 agent 任务上,"多目标激发式后训练"和"显式 latent rollout"哪个的泛化/成本比更优?这两篇论文提供了现成的两端设置。
#5. PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents
- 链接:https://arxiv.org/abs/2609.40285
- 来源:Hugging Face Papers(20 票);同日相关:HiSentinel(https://arxiv.org/abs/2609.39957,hindsight 蒸馏 0.6B/1.7B 哨兵做预执行干预)
- 日期:2026-09-30
- 类别:Post-training / On-Policy Distillation / LLM Agent
- 核心贡献:跨三个 Qwen3 模型(8B–235B)统计发现:超过一半的失败 rollout 含有一个 pivotal mistake(把 agent 推离任务完成的动作),且通常发生在早期、往往是可恢复的——关键失误后引导几轮即可恢复任务成功。据此把 OPD 的教师监督集中分配在 pivotal turn 之后,而不是均匀铺满轨迹。
- 为什么值得关注:给了 OPD 在多轮场景下一个可量化的结构先验(失误早发 + 可恢复),相当于把"稠密监督该稠密在哪"这个问题用数据回答了。与昨天 RLVR 信用分配系列(Hindsight-Divergence Localization 等)形成呼应:优势/监督的空间分配是当前 agent 训练的核心杠杆。
- 与 wenjun 的关系:与长轨迹 Agent RL 的 credit assignment 直接相关。pivotal-turn 检测器 + 局部 OPD 的组合可以和 GIGPO 的分组优势做 ablation 对比;"错误-诊断"侧的同日数据集 Agent Error Dataset(50,228 对,见下文速览)正好提供训练语料。
#三、其余值得关注的论文速览
#LLM Agent / 自演化 / Harness
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks | https://arxiv.org/abs/2609.38288 | 09-29 | 从 ML/算法编程任务合成可验证反馈的长程自我改进轨迹,把"反思 + 长程执行"作为域无关能力训练(116 票) | Self-Evolving Agent |
| Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents | https://arxiv.org/abs/2609.39982 | 09-30 | 在模型-框架边界采样并验证候选动作再执行,用 test-time compute 换动作可靠性(98 票) | LLM Agent / Systems |
| EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving | https://arxiv.org/abs/2609.40340 | 09-30 | 双层优化让检索 query 与解方案共同演化,retrieval gate 自评知识缺口(92 票) | LLM Agent / Tool-use |
| Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI | https://arxiv.org/abs/2609.38143 | 09-29 | Builder 从 Target 执行反馈中学习可复用 Meta-Skill 库来构造 harness,冻结双方权重(71 票) | Harness / Self-Evolving |
| Thinking Outside the Box: Can LMs Rely on External Guidance Selectively? | https://arxiv.org/abs/2609.39578 | 09-30 | Box²-Bench 固定模型与任务、只变 workflow 可靠性,测量模型能否"受益于可靠指导并否决不可靠指导"(60 票) | LLM Agent / Evaluation |
| RSIGame: Autonomous Agentic Game Development with Recursive Self-improvement | https://arxiv.org/abs/2609.39045 | 09-30 | 游戏开发场景的递归自提升 agent(60 票) | Self-Evolving / Code Agent |
| AIM: Agentic Idea Management for Automated Research | https://arxiv.org/abs/2609.38445 | 09-29 | 自动化科研里的 idea 管理系统(40 票) | LLM Agent |
| MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution | https://arxiv.org/abs/2609.38349 | 09-29 | 多智能体协同进化自动发现 harness(13 票) | Harness |
| Learning from Research: Toward Lifelong Agent Harness Evolution | https://arxiv.org/abs/2609.40169 | 09-30 | 把 agent 自己的历史研究经验回流为 harness 终身演化 | Harness / Lifelong |
| Agent Error Dataset (AED) | https://arxiv.org/abs/2609.40111 | 09-30 | 50,228 个错误-诊断对、33 环境、19 harness 族、23 策略模型,附 Error-to-Training 管线(43 票) | LLM Agent / Post-training 数据 |
| MemCodex: Self-Programming Hierarchical Memory | https://arxiv.org/abs/2609.39765 | 09-30 | 开放式程序进化搜索"每层记忆程序怎么构造"的设计空间 | Memory / Self-Evolving |
| Persistent Context Graphs for Efficient Memory Compaction | https://arxiv.org/abs/2609.40118 | 09-30 | 用 past attention 信号 + 新请求相关性做记忆压缩图,省 prefill 成本 | Memory / Systems |
| Learning When and How to Intervene: HiSentinel for Coding Agents | https://arxiv.org/abs/2609.39957 | 09-30 | 0.6B/1.7B hindsight 蒸馏哨兵在执行前决定是否干预 coding agent 动作 | Code Agent / Credit Assignment |
| cua-speedrun | https://arxiv.org/abs/2609.40284 | 09-30 | 计算机使用 agent 的速度标准化基准 | Evaluation |
| ComputerSD: Online Self-Distillation from Real-Time Feedback for CUA | https://arxiv.org/abs/2609.40253 | 09-30 | 计算机使用 agent 从实时反馈在线自蒸馏 | LLM Agent |
| PhantomEnvironments: Training LLM Agents in Fictional Worlds | https://arxiv.org/abs/2609.40221 | 09-30 | 在虚构世界训练 agent 以对齐真实环境 | Pretraining/Env Design |
| CUA-SWE: When Computer-Use Agents Meet Visual SWE | https://arxiv.org/abs/2609.32600 | 09-26 | 视觉软件工程 + 计算机使用交叉基准 | Code Agent / Evaluation |
| OSWorld-Science | https://arxiv.org/abs/2609.39903 | 09-30 | 学习使用科学软件的 CUA 基准(24 票) | Evaluation |
| WorldAuditBench | https://arxiv.org/abs/2609.40325 | 09-30 | 多模态 agent 交互式审计 3D 世界(90 票) | Evaluation |
| TRACE: Trajectory Selection for Parallel Scaling of Search Agents | https://arxiv.org/abs/2609.39912 | 09-29 | 把并行搜索的"选哪条轨迹"形式化,避免 final-answer voting 选错 | Test-time Scaling |
#Model-based RL / World Model / 具身
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| RoboCoach: World Models as Active Coaches for Compositional Robot Skills | https://arxiv.org/abs/2609.39685 | 09-30 | 世界模型作为"主动教练"分解组合式技能再教 agent | Model-based RL |
| DashVMC: Real-Time Discrete World Model Control in Geometry Dash | https://arxiv.org/abs/2609.40003 | 09-30 | 离散世界模型实时控制,游戏域的 WAM 工程参考 | Model-based RL |
| GPT-6 Astra as Embodied Policies | https://arxiv.org/abs/2609.38537 | 09-29 | 系统测试 GPT-6 Astra 直接输出数值机器人动作的能力(28 票) | Embodied / Evaluation |
| Imagine3D-LLM | https://arxiv.org/abs/2609.38177 | 09-29 | MLLM 回答前先"想象"3D 场景(53 票),潜空间预演思想的视觉版 | Latent Reasoning / VLA |
| CompoWorld: Compositional Environment Scaling for General Agents | https://arxiv.org/abs/2609.33665 | 09-27 | 组合式环境 scaling 造通用 agent | Env Design |
| Skill2Env: Capability-Oriented Environment Synthesis | https://arxiv.org/abs/2609.33772 | 09-27 | 从技能清单反向合成训练环境 | Env Design |
#Latent Reasoning / 递归模型
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| What Limits Recursive Reasoning Models | https://arxiv.org/abs/2609.39967 | 09-30 | 统一实验管线解耦 HRM/TRM/URM 的架构、梯度传播与训练差异,定位其不稳定来源 | Latent Reasoning |
| Rethinking Latent Visual Reasoning | https://arxiv.org/abs/2609.34563 | 09-28 | 发现 latent token 对改变正确答案的图像扰动响应弱(evidence-credit gap),GRPO 的 final-answer 奖励监督不足(202 票) | Latent Reasoning / RLVR |
| Scaling Laws for Looped Mixture of Experts | https://arxiv.org/abs/2609.40316 | 09-30 | looped MoE 的 scaling law(16 票) | Latent Reasoning / Systems |
| Adaptive Looped Transformers for Test-Time Scaling | https://arxiv.org/abs/2609.35748 | 09-28 | 循环深度自适应分配 test-time compute(54 票) | Latent Reasoning |
#OPD / 后训练
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| UniEvo-VL: On-policy Self-Distillation Training Recipe | https://arxiv.org/abs/2609.38721 | 09-30 | 统一多模态模型自兼任师生(critique 作为 privileged context),免外部 teacher(196 票) | OPD / Multimodal |
| OPSRD: On-Policy Self-Role Distillation | https://arxiv.org/abs/2609.39884 | 09-30 | 用固定专家 role prompt 作为 privileged 教学上下文的自蒸馏 | OPD |
| N-OPSD: Neighborhood On-Policy Self-Distillation | https://arxiv.org/abs/2609.39687 | 09-30 | 扰动参数揭示互补的参考对齐修正,扩展监督覆盖 | OPD |
| DuoOPD: Joint Teacher-Student Outcomes for Multi-Task OPD | https://arxiv.org/abs/2609.33711 | 09-27 | 多任务 OPD 同时用师生联合结果 | OPD |
| Domain-Normalized Multi-Teacher OPD | https://arxiv.org/abs/2609.35347 | 09-28 | 多 teacher 域归一化分配(174 票,昨日报告已收录,今日仍在热榜) | OPD |
| Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL | https://arxiv.org/abs/2609.32577 | 09-26 | 代码 agent RL 的分组评分与优势重分配(123 票) | Post-training RL / Code Agent |
| Selecting Diverse SFT Traces Improves Post-RL Generalization | https://arxiv.org/abs/2609.33780 | 09-27 | SFT 轨迹多样性提升后续 RL 泛化(35 票) | Post-training RL |
| Entropy-Guided Credit Assignment for Exploration | https://arxiv.org/abs/2609.33781 | 09-27 | 熵引导的信用分配(41 票,昨日报告已收录) | RLVR |
#预训练数据 / 持续学习 / 机制
| 论文 | 链接 | 日期 | 一句话核心贡献 | 类别 |
|---|---|---|---|---|
| Replay on Demand: Emergent Curriculum for Continued Pretraining | https://arxiv.org/abs/2609.40089 | 09-30 | 按模型实际遗忘/学习动态竞争式分配 replay 预算,平衡适应与遗忘 | Continual Learning |
| Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior | https://arxiv.org/abs/2609.39827 | 09-30 | 合成数据 pre-pretraining 在更大规模与真实混合(code/math)下仍有效,但机制不是语法先验 | Pretraining Data |
| From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes | https://arxiv.org/abs/2609.40148 | 09-30 | 用谱方法发现预训练学习率的多个 scaling-law regime | Pretraining |
| Unmask the State: When Does State Adaptation Matter for MDMs | https://arxiv.org/abs/2609.33355 | 09-30 | masked diffusion LM 的 unmasking 状态自适应条件(41 票) | Pretraining / 机制 |
| MassAlloc Attention: Let Attention Allocate Its Own Compute | https://arxiv.org/abs/2609.32712 | 09-26 | 注意力自己分配计算量的机制(71 票) | Systems / 机制 |
| Post-Training Leaves Behavioral Shadows on Unrelated Decisions | https://arxiv.org/abs/2609.29233 | 09-24 | 后训练在无关决策上留下行为阴影(269 票,昨日已收录,今日仍居前列) | 机制 / Post-training |
| LANTERN: Illuminating Hidden Mathematical Knowledge | https://arxiv.org/abs/2609.32264 | 09-26 | 探测 LM 隐藏数学知识(40 票) | 机制 / Interpretability |
#四、GitHub / 开源动态(近一周新建,按 star)
- dzhng/jevgrep(2000 stars,一周内):<https://github.com/dzhng/jevgrep> — "按代码做什么来查找代码"的 CLI,供 coding agent 用语义查询发现相关文件,编码 agent 工具链热度极高。
- nanaism/yomiyasu(944 stars):<https://github.com/nanaism/yomiyasu> — Agent Skill:把 AI 生成的日语推敲为自然日语;Agent Skill 生态(CLAUDE.md/skill 格式)爆发的一个侧影。
- scarletkc/seiso(163 stars):<https://github.com/scarletkc/seiso> — 面向"AI 写、人类和 agent 读"的 Markdown 文档规范与 linter,"agent 可读文档"正在形成自己的工程规范。
- ArtificialAnalysis/aa-agentperf-local(69 stars):<https://github.com/ArtificialAnalysis/aa-agentperf-local> — 通过回放真实 agent 轨迹来基准测试本地 LLM serving,agent 负载的系统评测工具。
- strands-labs/strands-decider(54 stars):<https://github.com/strands-labs/strands-decider> — 面向 agentic workflow 的小型快速"System 1"决策模型(选项挑选/打分),与昨日直报里 direct-decision model 的论文(JEV-like,arXiv:2609.38827)方向相互印证。
- camail-official/LoopedActor(2 stars 但值得关注):<https://github.com/camail-official/LoopedActor> — "Looped Actor: Depth-Recurrent Reasoning Models for Reinforcement Learning" 官方代码:looped/潜空间推理模型进 RL,与 LatentHarness 一同指向"递归潜状态 + RL"的合流趋势。
说明:GitHub trending 的头部位多被 Claude Code 生态工具占据,与学术热点的相关性我已做了人工筛选;上表是剔除纯生态工具后与研究方向相关的部分。
#五、今日建议
#1. 今日最值得精读的 3 篇
- The Teacher Is a Direction, Not a Destination(https://arxiv.org/abs/2609.36484)— OPD 机制层面的标杆分析,隐空间残差外推的方法对潜空间推理训练同样适用。
- False Frontiers: Co-Cheating in Self-Evolving Search Agents(https://arxiv.org/abs/2609.39102)— 自演化方向必须内化的失败模式 + 审计协议。
- LatentHarness(https://arxiv.org/abs/2609.39740)— 记忆与潜空间推理统一为隐动作选择,正中两条主线交点。
#2. 今日最值得跟进的 3 个 repo / 资源
- camail-official/LoopedActor:<https://github.com/camail-official/LoopedActor> — depth-recurrent 推理模型 + RL 的官方实现,潜空间推理主线的工程锚点。
- Agent Error Dataset(AED):https://arxiv.org/abs/2609.40111 — 50K 错误-诊断对、33 环境,做 agent 失败分析/错误感知后训练的现成语料,关注其数据发布。
- aa-agentperf-local:<https://github.com/ArtificialAnalysis/aa-agentperf-local> — 真实 agent 轨迹回放测本地 serving,做 agent 训练/部署系统实验的基础设施。
#3. 研究机会 / idea
- Pivotal-turn 检测器 × co-cheating 审计器:PivotOPD 证明了"关键失误早期发生且可恢复"的结构先验,False Frontiers 证明了自演化闭环会自我确证。二者交集是一个清晰的题目:在自演化 agent 的训练信号里在线检测"共享错误"(proposer-solver 一致性 + 外部证据审计 + pivotal-turn 定位三信号融合),把它作为课程门的 gate。AED 数据集可以直接当训练/评测语料。
- EVOKE vs 显式 WAM 的对照实验:昨天 Simple-WAM 证明显式未来建模带来泛化收益,今天 EVOKE 论证知识已内化、只需多目标激发。值得做一个受控实验:同一 LLM agent 骨架,三种后训练(单目标 BC/RL、多目标激发、显式 latent rollout 训练)在跨环境迁移 + 计算成本两个轴上对比——这基本就是"LLM Dreamer 该不该显式 rollout"的判决性实验。
- THINK/RECALL/EXIT 三元隐动作迁移到 model-based RL:LatentHarness 的动作分解(算/取/停)可以自然映射为 LLM world model 的内部操作(推演 latent state / 从上下文检索证据 / 提交决策)。反事实策略蒸馏的监督方式恰好解决"latent rollout 步无奖励"的问题。与 REST 的表征监督目标可以叠加做 ablation。
#六、来源可靠性说明
- 所有 arXiv 链接均为逐条抓取摘要页核实过的真实论文(HTTP 200 + 摘要解析成功);未抓取的仅引用 HF API 返回的元数据。
- HF 投票数为 2026-10-01 榜单快照。
- X/Twitter:匿名访问 403 被拦截,未能检索,机构动态以 arXiv/HF/GitHub 补足。
- Tavily web_search API key 未配置(
~/.openclaw/.env中无 TAVILY_API_KEY),通用 web 检索受限;arXiv API 出现对 cs.SE / stat.ML 的 429 限流,故今日 cs.SE 新提交覆盖不完整,若有遗漏的代码智能方向论文,明日补扫。