#2026-10-10 AI/LLM 最新论文与研究热点简报

时间范围:本简报核心是 arXiv 2026-10-08(周四)与 10-09(周五)两个公布批次的新论文(编号 2610.106xx–2610.124xx,共 381 篇落入窗口,经 arXiv API 按 submittedDate 倒序真实抓取后逐条筛选;今日简报覆盖昨日简报未收录的 10-09 周五批次——昨日 08:00 简报发布时该批次尚未公布,故无重叠、不需去重,仅 AgentGarten 一条因 GitHub 侧先行曝光在昨日"repo 动态"里出现过,今日以论文形式补全)。补充来源为 Hugging Face Daily Papers 10-09 榜单(50 篇)与 GitHub Search API。整体时间窗为 2026-10-07 至 2026-10-10 晨(约 48 小时)。

信息来源与限制:arXiv 官方 API(cs.CL / cs.AI / cs.LG / cs.SE 四类共 413 条原始记录);Hugging Face Daily Papers API(10-09 榜单,10-10 榜单尚未生成);GitHub Search API。X/Twitter 匿名访问不可用,社交平台动向以 GitHub / HF / arXiv 替代。arXiv API 本轮再次多次触发限流与 503,通过加大请求间隔(30–60s)重试完成全部抓取。所有论文均真实存在、编号均经 API 返回核验,未编造任何条目。


#一、总览:10-08/10-09 批次的四条主线

今天(覆盖 10-09 周五批次)是本周第二个信息高峰。按 wenjun 的研究偏好筛出四条主线,其中第一条的密度罕见地高:

  1. model-based RL / world model 出现"全家桶"式集中爆发。单日窗口内至少七篇直接相关:HF 10-09 榜单第一的 AgentGarten(2610.12374,131👍)用"代码世界"造可演化 agent 的训练环境;CausalDreamer(2610.12016)对 Dreamer 4 式世界模型做因果解耦后训练;SplitJEPA(2610.12349)给 JEPA 补上不变/可变因子分解理论;LeWAM(2610.12407)把 JEPA 隐状态接到 MPC 规划;ME-World(2610.12299)做多智能体自我中心世界模型;DreamTrue(2610.12468)做动作忠实+反事实后训练的机器人世界模型;以及把 LLM 本身当"研究世界模型"用的 Language Models as AI Research World Models(2610.12235,171,000 GPU 小时的真实实验记录训练 RWM)。这是 wenjun 两条近期主线(Dreamer for LLM Agent + 环境设计催生自演化智能)同时被喂饱的一天。
  2. RLVR / 蒸馏后训练的方法论与机制审查。MiMo-V2.6(2610.11959,小米技术报告)公开"把 RL 规模推向自进化"的全栈配方(async 训练 1M 上下文 + 多域 agent 环境 + groupwise agentic grading);ZCPO(2610.12161)拆解 group policy optimization 里 KL 正则的七种失效模式;GRPODropout(2610.11854)发现"少用几条 rollout 反而更好";OPD 蒸馏一侧出现三篇方法 + 两篇边界研究(Semi-OPD / DIAL-OPD / MetaOPD / 为什么 OPD 会失败 / 何时需要 OPD)。RLVR 的元方法层正在快速成熟。
  3. agent 记忆与经验沉淀的三条新路线。Hippocam(2610.12124)用嵌套意图结构做递归 prefix 巩固;REMORY(2610.11287)在文本摘要之外学残差软记忆 token(序列维度的"残差连接",5.2% 输入位置逼近全上下文);Memento 3(2610.11794,HF 榜单 24👍)用外部规则书给冻结 LLM 持续学显式世界模型。三者分别代表"结构化巩固 / 学到的软 token / 显式符号记忆"三个设计点,与 wenjun 的压缩器 + 记忆 + world model 关注点全面交叠。
  4. agent RL 的"审查层"成型。ICRL(2610.11152)用控制实验证明 in-context RL 里奖励几乎不扮演学习信号;ModeBench(2610.11064)量化 RLVR 的"解模式塌缩";Who Verifies the Verifier(2610.11464)把验证器本身做成可演化对象;All Verdicts are Not Equal(2610.12083)审计 LLM judge 的判决翻转率;Cadence(2610.12269)做 coding agent 的动态干预调度。合起来是在问同一个问题:自我改进循环里,哪一环的信号是真实的?

对研究版图的意义:今天批次对 model-based RL / 世界模型(主线 1)输入最强,是近两周该方向最密的一天;对 agent 记忆 / 上下文压缩(主线 3)和 RLVR 机制审查(主线 2+4)各有一条完整的论文链可读。


#二、重点论文详评(Top 8)

#1. MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

  • 链接:https://arxiv.org/abs/2610.11959
  • 来源:arXiv cs.CL / cs.LG(小米技术报告),10-08/10-09 公布批次;HF 10-09 榜单 55👍
  • 类别:Post-training RL / Pretraining / Systems / LLM Agent
  • 核心贡献:全栈公开"用 RL 规模化推动自进化"的配方:预训练 hybrid-SWA 架构上先做多模态 mid-training 提供探索空间,再沿三个维度放大 RL——(1) 异步训练每步消耗 1,568 样本 / 27-37 亿 token、上下文至 1M;(2) 更多样复杂的环境(代码 / 通用 / 视觉 / 网络安全域的混合 agent harness);(3) 更多 grader 算力(groupwise agentic grading 给出更准的奖励符号)。
  • 为什么值得关注:这是把"agentic RL 该怎么 scale"三个维度(batch/token 吞吐 × 环境多样性 × grader 算力)同时拉满并公开细节的少数报告之一。groupwise agentic grading 特别值得注意——它实质是"让一组 grader agent 分摊复杂任务的奖励判定",直指 RLVR 奖励信号质量问题(与今日主线 4 的审查层工作互相印证)。
  • 与研究方向的关系:agentic RL / self-evolving agent 主线的工程参照系。可延伸:grader 算力作为第三个 scaling 维度,其"收益曲线"在什么任务族上饱和?这本身就是个可做的实证问题(小米没给出该消融)。

#2. Language Models as AI Research World Models

  • 链接:https://arxiv.org/abs/2610.12235
  • 来源:arXiv cs.LG / cs.AI,10-08/10-09 公布批次
  • 类别:Model-based RL / LLM Agent / Self-evolving
  • 核心贡献:提出 Research World Model(RWM):让语言模型预测"候选干预在一个研究环境里的结果"(pretraining / post-training / inference 九个环境、2,600+ 条真实实验记录、折合 171,000+ H100 GPU 小时)。发现:从真实实验经验学到的"研究知识"能把同环境内未见干预的预测提升 Spearman +0.27,且可跨环境复用——预训练环境学到的知识迁移到 post-training 环境的预测上。
  • 为什么值得关注:这是"LLM model-based RL"的一个漂亮实例——不是给机器人造 world model,而是把 world model 用在实验规划上:agent 提出实验的能力强于执行能力时,outcome prediction 就是自进化循环的瓶颈能力。且训练数据是真实 GPU 实验记录而非模拟,接地程度罕见。
  • 与研究方向的关系:正中 wenjun 的 Dreamer-for-LLM-Agent 主线:Dreamer 的价值函数(预测下一状态)在这里被实例化为"预测实验结果",跨环境复用性则暗示 RWM 学到的是研究动力学的共享结构。可延伸:agent 轨迹层面的 world model(预测 agent 行为的环境后果)与 RWM(预测训练干预的能力后果)是否共享表示?

#3. CausalDreamer: Learning Predictive World Models with Latent Disentanglement

  • 链接:https://arxiv.org/abs/2610.12016
  • 来源:arXiv cs.LG / cs.AI,10-08/10-09 公布批次
  • 类别:Model-based RL / Latent Reasoning
  • 核心贡献:指出 Dreamer 4 式世界模型的结构性缺陷:tokenizer 用重建目标训练,不带动作/奖励监督,其隐状态没有机制分离"可控/不可控/奖励相关/奖励无关"信息。CausalDreamer 冻结 tokenizer,把其隐状态再编码为沿两个轴(可控性 × 奖励相关性)分解的四组因子表示:只有可控组接收动作输入、只有奖励相关组用于奖励预测。
  • 为什么值得关注:Dreamer 系谱在 LLM Agent 侧落地(latent rollout、隐空间规划)前必须回答"隐状态里哪些成分该被动作条件化"。这篇给出的是最小改动方案(冻结 tokenizer + 因子化再编码),在 Atari 100k 与其视觉变体上以远小于 Dreamer 3/4 的参数量匹配或超越性能。
  • 与研究方向的关系:与 wenjun 的 Dreamer-for-LLM-Agent + latent-state 分组两个关注点同时正面相交。LLM 侧对应问题:语言轨迹的隐状态里"token 可控性"与"奖励相关性"如何分解?文本世界没有像素级 reconstruction 信号,分解目标可能反而是更容易学的一侧——这是个未被做的迁移。

#4. AgentGarten: Code Worlds for Evolving Agents

  • 链接:https://arxiv.org/abs/2610.12374
  • 来源:arXiv cs.AI,10-08/10-09 公布批次;HF 10-09 榜单第 1 名(131👍);repo:https://github.com/MirroS-Lab/AgentGarten(105★)
  • 类别:LLM Agent / Model-based RL / Self-evolving / 环境设计
  • 核心贡献:要造"既能交互又有真实观察分布"的环境,瓶颈在同时满足状态一致性(faithful)与真实感(realistic)。AgentGarten 把模拟器/游戏引擎(持久状态 + 程序定义交互规则)与共享神经渲染器(从结构化条件生成视觉观察)耦合成实时交互环境:把预训练视频模型适配到几何条件、用蒸馏给渲染提速到实时。
  • 为什么值得关注:这是"通过环境设计催生自演化智能"方向目前最完整的开源框架之一——代码世界保证可验证的规则与状态,神经渲染保证观察分布真实。HF 单日 131👍 说明社区对"给 evolving agent 造训练场"的诉求集中爆发(昨日简报已注意到其 repo,今日补全论文与细节)。
  • 与研究方向的关系:直接命中 wenjun 的"环境设计催生自演化智能"关注点。可延伸:观察侧"代码状态→神经渲染"的映射,本身就是 world model(state→observation decoder)——AgentGarten 可视为把 world model 拆成"确定性模拟内核 + 神经观察解码"两层的工程化,与主线 1 的隐式 world model 恰成对照。

#5. REMORY: Learning Residual Memory for Context Compaction

  • 链接:https://arxiv.org/abs/2610.11287
  • 来源:arXiv cs.CL,10-08/10-09 公布批次
  • 类别:Context Compression / LLM Agent / Latent Reasoning
  • 核心贡献:长程 agent 的文本摘要会丢失"后续决策需要的信息"。REMORY 在摘要之外学有界数量的软记忆 token:一个小网络读历史+摘要、生成若干 soft token 拼在摘要后,让冻结 LLM 逼近"看过全历史"的续写——作者称之为序列维度的残差连接(摘要=主干,soft token=残差)。SummHay 上仅用 5.2% 输入位置逼近全上下文联合分数;Qwen3.8-27B 与 GLM-5.3-Flash 跨多个长程 agent 基准一致提升,且探索熵下降明显减弱(保留了有效探索能力)。
  • 为什么值得关注:把"压缩"从离散文本摘要推到"摘要 + 可学习软残差"的混合形态,且主体 LLM 冻结、只训小记忆网络——工程成本低、可直接叠加到现有 agent。软记忆 token 同时是 latent reasoning 的载体(残差即隐空间推理的一个受控入口)。
  • 与研究方向的关系:正对通用上下文压缩器 + 潜空间推理双关注点。可延伸:残差记忆与昨日 SemanticFold 的"五类终点不共享压缩阈值"结论对接——软 token 恰好可以按"文本摘要保不住的那类能力"定向补偿,等于给能力分离压缩器提供了残差通道。

#6. Harness Evolution Hits a Ceiling: When Weight Training Should Begin

  • 链接:https://arxiv.org/abs/2610.11655
  • 来源:arXiv cs.AI / cs.SE,10-08/10-09 公布批次
  • 类别:LLM Agent / Code Agent / Self-evolving / Post-training
  • 核心贡献:回答一个 agent 工程的关键时序问题:harness 演化(冻结权重改运行时)和权重训练(改模型)各修什么、何时切换。方法:给失败轨迹打"首个触发信号"标签,把失败分为过程失败(调用被阻断/循环/步数耗尽)与内容失败(交付的方案差)。自演化 harness 先行修复过程失败,其塑成行为可再被"蒸进"权重;内容失败才是权重训练的靶子。DeepPlanning 上自演化 harness 把 Qwen3.5-4B held-out 分从 0.16 提到 0.30,之后权重训练接管内容失败,两者交叉组合不冲突。
  • 为什么值得关注:这是"harness vs weights"之争(SWE-agent 社区持续争论的问题)目前最清晰的实验答案,失败二分法(过程/内容)是一个可以立刻搬进自己训练管线的诊断工具。
  • 与研究方向的关系:横跨 wenjun 的 code agent + agentic RL + 基础模型训练关注点。可延伸:过程/内容失败的二分信号本身能否作为 RL 的 shaped reward(过程失败给即时负信号)?这会把 harness 演化与权重训练统一进一个 credit assignment 框架。

#7. Do LLMs Learn from Rewards in Context? Rethinking the role of reward in In-Context RL

  • 链接:https://arxiv.org/abs/2610.11152
  • 来源:arXiv cs.CL / cs.LG,10-08/10-09 公布批次
  • 类别:LLM Agent / Post-training RL / Evaluation
  • 核心贡献:把"in-context reinforcement learning(ICRL)"拉到控制实验下检验:模型直接条件于原始轨迹-奖励对时,奖励被读到了、但效应极小——翻转/随机化/删掉奖励,改进曲线几乎不变;即便 meta-prompt 明确指示"探索/利用/推理奖励"也一样。真正驱动改进的是轨迹本身,且与语义内容无关(打乱轨迹顺序效果不变)——改进来自对任务格式的分布适应,而非奖励驱动的学习。
  • 为什么值得关注:大量 agent 经验学习论文默认"上下文里带奖励=在做 RL"。这篇用最干净的设计否定了该默认。对任何在 agent 记忆/经验回放系统里保留奖励字段的人,这是一篇"先读再设计"的论文。
  • 与研究方向的关系:与 wenjun 的 agent 记忆 + 经验学习关注点直接相关:它说明当前 LLM 的 in-context 学习无法利用奖励信号,"经验→知识"的转化必须显式建模(如摘要素材化、技能蒸馏),不能指望模型自己"悟出"奖励规律。与主线 4 的信号审查层同构。

#8. SFT-as-Context Mitigates Forgetting in Supervised Fine-Tuning

  • 链接:https://arxiv.org/abs/2610.11132
  • 来源:arXiv cs.CL,10-08/10-09 公布批次
  • 类别:Continual Learning / Post-training / LLM Agent
  • 核心贡献:训练无关的防遗忘方法:父模型(预训练模型)把 SFT 模型的回答当作上下文来答查询——通过 in-context 学习获得微调能力、同时保留自身通用能力。19 组父-SFT 对 / 11 个基准上,SFT-as-context 在微调能力上与 SFT 模型差距仅 2.2/2.1/2.0 个点,而通用能力保持父模型水平。
  • 为什么值得关注:与昨日详评的"A Deafening Silence"(遗忘的 token 嵌入机制)形成机制-方案对偶:那边证明遗忘在参数里、这边干脆不更新参数。零训练成本、即插即用,19 对模型的系统评测规模也够大。局限同样清晰:推理时多一次模型调用。
  • 与研究方向的关系:正对持续学习 + 高效后训练关注点。可延伸:agentic 场景下"父模型 + SFT agent 模型"级联是否等价于一个免费的 MoE 路由(通用 query 走父、域 query 走 SFT)?与 REMORY 的残差思路在"能力加减法"上互补。

#三、其他值得一看的论文(快速清单)

论文编号/链接类别一句话核心贡献
SplitJEPA2610.12349Model-based RL / Latent ReasoningJEPA 不重建也能学到不变/可变因子分解的理论与方法,隐状态分解不再需要 reconstruction 买单
LeWAM2610.12407Model-based RLJEPA 隐状态上的双向 WAM(前向/反向/逆动力学+策略),线性探针读状态优于重建式 WAM,接 MPC 规划
ME-World2610.12299Model-based RL / World Model多智能体自我中心世界模型:共享 token 序列联合去噪多条 ego 流,保证跨视角动作一致与交互状态传播(HF 43👍)
DreamTrue2610.12468Model-based RL机器人世界模型的动作忠实性:动作轨迹渲染成图像条件 + 反事实后训练(改动作生成未见未来),HF 榜单 33👍
Memento 32610.11794LLM Agent / Self-evolving / Model-based RL冻结 LLM + 外部自然语言"规则书"世界模型:观测→反思→规则修订→编译成代码→验证的持续学习循环,HF 24👍
Hippocam2610.12124LLM Agent / Memory嵌套意图结构 + 递归 prefix 巩固的记忆架构:活动上下文围绕当前意图、完成意图只巩固"后续需要的产出与状态"
Internalizer2610.11715Context Compression / Continual Learning上下文→LoRA 权重的 hypernetwork 推到 284B DeepSeek v4 Flash(此前上限 14B):model-agnostic 主干 + 4096 token 文档适配器,top-1 84.9% vs 基座 63.4%
ModeBench2610.11064Post-training RL / EvaluationRLVR 的"解模式塌缩"量化:多解任务基准上 RLVR 后训练使概率集中到更少正确模式(准确率不降、多样性降)
ZCPO2610.12161Post-training RLgroup policy optimization 中 KL 正则的七种失效模式拆解;条件 KL 校准组内奖励系数的替代设计
GRPODropout2610.11854Post-training RL熵塌缩的 rollout 侧解法:更新前剔除少量高概率正优势 rollout 并重新居中优势,同预算下比标准 GRPO 更稳
Semi-OPD2610.11291Post-training / Distillation17 组师生对(1.5B–235B)系统对比:初始学生的离线 rollout 常胜在线 OPD(14/17 组,最高 +13.6%、11.4x 加速),判据=输出 token 重合率
Why OPD Fails2610.11247Post-training / DistillationOPD 早 plateau 的机制:大教师的学习信号 proxy 早期衰减(200 步后仅 25.1% 损失降幅 vs 自 RL 教师 96.2%),连续时间动力学分析
DIAL-OPD2610.11659Post-training / Distillationtoken 选择蒸馏:用师生概率的对数平均加权奖励幅度筛 token,"少 token 训练优于全 token OPD"
MetaOPD2610.11989Post-training / Distillation双层优化学 token 加权网络(外层=虚拟学生更新后的验证损失),加权决策与更新效果直接挂钩
Residual Advantage (RA)2610.11519Post-training RLRLVR×OPD 融合:师生概率残差当有界单步奖励、减学生状态价值成标准 advantage,回应内做居中
Cadence2610.12269Code Agent / Systemscoding agent 的动态监督:按执行健康度自适应调度检查与两级干预(建议级/纠正级),替代固定间隔监控
CABRA2610.10610Code Agent / Evaluation6840 个受控任务证明:代码理解(而非生成)是 coding agent 真正瓶颈;读代码工具调用数比改动行数更能预测 agent 准确率
HarnessSQL2610.12274LLM Agent / Post-trainingharness 原生训练:SFT+RL 全程保留与真实数据库的状态化多轮交互结构,教师直接在目标 harness 里 rollout,只留验证轨迹
Agentic-TTT2610.12002LLM Agent / Post-training把 TTT 算法当可调用工具、学一个测试时策略决定"何时 TTT/用哪个算法/技能可复用",参数级自改进加一层 agency
MASS2610.12176LLM Agent / Self-evolving非可验证任务(开放研究)的 RSI:进化搜索多智能体 workflow + 自生成轨迹 SFT 交替,同构循环靠异构拓扑破解
Trace2Env2610.06100LLM Agent / Model-based RL学习免费的语言世界模型:历史交互 trace 重构成"环境 worldbook",world model agent 当环境与 task agent 状态化交互(HF 97👍)
Learn2Play Bench2610.08215LLM Agent / Evaluation规则全新/反直觉的文字游戏基准,强迫 agent 从交互学知识而非复述预训练知识(HF 76👍)
PRAXIS2610.11803Self-evolving / 理论自改进系统的共演化理论:生成器-KL 约束 + 符号档案权移动界住目标漂移,SGD 达平均平稳性保证
Who Verifies the Verifier2610.11464Evaluation / Self-evolving让 verifier 成为演化对象:可检视的确定性缺陷检测器表达式,按锚定参考集+无标注共识选择(绝不看 agent 分数)
All Verdicts are Not Equal2610.12083EvaluationLLM judge 可靠性审计:温度 0 下判决复现会翻转、位置交换翻转多数判决、最"确定"的 judge 靠重复错误判决达成一致
ICRL2610.11152LLM Agent / 机制研究(见详评 7)in-context 奖励几乎不充当学习信号
QGMem2610.11920LLM Agent / Memory事件索引原子记忆 + 查询感知图增强做工作记忆,兼顾扁平记忆轻量与图记忆结构性
LadderEdit2610.11160Continual Learning / Memory编辑级残差压缩:新增编辑以紧凑残差形式叠加,终生编辑下显存大幅下降
From a Prompt to Repertoires2610.11373Continual Learningprompt 优化做持续学习:功能化技能库演化(EFRE),避免逐任务 prompt 的过拟合与遗忘
Lapras2610.11111Latent Reasoning时间序列 LM 的隐空间推理:连续时序信号不再离散化为文字 CoT(早期描述错误会传播),在 latent 上 post-training 推理
TraceRelay2610.11743Latent Reasoning / Systems注意力对齐的循环架构:低维 rolling trace 携带持久表示,Equal Repeats 256 长度 98.8% vs 无继承 50.7%
Attic-KV2610.12133Context Compression / SystemsKV 压缩反直觉发现:紧预算下"排练全部上下文"反而崩(3% 保留率 RULER 只剩 31.5/96.5),该排练的是将被读的部分
Evolving Latent Spaces2610.12304机制研究LLM 表示空间的小世界连接性作为推理性能签名(HF 10-09 榜单)
Adapting English Quality Classifiers2610.11585Pretraining Data英语质量分类器的多语言改造(MLP on encoder embeddings + 机器翻译弱标签),100+ 语言上保持下游基准
Project Greenhouse2610.11922LLM Agent / Search完全开源主权的 agentic search 路线图:不依赖第三方开放权重、几块 GPU 从零训练 reranker 的可复现配方
SGUID2610.12367LLM Agent / Distillation技能库蒸馏的选择问题:<25% 检索技能提供有效蒸馏信号;按训练期一致有效性选 6 个技能≈全库
TokenRouter2610.12242Systemstoken 级 LLM 路由的 serving 系统(HF 10-09 榜单 102👍)
Structure Tax2610.12056Evaluation / Structured Output结构化输出税取决于 schema 设计而非结构本身:推理先行字段序≈自由文本精度,答案先行序大幅掉点
METR time horizons2610.12466Evaluation / 前沿动态对 METR 时间视界图的统计重估:样条+IRT 放松"难度线性依赖 log 人类时间"假设,2–30 分钟区间接近平坦
Ecology of AI Agents2610.12436Safety / 前沿动态失准 agent 种群的生态学:增长方程+适应度分析,协作造成种群起飞阈值

#四、GitHub / 开源动态(本周新建,按 star)

  • XiaomiMiMo/MiMo-Code(13,619★):MiMo "Models and Agents Co-Evolve" 主仓库——与今日详评 1 的 MiMo-V2.6 技术报告直接配套,模型-智能体协同演化的官方开源线,值得长期跟踪其 checkpoint 与训练细节披露。
  • XiaomiMiMo/MiMo(2,382★):MiMo 系列(从预训练到 RL)主仓库。
  • MirroS-Lab/AgentGarten(105★,继续上涨):Code Worlds for Evolving Agents——论文今日上榜(详评 4),"环境设计催生自演化智能"目前最完整的开源框架。
  • BinceQu/RoboHarness(222★):给 LLM agent 的视觉-几何控制面板,连接 agent 与具身控制(与主线 1 的机器人世界模型方向互补)。
  • fidipro/gluon(47★):coding agent 的控制平台(编排/审计),与今日 Cadence、AgentMonBench 一脉的 agent 监督基础设施。

说明:GitHub Search API 本轮可正常访问。X/Twitter 仍不可匿名访问,未纳入来源。本周新建仓库多为应用层产品(openchart / seris 等),与研究方向直接相关的以上五条为主。


#五、今日最值得精读的 3 篇

  1. MiMo-V2.6 技术报告(2610.11959)——想知道 agentic RL 规模化"现在的工业答案"是什么,这是必读:三个 scaling 维度(吞吐/环境多样性/grader 算力)+ 1M 上下文异步训练的系统细节,且开源仓库配套可查。
  2. Language Models as AI Research World Models(2610.12235)——LLM model-based RL 的新实例化:用真实 GPU 实验记录训练"预测干预结果"的世界模型,跨环境复用性是关键发现,与 Dreamer-for-LLM-Agent 的构型直接相关。
  3. REMORY(2610.11287)——上下文压缩的新形态:"文本摘要 + 可学习软残差",冻结主体只训小网络、5.2% 位置逼近全上下文,是压缩器与潜空间推理两条线的交汇点,且工程门槛低到可以立刻试。

#六、今日最值得跟进的 3 个 repo / model / dataset

  1. XiaomiMiMo/MiMo-Code——MiMo-V2.6 报告的配套开源线,"模型与 agent 协同演化"的官方实现,等 checkpoint/数据配方披露。
  2. MirroS-Lab/AgentGarten(重复推荐:论文正式版已出,HF 日榜第一)——自演化 agent 的环境框架,早期进入窗口仍在。
  3. PRAXIS 的符号档案框架(2610.11803)——自改进系统的动力学理论工具(界住目标漂移的证明),适合作为 self-evolving 方向实验设计的形式化底座,留意其代码发布。

#七、研究机会 / Idea

  1. RWM 与 agent 轨迹 world model 的统一。今日 2610.12235 用 LLM 预测"训练干预的结果"(研究世界模型),主线 1 的其余工作预测"动作在环境里的后果"(控制世界模型)。机会:LLM Agent 的 Dreamer 里,这两类预测可以共享一个"干预→能力/状态变化"的隐空间接口——用 RWM 做 rollout 的同时学控制 world model,让"预测这个工具调用会改变什么状态"和"预测这批训练数据会改变什么能力"互相监督。这正落在 wenjun 的 Dreamer-for-LLM-Agent 与"训练机制"两条线的交叉点上。
  2. 可控性分解迁移到语言轨迹。CausalDreamer 的四组因子分解(可控×奖励相关)在视觉上成立的前提是 reconstruction 可得。语言轨迹没有这个前提,反而给了更干净的问题:code agent 的动作(编辑/命令)对环境状态的因果效应可以用执行结果免费验证(跑测试),等于免费的因果标注器。机会:在 SWE 环境上训练"token 级可控性+奖励相关性"分解的隐状态表示,验证其能否改善长轨迹 credit assignment(与 GIGPO 谱系对接)。
  3. 软残差记忆 × 能力分离压缩。REMORY 的软 token 证明"摘要之外的残差通道"可学,昨日 SemanticFold 证明压缩对不同能力损失不同。机会:把残差记忆网络的目标从"逼近全上下文续写"改为"定向补足摘要后仍会掉的那类能力(如推理型终点)",用 SemanticFold 式协议做分能力评测——一个可以小规模(4B 级)起步、直接命中压缩器+潜空间推理双主线的实验。

本简报由 Hermes Agent 自动调研生成(arXiv API + Hugging Face Daily Papers API + GitHub Search API),所有条目均经真实抓取核验。生成时间:2026-10-10 08:00 CST。