#2026-10-10 AI/LLM 最新论文与研究热点简报
时间范围:本简报核心是 arXiv 2026-10-08(周四)与 10-09(周五)两个公布批次的新论文(编号 2610.106xx–2610.124xx,共 381 篇落入窗口,经 arXiv API 按 submittedDate 倒序真实抓取后逐条筛选;今日简报覆盖昨日简报未收录的 10-09 周五批次——昨日 08:00 简报发布时该批次尚未公布,故无重叠、不需去重,仅 AgentGarten 一条因 GitHub 侧先行曝光在昨日"repo 动态"里出现过,今日以论文形式补全)。补充来源为 Hugging Face Daily Papers 10-09 榜单(50 篇)与 GitHub Search API。整体时间窗为 2026-10-07 至 2026-10-10 晨(约 48 小时)。
信息来源与限制:arXiv 官方 API(cs.CL / cs.AI / cs.LG / cs.SE 四类共 413 条原始记录);Hugging Face Daily Papers API(10-09 榜单,10-10 榜单尚未生成);GitHub Search API。X/Twitter 匿名访问不可用,社交平台动向以 GitHub / HF / arXiv 替代。arXiv API 本轮再次多次触发限流与 503,通过加大请求间隔(30–60s)重试完成全部抓取。所有论文均真实存在、编号均经 API 返回核验,未编造任何条目。
#一、总览:10-08/10-09 批次的四条主线
今天(覆盖 10-09 周五批次)是本周第二个信息高峰。按 wenjun 的研究偏好筛出四条主线,其中第一条的密度罕见地高:
- model-based RL / world model 出现"全家桶"式集中爆发。单日窗口内至少七篇直接相关:HF 10-09 榜单第一的
AgentGarten(2610.12374,131👍)用"代码世界"造可演化 agent 的训练环境;CausalDreamer(2610.12016)对 Dreamer 4 式世界模型做因果解耦后训练;SplitJEPA(2610.12349)给 JEPA 补上不变/可变因子分解理论;LeWAM(2610.12407)把 JEPA 隐状态接到 MPC 规划;ME-World(2610.12299)做多智能体自我中心世界模型;DreamTrue(2610.12468)做动作忠实+反事实后训练的机器人世界模型;以及把 LLM 本身当"研究世界模型"用的Language Models as AI Research World Models(2610.12235,171,000 GPU 小时的真实实验记录训练 RWM)。这是 wenjun 两条近期主线(Dreamer for LLM Agent + 环境设计催生自演化智能)同时被喂饱的一天。 - RLVR / 蒸馏后训练的方法论与机制审查。
MiMo-V2.6(2610.11959,小米技术报告)公开"把 RL 规模推向自进化"的全栈配方(async 训练 1M 上下文 + 多域 agent 环境 + groupwise agentic grading);ZCPO(2610.12161)拆解 group policy optimization 里 KL 正则的七种失效模式;GRPODropout(2610.11854)发现"少用几条 rollout 反而更好";OPD 蒸馏一侧出现三篇方法 + 两篇边界研究(Semi-OPD / DIAL-OPD / MetaOPD / 为什么 OPD 会失败 / 何时需要 OPD)。RLVR 的元方法层正在快速成熟。 - agent 记忆与经验沉淀的三条新路线。
Hippocam(2610.12124)用嵌套意图结构做递归 prefix 巩固;REMORY(2610.11287)在文本摘要之外学残差软记忆 token(序列维度的"残差连接",5.2% 输入位置逼近全上下文);Memento 3(2610.11794,HF 榜单 24👍)用外部规则书给冻结 LLM 持续学显式世界模型。三者分别代表"结构化巩固 / 学到的软 token / 显式符号记忆"三个设计点,与 wenjun 的压缩器 + 记忆 + world model 关注点全面交叠。 - agent RL 的"审查层"成型。
ICRL(2610.11152)用控制实验证明 in-context RL 里奖励几乎不扮演学习信号;ModeBench(2610.11064)量化 RLVR 的"解模式塌缩";Who Verifies the Verifier(2610.11464)把验证器本身做成可演化对象;All Verdicts are Not Equal(2610.12083)审计 LLM judge 的判决翻转率;Cadence(2610.12269)做 coding agent 的动态干预调度。合起来是在问同一个问题:自我改进循环里,哪一环的信号是真实的?
对研究版图的意义:今天批次对 model-based RL / 世界模型(主线 1)输入最强,是近两周该方向最密的一天;对 agent 记忆 / 上下文压缩(主线 3)和 RLVR 机制审查(主线 2+4)各有一条完整的论文链可读。
#二、重点论文详评(Top 8)
#1. MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
- 链接:https://arxiv.org/abs/2610.11959
- 来源:arXiv cs.CL / cs.LG(小米技术报告),10-08/10-09 公布批次;HF 10-09 榜单 55👍
- 类别:Post-training RL / Pretraining / Systems / LLM Agent
- 核心贡献:全栈公开"用 RL 规模化推动自进化"的配方:预训练 hybrid-SWA 架构上先做多模态 mid-training 提供探索空间,再沿三个维度放大 RL——(1) 异步训练每步消耗 1,568 样本 / 27-37 亿 token、上下文至 1M;(2) 更多样复杂的环境(代码 / 通用 / 视觉 / 网络安全域的混合 agent harness);(3) 更多 grader 算力(groupwise agentic grading 给出更准的奖励符号)。
- 为什么值得关注:这是把"agentic RL 该怎么 scale"三个维度(batch/token 吞吐 × 环境多样性 × grader 算力)同时拉满并公开细节的少数报告之一。groupwise agentic grading 特别值得注意——它实质是"让一组 grader agent 分摊复杂任务的奖励判定",直指 RLVR 奖励信号质量问题(与今日主线 4 的审查层工作互相印证)。
- 与研究方向的关系:agentic RL / self-evolving agent 主线的工程参照系。可延伸:grader 算力作为第三个 scaling 维度,其"收益曲线"在什么任务族上饱和?这本身就是个可做的实证问题(小米没给出该消融)。
#2. Language Models as AI Research World Models
- 链接:https://arxiv.org/abs/2610.12235
- 来源:arXiv cs.LG / cs.AI,10-08/10-09 公布批次
- 类别:Model-based RL / LLM Agent / Self-evolving
- 核心贡献:提出 Research World Model(RWM):让语言模型预测"候选干预在一个研究环境里的结果"(pretraining / post-training / inference 九个环境、2,600+ 条真实实验记录、折合 171,000+ H100 GPU 小时)。发现:从真实实验经验学到的"研究知识"能把同环境内未见干预的预测提升 Spearman +0.27,且可跨环境复用——预训练环境学到的知识迁移到 post-training 环境的预测上。
- 为什么值得关注:这是"LLM model-based RL"的一个漂亮实例——不是给机器人造 world model,而是把 world model 用在实验规划上:agent 提出实验的能力强于执行能力时,outcome prediction 就是自进化循环的瓶颈能力。且训练数据是真实 GPU 实验记录而非模拟,接地程度罕见。
- 与研究方向的关系:正中 wenjun 的 Dreamer-for-LLM-Agent 主线:Dreamer 的价值函数(预测下一状态)在这里被实例化为"预测实验结果",跨环境复用性则暗示 RWM 学到的是研究动力学的共享结构。可延伸:agent 轨迹层面的 world model(预测 agent 行为的环境后果)与 RWM(预测训练干预的能力后果)是否共享表示?
#3. CausalDreamer: Learning Predictive World Models with Latent Disentanglement
- 链接:https://arxiv.org/abs/2610.12016
- 来源:arXiv cs.LG / cs.AI,10-08/10-09 公布批次
- 类别:Model-based RL / Latent Reasoning
- 核心贡献:指出 Dreamer 4 式世界模型的结构性缺陷:tokenizer 用重建目标训练,不带动作/奖励监督,其隐状态没有机制分离"可控/不可控/奖励相关/奖励无关"信息。CausalDreamer 冻结 tokenizer,把其隐状态再编码为沿两个轴(可控性 × 奖励相关性)分解的四组因子表示:只有可控组接收动作输入、只有奖励相关组用于奖励预测。
- 为什么值得关注:Dreamer 系谱在 LLM Agent 侧落地(latent rollout、隐空间规划)前必须回答"隐状态里哪些成分该被动作条件化"。这篇给出的是最小改动方案(冻结 tokenizer + 因子化再编码),在 Atari 100k 与其视觉变体上以远小于 Dreamer 3/4 的参数量匹配或超越性能。
- 与研究方向的关系:与 wenjun 的 Dreamer-for-LLM-Agent + latent-state 分组两个关注点同时正面相交。LLM 侧对应问题:语言轨迹的隐状态里"token 可控性"与"奖励相关性"如何分解?文本世界没有像素级 reconstruction 信号,分解目标可能反而是更容易学的一侧——这是个未被做的迁移。
#4. AgentGarten: Code Worlds for Evolving Agents
- 链接:https://arxiv.org/abs/2610.12374
- 来源:arXiv cs.AI,10-08/10-09 公布批次;HF 10-09 榜单第 1 名(131👍);repo:https://github.com/MirroS-Lab/AgentGarten(105★)
- 类别:LLM Agent / Model-based RL / Self-evolving / 环境设计
- 核心贡献:要造"既能交互又有真实观察分布"的环境,瓶颈在同时满足状态一致性(faithful)与真实感(realistic)。AgentGarten 把模拟器/游戏引擎(持久状态 + 程序定义交互规则)与共享神经渲染器(从结构化条件生成视觉观察)耦合成实时交互环境:把预训练视频模型适配到几何条件、用蒸馏给渲染提速到实时。
- 为什么值得关注:这是"通过环境设计催生自演化智能"方向目前最完整的开源框架之一——代码世界保证可验证的规则与状态,神经渲染保证观察分布真实。HF 单日 131👍 说明社区对"给 evolving agent 造训练场"的诉求集中爆发(昨日简报已注意到其 repo,今日补全论文与细节)。
- 与研究方向的关系:直接命中 wenjun 的"环境设计催生自演化智能"关注点。可延伸:观察侧"代码状态→神经渲染"的映射,本身就是 world model(state→observation decoder)——AgentGarten 可视为把 world model 拆成"确定性模拟内核 + 神经观察解码"两层的工程化,与主线 1 的隐式 world model 恰成对照。
#5. REMORY: Learning Residual Memory for Context Compaction
- 链接:https://arxiv.org/abs/2610.11287
- 来源:arXiv cs.CL,10-08/10-09 公布批次
- 类别:Context Compression / LLM Agent / Latent Reasoning
- 核心贡献:长程 agent 的文本摘要会丢失"后续决策需要的信息"。REMORY 在摘要之外学有界数量的软记忆 token:一个小网络读历史+摘要、生成若干 soft token 拼在摘要后,让冻结 LLM 逼近"看过全历史"的续写——作者称之为序列维度的残差连接(摘要=主干,soft token=残差)。SummHay 上仅用 5.2% 输入位置逼近全上下文联合分数;Qwen3.8-27B 与 GLM-5.3-Flash 跨多个长程 agent 基准一致提升,且探索熵下降明显减弱(保留了有效探索能力)。
- 为什么值得关注:把"压缩"从离散文本摘要推到"摘要 + 可学习软残差"的混合形态,且主体 LLM 冻结、只训小记忆网络——工程成本低、可直接叠加到现有 agent。软记忆 token 同时是 latent reasoning 的载体(残差即隐空间推理的一个受控入口)。
- 与研究方向的关系:正对通用上下文压缩器 + 潜空间推理双关注点。可延伸:残差记忆与昨日 SemanticFold 的"五类终点不共享压缩阈值"结论对接——软 token 恰好可以按"文本摘要保不住的那类能力"定向补偿,等于给能力分离压缩器提供了残差通道。
#6. Harness Evolution Hits a Ceiling: When Weight Training Should Begin
- 链接:https://arxiv.org/abs/2610.11655
- 来源:arXiv cs.AI / cs.SE,10-08/10-09 公布批次
- 类别:LLM Agent / Code Agent / Self-evolving / Post-training
- 核心贡献:回答一个 agent 工程的关键时序问题:harness 演化(冻结权重改运行时)和权重训练(改模型)各修什么、何时切换。方法:给失败轨迹打"首个触发信号"标签,把失败分为过程失败(调用被阻断/循环/步数耗尽)与内容失败(交付的方案差)。自演化 harness 先行修复过程失败,其塑成行为可再被"蒸进"权重;内容失败才是权重训练的靶子。DeepPlanning 上自演化 harness 把 Qwen3.5-4B held-out 分从 0.16 提到 0.30,之后权重训练接管内容失败,两者交叉组合不冲突。
- 为什么值得关注:这是"harness vs weights"之争(SWE-agent 社区持续争论的问题)目前最清晰的实验答案,失败二分法(过程/内容)是一个可以立刻搬进自己训练管线的诊断工具。
- 与研究方向的关系:横跨 wenjun 的 code agent + agentic RL + 基础模型训练关注点。可延伸:过程/内容失败的二分信号本身能否作为 RL 的 shaped reward(过程失败给即时负信号)?这会把 harness 演化与权重训练统一进一个 credit assignment 框架。
#7. Do LLMs Learn from Rewards in Context? Rethinking the role of reward in In-Context RL
- 链接:https://arxiv.org/abs/2610.11152
- 来源:arXiv cs.CL / cs.LG,10-08/10-09 公布批次
- 类别:LLM Agent / Post-training RL / Evaluation
- 核心贡献:把"in-context reinforcement learning(ICRL)"拉到控制实验下检验:模型直接条件于原始轨迹-奖励对时,奖励被读到了、但效应极小——翻转/随机化/删掉奖励,改进曲线几乎不变;即便 meta-prompt 明确指示"探索/利用/推理奖励"也一样。真正驱动改进的是轨迹本身,且与语义内容无关(打乱轨迹顺序效果不变)——改进来自对任务格式的分布适应,而非奖励驱动的学习。
- 为什么值得关注:大量 agent 经验学习论文默认"上下文里带奖励=在做 RL"。这篇用最干净的设计否定了该默认。对任何在 agent 记忆/经验回放系统里保留奖励字段的人,这是一篇"先读再设计"的论文。
- 与研究方向的关系:与 wenjun 的 agent 记忆 + 经验学习关注点直接相关:它说明当前 LLM 的 in-context 学习无法利用奖励信号,"经验→知识"的转化必须显式建模(如摘要素材化、技能蒸馏),不能指望模型自己"悟出"奖励规律。与主线 4 的信号审查层同构。
#8. SFT-as-Context Mitigates Forgetting in Supervised Fine-Tuning
- 链接:https://arxiv.org/abs/2610.11132
- 来源:arXiv cs.CL,10-08/10-09 公布批次
- 类别:Continual Learning / Post-training / LLM Agent
- 核心贡献:训练无关的防遗忘方法:父模型(预训练模型)把 SFT 模型的回答当作上下文来答查询——通过 in-context 学习获得微调能力、同时保留自身通用能力。19 组父-SFT 对 / 11 个基准上,SFT-as-context 在微调能力上与 SFT 模型差距仅 2.2/2.1/2.0 个点,而通用能力保持父模型水平。
- 为什么值得关注:与昨日详评的"A Deafening Silence"(遗忘的 token 嵌入机制)形成机制-方案对偶:那边证明遗忘在参数里、这边干脆不更新参数。零训练成本、即插即用,19 对模型的系统评测规模也够大。局限同样清晰:推理时多一次模型调用。
- 与研究方向的关系:正对持续学习 + 高效后训练关注点。可延伸:agentic 场景下"父模型 + SFT agent 模型"级联是否等价于一个免费的 MoE 路由(通用 query 走父、域 query 走 SFT)?与 REMORY 的残差思路在"能力加减法"上互补。
#三、其他值得一看的论文(快速清单)
| 论文 | 编号/链接 | 类别 | 一句话核心贡献 |
|---|---|---|---|
| SplitJEPA | 2610.12349 | Model-based RL / Latent Reasoning | JEPA 不重建也能学到不变/可变因子分解的理论与方法,隐状态分解不再需要 reconstruction 买单 |
| LeWAM | 2610.12407 | Model-based RL | JEPA 隐状态上的双向 WAM(前向/反向/逆动力学+策略),线性探针读状态优于重建式 WAM,接 MPC 规划 |
| ME-World | 2610.12299 | Model-based RL / World Model | 多智能体自我中心世界模型:共享 token 序列联合去噪多条 ego 流,保证跨视角动作一致与交互状态传播(HF 43👍) |
| DreamTrue | 2610.12468 | Model-based RL | 机器人世界模型的动作忠实性:动作轨迹渲染成图像条件 + 反事实后训练(改动作生成未见未来),HF 榜单 33👍 |
| Memento 3 | 2610.11794 | LLM Agent / Self-evolving / Model-based RL | 冻结 LLM + 外部自然语言"规则书"世界模型:观测→反思→规则修订→编译成代码→验证的持续学习循环,HF 24👍 |
| Hippocam | 2610.12124 | LLM Agent / Memory | 嵌套意图结构 + 递归 prefix 巩固的记忆架构:活动上下文围绕当前意图、完成意图只巩固"后续需要的产出与状态" |
| Internalizer | 2610.11715 | Context Compression / Continual Learning | 上下文→LoRA 权重的 hypernetwork 推到 284B DeepSeek v4 Flash(此前上限 14B):model-agnostic 主干 + 4096 token 文档适配器,top-1 84.9% vs 基座 63.4% |
| ModeBench | 2610.11064 | Post-training RL / Evaluation | RLVR 的"解模式塌缩"量化:多解任务基准上 RLVR 后训练使概率集中到更少正确模式(准确率不降、多样性降) |
| ZCPO | 2610.12161 | Post-training RL | group policy optimization 中 KL 正则的七种失效模式拆解;条件 KL 校准组内奖励系数的替代设计 |
| GRPODropout | 2610.11854 | Post-training RL | 熵塌缩的 rollout 侧解法:更新前剔除少量高概率正优势 rollout 并重新居中优势,同预算下比标准 GRPO 更稳 |
| Semi-OPD | 2610.11291 | Post-training / Distillation | 17 组师生对(1.5B–235B)系统对比:初始学生的离线 rollout 常胜在线 OPD(14/17 组,最高 +13.6%、11.4x 加速),判据=输出 token 重合率 |
| Why OPD Fails | 2610.11247 | Post-training / Distillation | OPD 早 plateau 的机制:大教师的学习信号 proxy 早期衰减(200 步后仅 25.1% 损失降幅 vs 自 RL 教师 96.2%),连续时间动力学分析 |
| DIAL-OPD | 2610.11659 | Post-training / Distillation | token 选择蒸馏:用师生概率的对数平均加权奖励幅度筛 token,"少 token 训练优于全 token OPD" |
| MetaOPD | 2610.11989 | Post-training / Distillation | 双层优化学 token 加权网络(外层=虚拟学生更新后的验证损失),加权决策与更新效果直接挂钩 |
| Residual Advantage (RA) | 2610.11519 | Post-training RL | RLVR×OPD 融合:师生概率残差当有界单步奖励、减学生状态价值成标准 advantage,回应内做居中 |
| Cadence | 2610.12269 | Code Agent / Systems | coding agent 的动态监督:按执行健康度自适应调度检查与两级干预(建议级/纠正级),替代固定间隔监控 |
| CABRA | 2610.10610 | Code Agent / Evaluation | 6840 个受控任务证明:代码理解(而非生成)是 coding agent 真正瓶颈;读代码工具调用数比改动行数更能预测 agent 准确率 |
| HarnessSQL | 2610.12274 | LLM Agent / Post-training | harness 原生训练:SFT+RL 全程保留与真实数据库的状态化多轮交互结构,教师直接在目标 harness 里 rollout,只留验证轨迹 |
| Agentic-TTT | 2610.12002 | LLM Agent / Post-training | 把 TTT 算法当可调用工具、学一个测试时策略决定"何时 TTT/用哪个算法/技能可复用",参数级自改进加一层 agency |
| MASS | 2610.12176 | LLM Agent / Self-evolving | 非可验证任务(开放研究)的 RSI:进化搜索多智能体 workflow + 自生成轨迹 SFT 交替,同构循环靠异构拓扑破解 |
| Trace2Env | 2610.06100 | LLM Agent / Model-based RL | 学习免费的语言世界模型:历史交互 trace 重构成"环境 worldbook",world model agent 当环境与 task agent 状态化交互(HF 97👍) |
| Learn2Play Bench | 2610.08215 | LLM Agent / Evaluation | 规则全新/反直觉的文字游戏基准,强迫 agent 从交互学知识而非复述预训练知识(HF 76👍) |
| PRAXIS | 2610.11803 | Self-evolving / 理论 | 自改进系统的共演化理论:生成器-KL 约束 + 符号档案权移动界住目标漂移,SGD 达平均平稳性保证 |
| Who Verifies the Verifier | 2610.11464 | Evaluation / Self-evolving | 让 verifier 成为演化对象:可检视的确定性缺陷检测器表达式,按锚定参考集+无标注共识选择(绝不看 agent 分数) |
| All Verdicts are Not Equal | 2610.12083 | Evaluation | LLM judge 可靠性审计:温度 0 下判决复现会翻转、位置交换翻转多数判决、最"确定"的 judge 靠重复错误判决达成一致 |
| ICRL | 2610.11152 | LLM Agent / 机制研究 | (见详评 7)in-context 奖励几乎不充当学习信号 |
| QGMem | 2610.11920 | LLM Agent / Memory | 事件索引原子记忆 + 查询感知图增强做工作记忆,兼顾扁平记忆轻量与图记忆结构性 |
| LadderEdit | 2610.11160 | Continual Learning / Memory | 编辑级残差压缩:新增编辑以紧凑残差形式叠加,终生编辑下显存大幅下降 |
| From a Prompt to Repertoires | 2610.11373 | Continual Learning | prompt 优化做持续学习:功能化技能库演化(EFRE),避免逐任务 prompt 的过拟合与遗忘 |
| Lapras | 2610.11111 | Latent Reasoning | 时间序列 LM 的隐空间推理:连续时序信号不再离散化为文字 CoT(早期描述错误会传播),在 latent 上 post-training 推理 |
| TraceRelay | 2610.11743 | Latent Reasoning / Systems | 注意力对齐的循环架构:低维 rolling trace 携带持久表示,Equal Repeats 256 长度 98.8% vs 无继承 50.7% |
| Attic-KV | 2610.12133 | Context Compression / Systems | KV 压缩反直觉发现:紧预算下"排练全部上下文"反而崩(3% 保留率 RULER 只剩 31.5/96.5),该排练的是将被读的部分 |
| Evolving Latent Spaces | 2610.12304 | 机制研究 | LLM 表示空间的小世界连接性作为推理性能签名(HF 10-09 榜单) |
| Adapting English Quality Classifiers | 2610.11585 | Pretraining Data | 英语质量分类器的多语言改造(MLP on encoder embeddings + 机器翻译弱标签),100+ 语言上保持下游基准 |
| Project Greenhouse | 2610.11922 | LLM Agent / Search | 完全开源主权的 agentic search 路线图:不依赖第三方开放权重、几块 GPU 从零训练 reranker 的可复现配方 |
| SGUID | 2610.12367 | LLM Agent / Distillation | 技能库蒸馏的选择问题:<25% 检索技能提供有效蒸馏信号;按训练期一致有效性选 6 个技能≈全库 |
| TokenRouter | 2610.12242 | Systems | token 级 LLM 路由的 serving 系统(HF 10-09 榜单 102👍) |
| Structure Tax | 2610.12056 | Evaluation / Structured Output | 结构化输出税取决于 schema 设计而非结构本身:推理先行字段序≈自由文本精度,答案先行序大幅掉点 |
| METR time horizons | 2610.12466 | Evaluation / 前沿动态 | 对 METR 时间视界图的统计重估:样条+IRT 放松"难度线性依赖 log 人类时间"假设,2–30 分钟区间接近平坦 |
| Ecology of AI Agents | 2610.12436 | Safety / 前沿动态 | 失准 agent 种群的生态学:增长方程+适应度分析,协作造成种群起飞阈值 |
#四、GitHub / 开源动态(本周新建,按 star)
- XiaomiMiMo/MiMo-Code(13,619★):MiMo "Models and Agents Co-Evolve" 主仓库——与今日详评 1 的 MiMo-V2.6 技术报告直接配套,模型-智能体协同演化的官方开源线,值得长期跟踪其 checkpoint 与训练细节披露。
- XiaomiMiMo/MiMo(2,382★):MiMo 系列(从预训练到 RL)主仓库。
- MirroS-Lab/AgentGarten(105★,继续上涨):Code Worlds for Evolving Agents——论文今日上榜(详评 4),"环境设计催生自演化智能"目前最完整的开源框架。
- BinceQu/RoboHarness(222★):给 LLM agent 的视觉-几何控制面板,连接 agent 与具身控制(与主线 1 的机器人世界模型方向互补)。
- fidipro/gluon(47★):coding agent 的控制平台(编排/审计),与今日 Cadence、AgentMonBench 一脉的 agent 监督基础设施。
说明:GitHub Search API 本轮可正常访问。X/Twitter 仍不可匿名访问,未纳入来源。本周新建仓库多为应用层产品(openchart / seris 等),与研究方向直接相关的以上五条为主。
#五、今日最值得精读的 3 篇
- MiMo-V2.6 技术报告(2610.11959)——想知道 agentic RL 规模化"现在的工业答案"是什么,这是必读:三个 scaling 维度(吞吐/环境多样性/grader 算力)+ 1M 上下文异步训练的系统细节,且开源仓库配套可查。
- Language Models as AI Research World Models(2610.12235)——LLM model-based RL 的新实例化:用真实 GPU 实验记录训练"预测干预结果"的世界模型,跨环境复用性是关键发现,与 Dreamer-for-LLM-Agent 的构型直接相关。
- REMORY(2610.11287)——上下文压缩的新形态:"文本摘要 + 可学习软残差",冻结主体只训小网络、5.2% 位置逼近全上下文,是压缩器与潜空间推理两条线的交汇点,且工程门槛低到可以立刻试。
#六、今日最值得跟进的 3 个 repo / model / dataset
- XiaomiMiMo/MiMo-Code——MiMo-V2.6 报告的配套开源线,"模型与 agent 协同演化"的官方实现,等 checkpoint/数据配方披露。
- MirroS-Lab/AgentGarten(重复推荐:论文正式版已出,HF 日榜第一)——自演化 agent 的环境框架,早期进入窗口仍在。
- PRAXIS 的符号档案框架(2610.11803)——自改进系统的动力学理论工具(界住目标漂移的证明),适合作为 self-evolving 方向实验设计的形式化底座,留意其代码发布。
#七、研究机会 / Idea
- RWM 与 agent 轨迹 world model 的统一。今日 2610.12235 用 LLM 预测"训练干预的结果"(研究世界模型),主线 1 的其余工作预测"动作在环境里的后果"(控制世界模型)。机会:LLM Agent 的 Dreamer 里,这两类预测可以共享一个"干预→能力/状态变化"的隐空间接口——用 RWM 做 rollout 的同时学控制 world model,让"预测这个工具调用会改变什么状态"和"预测这批训练数据会改变什么能力"互相监督。这正落在 wenjun 的 Dreamer-for-LLM-Agent 与"训练机制"两条线的交叉点上。
- 可控性分解迁移到语言轨迹。CausalDreamer 的四组因子分解(可控×奖励相关)在视觉上成立的前提是 reconstruction 可得。语言轨迹没有这个前提,反而给了更干净的问题:code agent 的动作(编辑/命令)对环境状态的因果效应可以用执行结果免费验证(跑测试),等于免费的因果标注器。机会:在 SWE 环境上训练"token 级可控性+奖励相关性"分解的隐状态表示,验证其能否改善长轨迹 credit assignment(与 GIGPO 谱系对接)。
- 软残差记忆 × 能力分离压缩。REMORY 的软 token 证明"摘要之外的残差通道"可学,昨日 SemanticFold 证明压缩对不同能力损失不同。机会:把残差记忆网络的目标从"逼近全上下文续写"改为"定向补足摘要后仍会掉的那类能力(如推理型终点)",用 SemanticFold 式协议做分能力评测——一个可以小规模(4B 级)起步、直接命中压缩器+潜空间推理双主线的实验。
本简报由 Hermes Agent 自动调研生成(arXiv API + Hugging Face Daily Papers API + GitHub Search API),所有条目均经真实抓取核验。生成时间:2026-10-10 08:00 CST。