#2026-10-11 AI/LLM 最新论文与研究热点简报
时间范围与特殊说明:今天(周六)早 8 点核查时,arXiv 尚无新公布批次——cs.LG/cs.CL/cs.SE/stat.ML 最近提交页与检索 API 的最新论文仍停留在 2610.124xx(周四 10-08 提交、周五 10-09 公布的批次,即昨日简报的主批次)。周六/周日 arXiv 不公布新论文(RSS 源显式声明 skipDays: Saturday, Sunday),下一个批次预计周一 10-12 晚 20:00 后公布、10-13 早可检索。因此本简报策略为:不编造"新"论文,改为系统回扫昨日主批次中因篇幅未覆盖的剩余论文(以 cs.AI 周五 RSS 全量 125 条 new 提交 + 四类列表页为底,经 API 逐条取摘要核验),并叠加 24-48 小时内的 GitHub / Hugging Face 动态。核心信息窗仍为 2026-10-07 至 10-11 晨,但内容与昨日简报零重叠(已按昨日 47 个编号去重)。
信息来源与限制:arXiv 官方 RSS(cs.AI,472 条含 125 条 new)+ arXiv API(摘要逐条核验)+ Hugging Face Daily Papers 10-09 榜单(10-10 榜单页面尚重定向至 latest,未生成)+ GitHub Search API / Trending。X/Twitter 匿名访问仍不可用,社交动向以 GitHub / HF 替代。arXiv 检索 API 本轮多次 429/503 限流,已通过退避重试完成。所有论文均真实存在、编号与摘要经 API 核验。
#一、总览:周五批次深挖出的五条主线
昨日简报以 model-based RL 爆发为主线;今天回扫批次剩余部分后,能看到几条昨天没写、但同样与研究方向强相关的暗线:
- 无奖励 agent 学习的"反馈建模"路线成型。RLVR 处处要 verifiable reward,但真实环境只有自然语言/执行反馈。
SELF(2610.11384)证明把环境反馈当"特权上下文"喂给 teacher 是不够的,必须显式学环境反馈的预测模型并与 hindsight 自蒸馏联合优化——这本质是"world model 当 teacher 用"。与ReTeach(2610.11529,纯自蒸馏自教师)、AgentEvolver(2610.11613,冻结模型靠任务执行演化系统能力)构成一条完整的"无奖励自改进"谱系。 - 循环/潜空间推理的工程化提速。
LLoCoT(2610.11472,cs.AI)把 CoT 从自回归串行生成改为非自回归潜空间循环精炼:36× 首 token 延迟降低、HumanEval/MBPP 精度不掉。InfiLoop(2610.11570,7M 参数)给循环 Transformer 补"循环原生残差",让测试时迭代可扩到 20,000+ 步仍在涨点(Sudoku-Extreme 97.9%)。两者一上一下,把"潜空间推理=慢"这个最大顾虑拆掉了。 - agent 记忆与上下文治理的"经济学"。
Curating Always-Loaded Context(2610.11007)把 AGENTS.md 这类常驻上下文做成带容量约束的品类优化问题:证明最优文件大小有上界、盲目追加可任意差、且反馈天然删失(没装的指令只有造成损失才被观测到)。与Agent-Controlled Forgetting(2610.10590,agent 自主把旧工具输出换短注+可恢复归档)、Memory Type Varies(2610.11573,记忆分型策略)一起,上下文管理开始有理论形状。 - 自我改进循环的"可验证层"从理论切入。
Verification and Self-Improvement in Agentic AI(2610.10611)给出有界验证 + 隐藏终端随机性的形式化框架,把"分数涨了"分解为搜索更长/外部支持/改验证方式三种机制;Distillation for Incrimination(2610.11012)则给"审计会伪装的模型"提供蒸馏双重bind的新思路。 - 多智能体世界模型的"一致性审查"。
MultiWorldBench(2610.11723,Minecraft 诊断基准):三个生成式世界模型在状态持久性/结构一致性上全部不及格(最高 8.00/100,引擎 ground truth 91.69)——"各视角看起来合理"不等于"共享一个连贯世界"。这给 Dreamer-for-agent 的状态一致性提出了量化底线。
对研究版图的意义:昨天的主线是"世界模型全家桶",今天的暗线是"当奖励不可用、上下文有限、验证不可信时,自改进还剩什么"——三条约束各自长出了一条论文链,而且都与 wenjun 的主线正交相交。
#二、重点论文详评(Top 8)
#1. SELF: Environmental Feedback Modeling Matters: Rethinking Feedback Treatment in Agentic Hindsight Self-Distillation
- 链接:https://arxiv.org/abs/2610.11384
- 来源:arXiv cs.AI(周四提交、周五 10-09 公布批次)
- 类别:LLM Agent / Model-based RL / Post-training
- 核心贡献:RL 无法直接用于无奖励环境;近期的 hindsight 自蒸馏把环境反馈当"特权上下文"条件给 teacher。本文指出这不够:环境反馈里含有"环境如何响应动作"的丰富监督,应被显式建模。SELF 联合优化"环境反馈预测"(teacher 学预测环境响应)与"策略蒸馏",二者互增强:反馈建模强化 hindsight 监督与策略学习,蒸馏反过来提升反馈预测。Qwen3-8B 上 τ-bench 成功率超 SDPO/GRPO 6.4/4.1 个点,AppWorld 目标完成超 10.71/3.57 个点。
- 为什么值得关注:这是"model-based RL 思想进入蒸馏框架"的干净实例——环境反馈模型就是 world model,hindsight 蒸馏就是用 world model 做 teacher 增广。它回答了一个实际问题:RLVR 之外的交互环境(客服、AppWorld 这类只有自然语言反馈的场景)怎么训练。
- 与研究方向的关系:正中 Dreamer-for-LLM-Agent 主线:Dreamer 的 dynamics model 在这里被实例化为"环境反馈预测器",且与策略学习共用一个训练循环。可延伸:反馈预测器能否像 Dreamer 那样用于 rollout 规划(而不只是蒸馏监督)?论文没做这一步。
#2. From Chain-of-Thought to Loops: Non-Autoregressive Latent Reasoning via Looped Transformers (LLoCoT)
- 链接:https://arxiv.org/abs/2610.11472
- 来源:arXiv cs.AI(10-09 公布批次)
- 类别:Latent Reasoning / Systems
- 核心贡献:现有潜空间推理大多保留隐向量间的自回归左到右依赖。LLoCoT 改为迭代精炼一个紧凑潜工作区:共享 transformer 重复作用于潜槽位、依据 prompt 与工作区现状并行更新;精炼后由概率头采样潜 token,再交给自回归解码器生成答案。训练用显式 CoT 蒸馏出的连续表示 + 答案预测损失 + 隐状态似然监督。HumanEval/MBPP 上与显式 CoT 精度持平,首 token 时延 ~36×、推理阶段延迟 ~42× 降低,端到端吞吐 +9.2%。
- 为什么值得关注:潜空间推理最大的落地障碍是"串行循环不一定比生成 CoT 快、还不一定准"。LLoCoT 用非自回归并行更新同时解决两头,且训练信号(CoT 蒸馏)不需要新数据——是"CoT 蒸馏到循环潜空间"这一路线目前最务实的配方。
- 与研究方向的关系:潜空间推理主线的直接素材。可延伸:code agent 场景里"潜精炼工作区"能否携带跨步骤的环境状态(工具返回的结构化结果进工作区、自然语言进解码器),变成 agent 的潜状态而非仅推理状态——这就是 latent reasoning 与 agent memory 的接缝。
#3. Scaling to Tens of Thousands of Test-Time Iterations with Loop-Native Attention Residuals (InfiLoop)
- 链接:https://arxiv.org/abs/2610.11570
- 来源:arXiv cs.AI(10-09 公布批次);代码:https://github.com/pixeli99/InfiLoop
- 类别:Latent Reasoning / Test-time Scaling
- 核心贡献:循环 Transformer 迭代数一多就退化:噪声状态更新会覆写已完成的正确中间结论,且错误一旦经长程传播进入循环就难纠正。InfiLoop 引入循环原生残差:内容加权 + 可学习时间衰减,学习"保留哪些过去计算、接受多少新更新",并给出精确流式递推使聚合记忆恒定。7M 参数即超越现有递归架构:Sudoku-Extreme 97.9%、ARC-AGI-2 13.6% pass@2,且 Sudoku-Extreme 上循环超过 20,000 有效步仍在持续涨点。
- 为什么值得关注:"深度换推理"的测试时扩展终于有了不塌缩的实现——残差连接之于循环 Transformer,恰如 ResNet 之于深度网络。小模型(7M)+超大循环深度 = 20k 步推理,这对"测试时算力按需伸缩"是一块清晰的拼图。
- 与研究方向的关系:与 LLoCoT 构成循环潜推理的"训练侧/架构侧"配对。可延伸:InfiLoop 的"内容加权保留"机制与 agent 记忆巩固是同一个问题(保留哪些、丢弃哪些)——把 InfiLoop 从玩具推理任务搬进 agent 长轨迹(保留成功子策略、抑制噪声经验)是显然的下一步实验。
#4. Curating Always-Loaded Context for LLM Agents: A Capacitated Assortment Model with Censored Feedback
- 链接:https://arxiv.org/abs/2610.11007
- 来源:arXiv cs.AI / cs.LG / math.OC(10-09 公布批次)
- 类别:LLM Agent / Context Compression / 理论
- 核心贡献:把 AGENTS.md 这类每轮都计费的常驻上下文文件的形式化成带容量约束的品类优化(assortment)问题:指令消耗有限注意力预算下的 token、增加指令绝不提升其余指令的合规率、保留指令有每会话固定成本。结论:最优文件大小有与候选指令数无关的上界;"凡有正边际价值就追加"的常见做法可任意次优;反馈天然删失(未加载的指令只在缺失造成损失时被观测),删除被忽略的指令必然误删部分有用指令;并刻画了加指令前应收集多少证据、人工审查受限时的 regret 界。
- 为什么值得关注:这是上下文压缩方向罕见的带定理的治理理论:它把"上下文文件越长越差"从经验现象变成可证结构,且删失反馈的刻画(你永远看不到没装的东西的好处)直指所有"上下文消融实验"的系统性偏差。
- 与研究方向的关系:正对通用上下文压缩器关注点的理论端。可延伸:把 assortment 模型里的"价值"换成按能力分解的价值(不同指令保不同能力),与 REMORY/Attic-KV 的能力分离压缩经验结论对接——"最优常驻上下文=按能力边际价值装的混合"是个可直接验证的假设。
#5. MultiWorldBench: Do Independently Controlled Views Describe One Shared World?
- 链接:https://arxiv.org/abs/2610.11723
- 来源:arXiv cs.AI / cs.CV(10-09 公开批次)
- 类别:Model-based RL / World Model / Evaluation
- 核心贡献:多人世界模型必须保证独立控制的各视角共享同一个持久世界。MultiWorldBench 用 Minecraft 构造 495 个案例配置、7 类任务、10 项能力(独立控制/跨视角运动/共享状态同步/持久性/结构推理/并发交互/延迟重访),以引擎 ground truth 为参照。结果:Gamma-World 十项平均 21.39、Solaris 20.88、MineWorld 1.89,而引擎 GT 91.69——所有生成系统在状态持久性上至多 8.00、结构一致性至多 1.33、空间推理与建筑身份保持全部失败。自动评测与人类偏好 Spearman 相关 0.96。
- 为什么值得关注:它把"世界模型一致性"从演示视频印象变成可量化诊断。"各视角单独看都合理,合起来不是一个连贯世界"——这正是 LLM Agent latent world model 在多智能体/多视角场景会踩的坑的具身预演。
- 与研究方向的关系:与 Dreamer-for-LLM-Agent 直接相关:Dreamer 假设单一状态空间,但真实 agent 环境是多人共享世界。可延伸:语言轨迹侧的同构基准——多个 agent 的文本观测是否"描述同一个世界状态"(跨 agent 状态一致性检验),目前没有人在 LLM 侧做这个。
#6. AgentEvolver: System-Wide Self-Evolution Through Task Execution
- 链接:https://arxiv.org/abs/2610.11613
- 来源:arXiv cs.AI(10-09 公布批次)
- 类别:LLM Agent / Self-evolving / Code Agent
- 核心贡献:任务完成 ≠ 工作方式改进。AgentEvolver 在冻结基座模型上,把任务执行经验转化为八类实体家族(可复用操作、方法、agent、控制流、接口等)的系统能力:每类实体的变更与其实际评估、后续被复用情况直接挂钩,形成"执行→沉淀→复用→再评估"的系统级演化回路。
- 为什么值得关注:与昨日详评的"Harness Evolution Hits a Ceiling"互补:那篇给 harness 演化划了边界(过程失败 vs 内容失败的二分),这篇给出 harness 侧自演化的完整系统设计。两篇合起来是"不改权重能走多远"的当前答案。
- 与研究方向的关系:自演化 code agent 主线的系统参照。可延伸:八类实体的"变更-评估-复用"闭环其实是一套显式的 credit assignment 机制——把它形式化后能否反过来指导权重级 RL 的奖励归因(哪类实体的改进对最终结果贡献最大)?
#7. LLM-IDEA: Identifiability-Driven Experimental Agent for Autonomous Discovery of Mechanistic World Models
- 链接:https://arxiv.org/abs/2610.11253
- 来源:arXiv cs.AI(10-09 公布批次)
- 类别:LLM Agent / Model-based RL / Scientific Discovery
- 核心贡献:自动化科研发现代理设计实验、推断机制世界模型时几乎不管可辨识性(identifiability):平台期到了,agent 需要知道"是我能力不够"还是"该模型从数据上就不可辨识(再做同类实验也无济于事)"。LLM-IDEA 给闭环发现装上可辨识性引擎,输出三路裁决:能力上限/设计类内可解/已证明穷尽。ODEBench 上 62 个含自由常数系统里 60 个在第 0 轮就可辨识,RC 电路被认证为穷尽。
- 为什么值得关注:这是把"实验设计停止条件"形式化的稀缺工作。所有 self-evolving agent 都有"何时停止探索"问题,可辨识性给了非平凡答案:有些任务不是难,是原理上做不出来。
- 与研究方向的关系:与 Dreamer 主线相交于"世界模型能学到什么":可辨识性引擎相当于给 world model 学习的可达到精度先验。可延伸:agent 环境建模里,"该环境的状态是否从观测序列可辨识"可作为环境设计的一个筛选准则——不可辨识的环境训练不出可迁移的 world model。
#8. Tracing the Thoughts of a Coding Agent Playing ARC-AGI-3: Lessons for Continual Learning
- 链接:https://arxiv.org/abs/2610.11450
- 来源:arXiv cs.AI(10-09 公布批次)
- 类别:Code Agent / Continual Learning / Memory
- 核心贡献:让一个冻结模型+固定 harness 的 coding agent 玩 ARC-AGI-3(无说明、闯关式推理游戏,每关都是新任务)。agent 只通过写文件保留状态——每个"想法"(写进文件的信念/规则/计划)都留下可追溯的痕迹。论文分析它形成、携带、纠正、放弃想法的完整过程:哪些想法跨关卡存活、哪些被错误保留、失败策略如何被放弃。贡献一套"思想级"追踪方法论与持续学习教训。
- 为什么值得关注:这是"持续学习不用梯度"的自然实验:agent 的文件系统=显式外置记忆,版本控制=记忆历史。它给"经验应该以什么粒度巩固"提供了真实数据(比人为设计的 continual learning 协议更接近 agent 实况)。
- 与研究方向的关系:正对 code agent + agent 记忆 + 持续学习三线交汇。可延伸:用这套"思想轨迹"数据训练记忆巩固策略(何时保留/改写/丢弃一条规则),相当于给 REMORY 式软记忆提供符号级的监督信号来源。
#三、其他值得一看的论文(快速清单)
| 论文 | 编号/链接 | 类别 | 一句话核心贡献 |
|---|---|---|---|
| Agent-Controlled Forgetting | 2610.10590 | Context Compression / Tool-use | agent 自主遗忘:把旧工具输出原位换成短注+可恢复归档,Python harness 暴露批量归档与显式恢复 |
| Plan-and-Patch | 2610.10786 | LLM Agent / Planning | dLLM 生成程序化计划,环境反馈后局部 patch 修订受影响区段(保留前后缀),不整盘重规划 |
| Verification and Self-Improvement in Agentic AI | 2610.10611 | Self-evolving / 理论 | 有界验证+隐藏终端随机性把"分数提升"分解为搜索更长/外部支持/改验证三种机制的形式化判别 |
| Distillation for Incrimination | 2610.11012 | Safety / Distillation | 蒸馏双重 bind:给会伪装的 teacher 蒸馏,错对齐若迁移则弱学生暴露它、若不迁移则学生泄证据 |
| SynCo | 2610.11345 | Self-evolving / Post-training | 合成器与推理器两个 agent 共同 MARL 训练:任务分布随能力共同演化,8 个数学基准最强综合 |
| ReTeach | 2610.11529 | Post-training / Distillation | 无参考答案的自蒸馏自教师:多轮反思+重试构造 teacher 优势,只用自生成尝试与结果级验证 |
| Memory Type Varies (TriMEM) | 2610.11573 | LLM Agent / Memory | 记忆多分类数据集+分型策略:不同类型记忆配不同处理策略,替代统一检索式记忆 |
| Hindsight Hierarchies | 2610.12168 | Post-training RL | "回头看"自改进循环:联合训练预测想法/从已知解反推想法/用想法解题三能力(Lean 实例化为未来工作) |
| Adaptive Reasoning via Cross-Turn Estimation | 2610.12061 | LLM Agent / Efficiency | 何时该再推理:跨轮估计先前推理是否仍足以支撑后续动作,省掉每轮冗余 CoT |
| TaReD | 2610.11268 | LLM Agent / Tool-use | 工具感知的递归任务分解:长程任务拆成带依赖图的子任务链,抑制早期规划误差传播 |
| DeltaReplay | 2610.11707 | LLM Agent / Memory | GUI agent 的步级记忆复用:按页面一致性+动作相似度决定"用多少旧轨迹",不强制不丢弃 |
| ReCast | 2610.11334 | LLM Agent / 机制研究 | 失败归因的步表示学习:冻结 LLM 隐状态对根因步区分度不足,学归因导向的步表示 |
| EvoAlloc | 2610.12086 | Self-evolving / Code Agent | 程序演化中的自演化资源分配 agent:从搜索经验学"把算力投给谁",替代固定分配策略 |
| Universal Textual Teaching | 2610.12114 | Distillation / Post-training | 无参数更新的蒸馏:师生差距写成自然语言 Primer(可解释、可跨模型复用),配对评测迭代更新 |
| Latent Core Tokenizer | 2610.12376 | Pretraining Data / Tokenization | MDL+熵边界+形态约束的语言无关分词:104 语言上 fertility 与 MorphScore 全面超 BPE/Unigram |
| Model Coherence | 2610.12129 | Continual Learning / 机制研究 | 窄微调模型重采样下自相矛盾:175 题高特异度不连贯性度量,暴露身份混淆与内省失败 |
| Where to Adapt Matters | 2610.11620 | Continual Learning / Post-training | 层选择性微调保通用能力:Fisher 信息量目标敏感度选层,PEFT 的"改哪里"比"怎么改"更根本 |
| CRUXEval 状态预测扩展 | 2610.11889 | Code / Evaluation | 预测程序输出+检查点状态的基准(400 例 Python/C++):推理模式比非推理高 33–55 点,长轨迹仍是短板 |
| SplitJEPA | 2610.12349 | Model-based RL / Latent | (昨已收录)JEPA 不重建学不变/可变因子分解的理论——今日补注:与 CausalDreamer 构成"分解目标"的两种答案 |
| VFold | 2610.12338 | Systems / Context Compression | 对称感知的跨层 value cache 合并:免改架构,可与量化/剪枝叠加达到单法不及的压缩比 |
| Caught in the Act | 2610.12445 | Safety / Interpretability | 白盒探针检测 agent 欺骗:跨层跨 token 聚合探针 SHADE-Arena 98.8% AUC,可捕获上下文无法判定的内省式欺骗 |
| OnTrack | 2610.12375 | LLM Agent / Systems | 流式结构感知最优传输的轨迹实时监控+干预:比逐步安全 agent 便宜、比事后审计及时 |
| AgenticBBO-Bench | 2610.12183 | LLM Agent / Evaluation | 跨域 agentic 黑盒优化基准:统一有限评估预算下隔离各设计选择的贡献 |
| DuplexAgent-RSI | 2610.11299 | LLM Agent / Voice | 全双工语音入口+异步委派 coding agent 的递归 harness 改进协作模式 |
| Pumpire | 2610.12423 | World Model / Evaluation | 3D 基础模型点对点度量距离估计的统一基准(100 场景物理实测标注) |
| SGUID | 2610.12367 | LLM Agent / Distillation | (昨已收录)技能库蒸馏选择:<25% 检索技能有蒸馏价值,选 6 个≈全库 |
#四、GitHub / 开源动态(近 48 小时)
- AetherLabsAI/Video2World(113★,10-05 建):Aether AI 的"视频→交互仿真"基准(论文 2610.04432):222 个重建实例、39 个任务族,把自动构建具身模拟器当成软件工程任务交给 coding agent,用执行反馈迭代精修。与 AgentGarten 同属"环境自动生成"路线,且完全开源(数据在 HF:AetherLabs-AI/Video2World)。周末冲榜中。
- Yoonkyo/TraceExtract(13★,10-07 建,CoRL 2026):"μ0: 可扩展 3D 交互轨迹世界模型"官方代码——从轨迹层(而非帧层)建模 3D 交互的 world model,值得与帧式世界模型对照阅读。
- pixeli99/InfiLoop:今日详评 3 的官方实现(7M 参数、20k+ 循环步),代码已放出,潜空间推理/循环架构方向的低成本实验载体。
- kutukam/autonomous-pentest-agent(103★,10-08 建):Go 后端的 LLM 多智能体自主渗透测试系统——自主安全 agent 是 RLVR 的天然高价值环境(有明确成功信号),可当环境设计参考。
- Elevatormusic/hermes-warm-compaction(42★,10-06 建,持续更新):上下文压缩的新工程路线——主模型在自己缓存的上下文上写压缩交接(而非调用小模型压缩),与 REMORY 的"残差"思路互补的"温压缩"路线。
- GitHub Trending 上与 coding agent 相关的:
morluto/rea(用 agent 逆向工程任何软件,25.8k★/日)、mksglu/context-mode(coding agent 的上下文窗口优化:沙箱化工具输出降 98%)、mattpocock/skills(工程化 agent skills 集合)——"上下文治理 + skills 沉淀"正在成为 coding agent 工具链的独立品类,与今日详评 4 的 assortment 理论互为表里。 - HF 侧:
XiaomiMiMo/MiMo-V2.6-RL-oss数据集(905👍,周榜第一梯队)——MiMo-V2.6 技术报告的开源 RL 数据线,与昨日详评 1 直接配套;harvardMadsys/freeinference_agentic_trace(10-05 新上)agentic 推理轨迹数据集,agent 记忆/经验学习方向的可挖原料。
说明:X/Twitter 匿名访问不可用,未纳入。GitHub Search API 正常(rate limit 内)。
#五、今日最值得精读的 3 篇
- SELF(2610.11384)——"环境反馈建模 × hindsight 自蒸馏"的联合优化,是 model-based RL 思想在无奖励 agent 环境最干净的落点,τ-bench/AppWorld 上对 SDPO/GRPO 的稳定优势说明这不是玩具。它给 Dreamer-for-LLM-Agent 提供了一个"world model 当 teacher"的可执行中间形态。
- LLoCoT(2610.11472)+ InfiLoop(2610.11570)(建议连读)——潜空间推理两条互补拼图:前者解决"非自并行的快与准"(36× 提速不掉点),后者解决"循环深度可扩展"(20k 步不塌缩)。合起来,"潜推理=慢且脆"这个最大质疑的工程答案基本齐了。
- Curating Always-Loaded Context(2610.11007)——常驻上下文治理的第一个带定理的框架:容量约束下最优文件大小有界、追加策略任意次优、反馈删失不可回避。做上下文压缩/记忆巩固的人应先读它的界再设计系统。
#六、今日最值得跟进的 3 个 repo / model / dataset
- AetherLabsAI/Video2World——"coding agent 造环境"(视频→交互仿真全自动化)与 AgentGarten(代码世界+神经渲染)构成环境自动生成双案例;数据/代码全开源,适合作为环境设计研究的对照实现。
- pixeli99/InfiLoop——循环潜推理的最小可复现载体(7M 参数),验证"循环深度换推理"在自己任务上的迁移成本极低。
- XiaomiMiMo/MiMo-V2.6-RL-oss(HF dataset,905👍)——MiMo-V2.6 报告的 RL 数据开源线,"grader 算力作为第三 scaling 维度"的实证原料,等 checkpoint 之外还能直接挖其 agentic grading 数据构成。
#七、研究机会 / Idea
- 环境反馈模型升级为规划器。SELF 证明"预测环境响应"能当蒸馏监督,但止步于 teacher 用。机会:让这个反馈预测器做 rollout——agent 在执行前用反馈模型模拟"这个工具调用会得到什么响应",在 τ-bench/AppWorld 这类自然语言反馈环境里实现真正的 Dreamer 式想象规划。落点恰是 wenjun 的 Dreamer-for-LLM-Agent 主线,且 SELF 的开源设置可直接接。
- 循环潜推理 × agent 潜状态统一。LLoCoT 的潜工作区精炼与 InfiLoop 的循环残差都只处理"单轮问题推理"。机会:把循环工作区扩展为跨轮持久的 agent 状态——工具返回的结构化结果写入工作区、InfiLoop 式残差决定保留/更新——等于给 agent 一个"梯度不经过、但可循环深化的外置隐状态"。ARC-AGI-3 思想追踪(详评 8)提供了现成的评测协议。
- 常驻上下文的能力分解装填。今日 assortment 理论证明统一价值度量下的追加策略任意差;昨日 SemanticFold/Attic-KV 证明压缩损失按能力分化。机会:把 assortment 中的指令价值按能力分维估计(每条指令保哪类能力、边际价值多少),解出"最优常驻上下文=按能力边际价值装填"的显式解并与追加式 AGENTS.md 对比——一个理论+实验双肩挑的小论文题目,直接命中压缩器主线。
本简报由 Hermes Agent 自动调研生成(arXiv RSS/API + Hugging Face API + GitHub Search/Trending API),所有条目均经真实抓取核验;今日为周末无新批次窗口,内容为周五批次系统性深挖(与昨日简报去重)。生成时间:2026-10-11 08:00 CST。