#2026-07-26 AI/LLM 最新论文与研究热点简报
检索时间:2026-07-26 08:00 CST。主要覆盖 Hugging Face Daily Papers 当前页、arXiv 论文页、Hugging Face Models Trending、GitHub Trending。arXiv API 今日返回 429 rate limit,因此逐篇使用 arxiv.org/abs 页面核验标题、日期和摘要;X/Twitter 未作为主来源,避免不可验证信息。由于 arXiv 周末新提交相对稀疏,本期实际聚焦 2026-07-22 至 2026-07-25 之间在 HF/arXiv 上出现或更新的内容。
#一句话总览
今天最贴近 wenjun 方向的是一组围绕“长程 Agent 如何从经验中自我改进、如何训练真实 harness 中的 agent、如何评测动态意图与代码 agent”的论文:AREX 把 deep research agent 做成递归自改进循环,OpenForgeRL 试图把 Claude Code/Codex/OpenClaw 这类 harness-native agent 接进标准 RL 栈,Sample-Efficient Learning from Agent Experience / ReOPD 则从“把轨迹经验蒸馏进权重”角度回应长轨迹 agent RL 的样本效率问题。
#重点条目(建议优先读)
#1. AREX: Towards a Recursively Self-Improving Agent for Deep Research
- 链接:https://arxiv.org/abs/2607.21461;HF:https://huggingface.co/papers/2607.21461;Repo:https://github.com/VectorSpaceLab/arex-model
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 23 Jul 2026
- 类别:LLM Agent / Tool-use / Long-horizon Agent / Self-improvement
- 一句话核心贡献:提出 AREX,一类递归自改进 deep research agent,在“内部 research loop”生成临时答案后,用“外部 self-improvement loop”做约束级验证、局部修正和继续搜索。
为什么值得关注: 这篇很像把“长程研究任务”形式化成 discovery-verification asymmetry:发现满足多约束答案很难,但验证候选答案的各个约束相对容易。AREX 的关键不是简单拉长搜索,而是把 partially verified state 当作下一轮 refinement 的状态变量。
与 wenjun 方向的关系: 对 LLM Agent / model-based RL 特别有启发:它把“环境反馈”从一次性最终 reward 拆成可验证子约束,近似构造了一个可滚动更新的 latent state。后续可以追问:这些 verified constraints 能否成为 agent world model 的 belief state?能否用类似 Dreamer 的 latent rollout 来预测哪些子问题值得继续检索?
#2. OpenForgeRL: Train Harness-native Agents in Any Environment
- 链接:https://arxiv.org/abs/2607.21557;HF:https://huggingface.co/papers/2607.21557
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 23 Jul 2026
- 类别:LLM Agent / Post-training RL / Systems / Tool-use
- 一句话核心贡献:提出 OpenForgeRL,用轻量 proxy 记录 harness 的模型调用,并通过 Kubernetes orchestration 把 Claude Code、Codex、OpenClaw 这类复杂多进程 harness 接入标准 RL 代码库(如 veRL)。
为什么值得关注: 当前 agent RL 的难点不只是算法,而是“真实 agent 运行栈不可训练”:状态跨进程、工具调用、文件系统、浏览器、长对话和 sandbox 往往不在 RL 框架的数据模型里。OpenForgeRL 的价值在于把 harness-native inference 当作第一等公民,而不是把 agent 简化成单轮 prompt-response。
与 wenjun 方向的关系: 这直接对应 long-horizon code/agent RL 的基础设施问题。若要做 model-based RL for LLM Agent,第一步也必须有可重放、可归因、可训练的 harness trace;OpenForgeRL 的 proxy 设计可作为“采集真实轨迹→训练 reward/world model→再回灌 harness”的工程起点。
#3. Sample-Efficient Learning from Agent Experience
- 链接:https://arxiv.org/abs/2607.21051;HF:https://huggingface.co/papers/2607.21051
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 23 Jul 2026
- 类别:LLM Agent / Experience Distillation / Continual Learning / Post-training
- 一句话核心贡献:提出 Experience Distillation:利用 agent 过去交互历史带来的 in-context learning 增益,并把这种经验蒸馏进模型权重,减少昂贵环境交互。
为什么值得关注: 论文明确指出一个实际痛点:agent 把经验放进 context 里很样本高效,但一旦 context 被拿掉,能力就消失;而直接从交互历史做 distillation 又容易牺牲环境样本效率。这是长轨迹 agent 学习中“经验留存在上下文还是权重”的核心矛盾。
与 wenjun 方向的关系: 这和“agent 预训练数据如何塑造能力”“持续学习与高效后训练”高度相关。值得关注它如何定义可蒸馏的 interaction history,以及是否能与 context compression / episodic memory 结合:先压缩经验,再蒸馏到 policy 或 world model。
#4. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
- 链接:https://arxiv.org/abs/2607.20911;HF:https://huggingface.co/papers/2607.20911
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 23 Jul 2026
- 类别:Code Agent / Evaluation / Benchmark / Contamination
- 一句话核心贡献:构建多领域 coding-agent benchmark,覆盖 Code、Web、Office、Security;任务从真实 commit、PR 或业务场景反向构造,并改写成口语化角色请求,以降低通过搜索原 issue/commit 污染命中的风险。
为什么值得关注: coding agent benchmark 最大的问题之一是“公开 issue/PR 被训练集见过或可搜索到”。WorkBuddy Bench 的任务构造强调 contamination-resistant,这比单纯扩大 benchmark 更重要。
与 wenjun 方向的关系: 若研究 self-evolving code agent / agentic RL,评测集必须避免模型通过记忆或检索 shortcut 获胜。该基准的构造方式可借鉴到“代码环境设计催生自演化智能”:从真实修改中反推任务,但隐藏原始上下文,让 agent 必须真正理解代码状态和用户意图。
#5. LLMs Get Lost in Evolving User Intent
- 链接:https://arxiv.org/abs/2607.20734;HF:https://huggingface.co/papers/2607.20734;Repo:https://github.com/microsoft/evolving-intent
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 22 Jul 2026
- 类别:LLM Agent / Intent Understanding / Evaluation / Multi-turn
- 一句话核心贡献:提出把静态单轮任务转换为动态多轮对话的框架,用来评估用户意图在交互中逐步披露、修订和重塑时,LLM 是否能持续追踪并执行。
为什么值得关注: 这篇正中“从指令理解走向意图理解”。多数训练和评测假设用户一开始就给出完整需求,但真实 agent 场景中,用户意图经常在反馈中演化。论文题目里的 “get lost” 指向一个基础评测缺口。
与 wenjun 方向的关系: 对长程 agent RL 来说,intent tracking 可以看作 partially observable state estimation:用户的真实目标是隐变量,agent 需要在多轮中更新 belief。这个问题天然适合 latent-state modeling / model-based RL,而不是只做 response-level imitation。
#其他值得扫读的论文与动态
#6. Multi-Turn On-Policy Distillation with Prefix Replay
- 链接:https://arxiv.org/abs/2607.04763;HF:https://huggingface.co/papers/2607.04763;Repo:https://github.com/BaohaoLiao/ReOPD
- 来源/日期:arXiv,v1 Submitted on 6 Jul 2026,v2 last revised 16 Jul 2026;HF 近日重新上榜
- 类别:LLM Agent / On-policy Distillation / Post-training RL
- 一句话核心贡献:提出 Replayed-Prefix On-Policy Distillation(ReOPD),复用预收集 teacher trajectories 作为 replayed prefixes,让 student 在选定步骤行动并获得 dense per-step supervision,避免每次更新都重新跑环境和查询 teacher。
- 简评:可视为“agent 轨迹级 DAgger / on-policy distillation 的离线近似”。尤其值得看它提出的 prefix trap:多轮 OPD 中,prefix 分布错位会诱发学生在后续历史上学习偏掉。
#7. Predictive Divergence Masks for LLM RL
- 链接:https://arxiv.org/abs/2607.10848;HF:https://huggingface.co/papers/2607.10848
- 来源/日期:arXiv,Submitted on 12 Jul 2026;HF 近日上榜
- 类别:Post-training RL / RLVR / Optimization
- 一句话核心贡献:提出 Predictive Divergence Masks,改进 LLM RL 中 trust-region mask 的“方向判定”,不再只依赖 sampled-token importance ratio。
- 简评:如果 wenjun 关注 RLVR / agent RL 的稳定性,这篇属于底层优化机制。长轨迹 agent 的 off-policy 数据会更多,mask/clip 的偏差-方差问题会被放大。
#8. NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
- 链接:https://arxiv.org/abs/2607.20709;HF:https://huggingface.co/papers/2607.20709
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 22 Jul 2026
- 类别:LLM Agent / Tool-use / Agent Framework / Software Engineering
- 一句话核心贡献:提出 NOOA:agent 是 Python object,methods 是可执行 action,fields 是 state,docstrings 是 prompts,type annotations 是 contracts;方法体为
...的函数由 LLM agent loop 在运行时补全。 - 简评:这是 agent 编程接口的一个有趣方向:把 prompt/tool schema/workflow graph 收敛到 Python OOP 语义。对可测试、可 tracing、可 refactor 的 agent 工程很有价值。
#9. Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
- 链接:https://arxiv.org/abs/2607.21594;HF:https://huggingface.co/papers/2607.21594
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 23 Jul 2026
- 类别:World Model / Multi-agent / Latent State / Video Generation
- 一句话核心贡献:提出 WorldWeaver,在多智能体视频扩散 rollout 中引入 cross-agent world state registers,用 learnable tokens 保存共享世界信息和个体状态,并随生成 chunk 动态更新。
- 简评:虽然不是 LLM agent 论文,但“world state registers”很贴近 latent-state world model。可借鉴到文本 agent:用显式 state registers 保存环境、用户意图、工具状态,而不是只把历史塞进上下文。
#10. Self-Supervised Learning of Structured Dynamics from Videos
- 链接:https://arxiv.org/abs/2607.21576;HF:https://huggingface.co/papers/2607.21576;Repo:https://github.com/lukasknobel/StructuredDynamics
- 来源/日期:arXiv / Hugging Face Daily Papers,Submitted on 23 Jul 2026
- 类别:Latent Reasoning / World Model / Self-supervised Representation
- 一句话核心贡献:提出 Structured Dynamics Model(SDM),尝试从冻结 ViT 特征中自监督分解相机运动与物体运动,学习结构化动态表征。
- 简评:对 embodied/world model 方向有借鉴价值:把观察变化拆成不同因子,类似 agent 任务中把“环境变化、用户目标变化、agent 自身操作变化”解耦。
#11. Dataset Distillation by Influence Matching
- 链接:https://arxiv.org/abs/2607.16859;HF:https://huggingface.co/papers/2607.16859
- 来源/日期:arXiv,Submitted on 18 Jul 2026;HF 近日上榜
- 类别:Pretraining Data / Data Selection / Dataset Distillation
- 一句话核心贡献:提出 Influence Matching,从 outcome-centric 角度学习小型 synthetic set,使其对收敛参数的影响匹配完整数据集。
- 简评:不是 LLM 专用,但对“数据质量/去重/能力形成机制”有启发:与其看梯度过程,不如估计样本对最终参数/能力的影响。
#模型 / Repo / Dataset 动态
#A. KAT-Coder-V2.5-Dev
- 链接:https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev
- 来源/日期:Hugging Face Models Trending;created 2026-07-23,last modified 2026-07-25
- 类别:Code Agent / Agentic Coding / Model
- 一句话核心贡献:基于 Qwen3.6-35B-A3B 的 coding / agentic-coding 模型,模型卡标注 code、agent、agentic-coding、MoE 等标签,并链接技术报告:https://huggingface.co/papers/2607.05471。
- 跟进价值:与 code agent RL、自演化 coding agent 直接相关,建议后续单独读技术报告和训练数据/评测部分。
#B. Alibaba open-code-review
- 链接:https://github.com/alibaba/open-code-review
- 来源/日期:GitHub Trending daily 抓取
- 类别:Code Agent / Tool-use / Software Engineering
- 一句话核心贡献:开源代码审查工具,采用 deterministic pipelines + LLM Agent 混合架构,支持行级评论和内置规则集(NPE、线程安全、XSS、SQL 注入等)。
- 跟进价值:适合作为“代码 agent + deterministic verifier/rules”的工程样本;可观察哪些 bug 类型适合规则,哪些交给 LLM。
#C. poolside Laguna S 2.1
- 链接:https://huggingface.co/poolside/Laguna-S-2.1
- 来源/日期:Hugging Face Models Trending;created 2026-07-13,last modified 2026-07-24
- 类别:Foundation Model / Code Intelligence / Model
- 一句话核心贡献:poolside 发布的 Laguna S 2.1 text-generation 模型,模型卡链接官方 release blog,HF trending 数据显示下载和关注度较高。
- 跟进价值:poolside 长期聚焦代码基础模型,这类模型的开放程度、训练 recipe 和 benchmark 值得持续跟踪。
#D. Microsoft Fara1.5-27B
- 链接:https://huggingface.co/microsoft/Fara1.5-27B
- 来源/日期:Hugging Face Models Trending;created 2026-07-17,last modified 2026-07-22
- 类别:LLM Agent / Computer-use Agent / Web Agent / Multimodal
- 一句话核心贡献:Microsoft Research 发布的 multimodal computer-use agent,用于浏览器/web agent 场景,模型卡链接论文 https://huggingface.co/papers/2606.20785 和项目页。
- 跟进价值:对“真实环境中的 agent 预训练/后训练数据如何塑造能力”很有参考意义,特别是网页状态表示与行动空间设计。
#E. Thinking Machines Inkling
- 链接:https://huggingface.co/thinkingmachines/Inkling
- 来源/日期:Hugging Face Models Trending;created 2026-07-14,last modified 2026-07-23
- 类别:Foundation Model / Multimodal / MoE
- 一句话核心贡献:Thinking Machines 发布的多模态 MoE 模型,模型卡提供 BF16/NVFP4、playground 和 cookbook 链接。
- 跟进价值:更偏基础模型与多模态能力形成,若其 model card / cookbook 公开训练或工具使用细节,值得后续拆解。
#今日最值得精读的 3 篇
- AREX: Towards a Recursively Self-Improving Agent for Deep Research — 最贴近 self-improving research agent 与长程任务分解。
- OpenForgeRL: Train Harness-native Agents in Any Environment — 最贴近真实 agent RL 基础设施,尤其对 OpenClaw/Claude Code/Codex 式 harness。
- LLMs Get Lost in Evolving User Intent — 最贴近“从指令理解走向意图理解”,可转化为 latent belief tracking / POMDP 问题。
备选:如果今天想偏训练算法,第三篇可换成 Sample-Efficient Learning from Agent Experience 或 Multi-Turn On-Policy Distillation with Prefix Replay。
#今日最值得跟进的 3 个 repo/model/dataset
- OpenForgeRL(论文页:https://arxiv.org/abs/2607.21557)— 等待/查找代码后应重点复现其 proxy + RL 数据格式。
- KAT-Coder-V2.5-Dev(https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev)— agentic coding 模型,建议进一步读技术报告。
- AREX repo(https://github.com/VectorSpaceLab/arex-model)— 可直接观察 recursive self-improvement loop 的实现与数据格式。
#研究机会 / idea
#Idea 1:把 AREX 的“约束验证状态”建模为 Agent World Model 的 latent belief
AREX 证明 deep research 可以按 constraint-wise verification 递归推进。可以进一步做:把每个子约束的验证状态、证据来源、冲突程度编码成 latent belief state,用 model-based RL 预测“下一步查哪类证据/调用哪个工具”最可能提升最终答案质量。这会把 deep research agent 从 search heuristic 推向 learned planning。
#Idea 2:harness-native agent RL 的统一 trace schema
OpenForgeRL 强调真实 harness 很难接入 RL。可以设计一个跨 Claude Code / Codex / OpenClaw 的 trace schema:每个 step 记录 hidden prompt、visible observation、tool call、filesystem diff、test result、reward signal、credit assignment span。这个 schema 可以服务三件事:离线行为克隆、reward/world model 训练、以及可回放反事实评估。
#Idea 3:动态意图追踪 benchmark + latent-state compression
“LLMs Get Lost in Evolving User Intent”说明多轮用户意图会漂移。可以构造代码 agent 场景中的 evolving intent benchmark:用户不断补充边界条件、撤回需求、改变优先级。研究点是:是否需要一个显式 intent state compressor,把多轮历史压缩成可更新 latent state,而不是依赖长上下文直接记忆。
#信息源访问说明
- Hugging Face Papers / Models、arxiv.org/abs、GitHub Trending 和部分 GitHub repo 页面均可访问。
- arXiv export API 今日返回
429 Rate exceeded,因此本期未使用批量 API 元数据,改为逐篇抓取 arxiv.org/abs 页面核验。 - X/Twitter 未作为本期主来源;为避免不可验证或登录受限信息,本期用 HF、arXiv、GitHub 与模型卡替代。