#2026-07-25 AI/LLM 最新论文与研究热点简报

时间范围:主要覆盖 Hugging Face Daily Papers 与 arXiv 在 2026-07-23 至 2026-07-25(Asia/Shanghai 早 8 点前)出现/更新的内容;GitHub/HF 取最近更新作为辅助信号。X/Twitter 在当前运行环境未登录,未作为一手来源;本期以 Hugging Face、arXiv、GitHub 与 HF API 交叉验证。

#一句话总览

过去 24-48 小时最值得关注的信号很集中:Agent RL 正在从“只训练模型输出”推进到“训练真实 harness 中的长轨迹智能体”,同时 coding agent 评测也从静态 issue 修复转向交互式、意图逐步变化、污染更难的工作流任务;另一条与 wenjun 当前兴趣高度相关的线是 latent reasoning 开始尝试 RLVR/test-time scaling,不再停留在 imitation-bound 的连续思维。

#今日重点 5 条

#1. OpenForgeRL: Train Harness-native Agents in Any Environment

  • 链接:arXiv:2607.21557 / HF Papers
  • 来源/日期:arXiv cs.AI/cs.CL,2026-07-23 提交;HF Daily Papers 2026-07-24/25
  • 类别:LLM Agent / Post-training RL / Tool-use / Systems
  • 一句话核心贡献:提出 OpenForgeRL,用轻量 proxy 截获/记录真实 agent harness 的模型调用,并用 Kubernetes 为每条 rollout 提供隔离环境,使 Claude Code、Codex、OpenClaw 这类复杂多进程 harness 能接入标准 RL 栈(如 veRL)做端到端训练。

为什么值得关注: 这正中 “agentic RL 的基础设施瓶颈”。过去很多 LLM Agent RL 论文默认环境是简单 Python API 或静态 benchmark,但真实 coding/research agent 的状态分布来自 shell、文件系统、浏览器、tool server、长上下文和失败恢复。OpenForgeRL 的关键点不是又一个 reward trick,而是把真实 harness 的 inference 轨迹转成可训练数据/rollout 单元。

与 wenjun 研究方向的关系: 如果要做 LLM model-based RL / Dreamer for Agent,首先需要一个能稳定采集 (history, action, observation, reward) 的真实 agent 环境层。OpenForgeRL 这类 proxy+harness-native 方案可以作为世界模型数据采集接口:先记录长轨迹,再学习 latent dynamics / outcome predictor / plan verifier。

#2. SLPO: Scaling Latent Reasoning via a Surrogate Policy

  • 链接:arXiv:2607.19691 / GitHub: ModalityDance/SLPO / HF Papers
  • 来源/日期:arXiv cs.CL/cs.AI/cs.LG,2026-07-22 提交;HF Daily Papers 2026-07-23;GitHub 2026-07-24 更新
  • 类别:Latent Reasoning / Post-training RL / Test-time Scaling
  • 一句话核心贡献:提出 Surrogate Latent Policy Optimization,让 latent reasoner 在缺少显式 token likelihood 与固定 thinking budget 下,仍能用 outcome reward 做类似 RLVR 的 test-time scaling。

为什么值得关注: 显式 CoT 的 RLVR 已经证明“结果可验证 + 更多思考 token”能拉升推理,但成本高且所有中间思考都必须离散化。SLPO 的问题意识是:连续 latent 思考已经能用更短 horizon 表达推理,但如何被 outcome reward 优化?这是 latent-space reasoning 从“模仿教师 hidden trajectory”走向“奖励驱动探索”的标志。

与 wenjun 研究方向的关系: 这条线可以与 model-based RL 自然结合:latent thought 本身就是可学习状态,surrogate policy 可以被看成对不可观测连续推理轨迹的可优化代理。值得进一步看它如何定义停止、预算分配、credit assignment,以及是否能迁移到 Agent 的长轨迹 latent planning。

#3. PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

  • 链接:arXiv:2607.21419
  • 来源/日期:arXiv cs.AI,2026-07-23 提交
  • 类别:LLM Agent / Post-training RL / Long-horizon Agent
  • 一句话核心贡献:把 agent RL 中的“技能/提示/经验”从静态资产改造成随当前 policy rollout 失败模式动态更新的训练脚手架,用 evidence cards 和任务评估指导下一轮 rollout。

为什么值得关注: 长轨迹 RL 的早期策略往往反复失败,rollout 信息熵低,导致优化信号贫乏。PATS 的思路是让环境/上下文对当前 policy 自适应,而不是只在 policy 端硬训。这相当于把 curriculum、memory、skill hint 和 evaluation feedback 融成训练时 scaffolding。

与 wenjun 研究方向的关系: 对“通过环境设计催生自演化智能”非常相关。一个可深挖问题是:scaffold 是否应被建模为世界模型/teacher policy 的一部分?当策略变强后,脚手架如何退火,避免训练-部署分布不一致?

#4. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

  • 链接:arXiv:2607.20911 / GitHub: Tencent/workbuddy-bench / HF Dataset: tencent/workbuddy-bench
  • 来源/日期:arXiv cs.CL/cs.SE,2026-07-23 提交;GitHub 2026-07-24 更新;HF Dataset lastModified 2026-07-21
  • 类别:Code Agent / Evaluation / Tool-use
  • 一句话核心贡献:构建覆盖 Code、Web、Office、Security 四类工作域的 coding-agent 评测,任务由真实 commit/PR/业务场景反向构造并改写成口语化需求,降低直接检索污染。

为什么值得关注: coding agent benchmark 最大风险是 benchmark leakage 和“issue 文本可搜索”。WorkBuddy 的任务构造强调污染抵抗,并公开 task directory、环境镜像、评测 harness、测试与参考解,有利于做可复现实验。

与 wenjun 研究方向的关系: 这类数据非常适合作为 agent 预训练/后训练的环境分布样本:不仅包含代码修复,还包含 office/web/security 等真实工具链。若要研究“agent 预训练数据如何塑造能力”,WorkBuddy 的跨域任务可用于分析模型在哪些工具/文档/安全场景上形成稳定策略。

#5. LLMs Get Lost in Evolving User Intent

  • 链接:arXiv:2607.20734 / HF Papers
  • 来源/日期:arXiv cs.LG,2026-07-22 提交;HF Daily Papers 2026-07-24/25
  • 类别:LLM Agent / Evaluation / Intent Understanding
  • 一句话核心贡献:把静态单轮任务转成多轮对话,其中用户意图会逐步披露、修订甚至中途转向,用来评估 LLM 是否能持续跟踪并执行变化中的真实意图。

为什么值得关注: 这是从“指令理解”走向“意图理解”的直接评测信号。许多 agent 失败并非不会调用工具,而是把早期假设固化到上下文里,后续用户修订无法正确覆盖。

与 wenjun 研究方向的关系: 对长轨迹 Agent RL 来说,reward 不应只验证最终 artifact,还应验证 agent 是否维护了可更新的 user-state belief。可以考虑把 evolving intent 作为部分可观测环境,研究 belief-state compression 与反事实意图修正。

#其他值得扫读的论文/动态

#Agent / Memory / Context Management

  1. AREX: Towards a Recursively Self-Improving Agent for Deep Research

- 链接:arXiv:2607.21461 / HF Papers

- 来源/日期:arXiv cs.AI,2026-07-23;HF Daily Papers 2026-07-24/25

- 类别:LLM Agent / Deep Research / Self-improvement

- 一句话贡献:利用“发现难、验证相对易”的不对称性,让 deep research agent 在内层研究循环后用外层 constraint-wise audit 递归修正未解决 claim。

  1. Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

- 链接:arXiv:2607.21503

- 来源/日期:arXiv cs.AI/cs.IR,2026-07-23

- 类别:LLM Agent / Context Compression / Memory

- 一句话贡献:主张 agent 记忆不是单纯 RAG 存取,而是覆盖记忆选择、结构化、存储、巩固、遗忘、召回与成本控制的生命周期架构问题。

  1. AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning

- 链接:arXiv:2607.21106

- 来源/日期:arXiv cs.AI,2026-07-23

- 类别:LLM Agent / Memory / Credit Assignment

- 一句话贡献:针对 memory-construction policy 的细粒度 credit assignment,用 attribution-guided process feedback 判断哪些中间记忆内容真正支撑最终答案。

  1. CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

- 链接:arXiv:2607.20553 / GitHub: Wyb0627/CMIMem

- 来源/日期:arXiv 2026-07-15;GitHub 2026-07-24 更新

- 类别:LLM Agent / Memory / Post-training RL

- 一句话贡献:训练轻量 memory manager,把下游 QA 正确性 reward 与条件互信息 CMI intrinsic reward 结合,减少仅靠 sampled QA 评价记忆价值的偏差。

  1. ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

- 链接:arXiv:2607.20764

- 来源/日期:arXiv cs.AI,近期出现在 arXiv recent

- 类别:Evaluation / Context Management

- 一句话贡献:用可验证任务图评估 agent context 管理是否能扩展,而不只是短上下文 QA。

#Code Agent / 软件工程评测

  1. ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

- 链接:arXiv:2607.21217 / HF Papers

- 来源/日期:arXiv cs.AI,2026-07-23;HF Daily Papers 2026-07-23

- 类别:Code Agent / Evaluation / Intent Understanding

- 一句话贡献:以模糊产品需求开局,通过自动 User Agent 模拟交互,把 coding agent 评测从静态补全推进到项目构建、需求澄清、调试与仓库级实现。

  1. Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks

- 链接:arXiv:2607.21482 / GitHub: UCL-ARC/RRBench

- 来源/日期:arXiv cs.AI/cs.CL,2026-07-23

- 类别:Code Agent / Open-weight Models / Evaluation

- 一句话贡献:评估本地开源权重模型在纵向人口研究数据准备任务中的 agentic coding 能力,服务于不能上传敏感数据的研究场景。

  1. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

- 链接:arXiv:2607.19865 / HF Papers

- 来源/日期:arXiv 2026-07-22;HF Daily Papers 2026-07-23

- 类别:LLM Agent / Evaluation / Tool-use

- 一句话贡献:提出确定性可验证的复杂文档操作 benchmark,揭示前沿 agent 在长程耦合文档工作流中的限制。

  1. DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

- 链接:arXiv:2607.20531

- 来源/日期:arXiv 2026-07-10;近期在 arXiv recent/HF 相关列表出现

- 类别:Tool-use / Evaluation / MCP

- 一句话贡献:面向 live MCP server 生成目标、记录成功轨迹并蒸馏成 path-agnostic effect checkpoints,以“是否复现效果”而非固定工具列表打分。

  1. NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

- 链接:arXiv:2607.20709 / HF Papers

- 来源/日期:arXiv 2026-07-22;HF Daily Papers 2026-07-24/25

- 类别:LLM Agent / Tool-use / Software Architecture

- 一句话贡献:把 agent 抽象成 Python object:方法是 action,字段是 state,docstring 是 prompt,类型注解是 contract,使 agent 更像可测试、可重构的软件组件。

#RL / Post-training / 推理机制

  1. Predictive Divergence Masks for LLM RL

- 链接:arXiv:2607.10848 / HF Papers

- 来源/日期:arXiv 2026-07-12;HF Daily Papers 2026-07-24/25

- 类别:Post-training RL / RL Algorithms

- 一句话贡献:改进 LLM RL 中 trust-region mask 的 direction criterion,用 predictive divergence 判断 policy 更新是否偏离行为策略,而非只依赖 sampled-token importance ratio。

  1. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

- 链接:arXiv:2607.10169 / HF Papers

- 来源/日期:arXiv 2026-07-11;HF Daily Papers 2026-07-23

- 类别:Post-training RL / Exploration

- 一句话贡献:指出 PPO-Clip 用欧式度量衡量 policy discrepancy 会导致低概率区域过度保守、高概率区域过激,提出 Riemannian Isometric Policy Optimization 缓解 exploration collapse。

  1. Multi-Turn On-Policy Distillation with Prefix Replay

- 链接:arXiv:2607.04763 / HF Papers

- 来源/日期:arXiv v2 2026-07-16;HF Daily Papers 2026-07-24/25

- 类别:LLM Agent / Distillation / Long-horizon Agent

- 一句话贡献:提出 Replayed-Prefix On-Policy Distillation,用预采集 teacher trajectory 作为 prefix replay,让 student 在部分步骤行动、teacher 提供逐步监督,降低在线多轮蒸馏成本。

  1. Sample-Efficient Learning from Agent Experience

- 链接:arXiv:2607.21051 / HF Papers

- 来源/日期:arXiv cs.CL,2026-07-23;HF Daily Papers 2026-07-24/25

- 类别:LLM Agent / Continual Learning / Code Agent

- 一句话贡献:研究 Experience Distillation:在不增加环境交互的前提下,把 agent 自身交互历史通过 context distillation 内化到模型权重中,并在 749 个软件工程任务上验证。

  1. Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models

- 链接:arXiv:2607.21433

- 来源/日期:arXiv cs.CL/cs.AI/cs.LG,近期提交

- 类别:Reasoning / Evaluation / Mechanistic Interpretability

- 一句话贡献:关注 CoT 模型 token budget 饱和与推理不收敛的早期机制检测,可作为 test-time scaling 的“何时停止/何时放弃”信号。

#基础模型训练机制 / 系统 / 数据

  1. SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

- 链接:HF Papers: 2607.20145 / arXiv:2607.20145

- 来源/日期:HF Daily Papers 2026-07-23;arXiv 近期

- 类别:Post-training / Systems / Foundation Models

- 一句话贡献:报告 DeepSeek-V4 家族在 Ascend SuperPOD 上做全参数后训练的系统与训练实践,适合关注国产算力大规模训练栈。

  1. Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

- 链接:HF Papers: 2607.19604 / arXiv:2607.19604

- 来源/日期:HF Daily Papers 2026-07-23

- 类别:Continual Learning / Knowledge Injection / Scaling Laws

- 一句话贡献:研究 hypernetwork 形式的知识注入在 LLM 中的 scaling law,可作为持续学习/知识更新不破坏基座能力的参考。

  1. OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining

- 链接:arXiv:2607.20486

- 来源/日期:arXiv 2026-06-02;近期在 arXiv recent 出现

- 类别:Foundation Model Training / Agentic Science / Optimization

- 一句话贡献:用多 agent 在 typed DSL 中搜索 Transformer 预训练 optimizer program,强调优化几何、状态动态、数值稳定与实现约束。

  1. InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents

- 链接:arXiv:2607.20468

- 来源/日期:arXiv 2026-05-20;近期在 arXiv recent 出现

- 类别:Systems / Code Agent / Evaluation

- 一句话贡献:给 agent 一个 H100、目标模型和两小时预算,让其部署 OpenAI-compatible inference server 并优化 prefill/decode/throughput,评估开放式系统优化能力。

  1. Dataset Distillation by Influence Matching

- 链接:HF Papers: 2607.16859 / arXiv:2607.16859

- 来源/日期:HF Daily Papers 2026-07-24/25

- 类别:Pretraining Data / Data Efficiency

- 一句话贡献:用 influence matching 做 dataset distillation;虽然未必专门针对 LLM 预训练,但对“数据质量/代表性样本选择”问题有方法启发。

#今日最值得精读的 3 篇

  1. OpenForgeRL — 优先级最高。它回答“真实 harness 中的 agent 轨迹如何被 RL 训练栈消费”,是做长轨迹 Agent RL / model-based Agent RL 的基础设施入口。
  2. SLPO — 与 latent-space reasoning 直接相关,重点看 surrogate policy 如何绕开 latent trajectory likelihood 与 stopping/budget 问题。
  3. Tencent WorkBuddy Bench — 适合作为 coding agent 研究的近期强基准;重点看污染抵抗任务构造、环境镜像、评分协议和任务分布。

备选精读:PATS(如果今天更想看 Agent RL 训练策略)与 LLMs Get Lost in Evolving User Intent(如果今天更想看意图理解/交互评测)。

#今日最值得跟进的 3 个 repo/model/dataset

  1. Tencent/workbuddy-bench:<https://github.com/Tencent/workbuddy-bench>

多域 coding-agent benchmark,配套 HF Dataset:<https://huggingface.co/datasets/tencent/workbuddy-bench>。

  1. ModalityDance/SLPO:<https://github.com/ModalityDance/SLPO>

SLPO 官方 repo,值得看 latent reasoner 的训练接口、reward 实现与实验任务。

  1. Wyb0627/CMIMem:<https://github.com/Wyb0627/CMIMem>

记忆管理 RL repo,适合追踪 memory reward、CMI intrinsic signal 与轻量 memory manager 实现。

补充观察:GitHub 搜索中出现多个 2026-07-24 更新的 agent RL/coding benchmark 小 repo(如 Tree-GRPO、AgentGym-RL、openbench 等),但星标和可信度信号尚弱,建议等论文/实验复现更明确后再投入。

#研究机会 / idea

#Idea 1:把 OpenForgeRL 轨迹变成 Agent 世界模型数据集

OpenForgeRL 解决了真实 harness rollout 采集问题。可以进一步做:

  • 从 shell/file/tool/browser observation 中学习一个 latent transition model;
  • 对 action 的 effect 做可验证 checkpoint 预测,而不是只预测文本 observation;
  • 用 learned world model 做 rollout pruning / imagination planning,再回到真实 harness 校正。

这会把 Dreamer-style model-based RL 与 LLM Agent 真实长轨迹连接起来。

#Idea 2:Evolving Intent 作为 POMDP,研究 belief-state/context compression

“LLMs Get Lost in Evolving User Intent” 可以被形式化成部分可观测任务:真实用户意图是隐藏状态,用户每轮消息是 noisy observation。值得尝试:

  • 训练一个显式 user-belief state summarizer;
  • 用反事实 user revision 测试 summary 是否能覆盖旧假设;
  • 将 belief 更新质量作为过程 reward,而不只看最终任务成功。

这和“从指令理解走向意图理解”高度贴合。

#Idea 3:Memory credit assignment 与 latent reasoning credit assignment 是否可统一?

AttriMem/CMI-Mem 关心“哪条记忆对最终答案有用”,SLPO 关心“哪段 latent computation 对最终 reward 有用”。二者都面临不可直接标注的中间状态 credit assignment。可以探索统一框架:

  • memory item / latent state 都看作可压缩中间变量;
  • 用 conditional mutual information、counterfactual deletion、verifier attribution 来估计贡献;
  • 在 Agent 长轨迹中同时优化“记什么”和“怎么想”。

#来源访问说明

  • Hugging Face Daily Papers 页面可访问,并检索了 2026-07-23/24/25 页面。
  • arXiv recent 与 abs 页面可访问,并抽取了 cs.AI/cs.CL/cs.LG/cs.SE/stat.ML 近期条目。
  • GitHub API 可访问,用于验证 WorkBuddy、SLPO、CMIMem 等 repo 更新与链接。
  • X/Twitter 当前环境未登录,未纳入直接引用;为避免编造,只使用可访问网页/API 作为来源。