#2026-07-29 AI/LLM 最新论文与研究热点简报

检索时间:2026-07-29 08:00(Asia/Shanghai)。主要覆盖 2026-07-27 至 2026-07-28 arXiv 新提交/更新、Hugging Face Daily Papers、GitHub 最新仓库动态;部分相关论文因 HF Daily 在 7 月 28 日收录但 arXiv 初投日期更早,也纳入“值得补读”。X/Twitter 未作为直接来源使用:当前环境没有稳定、可认证的 X 访问入口,因此用 Hugging Face、arXiv、GitHub、OpenAlex/API 作为替代来源。

#一句话总览

过去 24-48 小时最贴近 wenjun 方向的信号是:Agent 能力研究正在从“更强模型 + 更多工具”转向“可控环境、轨迹协议、奖励/评测器、harness 与数据配方共同优化”。尤其值得注意的是:

  1. 长程 Agent planning 开始被放进可控环境中,系统研究 pretraining 数据格式、world-model CoT、on-policy distillation 如何形成规划能力。
  2. Agentic search / computer-use / coding agent 的 RL 不再只看最终成功率,而开始关心“过程监督如何密化”“judge/reward 如何可靠”“harness 是否是隐藏变量”。
  3. 基础模型训练机制方面,Kimi K3 把百万上下文、MoE、latent MoE、RL for agentic/coding 放到一个 frontier open report 中;VLM/embodied data recipe 也出现更系统的 mixture optimization 与 data pyramid 视角。

#重点论文与动态(按相关性筛选)

#1. The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

  • 链接:https://arxiv.org/abs/2607.24720
  • 来源/日期:arXiv cs.CL/cs.AI/cs.LG,Submitted 2026-07-27;Hugging Face Daily Papers 2026-07-28 收录。
  • 类别:LLM Agent / Post-training RL / Pretraining Data / Model-based RL
  • 一句话核心贡献:构建一个可控多轮长程规划环境,系统研究规划能力如何在预训练、SFT、单/多教师 on-policy agentic distillation 中获得与泛化;摘要中特别提到显式 world model construction via CoT state transition modeling 能增强长程泛化。

为什么值得关注:这篇几乎正中 wenjun 的“LLM model-based RL / Dreamer for LLM Agent”兴趣。它没有直接说 Dreamer,但问题意识非常接近:把多步任务拆成可控状态转移环境,研究模型是否通过显式状态转移/世界模型式 CoT 学到可组合规划,而不是只记忆短程技能。

与 wenjun 研究方向的关系:可以把它当成“LLM Agent world model 训练机制”的新素材:预训练阶段的数据格式、分布、质量如何塑造 planning;后训练阶段 on-policy distillation 如何缓解离线轨迹分布偏移;Agent RL 阶段是否需要先学习可预测的状态转移 latent/textual world model,再做策略优化。


#2. Kimi K3: Open Frontier Intelligence

  • 链接:https://arxiv.org/abs/2607.24653;HF 页面:https://huggingface.co/papers/2607.24653
  • 来源/日期:arXiv,Submitted 2026-07-27;Hugging Face Daily Papers 2026-07-28 高热度收录。
  • 类别:Foundation Model / Systems / Long Context / Post-training RL / Code Intelligence
  • 一句话核心贡献:发布 2.8T 参数、104B activated、原生视觉、1M context 的 MoE frontier model report,提出 Kimi Delta Attention、Attention Residuals、Stable LatentMoE,并强调在 general、agentic、coding 域做多 reasoning-effort level 的 RL。

为什么值得关注:这类 frontier report 对“能力形成机制”很有参考价值。摘要里出现的几个关键词非常贴近当前趋势:长上下文结构、MoE 稳定路由、算法-系统协同、RL 覆盖 agentic/coding、多 reasoning effort level。它说明大模型竞争点已经从单纯扩参数,转向 长上下文信息流 + 稳定专家激活 + 后训练任务域结构化

与 wenjun 研究方向的关系:KDA/Attention Residuals 可作为“长上下文能力如何从架构进入训练动态”的案例;report 明确把 agentic/coding 作为 RL 域,值得查全文中是否有环境、reward、trajectory filtering、tool-use data 的细节;Stable LatentMoE 虽不等同于隐空间推理,但涉及 expert 激活稳定性与表示分解,可为 latent routing / latent planning 提供类比。


  • 链接:https://arxiv.org/abs/2607.24280
  • Repo:https://github.com/AaronLiu0702/MAPD (2026-07-28 更新,GitHub API 显示 37 stars)
  • 来源/日期:arXiv,Submitted 2026-07-27;HF Daily 2026-07-28 收录。
  • 类别:LLM Agent / Agentic Search / Post-training RL / Distillation / Tool-use
  • 一句话核心贡献:提出 Multi-Agent Protocol Distillation(MAPD),用结构化、风格归一的 protocol 作为专有教师与开源学生之间的中间监督,并结合 RL 改善 agentic search 的稀疏反馈问题。

为什么值得关注:Agentic search 很容易陷入“只模仿强模型自然语言轨迹”的陷阱:学生学到的是措辞和格式,而不是检索-推理-验证协议。MAPD 的关键是把 teacher trajectory 规约到一个更稳定的协议层,试图转移“决策结构”而不是“表面文本”。

与 wenjun 研究方向的关系:这与长轨迹 Agent RL 的 credit assignment 强相关。可把 protocol 看成一种可观测中间状态/latent schema:它可能降低轨迹模仿的方差,也可能为 model-based Agent RL 提供“状态抽象”;对代码 Agent 可迁移为 issue diagnosis -> file localization -> patch plan -> execution -> verification 的规范协议蒸馏。


#4. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

  • 链接:https://arxiv.org/abs/2607.23263
  • 来源/日期:arXiv,Submitted 2026-07-25;近 48 小时 arXiv/HF 相关流中出现。
  • 类别:Computer-use Agent / Post-training RL / Evaluation / Reward Modeling
  • 一句话核心贡献:提出由 Condense、Ground、Seek、Analyze 四类角色组成的 SeekJudge,用 Seek-Analyze loop 判断 GUI 轨迹是否真正完成指令,并蒸馏到一个 9B 专用 judge backbone。

为什么值得关注:computer-use agent 的瓶颈越来越像 RL 环境工程问题:如果 judge 不可靠,RL 就会优化错误目标;如果 rule-based eval 随 app 变化过期,长期训练不可持续。SeekJudge 把“轨迹验收”本身 agent 化,并用多角色流程做证据定位。

与 wenjun 研究方向的关系:对长程 Agent RL,reward 的关键不是只输出分数,而是能定位“哪里失败”。SeekJudge 的 Condense/Ground/Seek/Analyze 分工可借鉴到 coding agent:把测试日志、diff、文件状态、用户需求压缩成可判定 evidence,再给 step-level 或 subgoal-level feedback。


#5. CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents

  • 链接:https://arxiv.org/abs/2607.22711
  • 来源/日期:arXiv,Submitted 2026-07-20;近期 cs.AI/cs.LG/cs.SE 新列表中相关度高。
  • 类别:Code Agent / Context Compression / Tool-use / Systems
  • 一句话核心贡献:针对 coding agent append-only trajectory 导致文件快照陈旧和重复读文件的问题,提出把 file-read action 与 observation 解耦,用同步文件 registry 在每轮注入当前内容。

为什么值得关注:这是一个很实用的“上下文压缩/同步”问题:Agent 轨迹不是越完整越好,旧 observation 可能是误导性状态。CORVUS 的思想接近把 context 从事件日志改造成“事件日志 + 当前世界状态缓存”。

与 wenjun 研究方向的关系:这对 model-based Agent RL 也有启发:如果环境状态变化,纯历史序列会混淆状态;需要一个显式 belief/state registry。对代码 Agent,可把文件、测试结果、依赖图、issue 约束都放进同步状态层,再让语言轨迹只记录决策。


#6. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

  • 链接:https://arxiv.org/abs/2607.22688
  • 来源/日期:arXiv,Submitted 2026-07-17;近期 HF/arXiv 相关列表中出现。
  • 类别:LLM Agent / Post-training / Self-evolving Agent / Evaluation Harness
  • 一句话核心贡献:提出同时优化 agent harness(prompt、tools、skills、middleware、memory)与模型参数的 Co-Harness,而不是在固定 scaffold 下训练模型。

为什么值得关注:这篇把一个长期被忽视的问题说清楚:Agent 的数据分布不是模型单独产生的,而是“模型 × harness × 工具 × 记忆 × 评测器”的闭环产物。固定 harness 下训练,很可能只是在适应某个 scaffold 的局部最优。

与 wenjun 研究方向的关系:如果研究 self-evolving code agent,这篇是很好的概念支架。真正的自演化可能不是只 RL model weights,而是让 harness critic 发现失败模式并修改工具接口、上下文管理、验证门、memory schema。


#7. StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

  • 链接:https://arxiv.org/abs/2607.22798
  • 来源/日期:arXiv cs.SE,Submitted 2026-07-24。
  • 类别:Computer-use Agent / Tool-use / Long-horizon Agent / Code-first Agent
  • 一句话核心贡献:提出 code-first multi-agent harness:主 agent 直接操作程序状态,只有少量子目标交给 GUI subagent;并用独立 finish gate 检查保存结果等结构性失败。

判断:这与 CORVUS 一起形成一个趋势:Agent 不应只看 pixel/history,而要优先获取“真实程序状态”。对网页/IDE/OS agent 来说,DOM、文件系统、数据库、配置状态往往比截图更接近 MDP state。


#8. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

  • 链接:https://arxiv.org/abs/2607.23722
  • 来源/日期:arXiv,Submitted 2026-07-26。
  • 类别:Tool-use / Evaluation / LLM Agent
  • 一句话核心贡献:构造 323 个跨产品域、带状态变化的多步工具使用任务,通过 environment synthesis 与 task synthesis 解耦,制造信息缺口和工具缺口。

判断:值得跟进的点不是具体产品域,而是 benchmark 生成范式:先合成可复用环境,再生成需要探索隐藏信息、组合工具调用的任务。这对构造 code agent / research agent RL 环境有参考价值。


#9. AlloBench: Measuring Online Tool Allocation Capability in LLM Agents

  • 链接:https://arxiv.org/abs/2607.23332
  • 来源/日期:arXiv cs.LG,Submitted 2026-07-25。
  • 类别:LLM Agent / Tool-use / Evaluation / Planning
  • 一句话核心贡献:测试 Agent 是否会在固定预算下理性创建可复用工具;发现 frontier models 在抽象文本问题上近似最优,但迁移到脚本构造任务时失败。

判断:这点很像代码 Agent 的“投资型行动”问题:写一个 helper/test harness/diagnostic script 现在费 token,但未来复用收益大。AlloBench 可作为长程 credit assignment 的小型评测灵感。


#10. Codifying the Judge: Scalable Evaluation via Program Distillation

  • 链接:https://arxiv.org/abs/2607.22561
  • 来源/日期:arXiv 初投 2026-05-29;HF Daily 2026-07-28 收录。
  • 类别:Evaluation / Reward Modeling / Systems
  • 一句话核心贡献:将 LLM-as-a-judge 的决策逻辑蒸馏成程序委员会 PAJAMA,降低成本、延迟与不透明性,并在低置信样本回退到 LLM。

判断:对 RLVR/RLAIF 管线很实用。若 judge 能被蒸馏为可检查程序,就可以更稳定地大规模跑 agent trajectory filtering;但要注意程序 judge 可能继承 teacher bias,需要配合 adversarial validation。


#11. Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models

  • 链接:https://arxiv.org/abs/2607.22098
  • 来源/日期:arXiv Submitted 2026-07-24;HF Daily 2026-07-28 收录。
  • 类别:Reasoning Model / Evaluation / Latent Reasoning
  • 一句话核心贡献:指出长 reasoning trace 中无关和重复步骤会干扰 hallucination detection,提出 REDE,用 final-answer attention 作为自动监督来学习 step-level 表示并去噪。

判断:对 latent reasoning 的启发是:不是所有显式 CoT token 都是有效计算;训练和评测需要区分“真正影响答案的步骤”和“叙事噪声”。这也可迁移到 Agent 轨迹:并非每个 tool call / thought 都有 credit。


#12. DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

  • 链接:https://arxiv.org/abs/2607.24516
  • 来源/日期:arXiv Submitted 2026-07-27;HF Daily 2026-07-28 收录。
  • 类别:Pretraining Data / Data Mixture / Foundation Model
  • 一句话核心贡献:把 VLM 预训练数据配比拆成 inter-class ratio search 与 intra-class convex allocation,尝试将数据 recipe 从启发式堆叠变成可复现优化问题。

判断:虽然是 VLM,但对 LLM/Agent pretraining data 同样有意义:agent 预训练数据也需要决定任务类型比例、轨迹质量、难度、多样性与环境真实性之间的权衡。


#13. Data Pyramid for Embodied Manipulation

  • 链接:https://arxiv.org/abs/2607.24744
  • 来源/日期:arXiv Submitted 2026-07-27;HF Daily 2026-07-28 收录。
  • 类别:Embodied Agent / Pretraining Data / Foundation Model
  • 一句话核心贡献:把 embodied manipulation 数据生态组织为 real-robot、UMI-style、egocentric/exocentric、simulation、general V-L data 五层金字塔,并分析 scalability 与 robot alignment 的张力。

判断:对 LLM Agent 的类比很自然:真实用户任务轨迹、IDE/浏览器记录、合成环境轨迹、网页文本/代码语料也可构成 Agent data pyramid。关键问题是越真实越贵,越可扩展越可能偏离真实 agent alignment。


#14. TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs

  • 链接:https://arxiv.org/abs/2607.22639
  • 来源/日期:arXiv 初投 2026-06-22;HF Daily 2026-07-28 收录。
  • 类别:Tool-use / Enterprise LLM / Post-training / Reasoning Curriculum
  • 一句话核心贡献:针对 parametric tool retrieval 中工具知识遗忘与 beam search 慢的问题,用业务规则 grounded 的 reasoning trace curriculum 训练模型生成工具 token 列表。

判断:企业 tool retrieval 和代码库 API 选择非常相似。值得看它如何构造 business rules 与 reasoning traces,能否迁移到“代码 Agent 在 repo 内选择函数/API/脚本”的训练。


#15. AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

  • 链接:https://arxiv.org/abs/2607.22898
  • 来源/日期:arXiv Submitted 2026-07-24。
  • 类别:Code Intelligence / Code Agent / Evaluation / Intent Understanding
  • 一句话核心贡献:把 LLM 代码生成中的隐含假设显式化为可检查、可确认、可修订的 assumption layer,并通过 AST dependency graph 定向重生成受影响代码。

判断:这很贴合“从指令理解走向意图理解”。真实软件任务的 spec 永远不完整,Agent 的关键能力不是一次生成代码,而是暴露假设、追踪假设影响、请求/模拟验证。


#今日最值得精读的 3 篇

  1. The Physics of Multi-Turn Long-Horizon Planning — 最贴近 LLM Agent world model / model-based RL / planning 能力形成机制。

https://arxiv.org/abs/2607.24720

  1. From Proprietary to Open-Source: Multi-Agent Protocol Distillation in Agentic Search — 对长轨迹 Agent RL 的过程监督、协议蒸馏、teacher-student distribution gap 很关键。

https://arxiv.org/abs/2607.24280

  1. Kimi K3: Open Frontier Intelligence — frontier model report,值得重点看长上下文架构、Stable LatentMoE、agentic/coding RL 和数据/系统 recipe。

https://arxiv.org/abs/2607.24653

备选补读:SeekJudge(reward/judge)、CORVUS(coding agent context state)、Co-Harness(harness 与权重共同演化)。

#今日最值得跟进的 3 个 repo/model/dataset

  1. AgentR1/Agent-R1 — 端到端 RL 训练 LLM Agents,GitHub API 显示 2026-07-29 更新,约 1.6k stars。

https://github.com/AgentR1/Agent-R1

  1. AaronLiu0702/MAPD — agentic search 的 Multi-Agent Protocol Distillation 官方/相关 repo,2026-07-28 更新。

https://github.com/AaronLiu0702/MAPD

  1. PipeNetwork/kimi-k3-mlxSemiAnalysisAI/InferenceX — Kimi K3 生态跟进:前者是 MLX port 与 expert pruning/overlap 分析;后者是包含 Kimi K3 的持续推理基准平台。

https://github.com/PipeNetwork/kimi-k3-mlx

https://github.com/SemiAnalysisAI/InferenceX

可额外观察:ChessGRPO-The-Weight-of-Silence(latent reasoning curriculum + GRPO 的小型因果实验 repo)https://github.com/ishan-kshirsagar0-7/ChessGRPO-The-Weight-of-Silence

#研究机会 / Idea

#Idea 1:把 Agent trajectory 拆成“事件日志 + 同步世界状态 + 可蒸馏协议”

CORVUS、StateAct、MAPD 指向同一个方向:append-only natural language trace 不是最好的状态表示。可以设计一个 coding agent 训练框架:

  • 事件日志记录决策历史;
  • 同步世界状态维护 repo 文件、测试结果、依赖图、issue 约束;
  • protocol layer 记录 file localization、hypothesis、patch plan、verification 等结构化状态;
  • RL/IL 在 protocol 层做 credit assignment,而不是直接模仿 verbose CoT。

这会自然连接到 model-based RL:protocol/world-state 就是可学习/可预测的 latent state。

#Idea 2:从“最终 reward”转向“可验证 judge 的分层蒸馏”

SeekJudge 与 PAJAMA 都在解决 evaluator 成本和可靠性问题。可以研究 code agent 的 judge pyramid:

  1. deterministic tests / static analysis;
  2. programmatic judge(从 LLM judge 蒸馏);
  3. multi-agent evidence-seeking judge;
  4. human/strong model fallback。

关键问题:如何让 judge 不仅给 scalar reward,还给 subgoal-level blame,支持长轨迹 RL 的低方差更新。

#Idea 3:Agent 预训练数据金字塔与 mixture optimization

借鉴 DecoupleMix 和 Data Pyramid:为 LLM Agent 构造数据金字塔:

  • 真实开发者/浏览器/IDE 轨迹(高 fidelity,低规模);
  • 人类标注 task + agent/human mixed trajectories;
  • 合成 repo / synthetic web environments;
  • 单步工具调用/代码语料/网页文本(高规模,低 agent alignment)。

可研究的问题:少量高质量长程轨迹在预训练中是否比大量短程工具调用更能形成 planning?suboptimal trajectories 是否像 2607.24720 摘要所说会因错误放大严重伤害泛化?


#检索备注

  • Hugging Face Daily Papers API 可访问,使用 2026-07-28 收录列表筛选。
  • arXiv list 页面可访问;arXiv export API 在本次检索中多次 429/timeout,因此对重点条目改用 arXiv abs 页面逐条核验标题、日期和摘要。
  • GitHub API 可访问,用于核验 repo 更新时间、stars 与描述。
  • X/Twitter 未直接检索,避免引用不可核验的社媒传闻。