#2026-07-29 AI/LLM 最新论文与研究热点简报
检索时间:2026-07-29 08:00(Asia/Shanghai)。主要覆盖 2026-07-27 至 2026-07-28 arXiv 新提交/更新、Hugging Face Daily Papers、GitHub 最新仓库动态;部分相关论文因 HF Daily 在 7 月 28 日收录但 arXiv 初投日期更早,也纳入“值得补读”。X/Twitter 未作为直接来源使用:当前环境没有稳定、可认证的 X 访问入口,因此用 Hugging Face、arXiv、GitHub、OpenAlex/API 作为替代来源。
#一句话总览
过去 24-48 小时最贴近 wenjun 方向的信号是:Agent 能力研究正在从“更强模型 + 更多工具”转向“可控环境、轨迹协议、奖励/评测器、harness 与数据配方共同优化”。尤其值得注意的是:
- 长程 Agent planning 开始被放进可控环境中,系统研究 pretraining 数据格式、world-model CoT、on-policy distillation 如何形成规划能力。
- Agentic search / computer-use / coding agent 的 RL 不再只看最终成功率,而开始关心“过程监督如何密化”“judge/reward 如何可靠”“harness 是否是隐藏变量”。
- 基础模型训练机制方面,Kimi K3 把百万上下文、MoE、latent MoE、RL for agentic/coding 放到一个 frontier open report 中;VLM/embodied data recipe 也出现更系统的 mixture optimization 与 data pyramid 视角。
#重点论文与动态(按相关性筛选)
#1. The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
- 链接:https://arxiv.org/abs/2607.24720
- 来源/日期:arXiv cs.CL/cs.AI/cs.LG,Submitted 2026-07-27;Hugging Face Daily Papers 2026-07-28 收录。
- 类别:LLM Agent / Post-training RL / Pretraining Data / Model-based RL
- 一句话核心贡献:构建一个可控多轮长程规划环境,系统研究规划能力如何在预训练、SFT、单/多教师 on-policy agentic distillation 中获得与泛化;摘要中特别提到显式 world model construction via CoT state transition modeling 能增强长程泛化。
为什么值得关注:这篇几乎正中 wenjun 的“LLM model-based RL / Dreamer for LLM Agent”兴趣。它没有直接说 Dreamer,但问题意识非常接近:把多步任务拆成可控状态转移环境,研究模型是否通过显式状态转移/世界模型式 CoT 学到可组合规划,而不是只记忆短程技能。
与 wenjun 研究方向的关系:可以把它当成“LLM Agent world model 训练机制”的新素材:预训练阶段的数据格式、分布、质量如何塑造 planning;后训练阶段 on-policy distillation 如何缓解离线轨迹分布偏移;Agent RL 阶段是否需要先学习可预测的状态转移 latent/textual world model,再做策略优化。
#2. Kimi K3: Open Frontier Intelligence
- 链接:https://arxiv.org/abs/2607.24653;HF 页面:https://huggingface.co/papers/2607.24653
- 来源/日期:arXiv,Submitted 2026-07-27;Hugging Face Daily Papers 2026-07-28 高热度收录。
- 类别:Foundation Model / Systems / Long Context / Post-training RL / Code Intelligence
- 一句话核心贡献:发布 2.8T 参数、104B activated、原生视觉、1M context 的 MoE frontier model report,提出 Kimi Delta Attention、Attention Residuals、Stable LatentMoE,并强调在 general、agentic、coding 域做多 reasoning-effort level 的 RL。
为什么值得关注:这类 frontier report 对“能力形成机制”很有参考价值。摘要里出现的几个关键词非常贴近当前趋势:长上下文结构、MoE 稳定路由、算法-系统协同、RL 覆盖 agentic/coding、多 reasoning effort level。它说明大模型竞争点已经从单纯扩参数,转向 长上下文信息流 + 稳定专家激活 + 后训练任务域结构化。
与 wenjun 研究方向的关系:KDA/Attention Residuals 可作为“长上下文能力如何从架构进入训练动态”的案例;report 明确把 agentic/coding 作为 RL 域,值得查全文中是否有环境、reward、trajectory filtering、tool-use data 的细节;Stable LatentMoE 虽不等同于隐空间推理,但涉及 expert 激活稳定性与表示分解,可为 latent routing / latent planning 提供类比。
#3. From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- 链接:https://arxiv.org/abs/2607.24280
- Repo:https://github.com/AaronLiu0702/MAPD (2026-07-28 更新,GitHub API 显示 37 stars)
- 来源/日期:arXiv,Submitted 2026-07-27;HF Daily 2026-07-28 收录。
- 类别:LLM Agent / Agentic Search / Post-training RL / Distillation / Tool-use
- 一句话核心贡献:提出 Multi-Agent Protocol Distillation(MAPD),用结构化、风格归一的 protocol 作为专有教师与开源学生之间的中间监督,并结合 RL 改善 agentic search 的稀疏反馈问题。
为什么值得关注:Agentic search 很容易陷入“只模仿强模型自然语言轨迹”的陷阱:学生学到的是措辞和格式,而不是检索-推理-验证协议。MAPD 的关键是把 teacher trajectory 规约到一个更稳定的协议层,试图转移“决策结构”而不是“表面文本”。
与 wenjun 研究方向的关系:这与长轨迹 Agent RL 的 credit assignment 强相关。可把 protocol 看成一种可观测中间状态/latent schema:它可能降低轨迹模仿的方差,也可能为 model-based Agent RL 提供“状态抽象”;对代码 Agent 可迁移为 issue diagnosis -> file localization -> patch plan -> execution -> verification 的规范协议蒸馏。
#4. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
- 链接:https://arxiv.org/abs/2607.23263
- 来源/日期:arXiv,Submitted 2026-07-25;近 48 小时 arXiv/HF 相关流中出现。
- 类别:Computer-use Agent / Post-training RL / Evaluation / Reward Modeling
- 一句话核心贡献:提出由 Condense、Ground、Seek、Analyze 四类角色组成的 SeekJudge,用 Seek-Analyze loop 判断 GUI 轨迹是否真正完成指令,并蒸馏到一个 9B 专用 judge backbone。
为什么值得关注:computer-use agent 的瓶颈越来越像 RL 环境工程问题:如果 judge 不可靠,RL 就会优化错误目标;如果 rule-based eval 随 app 变化过期,长期训练不可持续。SeekJudge 把“轨迹验收”本身 agent 化,并用多角色流程做证据定位。
与 wenjun 研究方向的关系:对长程 Agent RL,reward 的关键不是只输出分数,而是能定位“哪里失败”。SeekJudge 的 Condense/Ground/Seek/Analyze 分工可借鉴到 coding agent:把测试日志、diff、文件状态、用户需求压缩成可判定 evidence,再给 step-level 或 subgoal-level feedback。
#5. CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents
- 链接:https://arxiv.org/abs/2607.22711
- 来源/日期:arXiv,Submitted 2026-07-20;近期 cs.AI/cs.LG/cs.SE 新列表中相关度高。
- 类别:Code Agent / Context Compression / Tool-use / Systems
- 一句话核心贡献:针对 coding agent append-only trajectory 导致文件快照陈旧和重复读文件的问题,提出把 file-read action 与 observation 解耦,用同步文件 registry 在每轮注入当前内容。
为什么值得关注:这是一个很实用的“上下文压缩/同步”问题:Agent 轨迹不是越完整越好,旧 observation 可能是误导性状态。CORVUS 的思想接近把 context 从事件日志改造成“事件日志 + 当前世界状态缓存”。
与 wenjun 研究方向的关系:这对 model-based Agent RL 也有启发:如果环境状态变化,纯历史序列会混淆状态;需要一个显式 belief/state registry。对代码 Agent,可把文件、测试结果、依赖图、issue 约束都放进同步状态层,再让语言轨迹只记录决策。
#6. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents
- 链接:https://arxiv.org/abs/2607.22688
- 来源/日期:arXiv,Submitted 2026-07-17;近期 HF/arXiv 相关列表中出现。
- 类别:LLM Agent / Post-training / Self-evolving Agent / Evaluation Harness
- 一句话核心贡献:提出同时优化 agent harness(prompt、tools、skills、middleware、memory)与模型参数的 Co-Harness,而不是在固定 scaffold 下训练模型。
为什么值得关注:这篇把一个长期被忽视的问题说清楚:Agent 的数据分布不是模型单独产生的,而是“模型 × harness × 工具 × 记忆 × 评测器”的闭环产物。固定 harness 下训练,很可能只是在适应某个 scaffold 的局部最优。
与 wenjun 研究方向的关系:如果研究 self-evolving code agent,这篇是很好的概念支架。真正的自演化可能不是只 RL model weights,而是让 harness critic 发现失败模式并修改工具接口、上下文管理、验证门、memory schema。
#7. StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
- 链接:https://arxiv.org/abs/2607.22798
- 来源/日期:arXiv cs.SE,Submitted 2026-07-24。
- 类别:Computer-use Agent / Tool-use / Long-horizon Agent / Code-first Agent
- 一句话核心贡献:提出 code-first multi-agent harness:主 agent 直接操作程序状态,只有少量子目标交给 GUI subagent;并用独立 finish gate 检查保存结果等结构性失败。
判断:这与 CORVUS 一起形成一个趋势:Agent 不应只看 pixel/history,而要优先获取“真实程序状态”。对网页/IDE/OS agent 来说,DOM、文件系统、数据库、配置状态往往比截图更接近 MDP state。
#8. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios
- 链接:https://arxiv.org/abs/2607.23722
- 来源/日期:arXiv,Submitted 2026-07-26。
- 类别:Tool-use / Evaluation / LLM Agent
- 一句话核心贡献:构造 323 个跨产品域、带状态变化的多步工具使用任务,通过 environment synthesis 与 task synthesis 解耦,制造信息缺口和工具缺口。
判断:值得跟进的点不是具体产品域,而是 benchmark 生成范式:先合成可复用环境,再生成需要探索隐藏信息、组合工具调用的任务。这对构造 code agent / research agent RL 环境有参考价值。
#9. AlloBench: Measuring Online Tool Allocation Capability in LLM Agents
- 链接:https://arxiv.org/abs/2607.23332
- 来源/日期:arXiv cs.LG,Submitted 2026-07-25。
- 类别:LLM Agent / Tool-use / Evaluation / Planning
- 一句话核心贡献:测试 Agent 是否会在固定预算下理性创建可复用工具;发现 frontier models 在抽象文本问题上近似最优,但迁移到脚本构造任务时失败。
判断:这点很像代码 Agent 的“投资型行动”问题:写一个 helper/test harness/diagnostic script 现在费 token,但未来复用收益大。AlloBench 可作为长程 credit assignment 的小型评测灵感。
#10. Codifying the Judge: Scalable Evaluation via Program Distillation
- 链接:https://arxiv.org/abs/2607.22561
- 来源/日期:arXiv 初投 2026-05-29;HF Daily 2026-07-28 收录。
- 类别:Evaluation / Reward Modeling / Systems
- 一句话核心贡献:将 LLM-as-a-judge 的决策逻辑蒸馏成程序委员会 PAJAMA,降低成本、延迟与不透明性,并在低置信样本回退到 LLM。
判断:对 RLVR/RLAIF 管线很实用。若 judge 能被蒸馏为可检查程序,就可以更稳定地大规模跑 agent trajectory filtering;但要注意程序 judge 可能继承 teacher bias,需要配合 adversarial validation。
#11. Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
- 链接:https://arxiv.org/abs/2607.22098
- 来源/日期:arXiv Submitted 2026-07-24;HF Daily 2026-07-28 收录。
- 类别:Reasoning Model / Evaluation / Latent Reasoning
- 一句话核心贡献:指出长 reasoning trace 中无关和重复步骤会干扰 hallucination detection,提出 REDE,用 final-answer attention 作为自动监督来学习 step-level 表示并去噪。
判断:对 latent reasoning 的启发是:不是所有显式 CoT token 都是有效计算;训练和评测需要区分“真正影响答案的步骤”和“叙事噪声”。这也可迁移到 Agent 轨迹:并非每个 tool call / thought 都有 credit。
#12. DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes
- 链接:https://arxiv.org/abs/2607.24516
- 来源/日期:arXiv Submitted 2026-07-27;HF Daily 2026-07-28 收录。
- 类别:Pretraining Data / Data Mixture / Foundation Model
- 一句话核心贡献:把 VLM 预训练数据配比拆成 inter-class ratio search 与 intra-class convex allocation,尝试将数据 recipe 从启发式堆叠变成可复现优化问题。
判断:虽然是 VLM,但对 LLM/Agent pretraining data 同样有意义:agent 预训练数据也需要决定任务类型比例、轨迹质量、难度、多样性与环境真实性之间的权衡。
#13. Data Pyramid for Embodied Manipulation
- 链接:https://arxiv.org/abs/2607.24744
- 来源/日期:arXiv Submitted 2026-07-27;HF Daily 2026-07-28 收录。
- 类别:Embodied Agent / Pretraining Data / Foundation Model
- 一句话核心贡献:把 embodied manipulation 数据生态组织为 real-robot、UMI-style、egocentric/exocentric、simulation、general V-L data 五层金字塔,并分析 scalability 与 robot alignment 的张力。
判断:对 LLM Agent 的类比很自然:真实用户任务轨迹、IDE/浏览器记录、合成环境轨迹、网页文本/代码语料也可构成 Agent data pyramid。关键问题是越真实越贵,越可扩展越可能偏离真实 agent alignment。
#14. TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
- 链接:https://arxiv.org/abs/2607.22639
- 来源/日期:arXiv 初投 2026-06-22;HF Daily 2026-07-28 收录。
- 类别:Tool-use / Enterprise LLM / Post-training / Reasoning Curriculum
- 一句话核心贡献:针对 parametric tool retrieval 中工具知识遗忘与 beam search 慢的问题,用业务规则 grounded 的 reasoning trace curriculum 训练模型生成工具 token 列表。
判断:企业 tool retrieval 和代码库 API 选择非常相似。值得看它如何构造 business rules 与 reasoning traces,能否迁移到“代码 Agent 在 repo 内选择函数/API/脚本”的训练。
#15. AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation
- 链接:https://arxiv.org/abs/2607.22898
- 来源/日期:arXiv Submitted 2026-07-24。
- 类别:Code Intelligence / Code Agent / Evaluation / Intent Understanding
- 一句话核心贡献:把 LLM 代码生成中的隐含假设显式化为可检查、可确认、可修订的 assumption layer,并通过 AST dependency graph 定向重生成受影响代码。
判断:这很贴合“从指令理解走向意图理解”。真实软件任务的 spec 永远不完整,Agent 的关键能力不是一次生成代码,而是暴露假设、追踪假设影响、请求/模拟验证。
#今日最值得精读的 3 篇
- The Physics of Multi-Turn Long-Horizon Planning — 最贴近 LLM Agent world model / model-based RL / planning 能力形成机制。
https://arxiv.org/abs/2607.24720
- From Proprietary to Open-Source: Multi-Agent Protocol Distillation in Agentic Search — 对长轨迹 Agent RL 的过程监督、协议蒸馏、teacher-student distribution gap 很关键。
https://arxiv.org/abs/2607.24280
- Kimi K3: Open Frontier Intelligence — frontier model report,值得重点看长上下文架构、Stable LatentMoE、agentic/coding RL 和数据/系统 recipe。
https://arxiv.org/abs/2607.24653
备选补读:SeekJudge(reward/judge)、CORVUS(coding agent context state)、Co-Harness(harness 与权重共同演化)。
#今日最值得跟进的 3 个 repo/model/dataset
- AgentR1/Agent-R1 — 端到端 RL 训练 LLM Agents,GitHub API 显示 2026-07-29 更新,约 1.6k stars。
https://github.com/AgentR1/Agent-R1
- AaronLiu0702/MAPD — agentic search 的 Multi-Agent Protocol Distillation 官方/相关 repo,2026-07-28 更新。
https://github.com/AaronLiu0702/MAPD
- PipeNetwork/kimi-k3-mlx 或 SemiAnalysisAI/InferenceX — Kimi K3 生态跟进:前者是 MLX port 与 expert pruning/overlap 分析;后者是包含 Kimi K3 的持续推理基准平台。
https://github.com/PipeNetwork/kimi-k3-mlx
https://github.com/SemiAnalysisAI/InferenceX
可额外观察:ChessGRPO-The-Weight-of-Silence(latent reasoning curriculum + GRPO 的小型因果实验 repo)https://github.com/ishan-kshirsagar0-7/ChessGRPO-The-Weight-of-Silence
#研究机会 / Idea
#Idea 1:把 Agent trajectory 拆成“事件日志 + 同步世界状态 + 可蒸馏协议”
CORVUS、StateAct、MAPD 指向同一个方向:append-only natural language trace 不是最好的状态表示。可以设计一个 coding agent 训练框架:
- 事件日志记录决策历史;
- 同步世界状态维护 repo 文件、测试结果、依赖图、issue 约束;
- protocol layer 记录 file localization、hypothesis、patch plan、verification 等结构化状态;
- RL/IL 在 protocol 层做 credit assignment,而不是直接模仿 verbose CoT。
这会自然连接到 model-based RL:protocol/world-state 就是可学习/可预测的 latent state。
#Idea 2:从“最终 reward”转向“可验证 judge 的分层蒸馏”
SeekJudge 与 PAJAMA 都在解决 evaluator 成本和可靠性问题。可以研究 code agent 的 judge pyramid:
- deterministic tests / static analysis;
- programmatic judge(从 LLM judge 蒸馏);
- multi-agent evidence-seeking judge;
- human/strong model fallback。
关键问题:如何让 judge 不仅给 scalar reward,还给 subgoal-level blame,支持长轨迹 RL 的低方差更新。
#Idea 3:Agent 预训练数据金字塔与 mixture optimization
借鉴 DecoupleMix 和 Data Pyramid:为 LLM Agent 构造数据金字塔:
- 真实开发者/浏览器/IDE 轨迹(高 fidelity,低规模);
- 人类标注 task + agent/human mixed trajectories;
- 合成 repo / synthetic web environments;
- 单步工具调用/代码语料/网页文本(高规模,低 agent alignment)。
可研究的问题:少量高质量长程轨迹在预训练中是否比大量短程工具调用更能形成 planning?suboptimal trajectories 是否像 2607.24720 摘要所说会因错误放大严重伤害泛化?
#检索备注
- Hugging Face Daily Papers API 可访问,使用 2026-07-28 收录列表筛选。
- arXiv list 页面可访问;arXiv export API 在本次检索中多次 429/timeout,因此对重点条目改用 arXiv abs 页面逐条核验标题、日期和摘要。
- GitHub API 可访问,用于核验 repo 更新时间、stars 与描述。
- X/Twitter 未直接检索,避免引用不可核验的社媒传闻。