#2026-10-09 AI/LLM 最新论文与研究热点简报
时间范围:本简报核心是 arXiv 2026-10-07(周四)公布批次(对应 10-06 至 10-07 晚间提交、2610.09xxx–2610.10xxx 编号的新论文;cs.CL / cs.AI / cs.LG / cs.SE 四类共 238 篇落入公布日窗口,标题与摘要经 arXiv API 真实抓取后按研究偏好逐条筛选),加上 Hugging Face Daily Papers 10-07 与 10-08 两份榜单(各 50 篇,部分与昨日简报重叠、已去重)。整体时间窗为 2026-10-06 至 2026-10-09 晨。说明:10-09(周五)批次在美国东部时间今晚 20:00 后才公布,本简报发布时(北京时间 08:00)尚未生成,属正常时差;明日简报将覆盖该批次。
信息来源与限制:arXiv 官方 API(按 submittedDate 倒序抓取四类共 462 条原始记录、去重后 238 篇为 10-07 公布);Hugging Face Daily Papers API(10-07 / 10-08 两个榜单);GitHub Search API(本周新建仓库,按 star 排序)。X/Twitter 匿名访问不可用,社交平台动向以 GitHub / HF / arXiv 替代。arXiv API 本轮多次触发 Rate exceeded(限流),通过加大请求间隔重试完成抓取,cs.SE 类别耗时较长。所有论文均真实存在、编号均经 API 返回核验,未编造任何条目。
#一、总览:10-07 批次的五条主线
今天是本周信息密度最高的一天(周四公布批次 + 两份 HF 榜单),按 wenjun 的研究偏好筛出五条主线:
- credit assignment / process reward 继续深化。
Retrieval Credit(2610.10179)系统研究搜索 agent 的中间检索步信用分配;BoT-GRPO(2610.09804)用 bag-of-tokens 聚合把 token 级 process reward 引入 GRPO 而不需要 value 网络;Caddie(2610.09858)训练自然语言 critic、只从任务最终成败获得奖励。三篇分别代表"步级信用、token 级信用、语言级反馈"三个粒度的进展,合起来正对着 wenjun 关注的 GRPO → GIGPO → HGPO 谱系继续向前。 - RLVR 的探索与归因反思。
ExpDis(2610.10536)指出强 novelty 激励在 RLVR 里容易掉点,提出"探索与优化解耦"的 explorer-distillation 框架;BehaviorTrace(2610.10422)用 planted behavior 审计在线 RL 的训练数据归因方法,发现大量"归因信号"其实只是梯度幅度的混淆。RLVR 的方法论审查正在成为独立研究方向。 - 上下文压缩 / latent reasoning 出现系统性边界研究。
SemanticFold(2610.10304)用固定目标协议证明:对 prompt 前缀做隐空间压缩后,语言建模、可解码性、推理能力不共享同一个压缩阈值,且影响非单调;LatentGRM(2610.09788)把 latent reasoning 用于生成式 reward model,在语义保持压缩的连续轨迹上直接做 pairwise 判断。YANchor-4B(2610.10118)和EncBank(2610.10058)则分别在 O(1) 记忆长程推理和可复用前缀状态缓存上给出新工程答案。 - 持续学习出现两篇机制性工作。
A Deafening Silence(2610.09835)把灾难性遗忘定位到新语料中从未出现的 token 的输出嵌入,机制是 Adam 二阶矩归一化把单侧 softmax 梯度放大成整幅更新;Continual Learning without Continual Training(2610.10379)干脆用冻结的 PFN + in-context 贝叶斯推断替代梯度更新。EngramEdit(2610.10533,HF 10-08 榜单)则在 DeepSeek Engram 条件记忆架构上做知识编辑。 - agentic coding 的"预测与编排"问题。
Before They Can Solve(2610.10478)提出用 post-trained agent 轨迹回放预测 base model 值不值得昂贵的 agentic post-training;When Sub-Agents Work in Parallel(2610.10263)在 354 个任务、2124 次 Codex/Claude Code/Kimi Code 执行上对照开/关动态并发,发现长程任务里编排比模型能力更决定成败;TestGRAD(2610.10242)把 SWE-agent ensemble 的测试选择形式化为带"失败模式动量"的测试空间优化。
对研究版图的意义:今天批次对 credit assignment / RLVR 方法论(主线 1+2)、上下文压缩与 latent reasoning 的有效性边界(主线 3)和 持续学习机制(主线 4)输入最直接;对 model-based RL 也有 Sparse Planning in Visual World Models(2610.10274)与 HF 榜单的 Long-WAM(2610.10528)两篇可迁移的工具性工作。
#二、重点论文详评(Top 8)
#1. Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents
- 链接:https://arxiv.org/abs/2610.10179
- 来源:arXiv cs.CL / cs.AI,10-07 公布批次
- 类别:Post-training RL / LLM Agent / Tool-use
- 核心贡献:针对搜索 agent(多跳检索)的 RLVR 训练,系统研究中间检索步的信用分配:比较一系列 reward shaping 与 credit assignment 策略(从检索步获得学习信号),再把中间信号与最终结果奖励组合成训练框架,多基准同条件对比下提升学习效率。
- 为什么值得关注:这是把"步级信用分配"问题从 SWE/数学推理扩展到检索/工具调用 agent 的系统消融研究。搜索 agent 的中间检索天然有可验证的对错信号(该步检索是否引入了最终需要的证据),是介于 outcome reward 与昂贵 process reward model 之间的天然监督源。
- 与研究方向的关系:直接位于 wenjun 的 agent RL 主线。可延伸问题:检索步的信用与 GIGPO 式分组基线如何叠加?多工具 agent(检索+代码执行)里不同工具步的信用可否统一度量?
#2. SemanticFold: Latent Sequence Compression Separates Language Modeling, Decodability, and Reasoning
- 链接:https://arxiv.org/abs/2610.10304
- 来源:arXiv cs.LG / cs.CL,10-07 公布批次
- 类别:Latent Reasoning / Context Compression / Pretraining
- 核心贡献:提出固定目标协议(frozen prefix 分别做原生执行与压缩,两臂 teacher-force 完全相同的续写 token,排除目标选择的解释),在 Qwen3-1.7B/8B、SmolLM2、Pythia-1.4B/6.9B 五个规模上研究:把 prompt 前缀的隐状态在学到的边界处"折叠"压缩后,固定目标 NLL、有限标签推理准确率、线性探针可及性、开放式生成、系统级延迟这五类终点如何变化。结论:压缩对这些终点的影响非单调,且它们不共享同一个压缩阈值。
- 为什么值得关注:这是上下文压缩/通用压缩器方向少见的受控机制研究——不提出刷分方法,而是回答"压缩到底损失了什么、在哪个尺度损失、损失的能力是否可分离"。对 latent reasoning 主线,它等价于在问:"隐空间推理所依赖的能力,能否在被压缩的隐状态里保留?"
- 与研究方向的关系:与 wenjun 的通用上下文压缩器与潜空间推理两个关注点同时相关。五类终点的分离意味着压缩器设计需要面向下游能力类型而非单一重构损失。可延伸:把该协议用于评估 latent rollout(world model 在压缩状态上展开)时推理能力的保有率。
#3. Caddie: Training Advisors for LLM Agents from Task Outcomes
- 链接:https://arxiv.org/abs/2610.09858
- 来源:arXiv cs.CL / cs.AI / cs.LG,10-07 公布批次
- 类别:LLM Agent / Post-training RL
- 核心贡献:训练一个 natural-language critic(advisor),在 agent 执行多步任务过程中提供自然语言分析与建议。关键设计:不依赖步级标签或参考 critique,只用"agent 收到反馈后最终是否成功"作为奖励,通过 RL 优化 critic、base model 冻结。Qwen3-4B critic 在 MuSiQue 上训练后,跨四个不同规模/架构的 base model(三个未在训练中见过)提升成功率。
- 为什么值得关注:这是"语言级 credit assignment"的代表工作——把中间监督从数值 advantage 换成可生成的自然语言反馈,且跨模型泛化。与数值型双层 credit assignment(昨日 VETTA)形成互补视角。
- 与研究方向的关系:对长轨迹 agent RL 有直接实用价值。可延伸问题:语言级反馈与 token 级 advantage 是否携带不同信息量?能否用信息论度量回答"什么时候 critic 该说话"?
#4. A Deafening Silence: Catastrophic Forgetting Lives in the Output Embeddings of Tokens the Data Never Speaks
- 链接:https://arxiv.org/abs/2610.09835
- 来源:arXiv cs.CL / cs.AI / cs.LG,10-07 公布批次
- 类别:Continual Learning / Post-training / Pretraining Data
- 核心贡献:在 data-free 持续训练设定下定位灾难性遗忘的位置与机制:跨五个设定(至 1.4B)的参数冻结实验显示,遗忘选择性地集中在"新语料中罕见 token 的输出嵌入"上,而模型主体的 sqrt(v-hat) 频段是惰性的。机制:缺席 token 收到持续的单侧 softmax 梯度,被 Adam 二阶矩归一化放大成整幅更新。语料的"词汇缺陷"决定遗忘分布,仅凭 token 计数即可做风险排序。
- 为什么值得关注:机制级发现 + 可操作的预测指标(token 计数)+ 直接对应 Adam 优化器行为的解释,是持续预训练方向少见的"解释-预测-缓解"闭环工作。
- 与研究方向的关系:正对 wenjun 的"LLM 持续学习与高效后训练"关注点。可延伸:agentic 后训练(工具调用格式天然集中在少数 token 上)的"词汇缺陷"是否比领域 CPT 更严重?该机制能否解释昨日批次中 RLVR 训练的漂移?
#5. BoT-GRPO: Efficient Process-Reward RL for Reasoning via Bag-of-Token Aggregation
- 链接:https://arxiv.org/abs/2610.09804
- 来源:arXiv cs.LG,10-07 公布批次
- 类别:Post-training RL
- 核心贡献:GRPO 里整条 rollout 的每个 token 共享同一个 outcome advantage。BoT-GRPO 把 GRPO 扩展到 token 级 reward model:把所有 rollout 的 token 级 reward 收进一个"bag of tokens",按源序列长度的倒数加权,再相对加权组统计计算逐 token advantage——长度不变、无需 value 网络。
- 为什么值得关注:过程监督与 GRPO 系算法的融合一直是"贵"(value net / PRM 标注)的代名词,这篇给出了一个轻量的聚合方案,延续"GRPO 变体家族"的清晰谱系。
- 与研究方向的关系:与 GIGPO/HGPO 的分组思想同源(相对统计而非绝对 value)。可延伸:bag-of-tokens 加权与 GIGPO 的 step 分组在长轨迹 agent 场景下的方差-偏差权衡对比。
#6. ExpDis: Decoupling Exploration from Optimization in RLVR
- 链接:https://arxiv.org/abs/2610.10536
- 来源:arXiv cs.LG / cs.AI / cs.CL,10-07 公布批次
- 类别:Post-training RL / LLM Agent
- 核心贡献:指出 RLVR 的一个实践矛盾:可验证奖励只监督模型知识与行为的窄切片,强 novelty 激励容易掉点且难以恢复。提出 Exploration-Distillation(ExpDis):训练带 novelty 激励的 explorer policy,再把探索到的新策略蒸馏回主模型。
- 为什么值得关注:直击 RLVR"发现新推理策略"的核心承诺与其失败模式,且解法(探索/优化解耦 + 蒸馏回灌)结构清晰,与 self-evolving agent 的"探索-固化"循环同构。
- 与研究方向的关系:对 wenjun 的 agentic RL 与 self-evolving code agent 主线都有迁移价值:code agent 的探索(大改动的补丁)与优化(收敛到可靠策略)同样可解耦。
#7. Before They Can Solve: Predicting Post-Training Coding-Agent Performance from Base Models
- 链接:https://arxiv.org/abs/2610.10478
- 来源:arXiv cs.AI / cs.SE,10-07 公布批次
- 类别:Code Agent / Pretraining / Evaluation
- 核心贡献:回答"哪个 base checkpoint 值得做一轮昂贵的 agentic post-training":pass@K 不适用(base model 常常连格式良好的工具调用都发不出来),单步任务又绕开了核心能力(多步工具调用中维持一致状态)。做法:把成功 post-trained agent 轨迹当作 base model 潜力的 lookahead 信号——回放轨迹并在每个改码步后重跑测试,定位决定性步骤,据此预测。
- 为什么值得关注:把"agent 预训练数据如何塑造能力"从数据配方视角翻转到潜力预测视角,对算力受限的实验室是高价值工具(先预测再训练)。
- 与研究方向的关系:直接对上 wenjun 的"agent 预训练数据 + 代码 agent + 基础模型能力形成机制"三个关注点。可延伸:决定性步骤密度是否是比 SFT 数据量更好的数据配方指标?
#8. Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression
- 链接:https://arxiv.org/abs/2610.09788
- 来源:arXiv cs.CL,10-07 公公布批次
- 类别:Latent Reasoning / Post-training RL / Evaluation
- 核心贡献:把 latent reasoning 用于生成式 reward model:LatentGRM 用 rubric 结构引导的语义分块-压缩-重构,学到紧凑连续轨迹,不生成文字评估直接在隐空间做 pairwise 判断;另训一个 interpreter 从轨迹重构评估文本,作为"压缩保留下多少信息"的离线视图。同训练数据同 backbone 下与显式 CoT 奖励模型精度相当,推理成本显著更低。
- 为什么值得关注:是 latent reasoning 的第一个大规模落地场景之一(reward modeling 是高频高成本环节),且"压缩轨迹 + 可解释重构"的双设计兼顾效率与可审计性。
- 与研究方向的关系:潜空间推理主线的应用侧证据。可延伸:把该框架搬到 latent rollout(world model 里的轨迹评估)会怎样?隐空间判断与显式 CoT 判断的系统性分歧在哪些准则上出现?
#三、其他值得一看的论文(快速清单)
| 论文 | 编号/链接 | 类别 | 一句话核心贡献 |
|---|---|---|---|
| When Sub-Agents Work in Parallel | 2610.10263 | Code Agent / Systems | 354 任务/2124 次执行对照实验:动态并发(agent 自行决定派生子 agent)在长程开发任务里利弊并存,编排质量决定成败 |
| TestGRAD | 2610.10242 | Code Agent / Evaluation | SWE-agent ensemble 的测试选择=测试空间优化:带差分损失与"失败模式动量"的进化式测试套件优化 |
| Coding-Agent Benchmarks Should Match Their Users' Task Flows | 2610.09633 | Code Agent / Evaluation | 4782 个 JetBrains IDE 真实会话:真实用户的"任务流"(任务类型混合+切换)与 issue 派生基准差异巨大,基准应声明目标用例并校准 |
| YANchor-4B | 2610.10118 | Latent Reasoning / Systems | 递归模型以 anchor 记忆实现 O(N) 时间 O(1) 记忆的长程推理,AIME24-26 pass@1 82.93%,吞吐数倍于 Transformer/hybrid |
| EncBank: Cache the Encoder Within | 2610.10058 | Context Compression / Systems | 把 LLM 低层当可复用文档编码器、4-bit 紧凑存中间态,共享 suffix adapter,持久 GPU 存储仅为原生 28.1%,prefill 提速 1.40x |
| Continual Learning without Continual Training | 2610.10379 | Continual Learning | 冻结 PFN + in-context 贝叶斯推断(Latent Concept PFN):加样本即更新隐概念后验,零梯度更新、天然无遗忘 |
| EngramEdit | 2610.10533 | Continual Learning / Memory | DeepSeek Engram 式条件记忆(n-gram 查找嵌入)上的知识编辑:解耦事实存储与主干计算,backbone 固定下更新事实 |
| On-Policy Distillation Teaches New Skills but Not New Knowledge | 2610.09639 | Post-training / Distillation | 受控合成实验:reverse-KL OPD 可靠迁移组合技能但几乎不迁移事实知识;换 forward KL 恢复事实迁移,学生 rollout 只改善多步执行 |
| Δ-MOPD: Multi-Teacher On-Policy Distillation | 2610.10460 | Post-training / Distillation | 多教师 OPD 只传"教师减 base 的 logit 偏移"再锚定到学生冻结初始化,避免把教师继承偏好当知识学走 |
| Q-Learning with Scalar Adjoint Matching | 2610.10437 | Model-based RL / RL 理论 | HF 10-07 榜单:用标量伴随匹配改进 Q-learning,机器人/控制任务验证 |
| Sparse Planning in Visual World Models via Cost Gradients | 2610.10274 | Model-based RL | training-free 的 COSTGRAD:按规划成本对输入 token 的梯度范数排序做 token 剪枝,50% 稀疏度下三个基准持平或超过全 token 规划,单步提速 2.6x |
| Long-WAM | 2610.10528 | Model-based RL / World Model | HF 10-08 榜单:扩展 world-action model 的上下文;核心发现——AR 预训练的视频基础才能真正用上更长历史(0→19.2s 历史使成功率 63.3%→更高) |
| RoboJEPA | 2610.10515 | Model-based RL / World Model | HF 10-07 榜单:规模化机器人隐空间世界模型(JEPA 路线) |
| SkillForge | 2610.09832 | LLM Agent / Self-evolving | HF 榜单:技能与 agent 协同演化,动态技能生命周期管理 |
| SkillSandbox | 2610.10088 | LLM Agent / Self-evolving | 自演化 agent 的技能验证:动态合成新场景,检验技能在蒸馏来源之外是否可复用 |
| ExperienceIndex | 2610.10091 | LLM Agent / Memory | 以 artifact 为锚点的 agent 记忆:积累"哪些 artifact 与任务相关"的经验知识并跨查询复用 |
| RSIGym | 2610.10310 | LLM Agent / Self-evolving | 递归自我改进(RSI)研究环境:EaaS 服务化训练/推理/rollout/评测/sandbox,定义 RSI-Index |
| Agent Plasticity | 2610.08902 | LLM Agent / Evaluation | HF 10-07 榜单:度量 agent 通过经验的自我改进程度(可塑性)的基准化工作 |
| Decoupling Logic from Persona (AO-DA) | 2610.09772 | LLM Agent / Systems | 边缘端 agent 的 What/How 双推理路径(INT4 + 热插拔 LoRA):逻辑路径只看核心轮并输出可验证结构状态,抗上下文污染 |
| RunningTab | 2610.10444 | LLM Agent / Tool-use | HF 10-08 榜单:让 agent 直接操作"环境侧 tab"的 workspace 交互范式 |
| Adversarial Images Hijack Web Agents | 2610.09240 | LLM Agent / Safety | WebMirage:从视觉 grounding 到浏览器执行的端到端对抗图片红队,model 级成功≠执行级控制 |
| DecepEval | 2610.07967 | LLM Agent / Safety / Evaluation | 1532 实例/28 场景:基于欺诈理论的 LLM Deception Diamond,系统度量 agent 欺骗的诱因条件 |
| LatentGRM | 2610.09788 | Latent Reasoning / Evaluation | 隐空间生成式奖励模型(见详评 8) |
| Mechanics of Long-Context Hybrid Models Part 1.1 | 2610.10114 | Pretraining / Systems | 从 hybrid attention 到 hybrid position 的系统机制分析,解释混合架构为何有效、如何设计更好 |
| BehaviorTrace | 2610.10422 | Post-training RL / Interpretability | planted behavior + 全梯度 sketch 的在线 RL 归因审计 harness:现有归因方法的信号多为梯度幅度混淆 |
| A self-learning scientific agent for X-ray diffraction | 2610.07862 | LLM Agent / Self-evolving | HF 榜单:X 射线衍射领域的自学习科学 agent |
| OOM-RL II | 2610.10256 | Code Agent / Systems | 量化交易系统上的"provenance 约束诊断":外部 oracle 只证明结果发生、不指认哪个演化过程产生它 |
| On the Reliability of LLM-Based Vulnerability Patching Benchmarks | 2610.10150 | Code Agent / Evaluation | 漏洞修补基准三大失真源:agent 层(prompt/工具拉高成功率)、框架层(权限/超时 bug)、数据层(PoC 单一) |
| Cost-Efficient Theorem Proving via Agent Orchestration | 2610.09681 | Code Agent / Tool-use | 程序验证中的 agent 编排降低定理证明成本 |
| nanoMuse | 2610.08699 | LLM Agent / Systems | 开源个人 agent 对照分析:从 Meta Muse 公开材料与生产 prompt 逐条溯源定义"个人 agent"五个问题,给出开放实现 |
| Cache/压缩补充:OrBIT | 2610.10385 | Context Compression | 结构引导的嵌入压缩 |
#四、GitHub / 开源动态(本周新建,按 star)
- QingYunA/answer-me-with-html(2319★,10-02 创建):让 agent 用一页可读 HTML 回答难题的 agent skill,本周最热新仓库之一,代表"agent 输出形态设计"的新玩法。
- strands-agents/box(232★,10-02):OS 级沙箱限制 agent 可执行/读写/联网范围,agentic 安全基础设施。
- nuglifeleoji/Sentry(106★,10-02):"Learning to Recover from LLM Agent Failures at Test Time"的官方仓库——与昨日详评的失败条件化/恢复训练方向直接呼应,值得跟进。
- AetherLabsAI/Video2World(84★,10-05):用编码 agent 从具身视频构建交互式世界模型(Real2Sim),连接 code agent 与 world model 两条线。
- MirroS-Lab/AgentGarten(50★,10-08):"Code Worlds for Evolving Agents"——通过环境设计催生自演化智能的直接实例,刚创建一天,与 wenjun 的环境设计关注点高度吻合。
- JinHo-von-Choi/anti-samcheonpo(78★,10-07):检测 AI 编码 agent 过度验证/上下文脱离/死循环/虚假完成的 harness——与昨日 ParanoiaEval 的"过度防御"问题相印证,说明该痛点是行业性的。
- fidipro/gluon(39★,10-07):coding agent 的控制平台(编排/审计方向)。
说明:GitHub Search API 本轮可正常访问(上周曾限流)。X/Twitter 仍不可匿名访问,未纳入本轮来源。
#五、今日最值得精读的 3 篇
- SemanticFold(2610.10304)——如果你在做通用上下文压缩器或潜空间推理,这篇的固定目标协议和"五类终点不共享压缩阈值"结论会直接改变你对压缩器评测的设计;方法部分可复用为标准协议。
- Beyond Outcome Rewards: Retrieval Credit(2610.10179)——搜索 agent 的中间步信用分配系统消融,是把 credit assignment 谱系扩展到 tool-use agent 的参照系工作,与 GIGPO/HGPO 对读收益最大。
- A Deafening Silence(2610.09835)——机制级的灾难性遗忘定位(罕见 token 输出嵌入 + Adam 二阶矩放大),对做持续预训练/agentic 后训练的人是"必知"级别的结论,且 token 计数风险排序立刻可用。
#六、今日最值得跟进的 3 个 repo / model / dataset
- nuglifeleoji/Sentry(Learning to Recover from LLM Agent Failures at Test Time)——测试时失败恢复,与 FC-SWE 的训练时失败条件化构成完整图景。
- MirroS-Lab/AgentGarten(Code Worlds for Evolving Agents)——"环境设计催生自演化智能"的最新开源实验场,刚起步、适合早期进入。
- BehaviorTrace 的开源 harness(2610.10422)——在线 RL 训练数据归因的审计工具,发布即可用于检查自己 RLVR 训练里的"伪归因信号"。
#七、研究机会 / Idea
- 压缩能力分离 → 面向能力类型的压缩器。SemanticFold 证明语言建模/可解码性/推理在压缩下不共享阈值。机会:设计按下游能力路由的混合压缩器——同一前缀的不同片段按其将被用于"生成续写"还是"支撑推理"选择不同压缩率,并用线性探针可及性作为路由信号。这直接横跨 wenjun 的压缩器与潜空间推理两条线。
- 词汇缺陷 × agentic 后训练的遗忘预测。A Deafening Silence 的机制只在新语料分布上验证。机会:agentic RL 数据的工具调用 token 分布极度尖锐(函数名/JSON 语法集中在少数 token),可验证"agentic 后训练的遗忘由工具 token 的输出嵌入主导"这一假设,并给出训练前的风险排序工具——把机制研究接到 wenjun 的 agent RL 主线上。
- 语言级 credit 与数值级 credit 的信息量对比。Caddie(自然语言 critic,只看最终成败)与 BoT-GRPO(token 级数值 advantage)代表两种监督模态。机会:在同一个多工具 agent 任务上做受控对比,度量两种信号各自可恢复的"哪个决策导致了成败"的信息量(可用 planted-behavior 类方法,参考 BehaviorTrace 的设计),回答"何时语言反馈优于数值 advantage"——这既是科学问题也有直接工程价值。
本简报由 Hermes Agent 自动调研生成(arXiv API + Hugging Face Daily Papers API + GitHub Search API),所有条目均经真实抓取核验。生成时间:2026-10-09 08:00 CST。