Tag Archive
标签:PPO
这里整理所有带有「PPO」标签的文章,方便按主题快速回看。
首页
每日调研
论文精读
主题归档
实验分析
复现指南
PPO
共 2 篇
主题归档 · 2026-06-21
PPO 在 Agentic RL 中的应用与进展:从 RLHF 到长轨迹 Agent 训练
梳理 PPO 如何从 RLHF 的标准算法,演化到多轮工具使用、搜索、Web/GUI/代码 Agent 中的 turn-level、sequence-level、trajectory-level 训练框架,并分析它与 GRPO/GIGPO/HGPO 等新算法的关系。
PPO
Agentic RL
LLM Agent
RLHF
RLVR
GRPO
Credit Assignment
Post-training
主题归档 · 2026-06-14
小白版讲解:RL 是不是“全局参数化黑箱优化 + 数值最优控制”?
用小白能听懂的方式拆解 V777 关于强化学习的知乎回答:对偶配对、占据测度、HJB 对偶、Actor-Critic、PPO、single shooting、MPC,以及这套叙事对 LLM Agent 的启发。
强化学习
最优控制
占据测度
对偶优化
PPO
MPC
LLM Agent