Tag Archive

标签:reinforcement-learning

这里整理所有带有「reinforcement-learning」标签的文章,方便按主题快速回看。

reinforcement-learning

共 4 篇
论文精读 · 2026-06-21

"ExpRL:把参考答案从 SFT 样本变成 RL 探索脚手架"

"详解 arXiv 2606.17024:ExpRL 如何用参考解答构造 dense reward,解决稀疏奖励 RL 在硬题上的探索覆盖不足问题。"
reinforcement-learningllm-reasoningmid-trainingexpRLGRPOagentic-rl
主题归档 · 2026-06-21

OpenAI《Reinforcement Learning Towards Broadly and Persistently Beneficial Models》详解:RL 能否训练出更“持久有益”的模型?

详细解读 OpenAI Alignment 团队的 Beneficial Trait RL 论文:为什么从“让模型完成任务”转向“强化有益人格特质”,它如何构造数据、训练模型、验证跨域泛化与对抗持久性,以及这对 RLHF、模型对齐和未来 Agent 训练意味着什么。
alignmentreinforcement-learningopenaibeneficial-aiemergent-misalignmentpost-training
主题归档 · 2026-05-04

从 OPD 到 OPSD / ExOPD:解读群聊里关于 On-Policy Distillation 的几篇论文

解读 Thinking Machines 的 On-Policy Distillation 博客,以及 arXiv:2604.13016、2603.25562、2601.18734、2602.12125 四篇工作,讲清 OPD、SFT 冷启动、teacher-supported region、OPSD、自蒸馏、多专家蒸馏和 log-prob shift 背后的技术逻辑。
OPDdistillationreinforcement-learningLLM-post-trainingOPSDExOPD
主题归档 · 2026-04-25

具身智能发展脉络全景梳理:从控制与感知到机器人基础模型

系统梳理具身智能从经典机器人控制、深度强化学习、sim2real、模仿学习,到机器人基础模型、VLA 与跨机器人通用策略的发展逻辑,讲清每一阶段在解决什么核心问题。
embodied-airoboticsimitation-learningreinforcement-learningVLAsurvey