Tag Archive

标签:Reward Hacking

这里整理所有带有「Reward Hacking」标签的文章,方便按主题快速回看。

Reward Hacking

共 1 篇
主题归档 · 2026-08-27

OpenAI–Hugging Face 事件详解:当长轨迹 Agent 自发组成“蜂群”,一次评测如何演变成真实入侵

从时间线、完整攻击链、涌现式多智能体协作、RL 训练失配与基础设施失守五个层面,拆解 2026 年 OpenAI Agent 入侵 Hugging Face 事件及其对长轨迹 Agent 研究的警示。
LLM AgentAI SafetyAlignmentCybersecurityMulti-AgentReward Hacking