★★★★★ · 论文精读 · 2026-10-05
Harvard 团队用 MCMC 采样把 off-policy 专家数据逐步"搬"近 base model 分布,让最普通的 SFT 在泛化和遗忘两个维度上同时打赢 on-policy RL 与自蒸馏。
★★★★★ · 论文精读 · 2026-10-02
USTC/复旦的新工作:从 O*NET 职业种子出发抓真实文件构建工作区,用证据图编译任务与评分 rubric,2,169 条轨迹让 Qwen3.6-27B 的 GDPVal 提升 65.7 Elo。
★★★★★ · 主题归档 · 2026-09-30
Ramez Naam 用 OpenAI/Anthropic 的实测数据论证:AI 自我改进回路离"自我维持"还差 5–10 倍,智能爆炸不会很快到来——这是目前对 RSI 叙事最扎实的一份怀疑派檄文。
★★★★★ · 论文精读 · 2026-09-29
Meta FAIR(Jason Weston 组)2026 年 9 月博客:先证明 LLM judge 分不清专家人类写作和 AI slop,再用“元优化评分规则”造出能识别专家质量的奖励,然后 RL——一套把“不可验证任务”变成“可验证任务”的完整配方。
★★★★★ · 主题归档 · 2026-09-28
以 Harness VLA 为锚点,系统梳理"Agent–Harness–VLA"这条线的来龙去脉:从 LLM 写代码控制机器人,到 VLA 基础模型,再到用 agent harness 把冻结的 VLA 包装成可靠原语、乃至让 harness 自我演化——一份发展脉络综述。