2026-07-07
详解 DUSt3R 如何用 pointmap 表示统一无标定双目/多视图重建、深度估计、像素匹配与相机位姿恢复。
2026-06-26
这篇论文把 Agent 的交互环境本身建模成一个语言世界模型:既可以作为可控模拟器给 Agent 做 RL,也可以作为 Agent 的预训练 warm-up,让模型在行动前学会预测下一步环境反馈。
2026-06-23
详解 arXiv 2606.09828v1:Mirage 如何用 latent spatial memory 替代 RGB 点云缓存,让视频世界模型在保持 3D 一致性的同时显著降低速度和显存开销。
2026-06-21
"详解 arXiv 2606.17024:ExpRL 如何用参考解答构造 dense reward,解决稀疏奖励 RL 在硬题上的探索覆盖不足问题。"
2026-06-18
解读 arXiv 2604.06628:reasoning SFT 的泛化不是“有/没有”的二元问题,而是由优化充分性、数据质量与结构、基础模型能力共同决定,并且伴随安全退化代价。
2026-06-17
详解 arXiv:2504.14945 的 LUFFY:为什么纯 on-policy RLVR 会受限于模型初始能力,为什么朴素 SFT 又容易僵硬模仿,以及如何用 Mixed-Policy GRPO 与 policy shaping 在 off-policy 指导下学习推理。
2026-06-17
详解 VibeThinker-3B 技术报告:如何用 Spectrum-to-Signal 后训练范式、multi-domain RL、offline self-distillation 与 claim-level test-time scaling,把 3B dense 小模型推到数学和代码等可验证推理任务的一线性能区间。
2026-06-15
详解 Just-In-Time Reinforcement Learning 如何把历史轨迹记忆转成 advantage,在推理时直接加到候选动作 logits 上,从而在不更新参数的情况下实现类似 KL 约束策略优化的 agent 持续学习。
2026-06-14
详细解读 τ0-WM 这篇机器人操作论文:它如何把 Video Action Model 和 Action-Conditioned Video Simulator 统一到一个视频-动作世界模型里,用异构数据训练,并在测试时通过候选动作筛选、未来模拟和动作修正提升长程操作成功率。
2026-06-13
这篇论文用纤维丛、商空间、同胚等拓扑概念解释一个直觉:视觉理解不是记住像素,而是把许多外观变化压缩成少量稳定语义;这种压缩需要外部语义目标和能做“展开—咔哒归类”的模型结构。
2026-06-10
这篇 position paper 认为,当前 LLM 的大规模后训练正在把评测分布变成训练分布;即使从随机初始化开始,只靠数学/代码 SFT 数据也能在对应 benchmark 上取得不低成绩,因此很多“推理能力”可能首先是分布拟合能力,而不是开放泛化能力。
2026-06-08
详细拆解小米 MiMo-7B 技术报告中的训练流程:推理导向预训练、MTP 架构、SFT 冷启动、可验证数学/代码 RL、test-difficulty reward、dynamic sampling 与 Seamless Rollout Engine。
2026-06-01
详解 MiniMax-M2.7 技术报告:从 229.9B 总参数/9.8B 激活参数的 MoE 架构,到 192K 长上下文、MTP 推测解码、agentic 数据管线、Forge 强化学习系统、交错思考与自演化能力,理解“mini activations, max real-world intelligence”背后的系统路线。
2026-06-01
详解 RiM 如何用固定 memory blocks 替代自回归生成的思维链,把中间推理从“说出来”变成“存在工作记忆里”,并在低延迟下取得比 Coconut 更好的数学推理表现。
2026-05-26
解读 Microsoft Research 论文 ECHO:把终端环境返回的 stdout、stderr、日志、文件内容等 observation token 也纳入训练损失,让失败轨迹也产生密集监督,从而在不增加 rollout 的情况下提升 terminal agent 的 RL 效率。
2026-05-24
解读 arXiv:2605.20613 HRM-Text:用分层递归架构、任务完成目标和 PrefixLM,把 1B 模型从零训练的门槛压到 40B tokens / 约 1500 美元量级。