快速读懂 $\pi_0$:它如何在 RT-2 与 OpenVLA 建立的 VLA 范式上,引入 PaliGemma、Action Expert、Flow Matching、Action Chunking 与跨机器人预训练,把视觉语言知识进一步连接到连续、高频、灵巧的机器人控制。
快速读懂 DreamerV3:RSSM 如何学习潜空间世界模型,Actor-Critic 如何在 imagined trajectories 中训练,以及 symlog、two-hot、KL balancing、free bits 与 return normalization 为什么让一套超参数可以跨 150+ 任务工作。
快速读懂 CVPR 2026 GaussianDWM:如何把语言语义直接嵌入 3D Gaussian,用任务感知采样将稠密三维世界压缩成 LLM 可处理的 World Tokens,并利用高层 World Knowledge 与低层图像条件统一驱动 RGB-D 空间与未来场景生成。
快速读懂 OpenVLA:它如何沿用 RT-2 的 Action Token 思路,用 DINOv2 + SigLIP + Llama 2 7B 和 Open X-Embodiment 的 970k 机器人轨迹构建开源 VLA,并把研究重点推进到跨机器人泛化、下游微调、LoRA 和量化部署,为后续 $\pi_0$ 的连续动作与高频控制路线铺路。
用一篇短文快速读懂 RT-1:大规模真实机器人数据、FiLM-EfficientNet、TokenLearner、Transformer 与 Action Tokenization,以及它为什么成为后来 VLA 路线的重要起点。
快速读懂 RT-2:如何把机器人动作表示成语言 Token,将 PaLI-X / PaLM-E 从视觉语言模型转化为可以直接闭环控制机器人的 Vision-Language-Action 模型,以及为什么这一步成为后来 VLA 路线的重要起点。
An introduction to my personal blog, where I share research notes, technical tutorials, project records, and reflections on artificial intelligence, multi-agent systems, robotics, …