RT-2 精读:从 Vision-Language Model 到 Vision-Language-Action
快速读懂 RT-2:如何把机器人动作表示成语言 Token,将 PaLI-X / PaLM-E 从视觉语言模型转化为可以直接闭环控制机器人的 Vision-Language-Action 模型,以及为什么这一步成为后来 VLA 路线的重要起点。
快速读懂 RT-2:如何把机器人动作表示成语言 Token,将 PaLI-X / PaLM-E 从视觉语言模型转化为可以直接闭环控制机器人的 Vision-Language-Action 模型,以及为什么这一步成为后来 VLA 路线的重要起点。
快速读懂 OpenVLA:它如何沿用 RT-2 的 Action Token 思路,用 DINOv2 + SigLIP + Llama 2 7B 和 Open X-Embodiment 的 970k 机器人轨迹构建开源 VLA,并把研究重点推进到跨机器人泛化、下游微调、LoRA 和量化部署,为后续 $\pi_0$ 的连续动作与高频控制路线铺路。
快速读懂 $\pi_0$:它如何在 RT-2 与 OpenVLA 建立的 VLA 范式上,引入 PaliGemma、Action Expert、Flow Matching、Action Chunking 与跨机器人预训练,把视觉语言知识进一步连接到连续、高频、灵巧的机器人控制。