Robotics

RT-2 精读:从 Vision-Language Model 到 Vision-Language-Action

快速读懂 RT-2:如何把机器人动作表示成语言 Token,将 PaLI-X / PaLM-E 从视觉语言模型转化为可以直接闭环控制机器人的 Vision-Language-Action 模型,以及为什么这一步成为后来 VLA 路线的重要起点。

avatar
Haotian Xue

RT-1 精读:Transformer 如何学会控制真实机器人

用一篇短文快速读懂 RT-1:大规模真实机器人数据、FiLM-EfficientNet、TokenLearner、Transformer 与 Action Tokenization,以及它为什么成为后来 VLA 路线的重要起点。

avatar
Haotian Xue

OpenVLA 精读:把 RT-2 的 VLA 范式真正开源

快速读懂 OpenVLA:它如何沿用 RT-2 的 Action Token 思路,用 DINOv2 + SigLIP + Llama 2 7B 和 Open X-Embodiment 的 970k 机器人轨迹构建开源 VLA,并把研究重点推进到跨机器人泛化、下游微调、LoRA 和量化部署,为后续 $\pi_0$ 的连续动作与高频控制路线铺路。

avatar
Haotian Xue

$\pi_0$ 精读:从 Action Token 到 Flow Matching,VLA 开始学习灵巧控制

快速读懂 $\pi_0$:它如何在 RT-2 与 OpenVLA 建立的 VLA 范式上,引入 PaliGemma、Action Expert、Flow Matching、Action Chunking 与跨机器人预训练,把视觉语言知识进一步连接到连续、高频、灵巧的机器人控制。

avatar
Haotian Xue
Welcome to My AI Research Blog: Multi-Agent Systems, Robotics and World Models featured image

Welcome to My AI Research Blog: Multi-Agent Systems, Robotics and World Models

An introduction to my personal blog, where I share research notes, technical tutorials, project records, and reflections on artificial intelligence, multi-agent systems, robotics, …

avatar
Haotian Xue