<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VLA &amp; Robot Foundation Models | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/blog/vla/</link><atom:link href="https://xht252.github.io/blog/vla/index.xml" rel="self" type="application/rss+xml"/><description>VLA &amp; Robot Foundation Models</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>VLA &amp; Robot Foundation Models</title><link>https://xht252.github.io/blog/vla/</link></image><item><title>$\pi_0$ 精读：从 Action Token 到 Flow Matching，VLA 开始学习灵巧控制</title><link>https://xht252.github.io/blog/vla/pi0/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/pi0/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Kevin Black et al., &lt;em&gt;$\pi_0$: A Vision-Language-Action Flow Model for General Robot Control&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;前面读完 RT-2 和 OpenVLA 后，VLA 的基本范式已经很清楚：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把视觉、语言和机器人动作放进一个统一模型，让模型根据 Image + Instruction 直接产生 Action。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 证明了这个方向可行；OpenVLA 又把它变成了一个开放、可微调的 7B VLA。&lt;/p&gt;
&lt;p&gt;但它们都留下了一个非常现实的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人动作真的应该像文本一样，被离散成 Token，然后一个一个自回归生成吗？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当任务变成折衣服、整理桌面、双臂协作、柔性物体操作，以及 20–50 Hz 的高频控制时，动作本质上仍然是连续轨迹。&lt;/p&gt;
&lt;p&gt;$\pi_0$ 的核心就是重新思考这一点。&lt;/p&gt;
&lt;p&gt;这条演进关系可以概括为：RT-2 建立 VLA，OpenVLA 推进开放与适配，而 $\pi_0$ 开始重点解决连续、高频、灵巧的 Action Generation。&lt;/p&gt;
&lt;p&gt;所以，如果一句话概括：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;$\pi_0$ 保留 VLM 负责“理解世界”，但不再强迫机器人动作完全遵循 Language Token 的生成方式，而是加入专门的 Action Expert，用 Flow Matching 生成连续动作序列。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="1-从-rt-2--openvla-到-到底变了什么"&gt;1. 从 RT-2 / OpenVLA 到 $\pi_0$，到底变了什么？&lt;/h2&gt;
&lt;p&gt;先看最核心的区别：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;RT-2&lt;/th&gt;
&lt;th&gt;OpenVLA&lt;/th&gt;
&lt;th&gt;$\pi_0$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;VLA&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;PaLI-X / PaLM-E&lt;/td&gt;
&lt;td&gt;DINOv2 + SigLIP + Llama 2&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;PaliGemma&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action Representation&lt;/td&gt;
&lt;td&gt;Discrete Token&lt;/td&gt;
&lt;td&gt;Discrete Token&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Continuous Action&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action Generation&lt;/td&gt;
&lt;td&gt;Autoregressive&lt;/td&gt;
&lt;td&gt;Autoregressive&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Flow Matching&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action Chunking&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;No&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;H = 50&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Robot-specific Module&lt;/td&gt;
&lt;td&gt;无独立 Expert&lt;/td&gt;
&lt;td&gt;无独立 Expert&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Action Expert&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cross-Embodiment&lt;/td&gt;
&lt;td&gt;有限&lt;/td&gt;
&lt;td&gt;OpenX&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心训练设计&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;高频 Dexterity&lt;/td&gt;
&lt;td&gt;有限&lt;/td&gt;
&lt;td&gt;有限&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心目标&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这三篇论文的研究重点其实在不断移动：&lt;/p&gt;
&lt;p&gt;因此，$\pi_0$ 并不是简单扩大 OpenVLA，而是把研究重点从“开放 VLA”进一步推进到“连续动作生成与物理灵巧性”。&lt;/p&gt;
&lt;p&gt;因此 $\pi_0$ 并不是“把 OpenVLA 再做大一点”。&lt;/p&gt;
&lt;p&gt;恰恰相反，它开始重新设计 VLA 中 &lt;strong&gt;Action Generation&lt;/strong&gt; 这一半。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-一张论文图看懂"&gt;2. 一张论文图看懂 $\pi_0$&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2410.24164v4/x1.png" alt="pi0 Architecture" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;$\pi_0$ 的整体结构。图片来自 arXiv HTML 版论文 Figure 3。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;输入主要包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;RGB Images；&lt;/li&gt;
&lt;li&gt;Language Instruction；&lt;/li&gt;
&lt;li&gt;Robot Proprioception。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;模型则可以理解为两个主要部分：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
I["RGB Images"] --&gt; V["Pre-trained VLM&lt;br/&gt;PaliGemma ~3B"]
L["Language Instruction"] --&gt; V
V --&gt; S["Shared Transformer Representation"]
P["Robot Proprioception"] --&gt; A["Action Expert&lt;br/&gt;~300M"]
N["Noisy Action Chunk"] --&gt; A
S --&gt; A
A --&gt; F["Flow Matching"]
F --&gt; O["Continuous Action Chunk"]
&lt;/div&gt;
&lt;p&gt;整个模型大约 &lt;strong&gt;3.3B 参数&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PaliGemma VLM ≈ 3B
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action Expert ≈ 300M
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里最重要的不是参数量，而是职责发生了分工。&lt;/p&gt;
&lt;h3 id="vlm-backbone"&gt;VLM Backbone&lt;/h3&gt;
&lt;p&gt;主要负责：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;视觉理解；&lt;/li&gt;
&lt;li&gt;语言理解；&lt;/li&gt;
&lt;li&gt;物体与语义关系；&lt;/li&gt;
&lt;li&gt;任务条件。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="action-expert"&gt;Action Expert&lt;/h3&gt;
&lt;p&gt;主要负责：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在机器人状态与 VLM 语义表示条件下，生成真正适合物理执行的连续动作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这和 RT-2 / OpenVLA 有一个非常重要的区别：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Language 和 Action 可以共享 Transformer 表示，但不一定必须共享完全相同的输出机制。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="3-核心创新flow-matching-action-expert"&gt;3. 核心创新：Flow Matching Action Expert&lt;/h2&gt;
&lt;p&gt;RT-2 和 OpenVLA 的动作生成可以粗略写成：&lt;/p&gt;
&lt;p&gt;RT-2 / OpenVLA 更接近“Image + Language → VLM → Autoregressive Action Tokens → Robot Action”的生成方式。&lt;/p&gt;
&lt;p&gt;也就是说：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;像生成文本一样，自回归地产生离散动作 Token。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$\pi_0$ 则改成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Image + Language + State"] --&gt; B["VLM Representation"]
B --&gt; C["Action Expert"]
N["Random Noise"] --&gt; C
C --&gt; D["Flow Matching"]
D --&gt; E["Continuous Action Trajectory"]
&lt;/div&gt;
&lt;p&gt;它不是直接预测一个固定动作，而是学习一个 &lt;strong&gt;velocity field&lt;/strong&gt;：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;怎样把初始随机噪声逐渐运输到真实机器人动作分布。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;直观理解就是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;random action noise
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;rough trajectory
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;refined trajectory
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;final robot action chunk
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;论文使用 &lt;strong&gt;10 个 flow integration steps&lt;/strong&gt; 来完成推理。&lt;/p&gt;
&lt;p&gt;所以 Flow Matching 在这里不是为了生成漂亮图像，而是在解决：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;连续、多模态、高维机器人动作分布如何被高效建模。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="4-action-chunking一次生成未来-50-个动作"&gt;4. Action Chunking：一次生成未来 50 个动作&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 的另一个关键设计是 &lt;strong&gt;Action Chunking&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;传统 single-step policy 更像：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;observe → predict one action → execute → observe again
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而 $\pi_0$ 一次预测：&lt;/p&gt;
$$
A_t =
[a_t,a_{t+1},\ldots,a_{t+H-1}],
$$&lt;p&gt;其中：&lt;/p&gt;
$$
H=50.
$$&lt;p&gt;也就是一次产生最多 &lt;strong&gt;50 个未来动作&lt;/strong&gt;。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Current Observation"] --&gt; B["pi0"]
B --&gt; C["50-step Action Chunk"]
C --&gt; D["a_t"]
C --&gt; E["a_t+1"]
C --&gt; F["..."]
C --&gt; G["a_t+49"]
&lt;/div&gt;
&lt;p&gt;这意味着模型学习的不再是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“下一步往哪动？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“接下来这一小段运动轨迹应该是什么？”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;对于折衣服、双臂协调、拿取柔性物体这类任务，这种 trajectory-level prediction 比单步动作自然得多。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="5-50-hz-并不意味着-33b-模型每秒完整推理-50-次"&gt;5. 50 Hz 并不意味着 3.3B 模型每秒完整推理 50 次&lt;/h2&gt;
&lt;p&gt;这是论文中非常容易被误读的一点。&lt;/p&gt;
&lt;p&gt;$\pi_0$ 支持最高约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;50 Hz robot control
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;但不等于：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;50 × full VLA inference / second
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;对于 50 Hz 的机器人，论文采用的方式大致是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;每 0.5 秒重新 inference
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ 执行约 25 个 action
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ 再重新 inference
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;对于 20 Hz 的 UR5e / Franka：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;每 0.8 秒 inference
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ 执行约 16 个 action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;RTX 4090 上论文报告的一次完整推理约为：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Image encoder 14 ms
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Observation pass 32 ms
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;10 × Flow steps 27 ms
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;-------------------------
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;On-board total 73 ms
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以真正的机制是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Visual Observation"] --&gt; B["Full pi0 Inference"]
B --&gt; C["Predict Action Chunk"]
C --&gt; D["High-frequency Robot Execution"]
D --&gt; E["Execute Several Actions Open-loop"]
E --&gt; F["New Observation"]
F --&gt; B
&lt;/div&gt;
&lt;p&gt;换句话说：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;低频生成一小段未来轨迹，高频执行这段轨迹。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是 Action Chunking 为什么重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-action-chunking-的代价closed-loop-feedback-变少"&gt;6. Action Chunking 的代价：Closed-loop Feedback 变少&lt;/h2&gt;
&lt;p&gt;Action Chunk 越长，效率越高。&lt;/p&gt;
&lt;p&gt;但执行 chunk 中间的动作时，模型不会每一步都重新观察环境。&lt;/p&gt;
&lt;p&gt;于是存在天然的 trade-off：&lt;/p&gt;
&lt;p&gt;这个 trade-off 可以直接理解为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Chunk&lt;/th&gt;
&lt;th&gt;优点&lt;/th&gt;
&lt;th&gt;代价&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Larger chunk&lt;/td&gt;
&lt;td&gt;执行效率更高&lt;/td&gt;
&lt;td&gt;视觉反馈更稀疏&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Smaller chunk&lt;/td&gt;
&lt;td&gt;Closed-loop 更强&lt;/td&gt;
&lt;td&gt;推理开销更大&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这也是为什么 Action Chunking 并不是简单的“越长越好”。&lt;/p&gt;
&lt;p&gt;在高度动态环境里，如果外界发生变化，而机器人仍然 open-loop 执行旧的 chunk，就可能产生误差。&lt;/p&gt;
&lt;p&gt;因此这里其实留下了一个后续非常重要的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何同时获得高频执行与高频视觉反馈？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="7-cross-embodiment一个模型学习多种机器人"&gt;7. Cross-Embodiment：一个模型学习多种机器人&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 的第二条大主线不是 Flow Matching，而是 &lt;strong&gt;Robot Data Scaling&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;论文自己的数据覆盖：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;7 robot configurations
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;68 broad tasks
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;包括：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;UR5e
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Franka
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Bimanual UR5e
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Bimanual Trossen
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Bimanual ARX / AgileX
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mobile Trossen / ARX
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mobile Fibocom
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;同时又混入 Open X-Embodiment、BridgeV2、DROID 等开放机器人数据。&lt;/p&gt;
&lt;p&gt;论文报告整个研究使用超过：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;10,000 hours
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的机器人数据，其自有数据约有：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;903M timesteps
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;因此训练目标已经不只是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“让一台机械臂学会很多任务。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让一个模型吸收不同 embodiment 的物理经验。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["Single-arm Robots"] --&gt; G["Cross-Embodiment Training"]
B["Dual-arm Robots"] --&gt; G
C["Mobile Manipulators"] --&gt; G
D["Open X-Embodiment"] --&gt; G
E["BridgeV2"] --&gt; G
F["DROID"] --&gt; G
G --&gt; H["Shared VLA Representation"]
H --&gt; I["Generalist Robot Foundation Model"]
&lt;/div&gt;
&lt;p&gt;不同机器人 action space 并不一样。&lt;/p&gt;
&lt;p&gt;$\pi_0$ 使用一个很工程化但有效的方法：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 state/action vector 统一 padding 到最大 18 维。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;缺少的维度补零；缺少的 camera slot 使用 mask。&lt;/p&gt;
&lt;p&gt;这看起来不“炫”，但对于 Robot Foundation Model 来说非常关键：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;统一数据接口往往和模型结构本身一样重要。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-pre-training--post-training机器人开始复制-llm-的训练范式"&gt;8. Pre-training + Post-training：机器人开始复制 LLM 的训练范式&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 还进一步采用了很明显的 Foundation Model Training Recipe：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Diverse Robot Data"] --&gt; B["Pre-training"]
B --&gt; C["General Capability"]
C --&gt; D["High-quality Task Data"]
D --&gt; E["Post-training"]
E --&gt; F["Specialized Robust Behavior"]
&lt;/div&gt;
&lt;h3 id="pre-training"&gt;Pre-training&lt;/h3&gt;
&lt;p&gt;目标是覆盖尽可能多的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;robots；&lt;/li&gt;
&lt;li&gt;objects；&lt;/li&gt;
&lt;li&gt;tasks；&lt;/li&gt;
&lt;li&gt;failures；&lt;/li&gt;
&lt;li&gt;recovery behaviors。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这里的数据可以非常多样，甚至质量不完全一致。&lt;/p&gt;
&lt;p&gt;它主要回答：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;What can the robot do?&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="post-training"&gt;Post-training&lt;/h3&gt;
&lt;p&gt;再使用质量更高、更一致的数据，对具体任务进行专项训练。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;laundry folding；&lt;/li&gt;
&lt;li&gt;table bussing；&lt;/li&gt;
&lt;li&gt;box assembly。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它回答的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;How can the robot do this task well?&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这和现代 LLM：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pre-training → Post-training
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的思路已经非常接近。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-实验完整--到底强在哪里"&gt;9. 实验：完整 $\pi_0$ 到底强在哪里？&lt;/h2&gt;
&lt;p&gt;论文首先进行 &lt;strong&gt;Out-of-Box&lt;/strong&gt; 测试，也就是不针对测试任务专门 post-train。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2410.24164v4/x4.png" alt="pi0 Out-of-Box Results" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;$\pi_0$、$\pi_0$-small、OpenVLA 和 Octo 的直接提示实验。图片来自 arXiv HTML 版论文 Figure 7。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;测试包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Shirt Folding；&lt;/li&gt;
&lt;li&gt;Bussing Easy；&lt;/li&gt;
&lt;li&gt;Bussing Hard；&lt;/li&gt;
&lt;li&gt;Grocery Bagging；&lt;/li&gt;
&lt;li&gt;Toast out of Toaster。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;完整 $\pi_0$ 的 normalized task progress 大约为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th style="text-align: right"&gt;$\pi_0$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Shirt Folding&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;1.000&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bussing Easy&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.971&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bussing Hard&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.875&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Grocery Bagging&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.786&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Toast out of Toaster&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.750&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个 baseline 很有代表性：&lt;/p&gt;
&lt;h3 id="openvla"&gt;OpenVLA&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Large VLA
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Discrete autoregressive actions
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="octo"&gt;Octo&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Robot Foundation Model
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Diffusion action generation
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="-small"&gt;$\pi_0$-small&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Continuous-action architecture
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;No large VLM initialization
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以这个实验真正说明的不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Flow Matching 单独解决了所有问题。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLM semantic prior + large robot data + cross-embodiment training + continuous action generation 需要组合在一起。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="10--真正提升的是-physical-dexterity"&gt;10. $\pi_0$ 真正提升的是 Physical Dexterity&lt;/h2&gt;
&lt;p&gt;RT-2 更强调：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Semantic Generalization&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;What object can be used as a hammer?
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型需要理解物体、语义与常识，再把它 Ground 到机器人动作。&lt;/p&gt;
&lt;p&gt;而 $\pi_0$ 更强调：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Physical Dexterity&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;fold crumpled clothes；&lt;/li&gt;
&lt;li&gt;stack dishes；&lt;/li&gt;
&lt;li&gt;manipulate deformable objects；&lt;/li&gt;
&lt;li&gt;use two arms simultaneously；&lt;/li&gt;
&lt;li&gt;recover from manipulation errors。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以可以粗略理解：&lt;/p&gt;
&lt;p&gt;因此可以粗略理解为：RT-2 / OpenVLA 更突出 &lt;strong&gt;semantic understanding → action&lt;/strong&gt;，而 $\pi_0$ 进一步强调 &lt;strong&gt;semantic representation → continuous action distribution → physical dexterity&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 更突出“机器人应该做什么”，$\pi_0$ 开始更认真地解决“机器人具体应该怎么动”。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;两者当然不是完全割裂，但这个视角非常适合快速理解技术演进。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="11--仍然没有彻底解决-long-horizon-planning"&gt;11. $\pi_0$ 仍然没有彻底解决 Long-Horizon Planning&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 展示了很多长时间任务：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;laundry folding；&lt;/li&gt;
&lt;li&gt;table bussing；&lt;/li&gt;
&lt;li&gt;box assembly；&lt;/li&gt;
&lt;li&gt;dryer unloading。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;部分任务甚至持续：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;5–20 minutes
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;但这里必须区分：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Low-level Dexterous Policy
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;和：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;High-level Task Planning
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;在部分复杂任务中，论文仍然使用一个高层 VLM 产生中间语言指令：&lt;/p&gt;
&lt;p&gt;在这种设置下，高层 VLM 负责把 &lt;code&gt;&amp;quot;bus the table&amp;quot;&lt;/code&gt; 分解成 &lt;code&gt;&amp;quot;pick up the napkin&amp;quot;&lt;/code&gt; 等子任务，再由 $\pi_0$ 把子任务转成连续机器人动作。&lt;/p&gt;
&lt;p&gt;所以不能简单理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“一个 $\pi_0$ 网络已经独立解决了 20 分钟 Long-Horizon Planning。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;更准确的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;$\pi_0$ 显著提升了通用低层策略的灵巧性，但高层任务分解在部分设置中仍然依赖单独的 VLM。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="12-从-rt-1-到-openvla再到"&gt;12. 从 RT-1 到 OpenVLA，再到 $\pi_0$&lt;/h2&gt;
&lt;p&gt;现在把这几篇论文放在一起，路线就非常清楚：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Scale Robot Data"]
--&gt; B["RT-2&lt;br/&gt;Scale Semantic Knowledge"]
--&gt; C["OpenVLA&lt;br/&gt;Scale Accessibility &amp; Adaptation"]
--&gt; D["pi0&lt;br/&gt;Scale Physical Dexterity"]
&lt;/div&gt;
&lt;p&gt;对应的问题分别是：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;核心问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td&gt;一个 Transformer 能否学习大量机器人任务？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2&lt;/td&gt;
&lt;td&gt;Web Knowledge 能否迁移到 Robot Action？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLA&lt;/td&gt;
&lt;td&gt;VLA 能否开放、微调并部署？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;$\pi_0$&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;VLA 如何产生连续、高频、灵巧的机器人动作？&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这样再看 $\pi_0$ 的几个设计，就非常自然：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action Expert
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flow Matching
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action Chunking
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Cross-Embodiment Training
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pre-training + Post-training
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它们都在回答同一个问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;一个真正的 Robot Foundation Model，除了“看懂”和“听懂”，还需要怎样学会“动得好”？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="13-我认为--真正重要在哪里"&gt;13. 我认为 $\pi_0$ 真正重要在哪里？&lt;/h2&gt;
&lt;p&gt;如果只把 $\pi_0$ 理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“把 Diffusion 换成 Flow Matching 的 VLA。”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;其实低估了这篇论文。&lt;/p&gt;
&lt;p&gt;它真正重要的是把此前几个方向组合到同一个 Robot Foundation Model 中：&lt;/p&gt;
&lt;p&gt;从系统角度看，$\pi_0$ 把 Internet-pretrained VLM、Cross-Embodiment Robot Data、Action Expert、Flow Matching、Action Chunking 与 Pre-training/Post-training 组合成了一套更完整的 Robot Foundation Model recipe。&lt;/p&gt;
&lt;p&gt;所以 $\pi_0$ 的贡献并不只是某一个模块。&lt;/p&gt;
&lt;p&gt;它更像是在回答：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Robot Foundation Model 到底应该由哪些部分组成？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 建立了：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Vision + Language → Action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;OpenVLA 让这个接口变得开放、可微调。&lt;/p&gt;
&lt;p&gt;而 $\pi_0$ 开始重新设计：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Action Representation；&lt;/li&gt;
&lt;li&gt;Action Generation；&lt;/li&gt;
&lt;li&gt;Robot Data Scaling；&lt;/li&gt;
&lt;li&gt;Embodiment Scaling；&lt;/li&gt;
&lt;li&gt;Training Recipe；&lt;/li&gt;
&lt;li&gt;Dexterity。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解"&gt;最后，用一句话理解 $\pi_0$&lt;/h2&gt;
&lt;p&gt;RT-2 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;预训练 VLM 可以被 Ground 到 Robot Action。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLA 可以成为开放、可适配的机器人基础模型。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$\pi_0$ 则进一步告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人动作并不一定要完全按照 Language Token 的方式生成；可以保留 VLM 负责语义理解，再使用专门的 Action Expert 和 Flow Matching 生成连续 Action Chunk。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此这条路线可以记成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;RT-1 → Robot Data
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;RT-2 → Semantic Knowledge
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;OpenVLA → Accessibility &amp;amp; Adaptation
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pi0 → Physical Dexterity
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而 $\pi_0$ 留下的下一道问题也非常自然：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何把更强的 reasoning、long-horizon planning、实时 closed-loop feedback 和更大规模机器人数据继续整合进同一个 VLA？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item><item><title>OpenVLA 精读：把 RT-2 的 VLA 范式真正开源</title><link>https://xht252.github.io/blog/vla/openvla/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/openvla/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Moo Jin Kim et al., &lt;em&gt;OpenVLA: An Open-Source Vision-Language-Action Model&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果 RT-2 回答的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Vision-Language Model 能不能直接输出 Robot Action？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 OpenVLA 继续追问的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这样的 VLA 能不能真正开放出来，让普通机器人实验室下载、微调并部署到自己的机器人上？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就是 OpenVLA 最值得关注的地方。&lt;/p&gt;
&lt;p&gt;OpenVLA 并没有推翻 RT-2 的基本思路。相反，它保留了最核心的 &lt;strong&gt;Action Tokenization&lt;/strong&gt;，然后把重点转向：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;开源模型；&lt;/li&gt;
&lt;li&gt;大规模跨机器人数据；&lt;/li&gt;
&lt;li&gt;下游任务微调；&lt;/li&gt;
&lt;li&gt;LoRA；&lt;/li&gt;
&lt;li&gt;量化部署。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以它是 RT-2 和后续 $\pi_0$ 之间非常自然的一块拼图。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-rt-2-到-openvla真正发生了什么"&gt;1. RT-2 到 OpenVLA，真正发生了什么？&lt;/h2&gt;
&lt;p&gt;先把二者放在一起：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;RT-2&lt;/th&gt;
&lt;th&gt;OpenVLA&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;时间&lt;/td&gt;
&lt;td&gt;2023&lt;/td&gt;
&lt;td&gt;2024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;模型规模&lt;/td&gt;
&lt;td&gt;12B / 55B&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;7B&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;PaLI-X / PaLM-E&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;DINOv2 + SigLIP + Llama 2&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action&lt;/td&gt;
&lt;td&gt;Discrete Tokens&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Discrete Tokens&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Robot Data&lt;/td&gt;
&lt;td&gt;RT data / RT-X&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;970k OpenX trajectories&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;开源&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;是&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;下游 Fine-tuning&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心问题&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LoRA / Quantization&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;系统研究&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;因此 OpenVLA 的主要贡献并不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;提出一种全新的 VLA 架构。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 RT-2 已经证明有效的 VLA 范式，做成一个开放、可适配的 Robot Foundation Model。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="2-一张图看懂-openvla"&gt;2. 一张图看懂 OpenVLA&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2406.09246v3/x1.png" alt="OpenVLA Architecture" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;OpenVLA 模型结构。图片来自 arXiv HTML 版论文 Figure 1。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;如果把论文原图抽象一下，整个网络其实非常清楚：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
I["RGB Image"] --&gt; D["DINOv2"]
I --&gt; S["SigLIP"]
D --&gt; F["Fused Visual Features"]
S --&gt; F
F --&gt; P["MLP Projector"]
P --&gt; L["Llama 2 7B"]
T["Language Instruction"] --&gt; L
L --&gt; A["Action Tokens"]
A --&gt; Q["Action De-Tokenizer"]
Q --&gt; R["7D Continuous Robot Action"]
&lt;/div&gt;
&lt;p&gt;OpenVLA 建立在 &lt;strong&gt;Prismatic-7B VLM&lt;/strong&gt; 上，主要由三个部分组成：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;DINOv2 + SigLIP 双视觉编码器&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MLP Projector&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Llama 2 7B&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为什么同时使用 DINOv2 和 SigLIP？&lt;/p&gt;
&lt;p&gt;可以粗略理解为：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;SigLIP&lt;/strong&gt; 更擅长语义层面的视觉—语言对齐；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DINOv2&lt;/strong&gt; 保留更丰富的空间和低层视觉信息。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;对于机器人来说，只知道：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“这是一个杯子。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;还不够。&lt;/p&gt;
&lt;p&gt;策略还需要判断：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“杯子具体在哪里？机械臂应该朝哪个方向移动？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此 OpenVLA 希望视觉表示同时包含：&lt;/p&gt;
&lt;p&gt;这是它相比单一视觉编码器很重要的设计。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-openvla-仍然把-action-当成-language-token"&gt;3. OpenVLA 仍然把 Action 当成 Language Token&lt;/h2&gt;
&lt;p&gt;这是 OpenVLA 和 RT-2 最直接的继承关系。&lt;/p&gt;
&lt;p&gt;典型机器人动作可以写成一个 7 维向量：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δx, Δy, Δz,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δroll, Δpitch, Δyaw,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;gripper
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这些值本来都是连续量。&lt;/p&gt;
&lt;p&gt;OpenVLA 不直接做连续回归，而是对每一个动作维度进行离散化：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Continuous Action"] --&gt; B["Clip by 1st–99th Percentile"]
B --&gt; C["Quantize into 256 Bins"]
C --&gt; D["Discrete Action Index"]
D --&gt; E["Language Token"]
&lt;/div&gt;
&lt;p&gt;也就是说，对于某个动作维度：&lt;/p&gt;
$$
a_i \in \mathbb{R}
$$&lt;p&gt;会被映射为：&lt;/p&gt;
$$
\hat a_i \in \{0,\ldots,255\}.
$$&lt;p&gt;这里有一个很实用的细节。&lt;/p&gt;
&lt;p&gt;OpenVLA 没有简单使用动作数据的绝对 &lt;code&gt;min/max&lt;/code&gt;，而是采用：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;1st percentile 到 99th percentile&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作为主要离散范围。&lt;/p&gt;
&lt;p&gt;原因是机器人数据中可能存在少量极端动作。如果直接使用最大值和最小值，256 个 bin 会被少数 outlier 拉得很宽，反而降低常见动作区域的分辨率。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-action-token-从哪里来"&gt;4. Action Token 从哪里来？&lt;/h2&gt;
&lt;p&gt;OpenVLA 使用 Llama 2 tokenizer。&lt;/p&gt;
&lt;p&gt;但机器人需要大约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;256 Action Tokens
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;作者采用了一个非常直接的方案：&lt;/p&gt;
&lt;p&gt;于是训练时仍然可以使用标准语言模型的 &lt;strong&gt;Next-Token Prediction&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;对于模型而言：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Image + &amp;#34;put eggplant in bowl&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;经过 Llama 2 后输出的不是自然语言：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;#34;The robot should move left...&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是类似：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;[action_132] [action_87] [action_201] ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这些 Token 再经过 de-tokenization 恢复成连续机器人控制量。&lt;/p&gt;
&lt;p&gt;因此 OpenVLA 本质上仍然是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把机器人控制问题重新写成语言模型的 Token Prediction 问题。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这正是 RT-2 建立的 VLA 范式。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="5-真正让-openvla-强起来的是-970k-robot-trajectories"&gt;5. 真正让 OpenVLA 强起来的是 970k Robot Trajectories&lt;/h2&gt;
&lt;p&gt;OpenVLA 的另一个核心是 &lt;strong&gt;Open X-Embodiment&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;论文最终整理了约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;970k robot trajectories
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;用于训练。&lt;/p&gt;
&lt;p&gt;问题在于，不同机器人数据天然是异构的：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Different Robots"] --&gt; G["OpenX Data Mixture"]
B["Different Cameras"] --&gt; G
C["Different Action Spaces"] --&gt; G
D["Different Control Frequencies"] --&gt; G
E["Different Tasks"] --&gt; G
F["Different Data Quality"] --&gt; G
G --&gt; H["Curate + Reweight"]
H --&gt; I["970k Training Trajectories"]
I --&gt; J["OpenVLA"]
&lt;/div&gt;
&lt;p&gt;所以 Robot Foundation Model 的问题已经不再只是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“数据够不够多？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;不同 embodiment、任务、相机和控制空间的数据，怎样组成一个有效的训练分布？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 对 OpenX 数据进行了筛选和重新加权，更偏好多样性较高的数据，降低重复性较强的数据权重。&lt;/p&gt;
&lt;p&gt;这也是后续跨 embodiment VLA 非常重要的一条经验。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-openvla-的训练方式其实很像-llm-fine-tuning"&gt;6. OpenVLA 的训练方式其实很像 LLM Fine-tuning&lt;/h2&gt;
&lt;p&gt;OpenVLA 并不是从零训练一个 7B 模型。&lt;/p&gt;
&lt;p&gt;它的训练路径非常直接：&lt;/p&gt;
&lt;p&gt;论文训练规模大致为：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;7B parameters
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;970k trajectories
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;27 epochs
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;64 × A100
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;≈ 2 weeks
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;一个很有意思的现象是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人数据可以被重复训练很多个 epoch，而真实性能仍然继续提升。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作者最终训练约 27 epochs，直到 Action Token Accuracy 超过 95%。&lt;/p&gt;
&lt;p&gt;这说明虽然 OpenVLA 使用的是语言模型形式的 Token Objective，但机器人 imitation learning 和互联网语言预训练的数据统计性质仍然非常不同。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="7-实验openvla-到底比-rt-2-x-强在哪里"&gt;7. 实验：OpenVLA 到底比 RT-2-X 强在哪里？&lt;/h2&gt;
&lt;p&gt;论文在多个真实机器人平台上进行评估。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2406.09246v3/x2.png" alt="OpenVLA Generalization Results" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;OpenVLA 与 RT-1-X、Octo、RT-2-X 的真实机器人泛化对比。图片来自 arXiv HTML 版论文 Figure 2。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;在 BridgeData V2 WidowX 测试中：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Average Success&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1-X&lt;/td&gt;
&lt;td style="text-align: right"&gt;18.5%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Octo&lt;/td&gt;
&lt;td style="text-align: right"&gt;20.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-X&lt;/td&gt;
&lt;td style="text-align: right"&gt;50.6%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;OpenVLA&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;70.6%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;分不同泛化维度看：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Generalization&lt;/th&gt;
&lt;th style="text-align: right"&gt;RT-2-X&lt;/th&gt;
&lt;th style="text-align: right"&gt;OpenVLA&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Visual&lt;/td&gt;
&lt;td style="text-align: right"&gt;52.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;87.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Motion&lt;/td&gt;
&lt;td style="text-align: right"&gt;55.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;60.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physical&lt;/td&gt;
&lt;td style="text-align: right"&gt;26.7%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;76.7%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Semantic&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;38.8%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;36.3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Language Grounding&lt;/td&gt;
&lt;td style="text-align: right"&gt;85.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;90.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这里最值得关注的反而不是 OpenVLA 全面领先。&lt;/p&gt;
&lt;p&gt;因为：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Semantic Generalization 上 RT-2-X 仍然略强。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;为什么？&lt;/p&gt;
&lt;p&gt;RT-2-X 在训练机器人动作时继续混入互联网 Vision-Language Data，也就是 &lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;而 OpenVLA 的路径更接近：&lt;/p&gt;
&lt;p&gt;因此 OpenVLA 在机器人 Fine-tuning 后可能遗忘一部分原本的 Web Knowledge。&lt;/p&gt;
&lt;p&gt;这与 RT-2 中的结论正好对应：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Co-Fine-Tuning 的一个重要作用，就是防止机器人训练把预训练语义知识冲掉。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-openvla-真正重要的贡献fine-tuning"&gt;8. OpenVLA 真正重要的贡献：Fine-tuning&lt;/h2&gt;
&lt;p&gt;如果你自己有一台 Franka，真正关心的问题通常不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;OpenVLA 在作者实验室跑多少分？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;我采几十条 demonstration，能不能让它学会我的任务？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 专门研究了这个问题。&lt;/p&gt;
&lt;p&gt;作者在新的 Franka setup 上使用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;10–150 demonstrations
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;进行下游 Fine-tuning，并和：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Diffusion Policy&lt;/li&gt;
&lt;li&gt;Octo&lt;/li&gt;
&lt;li&gt;OpenVLA from scratch&lt;/li&gt;
&lt;li&gt;pretrained OpenVLA&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;进行比较。&lt;/p&gt;
&lt;p&gt;结果有一个很重要的规律：&lt;/p&gt;
&lt;h3 id="narrow-single-task"&gt;Narrow Single-task&lt;/h3&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;put carrot in bowl
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这种非常窄、非常强调动作精度的任务，Diffusion Policy 依然很强。&lt;/p&gt;
&lt;h3 id="multi-task--language-grounding"&gt;Multi-task + Language Grounding&lt;/h3&gt;
&lt;p&gt;当环境开始包含：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;多个物体；&lt;/li&gt;
&lt;li&gt;多种语言指令；&lt;/li&gt;
&lt;li&gt;需要根据语言选择目标；&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;OpenVLA 的优势会更加明显。&lt;/p&gt;
&lt;p&gt;因此可以这样理解：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLA 的优势不是一定体现在最窄的单技能控制，而是在任务分布、语言条件和物体组合逐渐复杂后出现。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="9-loravla-开始真正进入普通机器人实验室"&gt;9. LoRA：VLA 开始真正进入普通机器人实验室&lt;/h2&gt;
&lt;p&gt;Full Fine-tuning 一个 7B 模型依然很贵。&lt;/p&gt;
&lt;p&gt;论文因此系统测试了参数高效微调。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Method&lt;/th&gt;
&lt;th style="text-align: right"&gt;Success&lt;/th&gt;
&lt;th style="text-align: right"&gt;Trainable Params&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Full Fine-tuning&lt;/td&gt;
&lt;td style="text-align: right"&gt;69.7%&lt;/td&gt;
&lt;td style="text-align: right"&gt;7.19B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Last Layer&lt;/td&gt;
&lt;td style="text-align: right"&gt;30.3%&lt;/td&gt;
&lt;td style="text-align: right"&gt;465M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Frozen Vision&lt;/td&gt;
&lt;td style="text-align: right"&gt;47.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;6.76B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Sandwich&lt;/td&gt;
&lt;td style="text-align: right"&gt;62.1%&lt;/td&gt;
&lt;td style="text-align: right"&gt;914M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;LoRA r=32&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;68.2%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;97.6M&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;LoRA rank 32 只训练约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1.4% parameters
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;却基本追平 Full Fine-tuning。&lt;/p&gt;
&lt;p&gt;于是一个普通实验室第一次可以形成非常现实的工作流：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Download OpenVLA"] --&gt; B["Collect Your Robot Data"]
B --&gt; C["LoRA Fine-tuning"]
C --&gt; D["New Task / New Setup"]
D --&gt; E["Deploy on Your Robot"]
&lt;/div&gt;
&lt;p&gt;这可能比某一个 benchmark 数字更重要。&lt;/p&gt;
&lt;p&gt;因为 VLA 从：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;大型实验室里的展示模型&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;开始变成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人研究者真正可以拿来二次开发的基础模型。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="10-quantization机器人模型不能只看模型大小"&gt;10. Quantization：机器人模型不能只看模型大小&lt;/h2&gt;
&lt;p&gt;OpenVLA 原始 bfloat16 推理需要大约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;15–17 GB VRAM
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;在 RTX 4090 上大约可以达到：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;6 Hz
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;作者又测试了 bfloat16、int8 和 int4。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Precision&lt;/th&gt;
&lt;th style="text-align: right"&gt;Success&lt;/th&gt;
&lt;th style="text-align: right"&gt;VRAM&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;bfloat16&lt;/td&gt;
&lt;td style="text-align: right"&gt;71.3%&lt;/td&gt;
&lt;td style="text-align: right"&gt;16.8 GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;int8&lt;/td&gt;
&lt;td style="text-align: right"&gt;58.1%&lt;/td&gt;
&lt;td style="text-align: right"&gt;10.2 GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;int4&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;71.9%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;7.0 GB&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一个很有意思的结果是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;int8 反而明显变差。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文分析认为，一个关键因素并不是数值精度本身，而是量化实现导致推理速度变化，进而改变了机器人实际控制频率。&lt;/p&gt;
&lt;p&gt;这暴露了 Robot Policy 和普通 LLM 的本质区别：&lt;/p&gt;
&lt;p&gt;所以对于机器人而言：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Inference Latency 本身就是 Policy Performance 的一部分。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="11-openvla-的局限几乎直接指向了后来的"&gt;11. OpenVLA 的局限，几乎直接指向了后来的 $\pi_0$&lt;/h2&gt;
&lt;p&gt;这是这篇论文最值得和 $\pi_0$ 连起来读的地方。&lt;/p&gt;
&lt;p&gt;OpenVLA 仍然存在几个非常明确的限制：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;主要使用单帧 RGB；&lt;/li&gt;
&lt;li&gt;缺乏更丰富的 observation history；&lt;/li&gt;
&lt;li&gt;proprioception 使用有限；&lt;/li&gt;
&lt;li&gt;基本是 single-step action prediction；&lt;/li&gt;
&lt;li&gt;Action Token 自回归生成；&lt;/li&gt;
&lt;li&gt;RTX 4090 上约 6 Hz；&lt;/li&gt;
&lt;li&gt;对高频 dexterous control 仍然有限。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;把这些问题放在一起，会得到非常自然的下一步：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
subgraph A["OpenVLA Bottlenecks"]
A1["Discrete Action Tokens"]
A2["Single-step Prediction"]
A3["Autoregressive Decoding"]
A4["Low Control Frequency"]
A5["Limited Dexterity"]
end
subgraph B["Later pi0 Direction"]
B1["Continuous Actions"]
B2["Action Chunking"]
B3["Flow Matching"]
B4["Action Expert"]
B5["High-frequency Execution"]
end
A --&gt; B
&lt;/div&gt;
&lt;p&gt;这也是为什么 $\pi_0$ 的 Action Expert、Flow Matching 和 Action Chunking 并不是突然出现的。&lt;/p&gt;
&lt;p&gt;它们实际上是在回答 OpenVLA 已经暴露出来的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;当 VLA 已经能够理解视觉和语言以后，我们还应该继续像生成文字一样，一步一步生成机器人动作吗？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="12-把-openvla-放回-vla-的发展主线"&gt;12. 把 OpenVLA 放回 VLA 的发展主线&lt;/h2&gt;
&lt;p&gt;现在这几篇论文的关系就非常清楚了：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Robot Data Scaling"] --&gt; B["RT-2&lt;br/&gt;Web Knowledge → Action"]
B --&gt; C["Open X-Embodiment / RT-X&lt;br/&gt;Cross-Embodiment Data"]
C --&gt; D["OpenVLA&lt;br/&gt;Open + Fine-tunable VLA"]
D --&gt; E["pi0&lt;br/&gt;Continuous Action + Flow Matching"]
&lt;/div&gt;
&lt;p&gt;对应的问题分别是：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;最核心的问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td&gt;一个 Transformer 能否学习大量机器人任务？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2&lt;/td&gt;
&lt;td&gt;Web Knowledge 能否迁移到 Robot Action？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Open X-Embodiment / RT-X&lt;/td&gt;
&lt;td&gt;Robot Data 能否跨 embodiment 扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;OpenVLA&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;VLA 能否开放、可微调、可部署？&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;连续高频灵巧控制应该怎样建模？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以我更愿意把 OpenVLA 的位置总结成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 证明了 VLA；OpenVLA 把 VLA 变成了开放的研究基础设施；$\pi_0$ 开始重新设计 VLA 的 Action Generation。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-openvla"&gt;最后，用一句话理解 OpenVLA&lt;/h2&gt;
&lt;p&gt;RT-2 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Vision-Language Model 可以通过 Action Token 直接变成 Robot Policy。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 进一步证明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这种 VLA 可以建立在开放 VLM 和 Open X-Embodiment 上，并通过标准的 Fine-tuning、LoRA 和 Quantization 工具链适配到新的机器人和任务。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但它也留下了一个非常关键的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;离散、自回归、单步 Action Token，真的是机器人动作最合适的表示方式吗？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这个问题，正好把阅读路线自然地引向后面的：&lt;/p&gt;
$$
\pi_0.
$$</description></item><item><title>RT-1 精读：Transformer 如何学会控制真实机器人</title><link>https://xht252.github.io/blog/vla/rt1/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/rt1/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Anthony Brohan et al., &lt;em&gt;RT-1: Robotics Transformer for Real-World Control at Scale&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-1 是一篇非常适合作为 &lt;strong&gt;Robot Foundation Model / Vision-Language-Action（VLA）&lt;/strong&gt; 入门的论文。&lt;/p&gt;
&lt;p&gt;如果只用一句话概括：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-1 用大规模、多任务的真实机器人示范数据训练一个语言条件 Transformer，让同一个策略直接从图像和自然语言指令预测机器人动作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它真正重要的地方并不是“Transformer 也可以控制机器人”，而是开始验证一个更大的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人策略能不能像大语言模型一样，通过更大的数据规模、更高的任务多样性和足够强的模型容量，获得更好的泛化能力？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer1.github.io/img/rt1_teaser.png" alt="RT-1 Overview" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-1 的整体目标：从大规模真实机器人数据中学习一个可以泛化到新任务、新物体和新场景的统一策略。图片来自 RT-1 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-rt-1-到底在做什么"&gt;1. RT-1 到底在做什么？&lt;/h2&gt;
&lt;p&gt;RT-1 学习的是一个端到端机器人策略。&lt;/p&gt;
&lt;p&gt;输入主要包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;最近 &lt;strong&gt;6 帧 RGB 图像&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;一条自然语言指令，例如 &lt;code&gt;pick apple&lt;/code&gt;、&lt;code&gt;open the drawer&lt;/code&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;输出是机器人当前应该执行的动作，包括机械臂位姿变化、夹爪开合、移动底盘动作和任务终止信号。&lt;/p&gt;
&lt;p&gt;整个过程可以概括为：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Language Instruction"] --&gt; C["FiLM-EfficientNet"]
B["6-frame RGB History"] --&gt; C
C --&gt; D["TokenLearner"]
D --&gt; E["Transformer"]
E --&gt; F["Action Tokens"]
F --&gt; G["Robot Execution"]
&lt;/div&gt;
&lt;p&gt;RT-1 没有显式地图，没有单独的路径规划器，也不像 Dreamer 一样先学习世界模型再 imagined rollout。&lt;/p&gt;
&lt;p&gt;它做的事情很直接：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;根据当前看到的图像和任务指令，直接预测下一步动作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="2-rt-1-最核心的东西其实是数据"&gt;2. RT-1 最核心的东西其实是数据&lt;/h2&gt;
&lt;p&gt;RT-1 使用 &lt;strong&gt;13 台真实机器人&lt;/strong&gt;，持续约 &lt;strong&gt;17 个月&lt;/strong&gt;收集数据，最终得到约 &lt;strong&gt;13 万条真实机器人 episode&lt;/strong&gt;，覆盖 &lt;strong&gt;700+ 个任务&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这些任务包括：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick object
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;place object
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;open / close drawer
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move object near another object
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;put object into drawer
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;knock object over
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;真正值得关注的不是“700”这个数字，而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这些任务之间存在大量可以复用的行为结构。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如训练数据中可能出现：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick coke can
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick apple
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move apple near bottle
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型反复看到的是不同的：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;skill + object + scene
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;组合。&lt;/p&gt;
&lt;p&gt;因此测试时，即使某条完整指令没有在训练集中出现，模型仍然可能重新组合已经学过的 skill、object 和 scene。&lt;/p&gt;
&lt;p&gt;这个过程可以这样理解：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["Many Robot Demonstrations"] --&gt; B["Reusable Skills"]
A --&gt; C["Object Concepts"]
A --&gt; D["Scene Context"]
B --&gt; E["Shared Multi-task Policy"]
C --&gt; E
D --&gt; E
E --&gt; F["New Skill–Object–Scene Combination"]
F --&gt; G["Compositional Generalization"]
&lt;/div&gt;
&lt;p&gt;所以 RT-1 并不是希望机器人“记住 700 个任务”。&lt;/p&gt;
&lt;p&gt;它真正想验证的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;一个统一策略能否从大量任务中学习到可以跨任务复用的行为表示。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="3-模型结构其实只需要理解四步"&gt;3. 模型结构：其实只需要理解四步&lt;/h2&gt;
&lt;p&gt;RT-1 约有 &lt;strong&gt;35M 参数&lt;/strong&gt;，并且需要在真实机器人上以大约 &lt;strong&gt;3 Hz&lt;/strong&gt; 的频率进行闭环控制。&lt;/p&gt;
&lt;p&gt;因此它不是简单堆一个更大的 Transformer，而是在：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;模型容量 ↔ 实时推理速度&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;之间做平衡。&lt;/p&gt;
&lt;p&gt;完整结构如下：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEj11ho9tm4Td7ByTigAgDxFWsxbsZ6tQsAng3AtwuufHRuoLaLOV9YN7FUMyyAhefzuFOVCrbwTLsEaRYidOOToS__KRrotot-6aBxTliZxYz-B2jiJG-4myq5NB3vRKaY86nr5y1-13dBv_H_XyfnDijphCM3UBalczim0PeGJ63Z0Ok6k9zvKQ2D55A/s16000/image1.png" alt="RT-1 Architecture" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-1 的模型结构：语言指令通过 USE 编码，并通过 FiLM 调制 EfficientNet；视觉特征经 TokenLearner 压缩后送入 Transformer，最终输出离散动作 token。图片来自 Google Research 官方博客。&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="31-language--universal-sentence-encoder"&gt;3.1 Language → Universal Sentence Encoder&lt;/h3&gt;
&lt;p&gt;自然语言指令首先经过预训练的 &lt;strong&gt;Universal Sentence Encoder（USE）&lt;/strong&gt;，得到语言 embedding。&lt;/p&gt;
&lt;p&gt;RT-1 并没有依靠机器人数据从零学习语言，而是直接利用已经训练好的语言语义表示。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="32-film-efficientnet让视觉特征被任务条件化"&gt;3.2 FiLM-EfficientNet：让视觉特征被任务条件化&lt;/h3&gt;
&lt;p&gt;每帧 RGB 图像经过 ImageNet 预训练的 &lt;strong&gt;EfficientNet-B3&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这里真正关键的是 &lt;strong&gt;FiLM&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;语言 embedding 会直接调制 EfficientNet 中间的视觉特征：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Instruction&lt;br/&gt;pick apple"] --&gt; B["USE Language Embedding"]
C["RGB Image"] --&gt; D["EfficientNet-B3"]
B --&gt; E["FiLM Modulation"]
D --&gt; E
E --&gt; F["Task-conditioned Visual Features"]
F --&gt; G["Focus on Task-relevant Information"]
&lt;/div&gt;
&lt;p&gt;因此 RT-1 并不是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;先看图 → 最后再拼语言
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是一种明显的 &lt;strong&gt;early language fusion&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;视觉编码过程本身就已经被当前任务条件化。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="33-tokenlearner81--8"&gt;3.3 TokenLearner：81 → 8&lt;/h3&gt;
&lt;p&gt;EfficientNet 最终得到一个：&lt;/p&gt;
$$
9\times9\times512
$$&lt;p&gt;的空间特征图。&lt;/p&gt;
&lt;p&gt;展平以后，每帧有：&lt;/p&gt;
$$
9\times9=81
$$&lt;p&gt;个视觉 token。&lt;/p&gt;
&lt;p&gt;RT-1 一次输入 6 帧，因此如果不压缩：&lt;/p&gt;
$$
6\times81=486
$$&lt;p&gt;个 token 会全部进入 Transformer。&lt;/p&gt;
&lt;p&gt;为满足实时控制要求，RT-1 使用 &lt;strong&gt;TokenLearner&lt;/strong&gt;，把每帧：&lt;/p&gt;
$$
81\rightarrow8.
$$&lt;p&gt;于是最终：&lt;/p&gt;
$$
6\times8=48
$$&lt;p&gt;个视觉 token 进入 Transformer。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["One Frame&lt;br/&gt;9 × 9 = 81 Tokens"] --&gt; B["TokenLearner"]
B --&gt; C["8 Learned Tokens / Frame"]
C --&gt; D["6 Frames"]
D --&gt; E["48 Tokens Total"]
E --&gt; F["Transformer"]
&lt;/div&gt;
&lt;p&gt;这一步非常关键。&lt;/p&gt;
&lt;p&gt;TokenLearner 不是简单 resize 或 average pooling，而是学习：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;当前任务中哪些视觉信息最值得保留。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以它同时解决了两个问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;保留任务相关视觉信息；&lt;/li&gt;
&lt;li&gt;显著降低 Transformer 计算量。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h3 id="34-transformer--action"&gt;3.4 Transformer → Action&lt;/h3&gt;
&lt;p&gt;最后，48 个视觉—语言 token 被送入一个 &lt;strong&gt;8 层 decoder-only Transformer&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Transformer 输出的不是文本，而是机器人动作。&lt;/p&gt;
&lt;p&gt;因此 RT-1 本质上把机器人控制重新写成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Task-conditioned Visual Tokens"] --&gt; B["8-layer Decoder-only Transformer"]
B --&gt; C["Action Tokens"]
C --&gt; D["Robot Control"]
&lt;/div&gt;
&lt;p&gt;这就是 &lt;strong&gt;Robotics Transformer&lt;/strong&gt; 这个名字最直接的含义：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 Robot Policy 看成一个序列建模问题。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="4-为什么要把机器人动作也变成-token"&gt;4. 为什么要把机器人动作也变成 Token？&lt;/h2&gt;
&lt;p&gt;这是 RT-1 中非常值得记住的设计。&lt;/p&gt;
&lt;p&gt;机器人机械臂和移动底盘本来都是连续控制量，但 RT-1 没有直接进行连续值回归，而是把每一个连续动作维度划分为：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;256 bins
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;整个过程可以写成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Continuous Action"] --&gt; B["Quantize"]
B --&gt; C["256 Discrete Bins"]
C --&gt; D["Categorical Prediction"]
D --&gt; E["Action Token"]
E --&gt; F["Robot Action"]
&lt;/div&gt;
&lt;p&gt;为什么这样设计？&lt;/p&gt;
&lt;p&gt;一个重要原因是机器人示范数据具有明显的 &lt;strong&gt;multi-modality&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;例如抓取同一个物体：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;可以从左边接近；&lt;/li&gt;
&lt;li&gt;可以从右边接近；&lt;/li&gt;
&lt;li&gt;可以采用不同末端执行器姿态。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些动作都可能是合理的。&lt;/p&gt;
&lt;p&gt;如果使用简单的 Gaussian 去拟合连续动作，模型可能预测多个合理动作之间的“平均值”，而这个平均值反而可能不是一个好动作。&lt;/p&gt;
&lt;p&gt;离散 categorical distribution 则可以更自然地表达多个可能的动作模式。&lt;/p&gt;
&lt;p&gt;论文消融也显示，替换成连续动作输出后性能明显下降。&lt;/p&gt;
&lt;p&gt;所以 RT-1 给出了一个后续 VLA 一直在讨论的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Action Representation 并不是实现细节，而是会直接决定机器人策略能够表达怎样的行为分布。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这条线后来会继续演化：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1 / RT-2&lt;br/&gt;Discrete Action Tokens"] --&gt; B["OpenVLA&lt;br/&gt;Open Autoregressive Action Tokens"]
B --&gt; C["pi0&lt;br/&gt;Continuous Action + Flow Matching"]
&lt;/div&gt;
&lt;hr&gt;
&lt;h2 id="5-实验结果重点看泛化而不是-seen-task"&gt;5. 实验结果：重点看泛化，而不是 Seen Task&lt;/h2&gt;
&lt;p&gt;论文在真实机器人上进行了超过 &lt;strong&gt;3000 次 rollout&lt;/strong&gt;，主要测试：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Seen Tasks&lt;/strong&gt;：训练中出现过；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Unseen Tasks&lt;/strong&gt;：新的任务组合；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Distractors&lt;/strong&gt;：加入额外干扰物；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Backgrounds&lt;/strong&gt;：改变环境背景。&lt;/li&gt;
&lt;/ul&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Seen&lt;/th&gt;
&lt;th style="text-align: right"&gt;Unseen&lt;/th&gt;
&lt;th style="text-align: right"&gt;Distractors&lt;/th&gt;
&lt;th style="text-align: right"&gt;Backgrounds&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Gato&lt;/td&gt;
&lt;td style="text-align: right"&gt;65%&lt;/td&gt;
&lt;td style="text-align: right"&gt;52%&lt;/td&gt;
&lt;td style="text-align: right"&gt;43%&lt;/td&gt;
&lt;td style="text-align: right"&gt;35%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BC-Z&lt;/td&gt;
&lt;td style="text-align: right"&gt;72%&lt;/td&gt;
&lt;td style="text-align: right"&gt;19%&lt;/td&gt;
&lt;td style="text-align: right"&gt;47%&lt;/td&gt;
&lt;td style="text-align: right"&gt;41%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BC-Z XL&lt;/td&gt;
&lt;td style="text-align: right"&gt;56%&lt;/td&gt;
&lt;td style="text-align: right"&gt;43%&lt;/td&gt;
&lt;td style="text-align: right"&gt;23%&lt;/td&gt;
&lt;td style="text-align: right"&gt;35%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-1&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;97%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;76%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;83%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;59%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;论文的主要对比如下：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer1.github.io/img/main_baselines.png" alt="RT-1 Main Results" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-1 与 Gato、BC-Z 和 BC-Z XL 在 Seen Tasks、Unseen Tasks、Distractors 与 Backgrounds 四类场景中的成功率对比。图片来自 RT-1 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;真正值得看的并不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Seen = 97%&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是另外三个结果。&lt;/p&gt;
&lt;h3 id="unseen-tasks76"&gt;Unseen Tasks：76%&lt;/h3&gt;
&lt;p&gt;说明 RT-1 可以一定程度上重新组合训练中学到的技能、物体和任务结构，而不是只记忆完整指令。&lt;/p&gt;
&lt;h3 id="distractors83"&gt;Distractors：83%&lt;/h3&gt;
&lt;p&gt;说明加入额外无关物体后，策略仍具有较强鲁棒性。&lt;/p&gt;
&lt;h3 id="backgrounds59"&gt;Backgrounds：59%&lt;/h3&gt;
&lt;p&gt;这个结果一方面优于基线，另一方面也说明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;视觉环境发生较大变化后，RT-1 仍然明显受到 distribution shift 影响。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以 RT-1 的泛化更准确地说是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在大规模但仍有限的机器人数据分布附近，获得更好的组合泛化和场景鲁棒性。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而不是今天所说的完全开放世界泛化。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-rt-1-真正重要的不是某一个模块而是-scaling-思想"&gt;6. RT-1 真正重要的不是某一个模块，而是 Scaling 思想&lt;/h2&gt;
&lt;p&gt;如果只记：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;EfficientNet
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;TokenLearner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;8-layer Transformer
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;256 Action Bins
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;很容易错过这篇论文真正重要的地方。&lt;/p&gt;
&lt;p&gt;RT-1 想验证的是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["More Diverse Robot Data"] --&gt; B["One Shared Multi-task Policy"]
B --&gt; C["Knowledge Sharing Across Tasks"]
C --&gt; D["Better Generalization"]
D --&gt; E["Absorb More Data Sources"]
E --&gt; A
&lt;/div&gt;
&lt;p&gt;论文后面还测试了：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;simulation data；&lt;/li&gt;
&lt;li&gt;另一种 Kuka 机器人数据；&lt;/li&gt;
&lt;li&gt;与 SayCan 的组合。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些实验不是理解 RT-1 架构所必需的，但它们共同指向一个很重要的趋势：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;统一机器人策略可能从不同任务、不同数据源，甚至不同机器人 embodiment 中吸收可迁移知识。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就已经开始接近后来 Robot Foundation Model 的基本思想。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="7-把-rt-1-放回-vla-的发展路线"&gt;7. 把 RT-1 放回 VLA 的发展路线&lt;/h2&gt;
&lt;p&gt;从今天回头看 RT-1，会发现它是后续很多 VLA 工作的重要起点。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;2022&lt;br/&gt;Scale Robot Data"]
--&gt; B["RT-2&lt;br/&gt;2023&lt;br/&gt;Web Knowledge → Action"]
--&gt; C["Open X-Embodiment / RT-X&lt;br/&gt;Cross-Embodiment Data"]
--&gt; D["OpenVLA&lt;br/&gt;2024&lt;br/&gt;Open + Fine-tunable VLA"]
--&gt; E["pi0&lt;br/&gt;2024&lt;br/&gt;Continuous Dexterous Control"]
&lt;/div&gt;
&lt;p&gt;对应的核心问题也在不断变化：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;核心问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-1&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;一个统一策略能否从大规模机器人数据中学习大量任务？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2&lt;/td&gt;
&lt;td&gt;Web Vision-Language Knowledge 能否迁移到 Robot Action？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Open X-Embodiment / RT-X&lt;/td&gt;
&lt;td&gt;Robot Data 能否跨 embodiment 扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLA&lt;/td&gt;
&lt;td&gt;VLA 能否开放、微调和部署？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;VLA 如何实现连续、高频、灵巧控制？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以 RT-1 的历史位置可以概括成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;它把“机器人策略能否随着数据和任务规模一起扩展”这个问题真正摆到了桌面上。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话重新理解-rt-1"&gt;最后，用一句话重新理解 RT-1&lt;/h2&gt;
&lt;p&gt;读完整篇论文以后，我会把 RT-1 概括为：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-1 的核心不是提出一个特别复杂的机器人网络，而是证明：当真实机器人数据的规模和多样性足够大，并用一个能够有效吸收这些数据的统一 Transformer 策略进行训练时，机器人控制也开始出现类似 Foundation Model 的 scaling 与泛化趋势。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果继续沿着这条路线读，下一篇最自然的是 &lt;strong&gt;RT-2&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Learn from Robot Experience"] --&gt; B["RT-2&lt;br/&gt;Bring Web Knowledge into Action"]
&lt;/div&gt;
&lt;p&gt;RT-1 解决的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何从大量机器人经验中学习统一策略？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 则进一步追问：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能把互联网规模的视觉—语言知识，直接带进机器人动作空间？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item><item><title>RT-2 精读：从 Vision-Language Model 到 Vision-Language-Action</title><link>https://xht252.github.io/blog/vla/rt2/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/rt2/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Anthony Brohan et al., &lt;em&gt;RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Blog:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果 RT-1 解决的问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能用一个统一的 Transformer，从大规模、多任务机器人数据中直接学习机器人策略？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 RT-2 继续追问：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能把互联网规模的视觉—语言知识，直接迁移到机器人动作空间？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 给出的答案非常直接：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把机器人动作也表示成 Token，然后让一个预训练 Vision-Language Model 同时学习“回答问题”和“输出机器人动作”。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就是论文中提出的 &lt;strong&gt;Vision-Language-Action Model，VLA&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer2.github.io/img/fig1.png" alt="RT-2 Overview" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-2 的核心思路：将互联网视觉语言数据与机器人动作数据共同训练，使预训练 VLM 直接变成可以控制机器人的 VLA。图片来自 RT-2 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-从-rt-1-到-rt-2真正发生了什么变化"&gt;1. 从 RT-1 到 RT-2，真正发生了什么变化？&lt;/h2&gt;
&lt;p&gt;RT-1 已经证明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;大规模、多任务机器人数据可以训练出一个具有一定泛化能力的统一策略。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但 RT-1 有一个明显的边界：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;它知道的世界，基本仍然来自机器人自己见过的数据。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;即使 RT-1 已经收集了 13 台机器人、17 个月、约 13 万条示范，与互联网规模的图像和文本数据相比仍然非常小。&lt;/p&gt;
&lt;p&gt;真实机器人很难通过亲自交互覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;所有物体；&lt;/li&gt;
&lt;li&gt;所有环境；&lt;/li&gt;
&lt;li&gt;所有语言表达；&lt;/li&gt;
&lt;li&gt;所有语义关系；&lt;/li&gt;
&lt;li&gt;所有常识。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;而大型 Vision-Language Model 已经通过互联网数据学到了大量这些知识。&lt;/p&gt;
&lt;p&gt;所以 RT-2 的核心思路变成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Internet-scale&lt;br/&gt;Vision-Language Knowledge"] --&gt; C["Pre-trained VLM"]
B["Robot Experience"] --&gt; C
C --&gt; D["Vision-Language-Action Model"]
D --&gt; E["Robot Control"]
&lt;/div&gt;
&lt;p&gt;RT-2 不再从头训练一个机器人 Transformer，而是直接从大型预训练 VLM 出发。&lt;/p&gt;
&lt;p&gt;论文主要使用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;PaLI-X&lt;/strong&gt;：5B 和 55B 版本；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;PaLM-E&lt;/strong&gt;：主要使用 12B 版本。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;于是 RT-1 和 RT-2 的差别可以简单总结为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;RT-1&lt;/th&gt;
&lt;th&gt;RT-2&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;知识来源&lt;/td&gt;
&lt;td&gt;Robot Data&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web Data + Robot Data&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;Robot Transformer&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Pre-trained VLM&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输入&lt;/td&gt;
&lt;td&gt;Image + Language&lt;/td&gt;
&lt;td&gt;Image + Language&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输出&lt;/td&gt;
&lt;td&gt;Action Tokens&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Text-form Action Tokens&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;重点&lt;/td&gt;
&lt;td&gt;多任务 Robot Policy&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web Knowledge → Robot Action&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;核心概念&lt;/td&gt;
&lt;td&gt;Robotics Transformer&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Vision-Language-Action&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="2-rt-2-最关键的一步把-action-当成-language"&gt;2. RT-2 最关键的一步：把 Action 当成 Language&lt;/h2&gt;
&lt;p&gt;理解 RT-2，其实真正需要理解的只有一件事：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人动作怎样进入 VLM 的输出空间？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;传统 VLM 做的是：&lt;/p&gt;
&lt;p&gt;传统 VLM 可以概括为 &lt;strong&gt;Image + Text → VLM → Text Tokens&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Q: What is in the image?
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;A: A red apple.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而机器人策略需要：&lt;/p&gt;
&lt;p&gt;而机器人策略需要的是 &lt;strong&gt;Robot Image + Instruction → Policy → Robot Action&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;问题就在这里：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;VLM 原本输出的是 &lt;strong&gt;Language Tokens&lt;/strong&gt;，而机器人需要的是连续控制量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 没有另外设计一个复杂的 Action Head。&lt;/p&gt;
&lt;p&gt;它直接把 Robot Action 也编码成 Token。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer2.github.io/img/fig3.png" alt="RT-2 Action Representation" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-2 的动作表示：终止标志、三维位置变化、三维旋转变化和夹爪状态共同组成一个机器人动作。图片来自 RT-2 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;RT-2 延续 RT-1 的动作空间：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Terminate / Continue
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Position X
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Position Y
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Position Z
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Rotation X
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Rotation Y
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Rotation Z
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Gripper
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;连续动作维度被离散为 &lt;strong&gt;256 bins&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Continuous Robot Action"] --&gt; B["Quantize Each Dimension"]
B --&gt; C["256 Bins"]
C --&gt; D["Integer Action IDs"]
D --&gt; E["Text-form Action Tokens"]
&lt;/div&gt;
&lt;p&gt;一个动作于是可以写成类似：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1 128 91 241 5 101 127 217
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;对于模型来说：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;#34;The object is an apple.&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;和：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;#34;1 128 91 241 5 101 127 217&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;本质上都变成了同一件事：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Next-Token Prediction&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一步非常关键。&lt;/p&gt;
&lt;p&gt;因为一旦 Action 和 Language 共享同一个 Token Interface：&lt;/p&gt;
&lt;p&gt;因此，一个关键变化是让 Language 与 Action 共享同一种 Token Interface：VLM 既可以生成文本，也可以生成机器人动作 Token。&lt;/p&gt;
&lt;p&gt;原本负责图像理解、视觉问答和语言推理的 VLM，就可以在不重构整个网络的情况下被训练成机器人策略。&lt;/p&gt;
&lt;p&gt;这就是 &lt;strong&gt;Vision-Language-Action&lt;/strong&gt; 的核心。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-co-fine-tuning学会-action-的同时不要忘掉-web-knowledge"&gt;3. Co-Fine-Tuning：学会 Action 的同时不要忘掉 Web Knowledge&lt;/h2&gt;
&lt;p&gt;如果直接拿一个 VLM，只用机器人数据进行 Fine-tuning，会产生一个问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;模型可能逐渐忘掉预训练阶段从互联网中学到的视觉和语言知识。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但 RT-2 的目的恰恰是利用这些知识。&lt;/p&gt;
&lt;p&gt;因此论文采用 &lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;：&lt;/p&gt;
&lt;p&gt;训练后，同一个模型同时保留 Vision→Language、Semantic Reasoning 和 Vision+Language→Action 三类能力。&lt;/p&gt;
&lt;p&gt;训练过程中同时存在两类样本。&lt;/p&gt;
&lt;h3 id="普通-vision-language-数据"&gt;普通 Vision-Language 数据&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Image + Question
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Natural Language Answer
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="robot-数据"&gt;Robot 数据&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Robot Image + Instruction
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Action Tokens
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;因此同一个模型同时保留：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Vision"] --&gt; D["RT-2 Representation"]
B["Language"] --&gt; D
C["Robot Experience"] --&gt; D
D --&gt; E["Vision → Language"]
D --&gt; F["Semantic Reasoning"]
D --&gt; G["Vision + Language → Action"]
&lt;/div&gt;
&lt;p&gt;这也是 RT-2 与“拿一个预训练视觉 Encoder 接到 Robot Policy 前面”最大的不同：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 希望保留整个 VLM 已经学到的视觉—语言知识，而不只是借一个视觉特征提取器。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文消融结果也很清楚：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;RT-2-PaLI-X&lt;/th&gt;
&lt;th style="text-align: right"&gt;Size&lt;/th&gt;
&lt;th&gt;Training&lt;/th&gt;
&lt;th style="text-align: right"&gt;Unseen Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;From scratch&lt;/td&gt;
&lt;td style="text-align: right"&gt;5B&lt;/td&gt;
&lt;td&gt;Robot data&lt;/td&gt;
&lt;td style="text-align: right"&gt;9%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fine-tuning&lt;/td&gt;
&lt;td style="text-align: right"&gt;5B&lt;/td&gt;
&lt;td&gt;Robot data&lt;/td&gt;
&lt;td style="text-align: right"&gt;42%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;5B&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web + Robot&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;44%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fine-tuning&lt;/td&gt;
&lt;td style="text-align: right"&gt;55B&lt;/td&gt;
&lt;td&gt;Robot data&lt;/td&gt;
&lt;td style="text-align: right"&gt;52%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;55B&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web + Robot&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;63%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最值得记住的是三个趋势：&lt;/p&gt;
&lt;p&gt;因此，预训练、Co-Fine-Tuning 和模型规模共同决定了 RT-2 的泛化能力。&lt;/p&gt;
&lt;p&gt;RT-2 的泛化能力并不是简单来自“更多 Robot Data”，而是开始真正利用 &lt;strong&gt;Foundation Model Knowledge&lt;/strong&gt;。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-实验到底证明了什么"&gt;4. 实验到底证明了什么？&lt;/h2&gt;
&lt;p&gt;RT-2 做了超过 &lt;strong&gt;6000 次真实机器人 evaluation trials&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;快速精读时不需要看完所有实验，只需要回答两个问题。&lt;/p&gt;
&lt;h3 id="41-基本机器人控制有没有因为换成大-vlm-而变差"&gt;4.1 基本机器人控制有没有因为换成大 VLM 而变差？&lt;/h3&gt;
&lt;p&gt;Seen Tasks：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Seen Tasks&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;92%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-PaLI-X-55B&lt;/td&gt;
&lt;td style="text-align: right"&gt;91%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-PaLM-E-12B&lt;/td&gt;
&lt;td style="text-align: right"&gt;93%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;基本没有。&lt;/p&gt;
&lt;p&gt;所以引入大型 VLM 后，RT-2 仍然保持了与 RT-1 接近的机器人控制能力。&lt;/p&gt;
&lt;h3 id="42-web-knowledge-有没有真正迁移到机器人"&gt;4.2 Web Knowledge 有没有真正迁移到机器人？&lt;/h3&gt;
&lt;p&gt;论文重点测试：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Unseen Objects
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Unseen Backgrounds
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Unseen Environments
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;平均结果：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Unseen Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;R3M&lt;/td&gt;
&lt;td style="text-align: right"&gt;12%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VC-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;10%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;32%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MOO&lt;/td&gt;
&lt;td style="text-align: right"&gt;35%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2-PaLI-X-55B&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;62%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2-PaLM-E-12B&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;62%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最关键的变化是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Seen Task 几乎没有损失，但 Unseen Average 从 RT-1 的 32% 提升到了 62%。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;可以把 RT-2 的实验结论概括成：&lt;/p&gt;
&lt;p&gt;实验上可以把 RT-2 理解为：&lt;strong&gt;Web 预训练提供语义/视觉知识，Robot Data 提供物理技能，两者在同一个 VLA 中结合。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;所以 RT-2 的价值不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“把机器人已经会做的事情做得更准。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让机器人可以利用 VLM 中已经存在的知识，处理机器人训练数据没有充分覆盖的新物体、新背景和新环境。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="5-什么叫-rt-2-的-emergent-capability"&gt;5. 什么叫 RT-2 的 Emergent Capability？&lt;/h2&gt;
&lt;p&gt;这是整篇论文最有意思的部分之一。&lt;/p&gt;
&lt;p&gt;研究者故意给机器人一些在机器人训练数据中没有直接出现过的语义任务。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move apple to 3
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型必须先理解数字符号，然后把这个理解转成机器人动作。&lt;/p&gt;
&lt;p&gt;或者：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move banana to the sum of two plus one
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里需要先完成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;2 + 1 = 3
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后再把 banana 移到数字 3。&lt;/p&gt;
&lt;p&gt;再比如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick up the bag about to fall off the table
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型不仅要识别 &lt;code&gt;bag&lt;/code&gt;，还需要理解：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;哪个 bag 处于“快掉下桌子”的状态？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文主要测试：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Symbol Understanding&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Reasoning&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Person Recognition&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;结果：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Emergent Task Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;VC-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;11%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;17%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-PaLM-E-12B&lt;/td&gt;
&lt;td style="text-align: right"&gt;40%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2-PaLI-X-55B&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;60%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;但这里必须注意一个非常重要的边界：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Web pre-training 并没有让机器人凭空学会新的运动技能。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正迁移过来的主要是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Web Pre-training"] --&gt; B["Semantic Concepts"]
A --&gt; C["Visual Concepts"]
A --&gt; D["Relations"]
A --&gt; E["Reasoning"]
A --&gt; F["World Knowledge"]
B --&gt; G["New Semantic Conditions"]
C --&gt; G
D --&gt; G
E --&gt; G
F --&gt; G
H["Robot Data"] --&gt; I["Physical Motor Skills"]
G --&gt; J["RT-2 Behavior"]
I --&gt; J
&lt;/div&gt;
&lt;p&gt;也就是说：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 更像是在把已有的 Robot Skills 应用到过去没见过的语义条件上，而不是从 Web 数据里凭空学会新的 motor skill。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这个区别非常重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-chain-of-thought-也开始进入机器人控制"&gt;6. Chain-of-Thought 也开始进入机器人控制&lt;/h2&gt;
&lt;p&gt;RT-2 还尝试把中间的自然语言 &lt;code&gt;Plan&lt;/code&gt; 和 Action 放在同一个生成序列中。&lt;/p&gt;
&lt;p&gt;普通 RT-2：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Instruction → Action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;加入 Plan 后：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Instruction"] --&gt; B["VLA"]
B --&gt; C["Plan Tokens"]
C --&gt; D["Action Tokens"]
D --&gt; E["Robot Execution"]
&lt;/div&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Instruction:
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;I need to hammer a nail,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;what object from the scene might be useful?
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Plan:
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;rock
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action:
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1 129 138 ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer2.github.io/img/CoT5.png" alt="RT-2 Chain-of-Thought" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-2 将自然语言 Plan 与 Action Token 放在同一个生成序列中，展示了将语义推理和机器人控制统一到同一个自回归模型中的可能性。图片来自 RT-2 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这和 SayCan 的思路并不一样。&lt;/p&gt;
&lt;p&gt;SayCan 更接近：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;LLM → High-level Skill Selection → Separate Low-level Policy
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而 RT-2 尝试的是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Vision + Language"] --&gt; B["Single VLA"]
B --&gt; C["Reasoning / Plan Tokens"]
C --&gt; D["Action Tokens"]
D --&gt; E["Robot Control"]
&lt;/div&gt;
&lt;p&gt;也就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Reasoning → Planning → Action 开始有可能出现在同一个 token-generation framework 中。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="7-rt-2-真正重要在哪里"&gt;7. RT-2 真正重要在哪里？&lt;/h2&gt;
&lt;p&gt;如果只看网络结构，RT-2 甚至没有特别复杂。&lt;/p&gt;
&lt;p&gt;它最核心的操作其实只有：&lt;/p&gt;
&lt;p&gt;相比 SayCan 的“LLM 选技能 + 独立低层策略”，RT-2 更进一步尝试把 Reasoning / Plan Tokens 与 Action Tokens 放进同一个生成模型。&lt;/p&gt;
&lt;p&gt;但这个接口把两个以前相对分离的世界连接了起来：&lt;/p&gt;
&lt;p&gt;RT-2 的方法可以概括为：&lt;strong&gt;Pre-trained VLM + Robot Action Tokens + Web/Robot Co-Fine-Tuning → VLA&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;所以 RT-2 最重要的贡献不是某个 Transformer Block，而是一种范式变化：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人策略不一定要从头学习整个世界。可以先让 Foundation Model 从互联网中学习视觉、语言和常识，再通过机器人数据把这些知识 Ground 到 Action Space。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是后来 VLA 路线最核心的思想之一。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="8-rt-2-的局限也直接指向了后续-openvla-和"&gt;8. RT-2 的局限，也直接指向了后续 OpenVLA 和 $\pi_0$&lt;/h2&gt;
&lt;p&gt;RT-2 并没有解决所有问题。&lt;/p&gt;
&lt;h3 id="第一模型非常大"&gt;第一，模型非常大&lt;/h3&gt;
&lt;p&gt;最大的 RT-2-PaLI-X 有：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;55B parameters
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型需要运行在多 TPU Cloud Service 上，再通过网络给机器人提供推理。&lt;/p&gt;
&lt;p&gt;控制频率大约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;55B → 1–3 Hz
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;5B → ~5 Hz
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这暴露出一个非常现实的矛盾：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Foundation Model 越大，实时 Robot Control 越困难。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="第二physical-skill-仍然依赖-robot-data"&gt;第二，Physical Skill 仍然依赖 Robot Data&lt;/h3&gt;
&lt;p&gt;RT-2 可以理解：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;rock can be used as a hammer
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;但并不意味着它会自动学会一套从未示范过的复杂 hammering motion。&lt;/p&gt;
&lt;p&gt;可以把这一边界理解为：&lt;/p&gt;
&lt;p&gt;它真正连接的是两个世界：Foundation Model 提供 Vision、Language、World Knowledge 与 Reasoning；Robot Data 则把这些能力 Ground 到 Physical Action 和 Closed-loop Control。&lt;/p&gt;
&lt;p&gt;所以 VLM 主要扩展的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;语义与世界知识&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而真正的 physical execution 仍然需要大量 Robot Data。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-把-rt-2-放回-vla-的技术发展路线"&gt;9. 把 RT-2 放回 VLA 的技术发展路线&lt;/h2&gt;
&lt;p&gt;现在可以把 RT-2 放到整个 VLA 演化中来看：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;2022&lt;br/&gt;Scale Robot Data"]
--&gt; B["RT-2&lt;br/&gt;2023&lt;br/&gt;Web Knowledge → Action"]
--&gt; C["Open X-Embodiment / RT-X&lt;br/&gt;Cross-Embodiment Robot Data"]
--&gt; D["OpenVLA&lt;br/&gt;2024&lt;br/&gt;Open + Fine-tunable VLA"]
--&gt; E["pi0&lt;br/&gt;2024&lt;br/&gt;Continuous Dexterous Control"]
&lt;/div&gt;
&lt;p&gt;这几篇论文分别在回答不同的问题：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;核心问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td&gt;Robot Policy 能否随着机器人数据和任务规模扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web Knowledge 能否直接 Ground 到 Robot Action？&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Open X-Embodiment / RT-X&lt;/td&gt;
&lt;td&gt;Robot Data 能否跨 embodiment 扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLA&lt;/td&gt;
&lt;td&gt;VLA 能否开放、微调和部署？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;VLA 如何实现连续、高频、灵巧控制？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以从今天回头看，RT-2 的历史位置非常明确：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;它真正建立了 Vision + Language → Action 这条 VLA 主线。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-rt-2"&gt;最后，用一句话理解 RT-2&lt;/h2&gt;
&lt;p&gt;如果 RT-1 的核心是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让 Transformer 从大量机器人经验中学习统一策略。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 RT-2 的核心就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 Robot Action 也变成一种 Token，使互联网规模 Vision-Language Pre-training 中获得的语义知识和推理能力，可以直接进入端到端机器人控制。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;可以把这条递进关系记成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Learn from Robot Experience"]
--&gt; B["RT-2&lt;br/&gt;Ground Web Knowledge into Action"]
--&gt; C["OpenVLA&lt;br/&gt;Make VLA Open and Adaptable"]
--&gt; D["pi0&lt;br/&gt;Rethink Continuous Action Generation"]
&lt;/div&gt;
&lt;p&gt;RT-1 让我们看到：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Robot Policy 可以开始 scale with robot data。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 则进一步告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人真正需要扩大的，不只是 Robot Data，而是能够被 Ground 到 Action 上的整个 Foundation Model Knowledge。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item></channel></rss>