<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>OpenVLA | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/tags/openvla/</link><atom:link href="https://xht252.github.io/tags/openvla/index.xml" rel="self" type="application/rss+xml"/><description>OpenVLA</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>OpenVLA</title><link>https://xht252.github.io/tags/openvla/</link></image><item><title>OpenVLA 精读：把 RT-2 的 VLA 范式真正开源</title><link>https://xht252.github.io/blog/vla/openvla/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/openvla/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Moo Jin Kim et al., &lt;em&gt;OpenVLA: An Open-Source Vision-Language-Action Model&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果 RT-2 回答的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Vision-Language Model 能不能直接输出 Robot Action？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 OpenVLA 继续追问的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这样的 VLA 能不能真正开放出来，让普通机器人实验室下载、微调并部署到自己的机器人上？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就是 OpenVLA 最值得关注的地方。&lt;/p&gt;
&lt;p&gt;OpenVLA 并没有推翻 RT-2 的基本思路。相反，它保留了最核心的 &lt;strong&gt;Action Tokenization&lt;/strong&gt;，然后把重点转向：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;开源模型；&lt;/li&gt;
&lt;li&gt;大规模跨机器人数据；&lt;/li&gt;
&lt;li&gt;下游任务微调；&lt;/li&gt;
&lt;li&gt;LoRA；&lt;/li&gt;
&lt;li&gt;量化部署。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以它是 RT-2 和后续 $\pi_0$ 之间非常自然的一块拼图。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-rt-2-到-openvla真正发生了什么"&gt;1. RT-2 到 OpenVLA，真正发生了什么？&lt;/h2&gt;
&lt;p&gt;先把二者放在一起：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;RT-2&lt;/th&gt;
&lt;th&gt;OpenVLA&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;时间&lt;/td&gt;
&lt;td&gt;2023&lt;/td&gt;
&lt;td&gt;2024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;模型规模&lt;/td&gt;
&lt;td&gt;12B / 55B&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;7B&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;PaLI-X / PaLM-E&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;DINOv2 + SigLIP + Llama 2&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action&lt;/td&gt;
&lt;td&gt;Discrete Tokens&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Discrete Tokens&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Robot Data&lt;/td&gt;
&lt;td&gt;RT data / RT-X&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;970k OpenX trajectories&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;开源&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;是&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;下游 Fine-tuning&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心问题&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LoRA / Quantization&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;系统研究&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;因此 OpenVLA 的主要贡献并不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;提出一种全新的 VLA 架构。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 RT-2 已经证明有效的 VLA 范式，做成一个开放、可适配的 Robot Foundation Model。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="2-一张图看懂-openvla"&gt;2. 一张图看懂 OpenVLA&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2406.09246v3/x1.png" alt="OpenVLA Architecture" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;OpenVLA 模型结构。图片来自 arXiv HTML 版论文 Figure 1。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;如果把论文原图抽象一下，整个网络其实非常清楚：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
I["RGB Image"] --&gt; D["DINOv2"]
I --&gt; S["SigLIP"]
D --&gt; F["Fused Visual Features"]
S --&gt; F
F --&gt; P["MLP Projector"]
P --&gt; L["Llama 2 7B"]
T["Language Instruction"] --&gt; L
L --&gt; A["Action Tokens"]
A --&gt; Q["Action De-Tokenizer"]
Q --&gt; R["7D Continuous Robot Action"]
&lt;/div&gt;
&lt;p&gt;OpenVLA 建立在 &lt;strong&gt;Prismatic-7B VLM&lt;/strong&gt; 上，主要由三个部分组成：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;DINOv2 + SigLIP 双视觉编码器&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MLP Projector&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Llama 2 7B&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为什么同时使用 DINOv2 和 SigLIP？&lt;/p&gt;
&lt;p&gt;可以粗略理解为：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;SigLIP&lt;/strong&gt; 更擅长语义层面的视觉—语言对齐；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DINOv2&lt;/strong&gt; 保留更丰富的空间和低层视觉信息。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;对于机器人来说，只知道：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“这是一个杯子。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;还不够。&lt;/p&gt;
&lt;p&gt;策略还需要判断：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“杯子具体在哪里？机械臂应该朝哪个方向移动？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此 OpenVLA 希望视觉表示同时包含：&lt;/p&gt;
&lt;p&gt;这是它相比单一视觉编码器很重要的设计。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-openvla-仍然把-action-当成-language-token"&gt;3. OpenVLA 仍然把 Action 当成 Language Token&lt;/h2&gt;
&lt;p&gt;这是 OpenVLA 和 RT-2 最直接的继承关系。&lt;/p&gt;
&lt;p&gt;典型机器人动作可以写成一个 7 维向量：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δx, Δy, Δz,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δroll, Δpitch, Δyaw,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;gripper
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这些值本来都是连续量。&lt;/p&gt;
&lt;p&gt;OpenVLA 不直接做连续回归，而是对每一个动作维度进行离散化：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Continuous Action"] --&gt; B["Clip by 1st–99th Percentile"]
B --&gt; C["Quantize into 256 Bins"]
C --&gt; D["Discrete Action Index"]
D --&gt; E["Language Token"]
&lt;/div&gt;
&lt;p&gt;也就是说，对于某个动作维度：&lt;/p&gt;
$$
a_i \in \mathbb{R}
$$&lt;p&gt;会被映射为：&lt;/p&gt;
$$
\hat a_i \in \{0,\ldots,255\}.
$$&lt;p&gt;这里有一个很实用的细节。&lt;/p&gt;
&lt;p&gt;OpenVLA 没有简单使用动作数据的绝对 &lt;code&gt;min/max&lt;/code&gt;，而是采用：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;1st percentile 到 99th percentile&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作为主要离散范围。&lt;/p&gt;
&lt;p&gt;原因是机器人数据中可能存在少量极端动作。如果直接使用最大值和最小值，256 个 bin 会被少数 outlier 拉得很宽，反而降低常见动作区域的分辨率。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-action-token-从哪里来"&gt;4. Action Token 从哪里来？&lt;/h2&gt;
&lt;p&gt;OpenVLA 使用 Llama 2 tokenizer。&lt;/p&gt;
&lt;p&gt;但机器人需要大约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;256 Action Tokens
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;作者采用了一个非常直接的方案：&lt;/p&gt;
&lt;p&gt;于是训练时仍然可以使用标准语言模型的 &lt;strong&gt;Next-Token Prediction&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;对于模型而言：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Image + &amp;#34;put eggplant in bowl&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;经过 Llama 2 后输出的不是自然语言：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;#34;The robot should move left...&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是类似：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;[action_132] [action_87] [action_201] ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这些 Token 再经过 de-tokenization 恢复成连续机器人控制量。&lt;/p&gt;
&lt;p&gt;因此 OpenVLA 本质上仍然是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把机器人控制问题重新写成语言模型的 Token Prediction 问题。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这正是 RT-2 建立的 VLA 范式。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="5-真正让-openvla-强起来的是-970k-robot-trajectories"&gt;5. 真正让 OpenVLA 强起来的是 970k Robot Trajectories&lt;/h2&gt;
&lt;p&gt;OpenVLA 的另一个核心是 &lt;strong&gt;Open X-Embodiment&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;论文最终整理了约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;970k robot trajectories
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;用于训练。&lt;/p&gt;
&lt;p&gt;问题在于，不同机器人数据天然是异构的：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Different Robots"] --&gt; G["OpenX Data Mixture"]
B["Different Cameras"] --&gt; G
C["Different Action Spaces"] --&gt; G
D["Different Control Frequencies"] --&gt; G
E["Different Tasks"] --&gt; G
F["Different Data Quality"] --&gt; G
G --&gt; H["Curate + Reweight"]
H --&gt; I["970k Training Trajectories"]
I --&gt; J["OpenVLA"]
&lt;/div&gt;
&lt;p&gt;所以 Robot Foundation Model 的问题已经不再只是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“数据够不够多？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;不同 embodiment、任务、相机和控制空间的数据，怎样组成一个有效的训练分布？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 对 OpenX 数据进行了筛选和重新加权，更偏好多样性较高的数据，降低重复性较强的数据权重。&lt;/p&gt;
&lt;p&gt;这也是后续跨 embodiment VLA 非常重要的一条经验。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-openvla-的训练方式其实很像-llm-fine-tuning"&gt;6. OpenVLA 的训练方式其实很像 LLM Fine-tuning&lt;/h2&gt;
&lt;p&gt;OpenVLA 并不是从零训练一个 7B 模型。&lt;/p&gt;
&lt;p&gt;它的训练路径非常直接：&lt;/p&gt;
&lt;p&gt;论文训练规模大致为：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;7B parameters
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;970k trajectories
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;27 epochs
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;64 × A100
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;≈ 2 weeks
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;一个很有意思的现象是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人数据可以被重复训练很多个 epoch，而真实性能仍然继续提升。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作者最终训练约 27 epochs，直到 Action Token Accuracy 超过 95%。&lt;/p&gt;
&lt;p&gt;这说明虽然 OpenVLA 使用的是语言模型形式的 Token Objective，但机器人 imitation learning 和互联网语言预训练的数据统计性质仍然非常不同。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="7-实验openvla-到底比-rt-2-x-强在哪里"&gt;7. 实验：OpenVLA 到底比 RT-2-X 强在哪里？&lt;/h2&gt;
&lt;p&gt;论文在多个真实机器人平台上进行评估。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2406.09246v3/x2.png" alt="OpenVLA Generalization Results" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;OpenVLA 与 RT-1-X、Octo、RT-2-X 的真实机器人泛化对比。图片来自 arXiv HTML 版论文 Figure 2。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;在 BridgeData V2 WidowX 测试中：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Average Success&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1-X&lt;/td&gt;
&lt;td style="text-align: right"&gt;18.5%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Octo&lt;/td&gt;
&lt;td style="text-align: right"&gt;20.0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-X&lt;/td&gt;
&lt;td style="text-align: right"&gt;50.6%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;OpenVLA&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;70.6%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;分不同泛化维度看：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Generalization&lt;/th&gt;
&lt;th style="text-align: right"&gt;RT-2-X&lt;/th&gt;
&lt;th style="text-align: right"&gt;OpenVLA&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Visual&lt;/td&gt;
&lt;td style="text-align: right"&gt;52.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;87.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Motion&lt;/td&gt;
&lt;td style="text-align: right"&gt;55.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;60.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physical&lt;/td&gt;
&lt;td style="text-align: right"&gt;26.7%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;76.7%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Semantic&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;38.8%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;36.3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Language Grounding&lt;/td&gt;
&lt;td style="text-align: right"&gt;85.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;90.0%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这里最值得关注的反而不是 OpenVLA 全面领先。&lt;/p&gt;
&lt;p&gt;因为：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Semantic Generalization 上 RT-2-X 仍然略强。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;为什么？&lt;/p&gt;
&lt;p&gt;RT-2-X 在训练机器人动作时继续混入互联网 Vision-Language Data，也就是 &lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;而 OpenVLA 的路径更接近：&lt;/p&gt;
&lt;p&gt;因此 OpenVLA 在机器人 Fine-tuning 后可能遗忘一部分原本的 Web Knowledge。&lt;/p&gt;
&lt;p&gt;这与 RT-2 中的结论正好对应：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Co-Fine-Tuning 的一个重要作用，就是防止机器人训练把预训练语义知识冲掉。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-openvla-真正重要的贡献fine-tuning"&gt;8. OpenVLA 真正重要的贡献：Fine-tuning&lt;/h2&gt;
&lt;p&gt;如果你自己有一台 Franka，真正关心的问题通常不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;OpenVLA 在作者实验室跑多少分？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;我采几十条 demonstration，能不能让它学会我的任务？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 专门研究了这个问题。&lt;/p&gt;
&lt;p&gt;作者在新的 Franka setup 上使用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;10–150 demonstrations
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;进行下游 Fine-tuning，并和：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Diffusion Policy&lt;/li&gt;
&lt;li&gt;Octo&lt;/li&gt;
&lt;li&gt;OpenVLA from scratch&lt;/li&gt;
&lt;li&gt;pretrained OpenVLA&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;进行比较。&lt;/p&gt;
&lt;p&gt;结果有一个很重要的规律：&lt;/p&gt;
&lt;h3 id="narrow-single-task"&gt;Narrow Single-task&lt;/h3&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;put carrot in bowl
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这种非常窄、非常强调动作精度的任务，Diffusion Policy 依然很强。&lt;/p&gt;
&lt;h3 id="multi-task--language-grounding"&gt;Multi-task + Language Grounding&lt;/h3&gt;
&lt;p&gt;当环境开始包含：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;多个物体；&lt;/li&gt;
&lt;li&gt;多种语言指令；&lt;/li&gt;
&lt;li&gt;需要根据语言选择目标；&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;OpenVLA 的优势会更加明显。&lt;/p&gt;
&lt;p&gt;因此可以这样理解：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLA 的优势不是一定体现在最窄的单技能控制，而是在任务分布、语言条件和物体组合逐渐复杂后出现。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="9-loravla-开始真正进入普通机器人实验室"&gt;9. LoRA：VLA 开始真正进入普通机器人实验室&lt;/h2&gt;
&lt;p&gt;Full Fine-tuning 一个 7B 模型依然很贵。&lt;/p&gt;
&lt;p&gt;论文因此系统测试了参数高效微调。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Method&lt;/th&gt;
&lt;th style="text-align: right"&gt;Success&lt;/th&gt;
&lt;th style="text-align: right"&gt;Trainable Params&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Full Fine-tuning&lt;/td&gt;
&lt;td style="text-align: right"&gt;69.7%&lt;/td&gt;
&lt;td style="text-align: right"&gt;7.19B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Last Layer&lt;/td&gt;
&lt;td style="text-align: right"&gt;30.3%&lt;/td&gt;
&lt;td style="text-align: right"&gt;465M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Frozen Vision&lt;/td&gt;
&lt;td style="text-align: right"&gt;47.0%&lt;/td&gt;
&lt;td style="text-align: right"&gt;6.76B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Sandwich&lt;/td&gt;
&lt;td style="text-align: right"&gt;62.1%&lt;/td&gt;
&lt;td style="text-align: right"&gt;914M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;LoRA r=32&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;68.2%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;97.6M&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;LoRA rank 32 只训练约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1.4% parameters
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;却基本追平 Full Fine-tuning。&lt;/p&gt;
&lt;p&gt;于是一个普通实验室第一次可以形成非常现实的工作流：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Download OpenVLA"] --&gt; B["Collect Your Robot Data"]
B --&gt; C["LoRA Fine-tuning"]
C --&gt; D["New Task / New Setup"]
D --&gt; E["Deploy on Your Robot"]
&lt;/div&gt;
&lt;p&gt;这可能比某一个 benchmark 数字更重要。&lt;/p&gt;
&lt;p&gt;因为 VLA 从：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;大型实验室里的展示模型&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;开始变成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人研究者真正可以拿来二次开发的基础模型。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="10-quantization机器人模型不能只看模型大小"&gt;10. Quantization：机器人模型不能只看模型大小&lt;/h2&gt;
&lt;p&gt;OpenVLA 原始 bfloat16 推理需要大约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;15–17 GB VRAM
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;在 RTX 4090 上大约可以达到：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;6 Hz
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;作者又测试了 bfloat16、int8 和 int4。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Precision&lt;/th&gt;
&lt;th style="text-align: right"&gt;Success&lt;/th&gt;
&lt;th style="text-align: right"&gt;VRAM&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;bfloat16&lt;/td&gt;
&lt;td style="text-align: right"&gt;71.3%&lt;/td&gt;
&lt;td style="text-align: right"&gt;16.8 GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;int8&lt;/td&gt;
&lt;td style="text-align: right"&gt;58.1%&lt;/td&gt;
&lt;td style="text-align: right"&gt;10.2 GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;int4&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;71.9%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;7.0 GB&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一个很有意思的结果是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;int8 反而明显变差。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文分析认为，一个关键因素并不是数值精度本身，而是量化实现导致推理速度变化，进而改变了机器人实际控制频率。&lt;/p&gt;
&lt;p&gt;这暴露了 Robot Policy 和普通 LLM 的本质区别：&lt;/p&gt;
&lt;p&gt;所以对于机器人而言：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Inference Latency 本身就是 Policy Performance 的一部分。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="11-openvla-的局限几乎直接指向了后来的"&gt;11. OpenVLA 的局限，几乎直接指向了后来的 $\pi_0$&lt;/h2&gt;
&lt;p&gt;这是这篇论文最值得和 $\pi_0$ 连起来读的地方。&lt;/p&gt;
&lt;p&gt;OpenVLA 仍然存在几个非常明确的限制：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;主要使用单帧 RGB；&lt;/li&gt;
&lt;li&gt;缺乏更丰富的 observation history；&lt;/li&gt;
&lt;li&gt;proprioception 使用有限；&lt;/li&gt;
&lt;li&gt;基本是 single-step action prediction；&lt;/li&gt;
&lt;li&gt;Action Token 自回归生成；&lt;/li&gt;
&lt;li&gt;RTX 4090 上约 6 Hz；&lt;/li&gt;
&lt;li&gt;对高频 dexterous control 仍然有限。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;把这些问题放在一起，会得到非常自然的下一步：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
subgraph A["OpenVLA Bottlenecks"]
A1["Discrete Action Tokens"]
A2["Single-step Prediction"]
A3["Autoregressive Decoding"]
A4["Low Control Frequency"]
A5["Limited Dexterity"]
end
subgraph B["Later pi0 Direction"]
B1["Continuous Actions"]
B2["Action Chunking"]
B3["Flow Matching"]
B4["Action Expert"]
B5["High-frequency Execution"]
end
A --&gt; B
&lt;/div&gt;
&lt;p&gt;这也是为什么 $\pi_0$ 的 Action Expert、Flow Matching 和 Action Chunking 并不是突然出现的。&lt;/p&gt;
&lt;p&gt;它们实际上是在回答 OpenVLA 已经暴露出来的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;当 VLA 已经能够理解视觉和语言以后，我们还应该继续像生成文字一样，一步一步生成机器人动作吗？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="12-把-openvla-放回-vla-的发展主线"&gt;12. 把 OpenVLA 放回 VLA 的发展主线&lt;/h2&gt;
&lt;p&gt;现在这几篇论文的关系就非常清楚了：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Robot Data Scaling"] --&gt; B["RT-2&lt;br/&gt;Web Knowledge → Action"]
B --&gt; C["Open X-Embodiment / RT-X&lt;br/&gt;Cross-Embodiment Data"]
C --&gt; D["OpenVLA&lt;br/&gt;Open + Fine-tunable VLA"]
D --&gt; E["pi0&lt;br/&gt;Continuous Action + Flow Matching"]
&lt;/div&gt;
&lt;p&gt;对应的问题分别是：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;最核心的问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td&gt;一个 Transformer 能否学习大量机器人任务？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2&lt;/td&gt;
&lt;td&gt;Web Knowledge 能否迁移到 Robot Action？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Open X-Embodiment / RT-X&lt;/td&gt;
&lt;td&gt;Robot Data 能否跨 embodiment 扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;OpenVLA&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;VLA 能否开放、可微调、可部署？&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;连续高频灵巧控制应该怎样建模？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以我更愿意把 OpenVLA 的位置总结成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 证明了 VLA；OpenVLA 把 VLA 变成了开放的研究基础设施；$\pi_0$ 开始重新设计 VLA 的 Action Generation。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-openvla"&gt;最后，用一句话理解 OpenVLA&lt;/h2&gt;
&lt;p&gt;RT-2 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Vision-Language Model 可以通过 Action Token 直接变成 Robot Policy。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 进一步证明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这种 VLA 可以建立在开放 VLM 和 Open X-Embodiment 上，并通过标准的 Fine-tuning、LoRA 和 Quantization 工具链适配到新的机器人和任务。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但它也留下了一个非常关键的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;离散、自回归、单步 Action Token，真的是机器人动作最合适的表示方式吗？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这个问题，正好把阅读路线自然地引向后面的：&lt;/p&gt;
$$
\pi_0.
$$</description></item></channel></rss>