<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Flow Matching | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/tags/flow-matching/</link><atom:link href="https://xht252.github.io/tags/flow-matching/index.xml" rel="self" type="application/rss+xml"/><description>Flow Matching</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>Flow Matching</title><link>https://xht252.github.io/tags/flow-matching/</link></image><item><title>$\pi_0$ 精读：从 Action Token 到 Flow Matching，VLA 开始学习灵巧控制</title><link>https://xht252.github.io/blog/vla/pi0/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/pi0/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Kevin Black et al., &lt;em&gt;$\pi_0$: A Vision-Language-Action Flow Model for General Robot Control&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;前面读完 RT-2 和 OpenVLA 后，VLA 的基本范式已经很清楚：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把视觉、语言和机器人动作放进一个统一模型，让模型根据 Image + Instruction 直接产生 Action。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 证明了这个方向可行；OpenVLA 又把它变成了一个开放、可微调的 7B VLA。&lt;/p&gt;
&lt;p&gt;但它们都留下了一个非常现实的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人动作真的应该像文本一样，被离散成 Token，然后一个一个自回归生成吗？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当任务变成折衣服、整理桌面、双臂协作、柔性物体操作，以及 20–50 Hz 的高频控制时，动作本质上仍然是连续轨迹。&lt;/p&gt;
&lt;p&gt;$\pi_0$ 的核心就是重新思考这一点。&lt;/p&gt;
&lt;p&gt;这条演进关系可以概括为：RT-2 建立 VLA，OpenVLA 推进开放与适配，而 $\pi_0$ 开始重点解决连续、高频、灵巧的 Action Generation。&lt;/p&gt;
&lt;p&gt;所以，如果一句话概括：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;$\pi_0$ 保留 VLM 负责“理解世界”，但不再强迫机器人动作完全遵循 Language Token 的生成方式，而是加入专门的 Action Expert，用 Flow Matching 生成连续动作序列。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="1-从-rt-2--openvla-到-到底变了什么"&gt;1. 从 RT-2 / OpenVLA 到 $\pi_0$，到底变了什么？&lt;/h2&gt;
&lt;p&gt;先看最核心的区别：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;RT-2&lt;/th&gt;
&lt;th&gt;OpenVLA&lt;/th&gt;
&lt;th&gt;$\pi_0$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;VLA&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;td&gt;✓&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;PaLI-X / PaLM-E&lt;/td&gt;
&lt;td&gt;DINOv2 + SigLIP + Llama 2&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;PaliGemma&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action Representation&lt;/td&gt;
&lt;td&gt;Discrete Token&lt;/td&gt;
&lt;td&gt;Discrete Token&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Continuous Action&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action Generation&lt;/td&gt;
&lt;td&gt;Autoregressive&lt;/td&gt;
&lt;td&gt;Autoregressive&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Flow Matching&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action Chunking&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;No&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;H = 50&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Robot-specific Module&lt;/td&gt;
&lt;td&gt;无独立 Expert&lt;/td&gt;
&lt;td&gt;无独立 Expert&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Action Expert&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cross-Embodiment&lt;/td&gt;
&lt;td&gt;有限&lt;/td&gt;
&lt;td&gt;OpenX&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心训练设计&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;高频 Dexterity&lt;/td&gt;
&lt;td&gt;有限&lt;/td&gt;
&lt;td&gt;有限&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心目标&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这三篇论文的研究重点其实在不断移动：&lt;/p&gt;
&lt;p&gt;因此，$\pi_0$ 并不是简单扩大 OpenVLA，而是把研究重点从“开放 VLA”进一步推进到“连续动作生成与物理灵巧性”。&lt;/p&gt;
&lt;p&gt;因此 $\pi_0$ 并不是“把 OpenVLA 再做大一点”。&lt;/p&gt;
&lt;p&gt;恰恰相反，它开始重新设计 VLA 中 &lt;strong&gt;Action Generation&lt;/strong&gt; 这一半。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-一张论文图看懂"&gt;2. 一张论文图看懂 $\pi_0$&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2410.24164v4/x1.png" alt="pi0 Architecture" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;$\pi_0$ 的整体结构。图片来自 arXiv HTML 版论文 Figure 3。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;输入主要包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;RGB Images；&lt;/li&gt;
&lt;li&gt;Language Instruction；&lt;/li&gt;
&lt;li&gt;Robot Proprioception。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;模型则可以理解为两个主要部分：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
I["RGB Images"] --&gt; V["Pre-trained VLM&lt;br/&gt;PaliGemma ~3B"]
L["Language Instruction"] --&gt; V
V --&gt; S["Shared Transformer Representation"]
P["Robot Proprioception"] --&gt; A["Action Expert&lt;br/&gt;~300M"]
N["Noisy Action Chunk"] --&gt; A
S --&gt; A
A --&gt; F["Flow Matching"]
F --&gt; O["Continuous Action Chunk"]
&lt;/div&gt;
&lt;p&gt;整个模型大约 &lt;strong&gt;3.3B 参数&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PaliGemma VLM ≈ 3B
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action Expert ≈ 300M
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里最重要的不是参数量，而是职责发生了分工。&lt;/p&gt;
&lt;h3 id="vlm-backbone"&gt;VLM Backbone&lt;/h3&gt;
&lt;p&gt;主要负责：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;视觉理解；&lt;/li&gt;
&lt;li&gt;语言理解；&lt;/li&gt;
&lt;li&gt;物体与语义关系；&lt;/li&gt;
&lt;li&gt;任务条件。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="action-expert"&gt;Action Expert&lt;/h3&gt;
&lt;p&gt;主要负责：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在机器人状态与 VLM 语义表示条件下，生成真正适合物理执行的连续动作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这和 RT-2 / OpenVLA 有一个非常重要的区别：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Language 和 Action 可以共享 Transformer 表示，但不一定必须共享完全相同的输出机制。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="3-核心创新flow-matching-action-expert"&gt;3. 核心创新：Flow Matching Action Expert&lt;/h2&gt;
&lt;p&gt;RT-2 和 OpenVLA 的动作生成可以粗略写成：&lt;/p&gt;
&lt;p&gt;RT-2 / OpenVLA 更接近“Image + Language → VLM → Autoregressive Action Tokens → Robot Action”的生成方式。&lt;/p&gt;
&lt;p&gt;也就是说：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;像生成文本一样，自回归地产生离散动作 Token。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$\pi_0$ 则改成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Image + Language + State"] --&gt; B["VLM Representation"]
B --&gt; C["Action Expert"]
N["Random Noise"] --&gt; C
C --&gt; D["Flow Matching"]
D --&gt; E["Continuous Action Trajectory"]
&lt;/div&gt;
&lt;p&gt;它不是直接预测一个固定动作，而是学习一个 &lt;strong&gt;velocity field&lt;/strong&gt;：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;怎样把初始随机噪声逐渐运输到真实机器人动作分布。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;直观理解就是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;random action noise
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;rough trajectory
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;refined trajectory
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;final robot action chunk
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;论文使用 &lt;strong&gt;10 个 flow integration steps&lt;/strong&gt; 来完成推理。&lt;/p&gt;
&lt;p&gt;所以 Flow Matching 在这里不是为了生成漂亮图像，而是在解决：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;连续、多模态、高维机器人动作分布如何被高效建模。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="4-action-chunking一次生成未来-50-个动作"&gt;4. Action Chunking：一次生成未来 50 个动作&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 的另一个关键设计是 &lt;strong&gt;Action Chunking&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;传统 single-step policy 更像：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;observe → predict one action → execute → observe again
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而 $\pi_0$ 一次预测：&lt;/p&gt;
$$
A_t =
[a_t,a_{t+1},\ldots,a_{t+H-1}],
$$&lt;p&gt;其中：&lt;/p&gt;
$$
H=50.
$$&lt;p&gt;也就是一次产生最多 &lt;strong&gt;50 个未来动作&lt;/strong&gt;。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Current Observation"] --&gt; B["pi0"]
B --&gt; C["50-step Action Chunk"]
C --&gt; D["a_t"]
C --&gt; E["a_t+1"]
C --&gt; F["..."]
C --&gt; G["a_t+49"]
&lt;/div&gt;
&lt;p&gt;这意味着模型学习的不再是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“下一步往哪动？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“接下来这一小段运动轨迹应该是什么？”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;对于折衣服、双臂协调、拿取柔性物体这类任务，这种 trajectory-level prediction 比单步动作自然得多。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="5-50-hz-并不意味着-33b-模型每秒完整推理-50-次"&gt;5. 50 Hz 并不意味着 3.3B 模型每秒完整推理 50 次&lt;/h2&gt;
&lt;p&gt;这是论文中非常容易被误读的一点。&lt;/p&gt;
&lt;p&gt;$\pi_0$ 支持最高约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;50 Hz robot control
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;但不等于：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;50 × full VLA inference / second
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;对于 50 Hz 的机器人，论文采用的方式大致是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;每 0.5 秒重新 inference
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ 执行约 25 个 action
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ 再重新 inference
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;对于 20 Hz 的 UR5e / Franka：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;每 0.8 秒 inference
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ 执行约 16 个 action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;RTX 4090 上论文报告的一次完整推理约为：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Image encoder 14 ms
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Observation pass 32 ms
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;10 × Flow steps 27 ms
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;-------------------------
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;On-board total 73 ms
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以真正的机制是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Visual Observation"] --&gt; B["Full pi0 Inference"]
B --&gt; C["Predict Action Chunk"]
C --&gt; D["High-frequency Robot Execution"]
D --&gt; E["Execute Several Actions Open-loop"]
E --&gt; F["New Observation"]
F --&gt; B
&lt;/div&gt;
&lt;p&gt;换句话说：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;低频生成一小段未来轨迹，高频执行这段轨迹。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是 Action Chunking 为什么重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-action-chunking-的代价closed-loop-feedback-变少"&gt;6. Action Chunking 的代价：Closed-loop Feedback 变少&lt;/h2&gt;
&lt;p&gt;Action Chunk 越长，效率越高。&lt;/p&gt;
&lt;p&gt;但执行 chunk 中间的动作时，模型不会每一步都重新观察环境。&lt;/p&gt;
&lt;p&gt;于是存在天然的 trade-off：&lt;/p&gt;
&lt;p&gt;这个 trade-off 可以直接理解为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Chunk&lt;/th&gt;
&lt;th&gt;优点&lt;/th&gt;
&lt;th&gt;代价&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Larger chunk&lt;/td&gt;
&lt;td&gt;执行效率更高&lt;/td&gt;
&lt;td&gt;视觉反馈更稀疏&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Smaller chunk&lt;/td&gt;
&lt;td&gt;Closed-loop 更强&lt;/td&gt;
&lt;td&gt;推理开销更大&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这也是为什么 Action Chunking 并不是简单的“越长越好”。&lt;/p&gt;
&lt;p&gt;在高度动态环境里，如果外界发生变化，而机器人仍然 open-loop 执行旧的 chunk，就可能产生误差。&lt;/p&gt;
&lt;p&gt;因此这里其实留下了一个后续非常重要的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何同时获得高频执行与高频视觉反馈？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="7-cross-embodiment一个模型学习多种机器人"&gt;7. Cross-Embodiment：一个模型学习多种机器人&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 的第二条大主线不是 Flow Matching，而是 &lt;strong&gt;Robot Data Scaling&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;论文自己的数据覆盖：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;7 robot configurations
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;68 broad tasks
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;包括：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;UR5e
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Franka
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Bimanual UR5e
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Bimanual Trossen
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Bimanual ARX / AgileX
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mobile Trossen / ARX
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mobile Fibocom
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;同时又混入 Open X-Embodiment、BridgeV2、DROID 等开放机器人数据。&lt;/p&gt;
&lt;p&gt;论文报告整个研究使用超过：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;10,000 hours
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的机器人数据，其自有数据约有：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;903M timesteps
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;因此训练目标已经不只是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“让一台机械臂学会很多任务。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让一个模型吸收不同 embodiment 的物理经验。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["Single-arm Robots"] --&gt; G["Cross-Embodiment Training"]
B["Dual-arm Robots"] --&gt; G
C["Mobile Manipulators"] --&gt; G
D["Open X-Embodiment"] --&gt; G
E["BridgeV2"] --&gt; G
F["DROID"] --&gt; G
G --&gt; H["Shared VLA Representation"]
H --&gt; I["Generalist Robot Foundation Model"]
&lt;/div&gt;
&lt;p&gt;不同机器人 action space 并不一样。&lt;/p&gt;
&lt;p&gt;$\pi_0$ 使用一个很工程化但有效的方法：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 state/action vector 统一 padding 到最大 18 维。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;缺少的维度补零；缺少的 camera slot 使用 mask。&lt;/p&gt;
&lt;p&gt;这看起来不“炫”，但对于 Robot Foundation Model 来说非常关键：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;统一数据接口往往和模型结构本身一样重要。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-pre-training--post-training机器人开始复制-llm-的训练范式"&gt;8. Pre-training + Post-training：机器人开始复制 LLM 的训练范式&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 还进一步采用了很明显的 Foundation Model Training Recipe：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Diverse Robot Data"] --&gt; B["Pre-training"]
B --&gt; C["General Capability"]
C --&gt; D["High-quality Task Data"]
D --&gt; E["Post-training"]
E --&gt; F["Specialized Robust Behavior"]
&lt;/div&gt;
&lt;h3 id="pre-training"&gt;Pre-training&lt;/h3&gt;
&lt;p&gt;目标是覆盖尽可能多的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;robots；&lt;/li&gt;
&lt;li&gt;objects；&lt;/li&gt;
&lt;li&gt;tasks；&lt;/li&gt;
&lt;li&gt;failures；&lt;/li&gt;
&lt;li&gt;recovery behaviors。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这里的数据可以非常多样，甚至质量不完全一致。&lt;/p&gt;
&lt;p&gt;它主要回答：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;What can the robot do?&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="post-training"&gt;Post-training&lt;/h3&gt;
&lt;p&gt;再使用质量更高、更一致的数据，对具体任务进行专项训练。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;laundry folding；&lt;/li&gt;
&lt;li&gt;table bussing；&lt;/li&gt;
&lt;li&gt;box assembly。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它回答的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;How can the robot do this task well?&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这和现代 LLM：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pre-training → Post-training
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的思路已经非常接近。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-实验完整--到底强在哪里"&gt;9. 实验：完整 $\pi_0$ 到底强在哪里？&lt;/h2&gt;
&lt;p&gt;论文首先进行 &lt;strong&gt;Out-of-Box&lt;/strong&gt; 测试，也就是不针对测试任务专门 post-train。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2410.24164v4/x4.png" alt="pi0 Out-of-Box Results" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;$\pi_0$、$\pi_0$-small、OpenVLA 和 Octo 的直接提示实验。图片来自 arXiv HTML 版论文 Figure 7。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;测试包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Shirt Folding；&lt;/li&gt;
&lt;li&gt;Bussing Easy；&lt;/li&gt;
&lt;li&gt;Bussing Hard；&lt;/li&gt;
&lt;li&gt;Grocery Bagging；&lt;/li&gt;
&lt;li&gt;Toast out of Toaster。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;完整 $\pi_0$ 的 normalized task progress 大约为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th style="text-align: right"&gt;$\pi_0$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Shirt Folding&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;1.000&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bussing Easy&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.971&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bussing Hard&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.875&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Grocery Bagging&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.786&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Toast out of Toaster&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;0.750&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个 baseline 很有代表性：&lt;/p&gt;
&lt;h3 id="openvla"&gt;OpenVLA&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Large VLA
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Discrete autoregressive actions
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="octo"&gt;Octo&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Robot Foundation Model
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Diffusion action generation
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="-small"&gt;$\pi_0$-small&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Continuous-action architecture
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;No large VLM initialization
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以这个实验真正说明的不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Flow Matching 单独解决了所有问题。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLM semantic prior + large robot data + cross-embodiment training + continuous action generation 需要组合在一起。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="10--真正提升的是-physical-dexterity"&gt;10. $\pi_0$ 真正提升的是 Physical Dexterity&lt;/h2&gt;
&lt;p&gt;RT-2 更强调：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Semantic Generalization&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;What object can be used as a hammer?
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型需要理解物体、语义与常识，再把它 Ground 到机器人动作。&lt;/p&gt;
&lt;p&gt;而 $\pi_0$ 更强调：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Physical Dexterity&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;fold crumpled clothes；&lt;/li&gt;
&lt;li&gt;stack dishes；&lt;/li&gt;
&lt;li&gt;manipulate deformable objects；&lt;/li&gt;
&lt;li&gt;use two arms simultaneously；&lt;/li&gt;
&lt;li&gt;recover from manipulation errors。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以可以粗略理解：&lt;/p&gt;
&lt;p&gt;因此可以粗略理解为：RT-2 / OpenVLA 更突出 &lt;strong&gt;semantic understanding → action&lt;/strong&gt;，而 $\pi_0$ 进一步强调 &lt;strong&gt;semantic representation → continuous action distribution → physical dexterity&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 更突出“机器人应该做什么”，$\pi_0$ 开始更认真地解决“机器人具体应该怎么动”。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;两者当然不是完全割裂，但这个视角非常适合快速理解技术演进。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="11--仍然没有彻底解决-long-horizon-planning"&gt;11. $\pi_0$ 仍然没有彻底解决 Long-Horizon Planning&lt;/h2&gt;
&lt;p&gt;$\pi_0$ 展示了很多长时间任务：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;laundry folding；&lt;/li&gt;
&lt;li&gt;table bussing；&lt;/li&gt;
&lt;li&gt;box assembly；&lt;/li&gt;
&lt;li&gt;dryer unloading。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;部分任务甚至持续：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;5–20 minutes
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;但这里必须区分：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Low-level Dexterous Policy
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;和：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;High-level Task Planning
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;在部分复杂任务中，论文仍然使用一个高层 VLM 产生中间语言指令：&lt;/p&gt;
&lt;p&gt;在这种设置下，高层 VLM 负责把 &lt;code&gt;&amp;quot;bus the table&amp;quot;&lt;/code&gt; 分解成 &lt;code&gt;&amp;quot;pick up the napkin&amp;quot;&lt;/code&gt; 等子任务，再由 $\pi_0$ 把子任务转成连续机器人动作。&lt;/p&gt;
&lt;p&gt;所以不能简单理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“一个 $\pi_0$ 网络已经独立解决了 20 分钟 Long-Horizon Planning。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;更准确的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;$\pi_0$ 显著提升了通用低层策略的灵巧性，但高层任务分解在部分设置中仍然依赖单独的 VLM。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="12-从-rt-1-到-openvla再到"&gt;12. 从 RT-1 到 OpenVLA，再到 $\pi_0$&lt;/h2&gt;
&lt;p&gt;现在把这几篇论文放在一起，路线就非常清楚：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Scale Robot Data"]
--&gt; B["RT-2&lt;br/&gt;Scale Semantic Knowledge"]
--&gt; C["OpenVLA&lt;br/&gt;Scale Accessibility &amp; Adaptation"]
--&gt; D["pi0&lt;br/&gt;Scale Physical Dexterity"]
&lt;/div&gt;
&lt;p&gt;对应的问题分别是：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;核心问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td&gt;一个 Transformer 能否学习大量机器人任务？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2&lt;/td&gt;
&lt;td&gt;Web Knowledge 能否迁移到 Robot Action？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLA&lt;/td&gt;
&lt;td&gt;VLA 能否开放、微调并部署？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;$\pi_0$&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;VLA 如何产生连续、高频、灵巧的机器人动作？&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这样再看 $\pi_0$ 的几个设计，就非常自然：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action Expert
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flow Matching
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action Chunking
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Cross-Embodiment Training
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pre-training + Post-training
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它们都在回答同一个问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;一个真正的 Robot Foundation Model，除了“看懂”和“听懂”，还需要怎样学会“动得好”？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="13-我认为--真正重要在哪里"&gt;13. 我认为 $\pi_0$ 真正重要在哪里？&lt;/h2&gt;
&lt;p&gt;如果只把 $\pi_0$ 理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“把 Diffusion 换成 Flow Matching 的 VLA。”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;其实低估了这篇论文。&lt;/p&gt;
&lt;p&gt;它真正重要的是把此前几个方向组合到同一个 Robot Foundation Model 中：&lt;/p&gt;
&lt;p&gt;从系统角度看，$\pi_0$ 把 Internet-pretrained VLM、Cross-Embodiment Robot Data、Action Expert、Flow Matching、Action Chunking 与 Pre-training/Post-training 组合成了一套更完整的 Robot Foundation Model recipe。&lt;/p&gt;
&lt;p&gt;所以 $\pi_0$ 的贡献并不只是某一个模块。&lt;/p&gt;
&lt;p&gt;它更像是在回答：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Robot Foundation Model 到底应该由哪些部分组成？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 建立了：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Vision + Language → Action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;OpenVLA 让这个接口变得开放、可微调。&lt;/p&gt;
&lt;p&gt;而 $\pi_0$ 开始重新设计：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Action Representation；&lt;/li&gt;
&lt;li&gt;Action Generation；&lt;/li&gt;
&lt;li&gt;Robot Data Scaling；&lt;/li&gt;
&lt;li&gt;Embodiment Scaling；&lt;/li&gt;
&lt;li&gt;Training Recipe；&lt;/li&gt;
&lt;li&gt;Dexterity。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解"&gt;最后，用一句话理解 $\pi_0$&lt;/h2&gt;
&lt;p&gt;RT-2 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;预训练 VLM 可以被 Ground 到 Robot Action。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;OpenVLA 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLA 可以成为开放、可适配的机器人基础模型。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$\pi_0$ 则进一步告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人动作并不一定要完全按照 Language Token 的方式生成；可以保留 VLM 负责语义理解，再使用专门的 Action Expert 和 Flow Matching 生成连续 Action Chunk。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此这条路线可以记成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;RT-1 → Robot Data
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;RT-2 → Semantic Knowledge
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;OpenVLA → Accessibility &amp;amp; Adaptation
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pi0 → Physical Dexterity
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而 $\pi_0$ 留下的下一道问题也非常自然：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何把更强的 reasoning、long-horizon planning、实时 closed-loop feedback 和更大规模机器人数据继续整合进同一个 VLA？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item></channel></rss>