<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>RT-2 | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/tags/rt-2/</link><atom:link href="https://xht252.github.io/tags/rt-2/index.xml" rel="self" type="application/rss+xml"/><description>RT-2</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>RT-2</title><link>https://xht252.github.io/tags/rt-2/</link></image><item><title>RT-2 精读：从 Vision-Language Model 到 Vision-Language-Action</title><link>https://xht252.github.io/blog/vla/rt2/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/rt2/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Anthony Brohan et al., &lt;em&gt;RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Blog:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果 RT-1 解决的问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能用一个统一的 Transformer，从大规模、多任务机器人数据中直接学习机器人策略？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 RT-2 继续追问：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能把互联网规模的视觉—语言知识，直接迁移到机器人动作空间？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 给出的答案非常直接：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把机器人动作也表示成 Token，然后让一个预训练 Vision-Language Model 同时学习“回答问题”和“输出机器人动作”。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就是论文中提出的 &lt;strong&gt;Vision-Language-Action Model，VLA&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer2.github.io/img/fig1.png" alt="RT-2 Overview" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-2 的核心思路：将互联网视觉语言数据与机器人动作数据共同训练，使预训练 VLM 直接变成可以控制机器人的 VLA。图片来自 RT-2 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-从-rt-1-到-rt-2真正发生了什么变化"&gt;1. 从 RT-1 到 RT-2，真正发生了什么变化？&lt;/h2&gt;
&lt;p&gt;RT-1 已经证明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;大规模、多任务机器人数据可以训练出一个具有一定泛化能力的统一策略。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但 RT-1 有一个明显的边界：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;它知道的世界，基本仍然来自机器人自己见过的数据。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;即使 RT-1 已经收集了 13 台机器人、17 个月、约 13 万条示范，与互联网规模的图像和文本数据相比仍然非常小。&lt;/p&gt;
&lt;p&gt;真实机器人很难通过亲自交互覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;所有物体；&lt;/li&gt;
&lt;li&gt;所有环境；&lt;/li&gt;
&lt;li&gt;所有语言表达；&lt;/li&gt;
&lt;li&gt;所有语义关系；&lt;/li&gt;
&lt;li&gt;所有常识。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;而大型 Vision-Language Model 已经通过互联网数据学到了大量这些知识。&lt;/p&gt;
&lt;p&gt;所以 RT-2 的核心思路变成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Internet-scale&lt;br/&gt;Vision-Language Knowledge"] --&gt; C["Pre-trained VLM"]
B["Robot Experience"] --&gt; C
C --&gt; D["Vision-Language-Action Model"]
D --&gt; E["Robot Control"]
&lt;/div&gt;
&lt;p&gt;RT-2 不再从头训练一个机器人 Transformer，而是直接从大型预训练 VLM 出发。&lt;/p&gt;
&lt;p&gt;论文主要使用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;PaLI-X&lt;/strong&gt;：5B 和 55B 版本；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;PaLM-E&lt;/strong&gt;：主要使用 12B 版本。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;于是 RT-1 和 RT-2 的差别可以简单总结为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;RT-1&lt;/th&gt;
&lt;th&gt;RT-2&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;知识来源&lt;/td&gt;
&lt;td&gt;Robot Data&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web Data + Robot Data&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;Robot Transformer&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Pre-trained VLM&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输入&lt;/td&gt;
&lt;td&gt;Image + Language&lt;/td&gt;
&lt;td&gt;Image + Language&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输出&lt;/td&gt;
&lt;td&gt;Action Tokens&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Text-form Action Tokens&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;重点&lt;/td&gt;
&lt;td&gt;多任务 Robot Policy&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web Knowledge → Robot Action&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;核心概念&lt;/td&gt;
&lt;td&gt;Robotics Transformer&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Vision-Language-Action&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="2-rt-2-最关键的一步把-action-当成-language"&gt;2. RT-2 最关键的一步：把 Action 当成 Language&lt;/h2&gt;
&lt;p&gt;理解 RT-2，其实真正需要理解的只有一件事：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人动作怎样进入 VLM 的输出空间？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;传统 VLM 做的是：&lt;/p&gt;
&lt;p&gt;传统 VLM 可以概括为 &lt;strong&gt;Image + Text → VLM → Text Tokens&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Q: What is in the image?
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;A: A red apple.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而机器人策略需要：&lt;/p&gt;
&lt;p&gt;而机器人策略需要的是 &lt;strong&gt;Robot Image + Instruction → Policy → Robot Action&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;问题就在这里：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;VLM 原本输出的是 &lt;strong&gt;Language Tokens&lt;/strong&gt;，而机器人需要的是连续控制量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 没有另外设计一个复杂的 Action Head。&lt;/p&gt;
&lt;p&gt;它直接把 Robot Action 也编码成 Token。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer2.github.io/img/fig3.png" alt="RT-2 Action Representation" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-2 的动作表示：终止标志、三维位置变化、三维旋转变化和夹爪状态共同组成一个机器人动作。图片来自 RT-2 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;RT-2 延续 RT-1 的动作空间：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Terminate / Continue
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Position X
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Position Y
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Position Z
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Rotation X
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Rotation Y
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Δ Rotation Z
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Gripper
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;连续动作维度被离散为 &lt;strong&gt;256 bins&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Continuous Robot Action"] --&gt; B["Quantize Each Dimension"]
B --&gt; C["256 Bins"]
C --&gt; D["Integer Action IDs"]
D --&gt; E["Text-form Action Tokens"]
&lt;/div&gt;
&lt;p&gt;一个动作于是可以写成类似：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1 128 91 241 5 101 127 217
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;对于模型来说：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;#34;The object is an apple.&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;和：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;#34;1 128 91 241 5 101 127 217&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;本质上都变成了同一件事：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Next-Token Prediction&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一步非常关键。&lt;/p&gt;
&lt;p&gt;因为一旦 Action 和 Language 共享同一个 Token Interface：&lt;/p&gt;
&lt;p&gt;因此，一个关键变化是让 Language 与 Action 共享同一种 Token Interface：VLM 既可以生成文本，也可以生成机器人动作 Token。&lt;/p&gt;
&lt;p&gt;原本负责图像理解、视觉问答和语言推理的 VLM，就可以在不重构整个网络的情况下被训练成机器人策略。&lt;/p&gt;
&lt;p&gt;这就是 &lt;strong&gt;Vision-Language-Action&lt;/strong&gt; 的核心。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-co-fine-tuning学会-action-的同时不要忘掉-web-knowledge"&gt;3. Co-Fine-Tuning：学会 Action 的同时不要忘掉 Web Knowledge&lt;/h2&gt;
&lt;p&gt;如果直接拿一个 VLM，只用机器人数据进行 Fine-tuning，会产生一个问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;模型可能逐渐忘掉预训练阶段从互联网中学到的视觉和语言知识。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但 RT-2 的目的恰恰是利用这些知识。&lt;/p&gt;
&lt;p&gt;因此论文采用 &lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;：&lt;/p&gt;
&lt;p&gt;训练后，同一个模型同时保留 Vision→Language、Semantic Reasoning 和 Vision+Language→Action 三类能力。&lt;/p&gt;
&lt;p&gt;训练过程中同时存在两类样本。&lt;/p&gt;
&lt;h3 id="普通-vision-language-数据"&gt;普通 Vision-Language 数据&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Image + Question
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Natural Language Answer
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="robot-数据"&gt;Robot 数据&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Robot Image + Instruction
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Action Tokens
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;因此同一个模型同时保留：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Vision"] --&gt; D["RT-2 Representation"]
B["Language"] --&gt; D
C["Robot Experience"] --&gt; D
D --&gt; E["Vision → Language"]
D --&gt; F["Semantic Reasoning"]
D --&gt; G["Vision + Language → Action"]
&lt;/div&gt;
&lt;p&gt;这也是 RT-2 与“拿一个预训练视觉 Encoder 接到 Robot Policy 前面”最大的不同：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 希望保留整个 VLM 已经学到的视觉—语言知识，而不只是借一个视觉特征提取器。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文消融结果也很清楚：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;RT-2-PaLI-X&lt;/th&gt;
&lt;th style="text-align: right"&gt;Size&lt;/th&gt;
&lt;th&gt;Training&lt;/th&gt;
&lt;th style="text-align: right"&gt;Unseen Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;From scratch&lt;/td&gt;
&lt;td style="text-align: right"&gt;5B&lt;/td&gt;
&lt;td&gt;Robot data&lt;/td&gt;
&lt;td style="text-align: right"&gt;9%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fine-tuning&lt;/td&gt;
&lt;td style="text-align: right"&gt;5B&lt;/td&gt;
&lt;td&gt;Robot data&lt;/td&gt;
&lt;td style="text-align: right"&gt;42%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;5B&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web + Robot&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;44%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fine-tuning&lt;/td&gt;
&lt;td style="text-align: right"&gt;55B&lt;/td&gt;
&lt;td&gt;Robot data&lt;/td&gt;
&lt;td style="text-align: right"&gt;52%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Co-Fine-Tuning&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;55B&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web + Robot&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;63%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最值得记住的是三个趋势：&lt;/p&gt;
&lt;p&gt;因此，预训练、Co-Fine-Tuning 和模型规模共同决定了 RT-2 的泛化能力。&lt;/p&gt;
&lt;p&gt;RT-2 的泛化能力并不是简单来自“更多 Robot Data”，而是开始真正利用 &lt;strong&gt;Foundation Model Knowledge&lt;/strong&gt;。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-实验到底证明了什么"&gt;4. 实验到底证明了什么？&lt;/h2&gt;
&lt;p&gt;RT-2 做了超过 &lt;strong&gt;6000 次真实机器人 evaluation trials&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;快速精读时不需要看完所有实验，只需要回答两个问题。&lt;/p&gt;
&lt;h3 id="41-基本机器人控制有没有因为换成大-vlm-而变差"&gt;4.1 基本机器人控制有没有因为换成大 VLM 而变差？&lt;/h3&gt;
&lt;p&gt;Seen Tasks：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Seen Tasks&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;92%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-PaLI-X-55B&lt;/td&gt;
&lt;td style="text-align: right"&gt;91%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-PaLM-E-12B&lt;/td&gt;
&lt;td style="text-align: right"&gt;93%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;基本没有。&lt;/p&gt;
&lt;p&gt;所以引入大型 VLM 后，RT-2 仍然保持了与 RT-1 接近的机器人控制能力。&lt;/p&gt;
&lt;h3 id="42-web-knowledge-有没有真正迁移到机器人"&gt;4.2 Web Knowledge 有没有真正迁移到机器人？&lt;/h3&gt;
&lt;p&gt;论文重点测试：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Unseen Objects
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Unseen Backgrounds
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Unseen Environments
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;平均结果：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Unseen Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;R3M&lt;/td&gt;
&lt;td style="text-align: right"&gt;12%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VC-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;10%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;32%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MOO&lt;/td&gt;
&lt;td style="text-align: right"&gt;35%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2-PaLI-X-55B&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;62%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2-PaLM-E-12B&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;62%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最关键的变化是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Seen Task 几乎没有损失，但 Unseen Average 从 RT-1 的 32% 提升到了 62%。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;可以把 RT-2 的实验结论概括成：&lt;/p&gt;
&lt;p&gt;实验上可以把 RT-2 理解为：&lt;strong&gt;Web 预训练提供语义/视觉知识，Robot Data 提供物理技能，两者在同一个 VLA 中结合。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;所以 RT-2 的价值不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“把机器人已经会做的事情做得更准。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让机器人可以利用 VLM 中已经存在的知识，处理机器人训练数据没有充分覆盖的新物体、新背景和新环境。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="5-什么叫-rt-2-的-emergent-capability"&gt;5. 什么叫 RT-2 的 Emergent Capability？&lt;/h2&gt;
&lt;p&gt;这是整篇论文最有意思的部分之一。&lt;/p&gt;
&lt;p&gt;研究者故意给机器人一些在机器人训练数据中没有直接出现过的语义任务。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move apple to 3
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型必须先理解数字符号，然后把这个理解转成机器人动作。&lt;/p&gt;
&lt;p&gt;或者：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move banana to the sum of two plus one
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里需要先完成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;2 + 1 = 3
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后再把 banana 移到数字 3。&lt;/p&gt;
&lt;p&gt;再比如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick up the bag about to fall off the table
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型不仅要识别 &lt;code&gt;bag&lt;/code&gt;，还需要理解：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;哪个 bag 处于“快掉下桌子”的状态？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文主要测试：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Symbol Understanding&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Reasoning&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Person Recognition&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;结果：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Emergent Task Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;VC-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;11%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td style="text-align: right"&gt;17%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2-PaLM-E-12B&lt;/td&gt;
&lt;td style="text-align: right"&gt;40%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2-PaLI-X-55B&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;60%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;但这里必须注意一个非常重要的边界：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Web pre-training 并没有让机器人凭空学会新的运动技能。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正迁移过来的主要是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Web Pre-training"] --&gt; B["Semantic Concepts"]
A --&gt; C["Visual Concepts"]
A --&gt; D["Relations"]
A --&gt; E["Reasoning"]
A --&gt; F["World Knowledge"]
B --&gt; G["New Semantic Conditions"]
C --&gt; G
D --&gt; G
E --&gt; G
F --&gt; G
H["Robot Data"] --&gt; I["Physical Motor Skills"]
G --&gt; J["RT-2 Behavior"]
I --&gt; J
&lt;/div&gt;
&lt;p&gt;也就是说：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-2 更像是在把已有的 Robot Skills 应用到过去没见过的语义条件上，而不是从 Web 数据里凭空学会新的 motor skill。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这个区别非常重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-chain-of-thought-也开始进入机器人控制"&gt;6. Chain-of-Thought 也开始进入机器人控制&lt;/h2&gt;
&lt;p&gt;RT-2 还尝试把中间的自然语言 &lt;code&gt;Plan&lt;/code&gt; 和 Action 放在同一个生成序列中。&lt;/p&gt;
&lt;p&gt;普通 RT-2：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Instruction → Action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;加入 Plan 后：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Instruction"] --&gt; B["VLA"]
B --&gt; C["Plan Tokens"]
C --&gt; D["Action Tokens"]
D --&gt; E["Robot Execution"]
&lt;/div&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Instruction:
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;I need to hammer a nail,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;what object from the scene might be useful?
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Plan:
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;rock
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Action:
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1 129 138 ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer2.github.io/img/CoT5.png" alt="RT-2 Chain-of-Thought" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-2 将自然语言 Plan 与 Action Token 放在同一个生成序列中，展示了将语义推理和机器人控制统一到同一个自回归模型中的可能性。图片来自 RT-2 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这和 SayCan 的思路并不一样。&lt;/p&gt;
&lt;p&gt;SayCan 更接近：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;LLM → High-level Skill Selection → Separate Low-level Policy
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而 RT-2 尝试的是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Vision + Language"] --&gt; B["Single VLA"]
B --&gt; C["Reasoning / Plan Tokens"]
C --&gt; D["Action Tokens"]
D --&gt; E["Robot Control"]
&lt;/div&gt;
&lt;p&gt;也就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Reasoning → Planning → Action 开始有可能出现在同一个 token-generation framework 中。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="7-rt-2-真正重要在哪里"&gt;7. RT-2 真正重要在哪里？&lt;/h2&gt;
&lt;p&gt;如果只看网络结构，RT-2 甚至没有特别复杂。&lt;/p&gt;
&lt;p&gt;它最核心的操作其实只有：&lt;/p&gt;
&lt;p&gt;相比 SayCan 的“LLM 选技能 + 独立低层策略”，RT-2 更进一步尝试把 Reasoning / Plan Tokens 与 Action Tokens 放进同一个生成模型。&lt;/p&gt;
&lt;p&gt;但这个接口把两个以前相对分离的世界连接了起来：&lt;/p&gt;
&lt;p&gt;RT-2 的方法可以概括为：&lt;strong&gt;Pre-trained VLM + Robot Action Tokens + Web/Robot Co-Fine-Tuning → VLA&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;所以 RT-2 最重要的贡献不是某个 Transformer Block，而是一种范式变化：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人策略不一定要从头学习整个世界。可以先让 Foundation Model 从互联网中学习视觉、语言和常识，再通过机器人数据把这些知识 Ground 到 Action Space。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是后来 VLA 路线最核心的思想之一。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="8-rt-2-的局限也直接指向了后续-openvla-和"&gt;8. RT-2 的局限，也直接指向了后续 OpenVLA 和 $\pi_0$&lt;/h2&gt;
&lt;p&gt;RT-2 并没有解决所有问题。&lt;/p&gt;
&lt;h3 id="第一模型非常大"&gt;第一，模型非常大&lt;/h3&gt;
&lt;p&gt;最大的 RT-2-PaLI-X 有：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;55B parameters
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型需要运行在多 TPU Cloud Service 上，再通过网络给机器人提供推理。&lt;/p&gt;
&lt;p&gt;控制频率大约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;55B → 1–3 Hz
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;5B → ~5 Hz
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这暴露出一个非常现实的矛盾：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Foundation Model 越大，实时 Robot Control 越困难。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="第二physical-skill-仍然依赖-robot-data"&gt;第二，Physical Skill 仍然依赖 Robot Data&lt;/h3&gt;
&lt;p&gt;RT-2 可以理解：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;rock can be used as a hammer
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;但并不意味着它会自动学会一套从未示范过的复杂 hammering motion。&lt;/p&gt;
&lt;p&gt;可以把这一边界理解为：&lt;/p&gt;
&lt;p&gt;它真正连接的是两个世界：Foundation Model 提供 Vision、Language、World Knowledge 与 Reasoning；Robot Data 则把这些能力 Ground 到 Physical Action 和 Closed-loop Control。&lt;/p&gt;
&lt;p&gt;所以 VLM 主要扩展的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;语义与世界知识&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而真正的 physical execution 仍然需要大量 Robot Data。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-把-rt-2-放回-vla-的技术发展路线"&gt;9. 把 RT-2 放回 VLA 的技术发展路线&lt;/h2&gt;
&lt;p&gt;现在可以把 RT-2 放到整个 VLA 演化中来看：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;2022&lt;br/&gt;Scale Robot Data"]
--&gt; B["RT-2&lt;br/&gt;2023&lt;br/&gt;Web Knowledge → Action"]
--&gt; C["Open X-Embodiment / RT-X&lt;br/&gt;Cross-Embodiment Robot Data"]
--&gt; D["OpenVLA&lt;br/&gt;2024&lt;br/&gt;Open + Fine-tunable VLA"]
--&gt; E["pi0&lt;br/&gt;2024&lt;br/&gt;Continuous Dexterous Control"]
&lt;/div&gt;
&lt;p&gt;这几篇论文分别在回答不同的问题：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;核心问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RT-1&lt;/td&gt;
&lt;td&gt;Robot Policy 能否随着机器人数据和任务规模扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-2&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Web Knowledge 能否直接 Ground 到 Robot Action？&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Open X-Embodiment / RT-X&lt;/td&gt;
&lt;td&gt;Robot Data 能否跨 embodiment 扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLA&lt;/td&gt;
&lt;td&gt;VLA 能否开放、微调和部署？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;VLA 如何实现连续、高频、灵巧控制？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以从今天回头看，RT-2 的历史位置非常明确：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;它真正建立了 Vision + Language → Action 这条 VLA 主线。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-rt-2"&gt;最后，用一句话理解 RT-2&lt;/h2&gt;
&lt;p&gt;如果 RT-1 的核心是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让 Transformer 从大量机器人经验中学习统一策略。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 RT-2 的核心就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 Robot Action 也变成一种 Token，使互联网规模 Vision-Language Pre-training 中获得的语义知识和推理能力，可以直接进入端到端机器人控制。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;可以把这条递进关系记成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Learn from Robot Experience"]
--&gt; B["RT-2&lt;br/&gt;Ground Web Knowledge into Action"]
--&gt; C["OpenVLA&lt;br/&gt;Make VLA Open and Adaptable"]
--&gt; D["pi0&lt;br/&gt;Rethink Continuous Action Generation"]
&lt;/div&gt;
&lt;p&gt;RT-1 让我们看到：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Robot Policy 可以开始 scale with robot data。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 则进一步告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人真正需要扩大的，不只是 Robot Data，而是能够被 Ground 到 Action 上的整个 Foundation Model Knowledge。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item></channel></rss>