<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Transformer | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/tags/transformer/</link><atom:link href="https://xht252.github.io/tags/transformer/index.xml" rel="self" type="application/rss+xml"/><description>Transformer</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>Transformer</title><link>https://xht252.github.io/tags/transformer/</link></image><item><title>RT-1 精读：Transformer 如何学会控制真实机器人</title><link>https://xht252.github.io/blog/vla/rt1/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/vla/rt1/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Anthony Brohan et al., &lt;em&gt;RT-1: Robotics Transformer for Real-World Control at Scale&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;PDF:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Project:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-1 是一篇非常适合作为 &lt;strong&gt;Robot Foundation Model / Vision-Language-Action（VLA）&lt;/strong&gt; 入门的论文。&lt;/p&gt;
&lt;p&gt;如果只用一句话概括：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-1 用大规模、多任务的真实机器人示范数据训练一个语言条件 Transformer，让同一个策略直接从图像和自然语言指令预测机器人动作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它真正重要的地方并不是“Transformer 也可以控制机器人”，而是开始验证一个更大的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;机器人策略能不能像大语言模型一样，通过更大的数据规模、更高的任务多样性和足够强的模型容量，获得更好的泛化能力？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer1.github.io/img/rt1_teaser.png" alt="RT-1 Overview" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-1 的整体目标：从大规模真实机器人数据中学习一个可以泛化到新任务、新物体和新场景的统一策略。图片来自 RT-1 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-rt-1-到底在做什么"&gt;1. RT-1 到底在做什么？&lt;/h2&gt;
&lt;p&gt;RT-1 学习的是一个端到端机器人策略。&lt;/p&gt;
&lt;p&gt;输入主要包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;最近 &lt;strong&gt;6 帧 RGB 图像&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;一条自然语言指令，例如 &lt;code&gt;pick apple&lt;/code&gt;、&lt;code&gt;open the drawer&lt;/code&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;输出是机器人当前应该执行的动作，包括机械臂位姿变化、夹爪开合、移动底盘动作和任务终止信号。&lt;/p&gt;
&lt;p&gt;整个过程可以概括为：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Language Instruction"] --&gt; C["FiLM-EfficientNet"]
B["6-frame RGB History"] --&gt; C
C --&gt; D["TokenLearner"]
D --&gt; E["Transformer"]
E --&gt; F["Action Tokens"]
F --&gt; G["Robot Execution"]
&lt;/div&gt;
&lt;p&gt;RT-1 没有显式地图，没有单独的路径规划器，也不像 Dreamer 一样先学习世界模型再 imagined rollout。&lt;/p&gt;
&lt;p&gt;它做的事情很直接：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;根据当前看到的图像和任务指令，直接预测下一步动作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="2-rt-1-最核心的东西其实是数据"&gt;2. RT-1 最核心的东西其实是数据&lt;/h2&gt;
&lt;p&gt;RT-1 使用 &lt;strong&gt;13 台真实机器人&lt;/strong&gt;，持续约 &lt;strong&gt;17 个月&lt;/strong&gt;收集数据，最终得到约 &lt;strong&gt;13 万条真实机器人 episode&lt;/strong&gt;，覆盖 &lt;strong&gt;700+ 个任务&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这些任务包括：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick object
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;place object
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;open / close drawer
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move object near another object
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;put object into drawer
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;knock object over
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;真正值得关注的不是“700”这个数字，而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这些任务之间存在大量可以复用的行为结构。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如训练数据中可能出现：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick coke can
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pick apple
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;move apple near bottle
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;模型反复看到的是不同的：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;skill + object + scene
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;组合。&lt;/p&gt;
&lt;p&gt;因此测试时，即使某条完整指令没有在训练集中出现，模型仍然可能重新组合已经学过的 skill、object 和 scene。&lt;/p&gt;
&lt;p&gt;这个过程可以这样理解：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["Many Robot Demonstrations"] --&gt; B["Reusable Skills"]
A --&gt; C["Object Concepts"]
A --&gt; D["Scene Context"]
B --&gt; E["Shared Multi-task Policy"]
C --&gt; E
D --&gt; E
E --&gt; F["New Skill–Object–Scene Combination"]
F --&gt; G["Compositional Generalization"]
&lt;/div&gt;
&lt;p&gt;所以 RT-1 并不是希望机器人“记住 700 个任务”。&lt;/p&gt;
&lt;p&gt;它真正想验证的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;一个统一策略能否从大量任务中学习到可以跨任务复用的行为表示。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="3-模型结构其实只需要理解四步"&gt;3. 模型结构：其实只需要理解四步&lt;/h2&gt;
&lt;p&gt;RT-1 约有 &lt;strong&gt;35M 参数&lt;/strong&gt;，并且需要在真实机器人上以大约 &lt;strong&gt;3 Hz&lt;/strong&gt; 的频率进行闭环控制。&lt;/p&gt;
&lt;p&gt;因此它不是简单堆一个更大的 Transformer，而是在：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;模型容量 ↔ 实时推理速度&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;之间做平衡。&lt;/p&gt;
&lt;p&gt;完整结构如下：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEj11ho9tm4Td7ByTigAgDxFWsxbsZ6tQsAng3AtwuufHRuoLaLOV9YN7FUMyyAhefzuFOVCrbwTLsEaRYidOOToS__KRrotot-6aBxTliZxYz-B2jiJG-4myq5NB3vRKaY86nr5y1-13dBv_H_XyfnDijphCM3UBalczim0PeGJ63Z0Ok6k9zvKQ2D55A/s16000/image1.png" alt="RT-1 Architecture" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-1 的模型结构：语言指令通过 USE 编码，并通过 FiLM 调制 EfficientNet；视觉特征经 TokenLearner 压缩后送入 Transformer，最终输出离散动作 token。图片来自 Google Research 官方博客。&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="31-language--universal-sentence-encoder"&gt;3.1 Language → Universal Sentence Encoder&lt;/h3&gt;
&lt;p&gt;自然语言指令首先经过预训练的 &lt;strong&gt;Universal Sentence Encoder（USE）&lt;/strong&gt;，得到语言 embedding。&lt;/p&gt;
&lt;p&gt;RT-1 并没有依靠机器人数据从零学习语言，而是直接利用已经训练好的语言语义表示。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="32-film-efficientnet让视觉特征被任务条件化"&gt;3.2 FiLM-EfficientNet：让视觉特征被任务条件化&lt;/h3&gt;
&lt;p&gt;每帧 RGB 图像经过 ImageNet 预训练的 &lt;strong&gt;EfficientNet-B3&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这里真正关键的是 &lt;strong&gt;FiLM&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;语言 embedding 会直接调制 EfficientNet 中间的视觉特征：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Instruction&lt;br/&gt;pick apple"] --&gt; B["USE Language Embedding"]
C["RGB Image"] --&gt; D["EfficientNet-B3"]
B --&gt; E["FiLM Modulation"]
D --&gt; E
E --&gt; F["Task-conditioned Visual Features"]
F --&gt; G["Focus on Task-relevant Information"]
&lt;/div&gt;
&lt;p&gt;因此 RT-1 并不是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;先看图 → 最后再拼语言
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是一种明显的 &lt;strong&gt;early language fusion&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;视觉编码过程本身就已经被当前任务条件化。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="33-tokenlearner81--8"&gt;3.3 TokenLearner：81 → 8&lt;/h3&gt;
&lt;p&gt;EfficientNet 最终得到一个：&lt;/p&gt;
$$
9\times9\times512
$$&lt;p&gt;的空间特征图。&lt;/p&gt;
&lt;p&gt;展平以后，每帧有：&lt;/p&gt;
$$
9\times9=81
$$&lt;p&gt;个视觉 token。&lt;/p&gt;
&lt;p&gt;RT-1 一次输入 6 帧，因此如果不压缩：&lt;/p&gt;
$$
6\times81=486
$$&lt;p&gt;个 token 会全部进入 Transformer。&lt;/p&gt;
&lt;p&gt;为满足实时控制要求，RT-1 使用 &lt;strong&gt;TokenLearner&lt;/strong&gt;，把每帧：&lt;/p&gt;
$$
81\rightarrow8.
$$&lt;p&gt;于是最终：&lt;/p&gt;
$$
6\times8=48
$$&lt;p&gt;个视觉 token 进入 Transformer。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["One Frame&lt;br/&gt;9 × 9 = 81 Tokens"] --&gt; B["TokenLearner"]
B --&gt; C["8 Learned Tokens / Frame"]
C --&gt; D["6 Frames"]
D --&gt; E["48 Tokens Total"]
E --&gt; F["Transformer"]
&lt;/div&gt;
&lt;p&gt;这一步非常关键。&lt;/p&gt;
&lt;p&gt;TokenLearner 不是简单 resize 或 average pooling，而是学习：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;当前任务中哪些视觉信息最值得保留。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以它同时解决了两个问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;保留任务相关视觉信息；&lt;/li&gt;
&lt;li&gt;显著降低 Transformer 计算量。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h3 id="34-transformer--action"&gt;3.4 Transformer → Action&lt;/h3&gt;
&lt;p&gt;最后，48 个视觉—语言 token 被送入一个 &lt;strong&gt;8 层 decoder-only Transformer&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Transformer 输出的不是文本，而是机器人动作。&lt;/p&gt;
&lt;p&gt;因此 RT-1 本质上把机器人控制重新写成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Task-conditioned Visual Tokens"] --&gt; B["8-layer Decoder-only Transformer"]
B --&gt; C["Action Tokens"]
C --&gt; D["Robot Control"]
&lt;/div&gt;
&lt;p&gt;这就是 &lt;strong&gt;Robotics Transformer&lt;/strong&gt; 这个名字最直接的含义：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 Robot Policy 看成一个序列建模问题。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="4-为什么要把机器人动作也变成-token"&gt;4. 为什么要把机器人动作也变成 Token？&lt;/h2&gt;
&lt;p&gt;这是 RT-1 中非常值得记住的设计。&lt;/p&gt;
&lt;p&gt;机器人机械臂和移动底盘本来都是连续控制量，但 RT-1 没有直接进行连续值回归，而是把每一个连续动作维度划分为：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;256 bins
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;整个过程可以写成：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Continuous Action"] --&gt; B["Quantize"]
B --&gt; C["256 Discrete Bins"]
C --&gt; D["Categorical Prediction"]
D --&gt; E["Action Token"]
E --&gt; F["Robot Action"]
&lt;/div&gt;
&lt;p&gt;为什么这样设计？&lt;/p&gt;
&lt;p&gt;一个重要原因是机器人示范数据具有明显的 &lt;strong&gt;multi-modality&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;例如抓取同一个物体：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;可以从左边接近；&lt;/li&gt;
&lt;li&gt;可以从右边接近；&lt;/li&gt;
&lt;li&gt;可以采用不同末端执行器姿态。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些动作都可能是合理的。&lt;/p&gt;
&lt;p&gt;如果使用简单的 Gaussian 去拟合连续动作，模型可能预测多个合理动作之间的“平均值”，而这个平均值反而可能不是一个好动作。&lt;/p&gt;
&lt;p&gt;离散 categorical distribution 则可以更自然地表达多个可能的动作模式。&lt;/p&gt;
&lt;p&gt;论文消融也显示，替换成连续动作输出后性能明显下降。&lt;/p&gt;
&lt;p&gt;所以 RT-1 给出了一个后续 VLA 一直在讨论的问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Action Representation 并不是实现细节，而是会直接决定机器人策略能够表达怎样的行为分布。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这条线后来会继续演化：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1 / RT-2&lt;br/&gt;Discrete Action Tokens"] --&gt; B["OpenVLA&lt;br/&gt;Open Autoregressive Action Tokens"]
B --&gt; C["pi0&lt;br/&gt;Continuous Action + Flow Matching"]
&lt;/div&gt;
&lt;hr&gt;
&lt;h2 id="5-实验结果重点看泛化而不是-seen-task"&gt;5. 实验结果：重点看泛化，而不是 Seen Task&lt;/h2&gt;
&lt;p&gt;论文在真实机器人上进行了超过 &lt;strong&gt;3000 次 rollout&lt;/strong&gt;，主要测试：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Seen Tasks&lt;/strong&gt;：训练中出现过；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Unseen Tasks&lt;/strong&gt;：新的任务组合；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Distractors&lt;/strong&gt;：加入额外干扰物；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Backgrounds&lt;/strong&gt;：改变环境背景。&lt;/li&gt;
&lt;/ul&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Seen&lt;/th&gt;
&lt;th style="text-align: right"&gt;Unseen&lt;/th&gt;
&lt;th style="text-align: right"&gt;Distractors&lt;/th&gt;
&lt;th style="text-align: right"&gt;Backgrounds&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Gato&lt;/td&gt;
&lt;td style="text-align: right"&gt;65%&lt;/td&gt;
&lt;td style="text-align: right"&gt;52%&lt;/td&gt;
&lt;td style="text-align: right"&gt;43%&lt;/td&gt;
&lt;td style="text-align: right"&gt;35%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BC-Z&lt;/td&gt;
&lt;td style="text-align: right"&gt;72%&lt;/td&gt;
&lt;td style="text-align: right"&gt;19%&lt;/td&gt;
&lt;td style="text-align: right"&gt;47%&lt;/td&gt;
&lt;td style="text-align: right"&gt;41%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BC-Z XL&lt;/td&gt;
&lt;td style="text-align: right"&gt;56%&lt;/td&gt;
&lt;td style="text-align: right"&gt;43%&lt;/td&gt;
&lt;td style="text-align: right"&gt;23%&lt;/td&gt;
&lt;td style="text-align: right"&gt;35%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-1&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;97%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;76%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;83%&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;59%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;论文的主要对比如下：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://robotics-transformer1.github.io/img/main_baselines.png" alt="RT-1 Main Results" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;RT-1 与 Gato、BC-Z 和 BC-Z XL 在 Seen Tasks、Unseen Tasks、Distractors 与 Backgrounds 四类场景中的成功率对比。图片来自 RT-1 官方项目页。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;真正值得看的并不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Seen = 97%&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是另外三个结果。&lt;/p&gt;
&lt;h3 id="unseen-tasks76"&gt;Unseen Tasks：76%&lt;/h3&gt;
&lt;p&gt;说明 RT-1 可以一定程度上重新组合训练中学到的技能、物体和任务结构，而不是只记忆完整指令。&lt;/p&gt;
&lt;h3 id="distractors83"&gt;Distractors：83%&lt;/h3&gt;
&lt;p&gt;说明加入额外无关物体后，策略仍具有较强鲁棒性。&lt;/p&gt;
&lt;h3 id="backgrounds59"&gt;Backgrounds：59%&lt;/h3&gt;
&lt;p&gt;这个结果一方面优于基线，另一方面也说明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;视觉环境发生较大变化后，RT-1 仍然明显受到 distribution shift 影响。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以 RT-1 的泛化更准确地说是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在大规模但仍有限的机器人数据分布附近，获得更好的组合泛化和场景鲁棒性。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而不是今天所说的完全开放世界泛化。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-rt-1-真正重要的不是某一个模块而是-scaling-思想"&gt;6. RT-1 真正重要的不是某一个模块，而是 Scaling 思想&lt;/h2&gt;
&lt;p&gt;如果只记：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;EfficientNet
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;TokenLearner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;8-layer Transformer
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;256 Action Bins
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;很容易错过这篇论文真正重要的地方。&lt;/p&gt;
&lt;p&gt;RT-1 想验证的是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["More Diverse Robot Data"] --&gt; B["One Shared Multi-task Policy"]
B --&gt; C["Knowledge Sharing Across Tasks"]
C --&gt; D["Better Generalization"]
D --&gt; E["Absorb More Data Sources"]
E --&gt; A
&lt;/div&gt;
&lt;p&gt;论文后面还测试了：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;simulation data；&lt;/li&gt;
&lt;li&gt;另一种 Kuka 机器人数据；&lt;/li&gt;
&lt;li&gt;与 SayCan 的组合。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些实验不是理解 RT-1 架构所必需的，但它们共同指向一个很重要的趋势：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;统一机器人策略可能从不同任务、不同数据源，甚至不同机器人 embodiment 中吸收可迁移知识。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就已经开始接近后来 Robot Foundation Model 的基本思想。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="7-把-rt-1-放回-vla-的发展路线"&gt;7. 把 RT-1 放回 VLA 的发展路线&lt;/h2&gt;
&lt;p&gt;从今天回头看 RT-1，会发现它是后续很多 VLA 工作的重要起点。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;2022&lt;br/&gt;Scale Robot Data"]
--&gt; B["RT-2&lt;br/&gt;2023&lt;br/&gt;Web Knowledge → Action"]
--&gt; C["Open X-Embodiment / RT-X&lt;br/&gt;Cross-Embodiment Data"]
--&gt; D["OpenVLA&lt;br/&gt;2024&lt;br/&gt;Open + Fine-tunable VLA"]
--&gt; E["pi0&lt;br/&gt;2024&lt;br/&gt;Continuous Dexterous Control"]
&lt;/div&gt;
&lt;p&gt;对应的核心问题也在不断变化：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Paper&lt;/th&gt;
&lt;th&gt;核心问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;RT-1&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;一个统一策略能否从大规模机器人数据中学习大量任务？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RT-2&lt;/td&gt;
&lt;td&gt;Web Vision-Language Knowledge 能否迁移到 Robot Action？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Open X-Embodiment / RT-X&lt;/td&gt;
&lt;td&gt;Robot Data 能否跨 embodiment 扩展？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenVLA&lt;/td&gt;
&lt;td&gt;VLA 能否开放、微调和部署？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;VLA 如何实现连续、高频、灵巧控制？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以 RT-1 的历史位置可以概括成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;它把“机器人策略能否随着数据和任务规模一起扩展”这个问题真正摆到了桌面上。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话重新理解-rt-1"&gt;最后，用一句话重新理解 RT-1&lt;/h2&gt;
&lt;p&gt;读完整篇论文以后，我会把 RT-1 概括为：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;RT-1 的核心不是提出一个特别复杂的机器人网络，而是证明：当真实机器人数据的规模和多样性足够大，并用一个能够有效吸收这些数据的统一 Transformer 策略进行训练时，机器人控制也开始出现类似 Foundation Model 的 scaling 与泛化趋势。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果继续沿着这条路线读，下一篇最自然的是 &lt;strong&gt;RT-2&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["RT-1&lt;br/&gt;Learn from Robot Experience"] --&gt; B["RT-2&lt;br/&gt;Bring Web Knowledge into Action"]
&lt;/div&gt;
&lt;p&gt;RT-1 解决的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何从大量机器人经验中学习统一策略？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;RT-2 则进一步追问：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能把互联网规模的视觉—语言知识，直接带进机器人动作空间？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item></channel></rss>