<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>World Models | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/blog/world-models/</link><atom:link href="https://xht252.github.io/blog/world-models/index.xml" rel="self" type="application/rss+xml"/><description>World Models</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>World Models</title><link>https://xht252.github.io/blog/world-models/</link></image><item><title>DreamerV3 精读：在世界模型中想象未来，再学习策略</title><link>https://xht252.github.io/blog/world-models/dreamerv3/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/world-models/dreamerv3/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Danijar Hafner et al., &lt;em&gt;Mastering diverse control tasks through world models&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;Nature:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;前面读 RT-1、RT-2、OpenVLA 和 $\pi_0$ 时，我们一直在研究一条路线：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Observation + Language → Action&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;DreamerV3 走的是另一条很重要的路线：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Observation + Action → World Model → Imagine Future → Learn Better Action&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它不要求策略只从真实环境交互中直接学习。&lt;/p&gt;
&lt;p&gt;相反，DreamerV3 先学习一个环境的 &lt;strong&gt;World Model&lt;/strong&gt;，然后让 Actor 和 Critic 在这个学习出来的潜空间世界中反复“想象未来”，再利用 imagined trajectories 学习策略。&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Real Environment"] --&gt; B["Experience"]
B --&gt; C["Replay Buffer"]
C --&gt; D["World Model"]
D --&gt; E["Imagine Future Trajectories"]
E --&gt; F["Actor + Critic Learning"]
F --&gt; G["Improved Policy"]
G --&gt; A
&lt;/div&gt;
&lt;p&gt;如果只用一句话概括 DreamerV3：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;不要只在真实世界里试错，而是先学会一个可以预测未来的世界模型，再在模型内部大量练习。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就是 Dreamer 系列最核心的思想。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="1-dreamerv3-真正想解决什么问题"&gt;1. DreamerV3 真正想解决什么问题？&lt;/h2&gt;
&lt;p&gt;强化学习算法往往非常依赖 domain-specific tuning。&lt;/p&gt;
&lt;p&gt;例如，同一个算法从：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Atari
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;换到：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Robot Control
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;再换到：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Minecraft
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;经常需要重新调整：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;reward scale；&lt;/li&gt;
&lt;li&gt;learning rate；&lt;/li&gt;
&lt;li&gt;entropy coefficient；&lt;/li&gt;
&lt;li&gt;network size；&lt;/li&gt;
&lt;li&gt;normalization；&lt;/li&gt;
&lt;li&gt;exploration strategy。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;DreamerV3 的目标更加激进：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能使用同一套超参数，在非常不同的任务上直接学习？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文最终在 &lt;strong&gt;8 个 domain、150+ 个任务&lt;/strong&gt;上使用统一配置，包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Atari；&lt;/li&gt;
&lt;li&gt;Atari100k；&lt;/li&gt;
&lt;li&gt;ProcGen；&lt;/li&gt;
&lt;li&gt;DMLab；&lt;/li&gt;
&lt;li&gt;BSuite；&lt;/li&gt;
&lt;li&gt;Proprio Control；&lt;/li&gt;
&lt;li&gt;Visual Control；&lt;/li&gt;
&lt;li&gt;Minecraft。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些任务同时包含：&lt;/p&gt;
&lt;p&gt;因此 DreamerV3 的难点不是只支持一种 observation/action，而是让同一套算法同时适应离散/连续动作、pixel/vector 输入、dense/sparse reward 和 2D/3D 环境。&lt;/p&gt;
&lt;p&gt;所以这篇论文真正强调的不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“DreamerV3 在某一个 benchmark 上拿到最高分。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;一个 Model-Based RL 算法能否在完全不同的环境里保持稳定，而不依赖大量人工调参。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="2-dreamerv3-的核心world-model--actor--critic"&gt;2. DreamerV3 的核心：World Model + Actor + Critic&lt;/h2&gt;
&lt;p&gt;DreamerV3 只有三个核心组件：&lt;/p&gt;
&lt;p&gt;三个核心组件的职责很直接：&lt;strong&gt;World Model 预测未来，Critic 评价未来，Actor 选择通向高价值未来的动作。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id="world-model"&gt;World Model&lt;/h3&gt;
&lt;p&gt;负责学习：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如果当前处于某个状态，并执行某个动作，未来会发生什么？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="critic"&gt;Critic&lt;/h3&gt;
&lt;p&gt;负责判断：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这个 imagined future 到底有多好？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="actor"&gt;Actor&lt;/h3&gt;
&lt;p&gt;负责选择：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;怎样行动才能到达价值更高的未来？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正关键的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Actor 和 Critic 的主要训练数据，不是直接来自真实环境，而是来自 World Model 产生的 imagined trajectories。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这就是 Dreamer 与普通 Model-Free RL 最大的区别。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-一张图看懂-dreamer-的-world-model"&gt;3. 一张图看懂 Dreamer 的 World Model&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2301.04104/x3.png" alt="Dreamer World Model" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;DreamerV3 的潜空间世界模型。图片来自 arXiv HTML 版论文。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;DreamerV3 使用 &lt;strong&gt;Recurrent State-Space Model（RSSM）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;它的潜状态不是单一向量，而由两部分组成：&lt;/p&gt;
$$
s_t = \{h_t,z_t\}.
$$&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$h_t$：deterministic recurrent state；&lt;/li&gt;
&lt;li&gt;$z_t$：stochastic discrete state。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;可以这样理解：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
X["Observation x_t"] --&gt; E["Encoder"]
H["Previous h_{t-1}"] --&gt; R["Recurrent Dynamics"]
Z0["Previous z_{t-1}"] --&gt; R
A["Previous Action a_{t-1}"] --&gt; R
R --&gt; HT["Deterministic State h_t"]
HT --&gt; P["Prior p(z_t | h_t)"]
HT --&gt; Q["Posterior q(z_t | h_t, x_t)"]
E --&gt; Q
Q --&gt; Z["Stochastic State z_t"]
HT --&gt; S["Model State s_t"]
Z --&gt; S
S --&gt; RW["Reward Prediction"]
S --&gt; CT["Continue Prediction"]
S --&gt; DEC["Observation Reconstruction"]
&lt;/div&gt;
&lt;p&gt;这里最容易混淆的是 &lt;strong&gt;Prior&lt;/strong&gt; 和 &lt;strong&gt;Posterior&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id="posterior训练时看到了真实-observation"&gt;Posterior：训练时看到了真实 observation&lt;/h3&gt;
$$
q_\phi(z_t\mid h_t,x_t)
$$&lt;p&gt;它可以利用当前真实观测 $x_t$ 推断潜状态。&lt;/p&gt;
&lt;h3 id="prior想象未来时看不到真实-observation"&gt;Prior：想象未来时看不到真实 observation&lt;/h3&gt;
$$
p_\phi(z_t\mid h_t)
$$&lt;p&gt;它只能依靠模型自己的 dynamics 来预测下一个潜状态。&lt;/p&gt;
&lt;p&gt;所以训练 World Model 的核心任务之一就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让 Prior 学会逼近 Posterior。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这样到了 imagined rollout 阶段，即使没有真实未来图像，模型也能够继续往前预测。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-为什么要在-latent-space-中想象而不是直接生成未来视频"&gt;4. 为什么要在 Latent Space 中想象，而不是直接生成未来视频？&lt;/h2&gt;
&lt;p&gt;DreamerV3 的 World Model 确实可以重建图像。&lt;/p&gt;
&lt;p&gt;论文甚至展示了长时间 open-loop prediction：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2301.04104/x4.png" alt="DreamerV3 Open-loop Prediction" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;给定前几个 context frames 和后续动作后，World Model 在不再读取真实中间图像的情况下预测后续画面。图片来自 arXiv HTML 版论文。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;但 Dreamer 的真正目的不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;生成好看的未来视频。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正用于策略学习的是潜状态：&lt;/p&gt;
$$
s_t=\{h_t,z_t\}.
$$&lt;p&gt;也就是说，策略学习发生在一个紧凑的 latent world 中：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Real Pixel Observation"] --&gt; B["Encoder"]
B --&gt; C["Latent State"]
C --&gt; D["World Model Dynamics"]
D --&gt; E["Imagined Latent State"]
E --&gt; F["Imagined Latent State"]
F --&gt; G["..."]
E --&gt; R["Predicted Reward"]
F --&gt; R2["Predicted Reward"]
&lt;/div&gt;
&lt;p&gt;这样做的好处很直接：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;不需要 Actor 直接处理完整高维图像；&lt;/li&gt;
&lt;li&gt;imagination 不需要每一步都生成真实 pixel；&lt;/li&gt;
&lt;li&gt;可以在 latent space 中快速 rollout；&lt;/li&gt;
&lt;li&gt;世界模型可以复用真实经验很多次。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以 Dreamer 更准确的理解不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“用视频生成模型做 RL。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;学习一个对控制有用的 latent dynamics model，然后在这个 latent dynamics 中训练策略。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="5-world-model-到底学习什么"&gt;5. World Model 到底学习什么？&lt;/h2&gt;
&lt;p&gt;World Model 从状态 $s_t=\{h_t,z_t\}$ 中预测三类关键信息：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
S["Latent State s_t"] --&gt; X["Observation Reconstruction"]
S --&gt; R["Reward Prediction"]
S --&gt; C["Continue Prediction"]
A["Action a_t"] --&gt; D["Dynamics"]
S --&gt; D
D --&gt; SN["Next Latent State"]
&lt;/div&gt;
&lt;p&gt;分别对应：&lt;/p&gt;
&lt;h3 id="observation"&gt;Observation&lt;/h3&gt;
$$
\hat{x}_t
$$&lt;p&gt;保证 latent representation 中仍然保留足够的环境信息。&lt;/p&gt;
&lt;h3 id="reward"&gt;Reward&lt;/h3&gt;
$$
\hat r_t
$$&lt;p&gt;告诉模型 imagined future 中发生的事情是否有价值。&lt;/p&gt;
&lt;h3 id="continue"&gt;Continue&lt;/h3&gt;
$$
\hat c_t
$$&lt;p&gt;预测 episode 是否继续。&lt;/p&gt;
&lt;p&gt;World Model 的总训练目标可以概括成：&lt;/p&gt;
&lt;h1 id="mathcal-l_textwm"&gt;$$
\mathcal L_{\text{WM}}&lt;/h1&gt;
&lt;p&gt;\beta_{\text{pred}}\mathcal L_{\text{pred}}
+
\beta_{\text{dyn}}\mathcal L_{\text{dyn}}
+
\beta_{\text{rep}}\mathcal L_{\text{rep}},
$$&lt;/p&gt;
&lt;p&gt;论文使用：&lt;/p&gt;
$$
\beta_{\text{pred}}=1,\qquad
\beta_{\text{dyn}}=1,\qquad
\beta_{\text{rep}}=0.1.
$$&lt;p&gt;快速阅读时不用死记公式。&lt;/p&gt;
&lt;p&gt;真正需要理解的是：&lt;/p&gt;
&lt;p&gt;因此一个 latent state 既要保留足够的信息用于 reconstruction，也要能够预测 reward、episode continuation 和下一时刻 latent state。&lt;/p&gt;
&lt;p&gt;模型既不能：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;只会重建图像，但预测不了未来。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;也不能：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;未来特别容易预测，但 latent 里面什么有用信息都没有。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;DreamerV3 的很多 robustness design，其实都在解决这个平衡问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-最关键的一步在-world-model-中-imagine"&gt;6. 最关键的一步：在 World Model 中 Imagine&lt;/h2&gt;
&lt;p&gt;World Model 学好以后，Dreamer 并不会每次都去真实环境采集新轨迹。&lt;/p&gt;
&lt;p&gt;它可以从 Replay Buffer 中取一个真实状态，然后开始：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Imagined Rollout&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文中 imagination horizon 为：&lt;/p&gt;
$$
T=16.
$$&lt;p&gt;整个过程是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Replay State s_0"] --&gt; B["Actor selects a_0"]
B --&gt; C["World Model predicts s_1, r_1"]
C --&gt; D["Actor selects a_1"]
D --&gt; E["World Model predicts s_2, r_2"]
E --&gt; F["..."]
F --&gt; G["16-step Imagined Trajectory"]
&lt;/div&gt;
&lt;p&gt;这条 imagined trajectory 包含：&lt;/p&gt;
$$
(s_t,a_t,r_t,c_t).
$$&lt;p&gt;然后：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Actor 从 imagined states 中选择动作；&lt;/li&gt;
&lt;li&gt;Critic 评估 imagined states 的未来 return；&lt;/li&gt;
&lt;li&gt;两者都不需要真实 environment step。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以 Dreamer 的数据利用方式是：&lt;/p&gt;
&lt;p&gt;一条真实经验可以被 Replay Buffer 和 World Model 反复利用，进一步产生大量 imagined trajectories 来更新 Actor-Critic。&lt;/p&gt;
&lt;p&gt;这正是 Model-Based RL 提升 &lt;strong&gt;sample efficiency&lt;/strong&gt; 的基本原因。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="7-critic怎样评价-imagined-future"&gt;7. Critic：怎样评价 imagined future？&lt;/h2&gt;
&lt;p&gt;Critic 学习的是 return distribution。&lt;/p&gt;
&lt;p&gt;DreamerV3 使用 bootstrapped $\lambda$-return：&lt;/p&gt;
&lt;h1 id="r_tlambda"&gt;$$
R_t^\lambda&lt;/h1&gt;
&lt;p&gt;r_t+
\gamma c_t
\left[
(1-\lambda)v_t
+
\lambda R_{t+1}^{\lambda}
\right].
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
$$
\gamma=0.997.
$$&lt;p&gt;不用死记这个式子。&lt;/p&gt;
&lt;p&gt;它表达的核心就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;短期相信 World Model 预测的 reward，长期则逐渐借助 Critic 的 value estimate。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Critic 将 predicted rewards 与自身的 value estimate 组合成 $\lambda$-return，用有限长度 imagination 近似更长期的未来价值。&lt;/p&gt;
&lt;p&gt;因为 imagination horizon 只有 16 steps，不可能直接模拟无限未来。&lt;/p&gt;
&lt;p&gt;Critic 的作用就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在有限 imagination 后面补上长期价值。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-actor直接在-imagined-trajectory-里学"&gt;8. Actor：直接在 imagined trajectory 里学&lt;/h2&gt;
&lt;p&gt;Actor 的输入同样是：&lt;/p&gt;
$$
s_t=\{h_t,z_t\}.
$$&lt;p&gt;它学习：&lt;/p&gt;
$$
a_t\sim\pi_\theta(a_t\mid s_t).
$$&lt;p&gt;DreamerV3 对连续动作和离散动作统一采用 &lt;strong&gt;REINFORCE estimator&lt;/strong&gt;，并加入 entropy regularization。&lt;/p&gt;
&lt;p&gt;因此策略学习可以简单理解为：&lt;/p&gt;
&lt;p&gt;Actor 直接在 imagined states 上学习动作，并通过 Critic 给出的 return signal 更新策略；DreamerV3 对连续和离散动作统一采用 REINFORCE estimator。&lt;/p&gt;
&lt;p&gt;这里一个很漂亮的地方是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;同一个 Actor-Critic learning framework 同时支持 continuous 和 discrete action spaces。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是 DreamerV3 能跨很多 domain 使用一套配置的重要基础。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-dreamerv3-真正的秘密不是新架构而是一整套-robustness-tricks"&gt;9. DreamerV3 真正的秘密：不是新架构，而是一整套 Robustness Tricks&lt;/h2&gt;
&lt;p&gt;如果只知道：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;RSSM + Actor-Critic + Imagination
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;其实更像是在理解 Dreamer 系列，而不是 DreamerV3。&lt;/p&gt;
&lt;p&gt;DreamerV3 真正解决的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;怎样让这套算法不用针对每个 domain 重新调参？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文加入了一整套 robustness techniques：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["DreamerV3 Robustness"] --&gt; B["KL Balancing + Free Bits"]
A --&gt; C["1% Uniform Mixing"]
A --&gt; D["Symlog / Symexp"]
A --&gt; E["Two-hot Prediction"]
A --&gt; F["Percentile Return Normalization"]
B --&gt; G["Stable World Model"]
C --&gt; G
D --&gt; H["Stable Prediction Across Scales"]
E --&gt; H
F --&gt; I["Stable Actor Learning"]
G --&gt; J["One Configuration Across Domains"]
H --&gt; J
I --&gt; J
&lt;/div&gt;
&lt;p&gt;其中最值得理解的是下面三个。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="10-symlog不同任务的数值尺度差太大怎么办"&gt;10. Symlog：不同任务的数值尺度差太大怎么办？&lt;/h2&gt;
&lt;p&gt;不同环境中的 observation、reward 和 return 可能差很多个数量级。&lt;/p&gt;
&lt;p&gt;直接使用 squared loss 时：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;大数值 target 会产生非常大的 gradient。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;DreamerV3 使用：&lt;/p&gt;
&lt;h1 id="operatornamesymlogx"&gt;$$
\operatorname{symlog}(x)&lt;/h1&gt;
&lt;p&gt;\operatorname{sign}(x)\ln(|x|+1).
$$&lt;/p&gt;
&lt;p&gt;它的逆变换是：&lt;/p&gt;
&lt;h1 id="operatornamesymexpx"&gt;$$
\operatorname{symexp}(x)&lt;/h1&gt;
&lt;p&gt;\operatorname{sign}(x)(e^{|x|}-1).
$$&lt;/p&gt;
&lt;p&gt;Symlog 的作用可以直观理解成：&lt;/p&gt;
&lt;p&gt;Symlog 会压缩绝对值很大的正负信号，同时在零附近近似恒等映射，因此可以缓解不同 domain 数值尺度差异造成的梯度不稳定。&lt;/p&gt;
&lt;p&gt;它有两个重要特点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;正负值都可以处理；&lt;/li&gt;
&lt;li&gt;小数值附近近似 identity，大数值则被 logarithmically compressed。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以同一套 loss 不容易因为不同 domain 的数值尺度而崩掉。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="11-two-hot为什么-reward-和-value-不直接做普通回归"&gt;11. Two-hot：为什么 Reward 和 Value 不直接做普通回归？&lt;/h2&gt;
&lt;p&gt;Reward 和 Return 往往：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;noisy；&lt;/li&gt;
&lt;li&gt;multi-modal；&lt;/li&gt;
&lt;li&gt;跨环境尺度差异巨大。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;DreamerV3 没有让 reward head 和 critic 简单输出一个 Gaussian mean。&lt;/p&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把连续值投到 exponentially spaced bins 上，再使用 two-hot target。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如某个 target 落在两个 bin 中间：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bin_k target bin_k+1
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; |-----------|-------------|
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; 0.7 0.3
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;于是 target 不是 one-hot：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;[0, 0, 1, 0, ...]
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是类似：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;[0, 0, 0.7, 0.3, 0, ...]
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这样最终仍可以恢复连续预测值，但训练变成更稳定的 categorical cross-entropy。&lt;/p&gt;
&lt;p&gt;最重要的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;gradient magnitude 不再直接由 target 的绝对数值大小决定。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这对跨 domain 学习非常重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="12-kl-balancing--free-bits不要让-latent-space-崩掉"&gt;12. KL Balancing + Free Bits：不要让 Latent Space 崩掉&lt;/h2&gt;
&lt;p&gt;RSSM 需要让：&lt;/p&gt;
$$
p_\phi(z_t\mid h_t)
$$&lt;p&gt;预测：&lt;/p&gt;
$$
q_\phi(z_t\mid h_t,x_t).
$$&lt;p&gt;但如果 KL regularization 太强，模型可能选择一个非常容易预测、却几乎不包含 observation information 的 latent representation。&lt;/p&gt;
&lt;p&gt;DreamerV3 使用 &lt;strong&gt;free bits&lt;/strong&gt;：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;当 KL 已经低于 &lt;strong&gt;1 nat&lt;/strong&gt; 时，不再继续强迫它变得更小。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Posterior q(z|h,x)"] --&gt; C["KL Alignment"]
B["Prior p(z|h)"] --&gt; C
C --&gt; D{"KL &gt; 1 nat?"}
D --&gt;|Yes| E["Continue Dynamics / Representation Alignment"]
D --&gt;|No| F["Stop Pushing KL Lower"]
F --&gt; G["Preserve Informative Latent Features"]
&lt;/div&gt;
&lt;p&gt;另外 categorical latent 还混入：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;99% predicted distribution
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;1% uniform distribution
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;避免概率变成完全 deterministic，从而减少 KL spike。&lt;/p&gt;
&lt;p&gt;论文消融显示：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;KL balancing + free bits 是最重要的一组 robustness techniques。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="13-return-normalization为什么-actor-能跨不同-reward-scale"&gt;13. Return Normalization：为什么 Actor 能跨不同 Reward Scale？&lt;/h2&gt;
&lt;p&gt;Actor 中 entropy regularization 的合理权重取决于 reward scale。&lt;/p&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Environment A reward ≈ 1
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Environment B reward ≈ 10000
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;如果直接用同一个 entropy coefficient，很难同时适配。&lt;/p&gt;
&lt;p&gt;DreamerV3 不使用简单 min/max，而根据 batch 中 return 的：&lt;/p&gt;
$$
95\%-5\%
$$&lt;p&gt;percentile range 估计尺度：&lt;/p&gt;
&lt;h2 id="operatornameper_95rlambda"&gt;$$
S=
\operatorname{EMA}
\left(
\operatorname{Per}_{95}(R^\lambda)&lt;/h2&gt;
&lt;p&gt;\operatorname{Per}_{5}(R^\lambda)
\right).
$$&lt;/p&gt;
&lt;p&gt;直观上：&lt;/p&gt;
&lt;p&gt;Return normalization 使用 batch 中 5th–95th percentile 的范围而不是 min/max，从而降低 outlier 对 Actor 学习和 entropy trade-off 的影响。&lt;/p&gt;
&lt;p&gt;使用 percentile 而不是 min/max，可以降低 outlier 的影响。&lt;/p&gt;
&lt;p&gt;这也是 DreamerV3 能使用固定 entropy scale 跨 domain 工作的关键之一。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="14-实验真正厉害在哪里"&gt;14. 实验真正厉害在哪里？&lt;/h2&gt;
&lt;p&gt;DreamerV3 最重要的实验结论不是某一个 benchmark 的单项 SOTA。&lt;/p&gt;
&lt;p&gt;而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;同一套超参数跨 8 个 domain、150+ tasks 工作。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文的 benchmark summary：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2301.04104/x1.png" alt="DreamerV3 Benchmark Summary" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;DreamerV3 使用统一配置与多个针对特定 benchmark 调优的 expert algorithms 比较。图片来自 arXiv HTML 版论文。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;论文覆盖：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Domain&lt;/th&gt;
&lt;th&gt;主要挑战&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Atari&lt;/td&gt;
&lt;td&gt;离散动作、视觉输入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Atari100k&lt;/td&gt;
&lt;td&gt;极低数据预算&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ProcGen&lt;/td&gt;
&lt;td&gt;Procedural generalization&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DMLab&lt;/td&gt;
&lt;td&gt;3D spatial / temporal reasoning&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BSuite&lt;/td&gt;
&lt;td&gt;Exploration、memory、reward scale&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Proprio Control&lt;/td&gt;
&lt;td&gt;连续控制、vector input&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Visual Control&lt;/td&gt;
&lt;td&gt;连续控制、pixel input&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Minecraft&lt;/td&gt;
&lt;td&gt;Sparse reward、long horizon、open world&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;DreamerV3 在这些 domain 上匹配或超过很多专门算法，并且在所有 domain 上明显优于论文使用的统一 PPO baseline。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="15-minecraft-diamond-为什么这么重要"&gt;15. Minecraft Diamond 为什么这么重要？&lt;/h2&gt;
&lt;p&gt;Minecraft 是 DreamerV3 最吸引人的实验。&lt;/p&gt;
&lt;p&gt;获取 diamond 需要完成一连串前置行为：&lt;/p&gt;
&lt;p&gt;Minecraft Diamond 任务需要探索、资源收集、工具制作和长时序 credit assignment；DreamerV3 在论文设置下不使用 human demonstrations 或 domain-specific curriculum，从 sparse rewards 学会获得 diamond。&lt;/p&gt;
&lt;p&gt;困难在于：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;sparse reward；&lt;/li&gt;
&lt;li&gt;long horizon；&lt;/li&gt;
&lt;li&gt;exploration；&lt;/li&gt;
&lt;li&gt;每次都是 procedurally generated world；&lt;/li&gt;
&lt;li&gt;从 pixels 开始学习。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;论文报告 DreamerV3 在默认配置下、&lt;strong&gt;不使用 human demonstration，也不使用 domain-specific curriculum&lt;/strong&gt;，能够从头学习获得 diamond。&lt;/p&gt;
&lt;p&gt;但这里也需要注意论文的实验边界：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;Minecraft 使用 MineRL competition action space，其中包含 abstract crafting actions；论文还沿用前人设置加速 block breaking。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以它并不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“直接从原始键盘鼠标操作无任何环境设计地学会完整 Minecraft。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这个边界在理解结果时很重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="16-scalingworld-model-也出现了规模效应"&gt;16. Scaling：World Model 也出现了规模效应&lt;/h2&gt;
&lt;p&gt;DreamerV3 还测试了从：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;12M → 400M parameters
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的多个模型规模。&lt;/p&gt;
&lt;p&gt;结果显示：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;模型越大，不仅最终 performance 更高，而且达到成功策略所需要的真实环境 interaction 更少。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;也就是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["More Compute"] --&gt; B["Larger World Model"]
A --&gt; C["Higher Replay Ratio"]
B --&gt; D["Better Prediction / Representation"]
C --&gt; E["More Learning per Real Experience"]
D --&gt; F["Higher Task Performance"]
E --&gt; F
D --&gt; G["Lower Environment Interaction"]
E --&gt; G
&lt;/div&gt;
&lt;p&gt;这点非常值得注意。&lt;/p&gt;
&lt;p&gt;在 Model-Based RL 中，更多计算不仅可以提升性能，还可能直接换来：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;更高的真实世界 sample efficiency。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;对于机器人这种真实 interaction 昂贵的任务，这一点尤其重要。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="17-dreamerv3-和-vla-到底是什么关系"&gt;17. DreamerV3 和 VLA 到底是什么关系？&lt;/h2&gt;
&lt;p&gt;这是我觉得最值得把 DreamerV3 放进前面阅读路线中的原因。&lt;/p&gt;
&lt;p&gt;VLA 和 Dreamer 其实在解决不同的问题。&lt;/p&gt;
&lt;h3 id="rt-2--openvla-"&gt;RT-2 / OpenVLA / $\pi_0$&lt;/h3&gt;
&lt;p&gt;更接近：&lt;/p&gt;
&lt;p&gt;对于 RT-2 / OpenVLA / $\pi_0$，主要计算路径更接近 &lt;strong&gt;Vision + Language → Policy/VLA → Action&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;核心问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;怎样直接从多模态 observation 产生泛化能力强的机器人动作？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="dreamerv3"&gt;DreamerV3&lt;/h3&gt;
&lt;p&gt;更接近：&lt;/p&gt;
&lt;p&gt;DreamerV3 则更接近 &lt;strong&gt;Observation + Action → World Model → Future Prediction → Imagination → Actor-Critic → Action&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;核心问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;怎样学习环境 dynamics，并利用 imagined future 提升策略学习效率？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;两条路线的区别可以总结为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;VLA&lt;/th&gt;
&lt;th&gt;DreamerV3&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;核心&lt;/td&gt;
&lt;td&gt;Direct Policy&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Learned World Model&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;主要知识&lt;/td&gt;
&lt;td&gt;Vision / Language / Robot Data&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Environment Dynamics&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;策略训练&lt;/td&gt;
&lt;td&gt;Demonstration / Policy Learning&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Imagined Rollouts&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Future Prediction&lt;/td&gt;
&lt;td&gt;通常隐式&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;显式核心模块&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;强项&lt;/td&gt;
&lt;td&gt;Semantic Generalization&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Sample-efficient Control&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;关键问题&lt;/td&gt;
&lt;td&gt;What action?&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;What happens if I take this action?&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以从研究角度看，两者并不是互斥路线。&lt;/p&gt;
&lt;p&gt;反而非常自然地可以继续追问：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;VLA 负责理解复杂语义和生成动作，World Model 负责预测动作之后未来会发生什么，二者能不能进一步结合？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是当前具身智能中非常值得研究的问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="18-dreamerv3-的局限也要看清楚"&gt;18. DreamerV3 的局限也要看清楚&lt;/h2&gt;
&lt;p&gt;DreamerV3 很强，但它并不是“已经学会通用世界知识”。&lt;/p&gt;
&lt;h3 id="第一它仍然需要-environment-interaction"&gt;第一，它仍然需要 Environment Interaction&lt;/h3&gt;
&lt;p&gt;DreamerV3 不依赖 human demonstration，但数据仍然来自 agent 自己与环境交互。&lt;/p&gt;
&lt;p&gt;也就是说：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;No Human Data
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;≠
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;No Environment Data
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="第二world-model-预测错误会影响-policy"&gt;第二，World Model 预测错误会影响 Policy&lt;/h3&gt;
&lt;p&gt;Actor 和 Critic 在 imagined trajectory 中训练。&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如果 World Model 在策略关心的区域预测错了，Actor 就可能学习利用模型错误。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一直是 Model-Based RL 的核心风险之一。&lt;/p&gt;
&lt;h3 id="第三它不是-internet-pretrained-world-model"&gt;第三，它不是 Internet-pretrained World Model&lt;/h3&gt;
&lt;p&gt;DreamerV3 的 World Model 是针对当前 environment 从 agent experience 中学习的。&lt;/p&gt;
&lt;p&gt;它和今天讨论的：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;large video world model
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;internet-scale pretraining
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;general physical foundation model
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;还不是同一个概念。&lt;/p&gt;
&lt;p&gt;论文的结论本身也把：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;从 internet videos 学习 world knowledge，以及跨 domain 学习单一 world model&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;列为未来方向。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-dreamerv3"&gt;最后，用一句话理解 DreamerV3&lt;/h2&gt;
&lt;p&gt;如果 VLA 的问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“看到现在，我应该做什么？”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;那么 DreamerV3 的核心问题更像：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“如果我这样做，未来会发生什么？哪一种未来更值得去？”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;整个算法可以最后压缩成：&lt;/p&gt;
&lt;p&gt;所以 DreamerV3 的核心循环可以压缩成：&lt;strong&gt;Interact → Learn World Model → Imagine Futures → Improve Policy → Interact Again&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;DreamerV3 真正重要的地方，不只是提出了一个 World Model。&lt;/p&gt;
&lt;p&gt;而是证明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;通过 RSSM 潜空间建模、imagined Actor-Critic learning，以及 symlog、two-hot、KL balancing、free bits、return normalization 等一整套稳定化设计，Model-Based RL 可以用同一套超参数跨越非常不同的任务，并随着模型规模和计算量增加获得更好的性能与数据效率。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果把它放到前面已经读过的具身智能路线中，我会这样记：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["VLA Line&lt;br/&gt;RT-1 → RT-2 → OpenVLA → pi0"]
--&gt; B["Understand Observation / Language&lt;br/&gt;Generate Action"]
C["World Model Line&lt;br/&gt;DreamerV1 → DreamerV2 → DreamerV3"]
--&gt; D["Learn Dynamics&lt;br/&gt;Imagine Future"]
B --&gt; E["Future Embodied Agent"]
D --&gt; E
&lt;/div&gt;
&lt;p&gt;真正有意思的下一步，正是在这两条线的交汇处：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;让智能体既具备 Foundation Model 的语义理解能力，又具备 World Model 的未来预测和 imagined decision-making 能力。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;</description></item><item><title>GaussianDWM 精读：用 3D Gaussian 统一驾驶场景理解与生成</title><link>https://xht252.github.io/blog/world-models/gaussiandwm/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/world-models/gaussiandwm/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Tianchen Deng et al., &lt;em&gt;GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;Venue:&lt;/strong&gt; CVPR 2026, pp. 10656–10667&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;CVPR:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;前面读 DreamerV3 时，我们看到的 World Model 是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;学习环境 dynamics，然后在 latent world 中想象未来，用 imagined trajectories 训练 Actor-Critic。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GaussianDWM 虽然同样叫 &lt;strong&gt;World Model&lt;/strong&gt;，但它走的是另一条路线。&lt;/p&gt;
&lt;p&gt;它更关心：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能构建一个显式的三维世界表示，让模型不仅可以生成未来，还能够真正理解“场景里有什么、在哪里、应该怎么描述和规划”？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以这篇论文最核心的关键词不是 RL，而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D Gaussian + Language + Scene Understanding + Multi-Modal Generation&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;传统 Driving World Model 更偏向“预测未来画面”，而 GaussianDWM 进一步把目标扩展到显式 3D scene understanding、language reasoning 和 multi-modal generation。&lt;/p&gt;
&lt;p&gt;如果只用一句话概括 GaussianDWM：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把语言增强的 3D Gaussian 作为统一 World Representation，让同一个世界模型既可以回答驾驶场景问题，也可以生成空间变化和未来时刻的 RGB-D 场景。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="1-gaussiandwm-到底想解决什么问题"&gt;1. GaussianDWM 到底想解决什么问题？&lt;/h2&gt;
&lt;p&gt;很多 Driving World Model 的核心任务是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Current Driving Scene
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Future Video / Image / Point Cloud
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;例如预测：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;车辆继续向前后画面会怎样变化；&lt;/li&gt;
&lt;li&gt;自车移动以后新的视角是什么；&lt;/li&gt;
&lt;li&gt;一两秒后的街景会是什么样。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些模型在 &lt;strong&gt;generation&lt;/strong&gt; 上越来越强，但论文认为还有一个明显问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;会生成未来，不等于真正理解三维世界。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;一个驾驶系统不仅需要生成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“未来长什么样？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;还需要回答：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;前方有哪些车？&lt;/li&gt;
&lt;li&gt;某个目标的 3D 位置在哪里？&lt;/li&gt;
&lt;li&gt;这个目标未来会怎样运动？&lt;/li&gt;
&lt;li&gt;ego vehicle 应该怎么走？&lt;/li&gt;
&lt;li&gt;不同 camera view 中的目标是不是同一个物体？&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此 GaussianDWM 想把两个长期相对独立的方向统一：&lt;/p&gt;
&lt;p&gt;因此 GaussianDWM 想统一两件事：一边做 &lt;strong&gt;Scene Understanding&lt;/strong&gt;，一边做 &lt;strong&gt;Scene Generation&lt;/strong&gt;，并让两者共享同一套 3D world representation。&lt;/p&gt;
&lt;p&gt;这也是论文标题里：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Unified Scene Understanding and Multi-Modal Generation&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正的含义。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-为什么是-3d-gaussian而不是-bev-或-point-cloud"&gt;2. 为什么是 3D Gaussian，而不是 BEV 或 Point Cloud？&lt;/h2&gt;
&lt;p&gt;在 GaussianDWM 之前，很多驾驶 VLM / World Model 会把三维信息表示成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;BEV Features
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Point Clouds
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Depth Features
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后再把这些特征投影到语言模型的 embedding space。&lt;/p&gt;
&lt;p&gt;问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这种对齐通常仍然停留在 feature-level，语言语义与真实三维空间之间缺乏显式对应。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GaussianDWM 的核心选择是 &lt;strong&gt;3D Gaussian Splatting（3DGS）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;一个 Gaussian primitive 本身带有明确的三维属性：&lt;/p&gt;
$$
G_i=(x_i,o_i,s_i,r_i,f_i),
$$&lt;p&gt;其中可以粗略理解为：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$x_i$：3D position；&lt;/li&gt;
&lt;li&gt;$o_i$：opacity；&lt;/li&gt;
&lt;li&gt;$s_i$：scale；&lt;/li&gt;
&lt;li&gt;$r_i$：rotation；&lt;/li&gt;
&lt;li&gt;$f_i$：language / semantic feature。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最重要的是最后一个：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;GaussianDWM 不只给 Gaussian 存 geometry 和 appearance，还把语言特征直接嵌入每一个 Gaussian primitive。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;于是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["3D Gaussian Primitive"] --&gt; B["3D Position"]
A --&gt; C["Scale"]
A --&gt; D["Rotation"]
A --&gt; E["Opacity"]
A --&gt; F["Language Feature"]
B --&gt; G["Geometry"]
C --&gt; G
D --&gt; G
E --&gt; H["Appearance / Rendering"]
F --&gt; I["Semantic Meaning"]
G --&gt; J["Language-aligned 3D World Representation"]
H --&gt; J
I --&gt; J
&lt;/div&gt;
&lt;p&gt;这一步非常重要。&lt;/p&gt;
&lt;p&gt;它让“某个文本概念”和“真实三维空间中的 Gaussian”之间建立更加直接的 correspondence。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-一张图看懂-gaussiandwm"&gt;3. 一张图看懂 GaussianDWM&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2512.23180v3/x1.png" alt="GaussianDWM System Overview" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;GaussianDWM 的整体框架。图片来自 arXiv HTML 版论文 Figure 2。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;整篇论文其实可以拆成三个模块：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Multi-view Images + 3D Gaussians"] --&gt; B["World Tokenizer"]
Q["Text Query"] --&gt; B
B --&gt; C["Compact 3D World Tokens"]
C --&gt; D["Scene Understanding LLM"]
D --&gt; E["Text Answer"]
D --&gt; F["High-level World Knowledge"]
F --&gt; G["Dual-condition Generator"]
H["Low-level Image / Geometry Condition"] --&gt; G
G --&gt; I["RGB Generation"]
G --&gt; J["Depth Generation"]
G --&gt; K["Spatial / Temporal Future"]
&lt;/div&gt;
&lt;p&gt;对应论文三部分：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;World Tokenizer&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Scene Understanding&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Multi-modal Scene Generation&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;其中真正把整个系统串起来的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Knowledge&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;理解模块不仅输出答案，还提取一个高层语言条件，继续指导后面的生成模型。&lt;/p&gt;
&lt;p&gt;这也是 GaussianDWM 相比“一个 VLM + 一个独立视频生成器”更有意思的地方。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-world-tokenizer把真实三维世界变成-llm-能读的-token"&gt;4. World Tokenizer：把真实三维世界变成 LLM 能读的 Token&lt;/h2&gt;
&lt;p&gt;这是整篇论文最值得理解的模块。&lt;/p&gt;
&lt;p&gt;原始驾驶场景中的 3D Gaussians 非常多。&lt;/p&gt;
&lt;p&gt;一个场景可能包含：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;几十万级 Gaussian primitives&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果全部直接塞给 LLM：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;hundreds of thousands of Gaussians
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ hundreds of thousands of tokens
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ impossible
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以 GaussianDWM 首先需要解决：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何把一个稠密的 3D Gaussian World 压缩成少量但有用的 World Tokens？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;整个过程是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Dense 3D Gaussian Scene"] --&gt; B["Language-augmented Gaussians"]
B --&gt; C["Gaussian Projector"]
C --&gt; D["Task-aware Sampling"]
D --&gt; E["Compact 3D Gaussian Tokens"]
E --&gt; F["LLM"]
&lt;/div&gt;
&lt;p&gt;这就是论文所谓的：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Tokenizer&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="5-language-augmented-gaussian先把语言放进-3d-世界"&gt;5. Language-Augmented Gaussian：先把语言放进 3D 世界&lt;/h2&gt;
&lt;p&gt;作者基于 &lt;strong&gt;LangSplat&lt;/strong&gt; 构建 3D Gaussian language field。&lt;/p&gt;
&lt;p&gt;语言特征来自：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;SAM
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;CLIP Semantic Features
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;3D Gaussian Language Features
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;论文还做了一个很实际的压缩。&lt;/p&gt;
&lt;p&gt;原始 CLIP feature：&lt;/p&gt;
$$
D=512.
$$&lt;p&gt;通过 scene-wise language autoencoder 压到：&lt;/p&gt;
$$
d=3.
$$&lt;p&gt;之后再通过 decoder 恢复到 CLIP feature space。&lt;/p&gt;
&lt;p&gt;这说明作者面对的一个实际问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D Gaussian 数量极多，即使每个 Gaussian 只多存一点语义特征，总 memory 也会迅速膨胀。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此这一步同时实现：&lt;/p&gt;
&lt;p&gt;作者把 512 维 CLIP semantic feature 通过 scene-wise language autoencoder 压缩到 3 维后存入 Gaussian primitive，再通过 decoder 恢复语义表示，以显著降低 dense 3DGS 的 memory cost。&lt;/p&gt;
&lt;p&gt;这里的“3D”指的是 &lt;strong&gt;3-dimensional feature vector&lt;/strong&gt;，不是“三维空间”本身。&lt;/p&gt;
&lt;p&gt;这是阅读论文时比较容易混淆的一点。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-gaussian-projectorgeometry--appearance--semantics-进入统一空间"&gt;6. Gaussian Projector：Geometry + Appearance + Semantics 进入统一空间&lt;/h2&gt;
&lt;p&gt;仅仅把 language feature 放进 Gaussian 还不够。&lt;/p&gt;
&lt;p&gt;LLM 需要的仍然是统一维度的 Token。&lt;/p&gt;
&lt;p&gt;所以对于每个 Gaussian：&lt;/p&gt;
$$
G_i=(x_i,o_i,s_i,r_i,f_i),
$$&lt;p&gt;作者分别编码：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;position；&lt;/li&gt;
&lt;li&gt;opacity；&lt;/li&gt;
&lt;li&gt;scale；&lt;/li&gt;
&lt;li&gt;rotation；&lt;/li&gt;
&lt;li&gt;semantic feature。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;其中 3D position 会先使用 Fourier embedding，论文设置：&lt;/p&gt;
$$
L=10.
$$&lt;p&gt;然后不同属性经过各自的 MLP projector，被映射到统一的 &lt;strong&gt;4096-dimensional feature space&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;最后利用可学习权重融合成一个 Gaussian token：&lt;/p&gt;
&lt;h1 id="mathcal-g_i"&gt;$$
\mathcal G_i&lt;/h1&gt;
&lt;p&gt;\sum_p \alpha_p h_i^p.
$$&lt;/p&gt;
&lt;p&gt;快速理解时不用记公式，记住这件事就够了：&lt;/p&gt;
&lt;p&gt;最终，每个 Gaussian 的 position、opacity、scale、rotation 和 semantic feature 分别投影后融合成统一 Gaussian Token，再送入 LLM feature space。&lt;/p&gt;
&lt;p&gt;所以一个 Gaussian Token 不只是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“这里有一个三维点。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“这里有一个具有位置、大小、朝向、可见性和语义信息的三维场景 primitive。”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="7-task-aware-sampling不是所有-gaussian-都值得给-llm-看"&gt;7. Task-Aware Sampling：不是所有 Gaussian 都值得给 LLM 看&lt;/h2&gt;
&lt;p&gt;这是我认为论文第二个非常漂亮的设计。&lt;/p&gt;
&lt;p&gt;即使完成 Gaussian Tokenization，场景中的 Gaussian 数量仍然太大。&lt;/p&gt;
&lt;p&gt;所以作者不固定使用一种 sampling，而是根据任务来决定：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;LLM 到底需要看全局，还是只需要看某一小块区域？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="scene-understanding--planning"&gt;Scene Understanding / Planning&lt;/h3&gt;
&lt;p&gt;对于需要全局理解的任务：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;scene caption
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;region description
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;planning
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;需要保留整体场景结构。&lt;/p&gt;
&lt;p&gt;作者使用：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Uniform Sampling + Top-k Sampling&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;最终从大量 Gaussians 中选择：&lt;/p&gt;
$$
N=4096
$$&lt;p&gt;个 token 给 LLM。&lt;/p&gt;
&lt;h3 id="2d--3d-visual-grounding"&gt;2D / 3D Visual Grounding&lt;/h3&gt;
&lt;p&gt;如果问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“后方相机里这辆车的 3D bounding box 是什么？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正有价值的是和这个 query 相关的 Gaussian。&lt;/p&gt;
&lt;p&gt;因此进一步加入：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Language-Guided Similarity Sampling&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["Dense Gaussian Tokens"] --&gt; B{"What task?"}
B --&gt;|"Global Understanding / Planning"| C["Uniform + Top-k Sampling"]
C --&gt; D["4096 Global Tokens"]
B --&gt;|"2D / 3D Grounding"| E["Text–Gaussian Similarity"]
E --&gt; F["Keep Query-relevant Gaussians"]
D --&gt; G["LLM"]
F --&gt; G
&lt;/div&gt;
&lt;p&gt;这其实和现代大模型里的 &lt;strong&gt;Token Pruning / Query-conditioned Retrieval&lt;/strong&gt; 很像。&lt;/p&gt;
&lt;p&gt;区别是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这里被检索的不是文本 chunk，而是真实三维世界中的 Gaussian primitives。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-scene-understanding让-llm-直接读三维世界"&gt;8. Scene Understanding：让 LLM 直接“读”三维世界&lt;/h2&gt;
&lt;p&gt;Gaussian tokens 与 text tokens 进入 LLM。&lt;/p&gt;
&lt;p&gt;论文最终使用：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Qwen3-8B&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作为语言模型。&lt;/p&gt;
&lt;p&gt;LLM 输出两类东西：&lt;/p&gt;
&lt;p&gt;Qwen3-8B 同时输出文本答案和高层 World Knowledge feature；前者用于理解任务，后者继续作为 scene generation 的高层条件。&lt;/p&gt;
&lt;p&gt;这里第二个输出尤其重要。&lt;/p&gt;
&lt;p&gt;LLM 不只是回答：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“前面有几辆车？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它内部提取出的高层世界知识还会继续传给 generation module。&lt;/p&gt;
&lt;p&gt;这让：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Understanding
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;和：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Generation
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;真正发生了信息交互。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-它到底理解哪些-driving-task"&gt;9. 它到底理解哪些 Driving Task？&lt;/h2&gt;
&lt;p&gt;论文在 NuInteract 上主要测试四类场景理解任务：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;模型需要做什么&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RD&amp;amp;P&lt;/td&gt;
&lt;td&gt;Region Description &amp;amp; Perception&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2D VG&lt;/td&gt;
&lt;td&gt;在图像中找到 query 对应目标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3D VG&lt;/td&gt;
&lt;td&gt;给出目标的三维空间位置&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Planning&lt;/td&gt;
&lt;td&gt;根据当前场景判断 ego vehicle 行为&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;How should the ego car proceed?
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Go Straight
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;或者：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Find all cars in CAM_BACK
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;and provide their 3D bounding boxes.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;论文中的定性结果非常直观：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2512.23180v3/x2.png" alt="GaussianDWM Understanding and Generation" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;GaussianDWM 同时进行 2D/3D grounding、场景问答、规划以及 RGB-D 空间/时间生成。图片来自 arXiv HTML 版论文 Figure 3。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这张图其实非常适合概括论文：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;同一个 3D Gaussian World 既能被“问问题”，也能被“向未来生成”。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="10-multi-modal-generation为什么还需要-language-condition"&gt;10. Multi-Modal Generation：为什么还需要 Language Condition？&lt;/h2&gt;
&lt;p&gt;如果只想生成未来场景，传统方法可以直接使用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;image
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;geometry / point cloud
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;camera pose
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;作为生成条件。&lt;/p&gt;
&lt;p&gt;GaussianDWM 认为这仍然不够。&lt;/p&gt;
&lt;p&gt;因为这些条件告诉生成器：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;像素和几何应该在哪里。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但并没有显式告诉它：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这个世界正在发生什么。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以论文提出 &lt;strong&gt;Dual-Condition Generation&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Low-level Condition&lt;br/&gt;Image + Geometry"] --&gt; D["Multi-modal Generator"]
B["High-level Condition&lt;br/&gt;LLM World Knowledge"] --&gt; D
C["Noisy RGB / Depth Latent"] --&gt; D
D --&gt; E["RGB"]
D --&gt; F["Depth"]
D --&gt; G["Spatial Generation"]
D --&gt; H["Temporal Generation"]
&lt;/div&gt;
&lt;p&gt;可以把两个 condition 的职责理解为：&lt;/p&gt;
&lt;h3 id="low-level-condition"&gt;Low-level Condition&lt;/h3&gt;
&lt;p&gt;负责：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;texture；&lt;/li&gt;
&lt;li&gt;local geometry；&lt;/li&gt;
&lt;li&gt;image style；&lt;/li&gt;
&lt;li&gt;precise spatial constraint。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="high-level-world-knowledge"&gt;High-level World Knowledge&lt;/h3&gt;
&lt;p&gt;负责：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;semantic context；&lt;/li&gt;
&lt;li&gt;object relationships；&lt;/li&gt;
&lt;li&gt;scene-level reasoning；&lt;/li&gt;
&lt;li&gt;temporal intent / trajectory information。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是论文所谓：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;high-level world knowledge + low-level image condition&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;联合指导生成。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="11-spatial-generation-与-temporal-generation-是两件不同的事"&gt;11. Spatial Generation 与 Temporal Generation 是两件不同的事&lt;/h2&gt;
&lt;p&gt;GaussianDWM 同时支持两种“未来”。&lt;/p&gt;
&lt;h3 id="spatial-generation"&gt;Spatial Generation&lt;/h3&gt;
&lt;p&gt;不是时间变化，而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如果 camera / ego position 改变，场景应该长什么样？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文测试 novel-view synthesis，例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;±1 m
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;±2 m
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;±4 m
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的 viewpoint shifts。&lt;/p&gt;
&lt;h3 id="temporal-generation"&gt;Temporal Generation&lt;/h3&gt;
&lt;p&gt;是真正的：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;1 秒或 2 秒以后，场景会怎样变化？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文方法部分支持：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+1 s
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+2 s
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;未来预测。&lt;/p&gt;
&lt;p&gt;整个区别可以表示成：&lt;/p&gt;
&lt;p&gt;因此，Spatial Generation 回答“换一个位置会看到什么”，Temporal Generation 回答“过一段时间世界会变成什么样”。&lt;/p&gt;
&lt;p&gt;这也是为什么 3D scene representation 很重要：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Spatial generation 需要 geometry，Temporal generation 又需要 world semantics 和 motion context。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="12-训练不是一次完成而是三阶段"&gt;12. 训练不是一次完成，而是三阶段&lt;/h2&gt;
&lt;p&gt;论文使用一个比较典型的模块化训练流程：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Stage 1&lt;br/&gt;World Tokenizer + Projector + Sampling"] --&gt; B["Integrate with LLM"]
B --&gt; C["Alignment + LoRA Fine-tuning"]
C --&gt; D["Stage 2&lt;br/&gt;Multi-modal Generation"]
D --&gt; E["RGB → RGB-D → High-resolution RGB-D"]
E --&gt; F["Stage 3&lt;br/&gt;End-to-End Joint Optimization"]
F --&gt; G["Unified Understanding + Generation"]
&lt;/div&gt;
&lt;p&gt;Scene Understanding 部分又包含：&lt;/p&gt;
&lt;h3 id="alignment-stage"&gt;Alignment Stage&lt;/h3&gt;
&lt;p&gt;冻结整个 VLM，训练 aligner：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;5k warm-up steps
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="llm-adaptation"&gt;LLM Adaptation&lt;/h3&gt;
&lt;p&gt;再通过：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;LoRA
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;30k steps
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;适配 LLM。&lt;/p&gt;
&lt;p&gt;论文的第一阶段模型训练使用 &lt;strong&gt;16 NVIDIA A100 GPUs&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Generation 部分则逐步从：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;224 × 400 RGB
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;224 × 400 RGB-D
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;424 × 800 RGB-D
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;训练到高分辨率生成，并使用 rectified-flow / v-prediction 目标。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="13-实验3d-gaussian-对-scene-understanding-到底有没有帮助"&gt;13. 实验：3D Gaussian 对 Scene Understanding 到底有没有帮助？&lt;/h2&gt;
&lt;p&gt;在 NuInteract 上，GaussianDWM 的总体平均分：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Avg.&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;InternVL2-8B&lt;/td&gt;
&lt;td style="text-align: right"&gt;45.42&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DriveMonkey&lt;/td&gt;
&lt;td style="text-align: right"&gt;52.12&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;GaussianDWM&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;59.23&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;论文报告相对前一个 SOTA 的平均提升约 &lt;strong&gt;13.6%&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;更有价值的是 ablation：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Setting&lt;/th&gt;
&lt;th style="text-align: right"&gt;Avg.&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Fine-tuned, no Gaussian&lt;/td&gt;
&lt;td style="text-align: right"&gt;53.32&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;+ Gaussian, Random Sampling&lt;/td&gt;
&lt;td style="text-align: right"&gt;55.21&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;+ Top-k + Uniform&lt;/td&gt;
&lt;td style="text-align: right"&gt;58.93&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;+ Similarity Sampling&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;59.23&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个结果非常清楚：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["2D / VLM Features Only&lt;br/&gt;53.32"] --&gt; B["+ 3D Gaussian&lt;br/&gt;55.21"]
B --&gt; C["+ Better Global Sampling&lt;br/&gt;58.93"]
C --&gt; D["+ Query-aware Similarity&lt;br/&gt;59.23"]
&lt;/div&gt;
&lt;p&gt;也就是说，性能提升并不只来自：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“多塞一种 3D feature。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;更关键的是：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;显式 3D Gaussian representation；&lt;/li&gt;
&lt;li&gt;合理的 token selection；&lt;/li&gt;
&lt;li&gt;query-conditioned semantic sampling。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h2 id="14-scene-generation高层-world-knowledge-真的有用吗"&gt;14. Scene Generation：高层 World Knowledge 真的有用吗？&lt;/h2&gt;
&lt;p&gt;GaussianDWM 在 nuScenes 上测试 RGB-D novel-view synthesis。&lt;/p&gt;
&lt;p&gt;论文 Table 3 中：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Method&lt;/th&gt;
&lt;th style="text-align: right"&gt;FID ±1m ↓&lt;/th&gt;
&lt;th style="text-align: right"&gt;FVD ±1m ↓&lt;/th&gt;
&lt;th style="text-align: right"&gt;FID ±2m ↓&lt;/th&gt;
&lt;th style="text-align: right"&gt;FVD ±2m ↓&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;StreetGaussian&lt;/td&gt;
&lt;td style="text-align: right"&gt;32.12&lt;/td&gt;
&lt;td style="text-align: right"&gt;153.45&lt;/td&gt;
&lt;td style="text-align: right"&gt;43.24&lt;/td&gt;
&lt;td style="text-align: right"&gt;256.91&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OmniRe&lt;/td&gt;
&lt;td style="text-align: right"&gt;31.48&lt;/td&gt;
&lt;td style="text-align: right"&gt;152.01&lt;/td&gt;
&lt;td style="text-align: right"&gt;43.31&lt;/td&gt;
&lt;td style="text-align: right"&gt;254.52&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DiST-S&lt;/td&gt;
&lt;td style="text-align: right"&gt;10.12&lt;/td&gt;
&lt;td style="text-align: right"&gt;45.14&lt;/td&gt;
&lt;td style="text-align: right"&gt;12.97&lt;/td&gt;
&lt;td style="text-align: right"&gt;68.80&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;GaussianDWM&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;8.36&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;44.50&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;11.27&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;68.17&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;在 $\pm1$m 和 $\pm2$m shift 下，GaussianDWM 的结果非常强。&lt;/p&gt;
&lt;p&gt;论文还测试了 $\pm4$m：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;GaussianDWM: FID 18.81 / FVD 116.40
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;DiST-S: FID 17.57 / FVD 105.29
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里有一个值得注意的小细节：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;论文正文声称在 extreme viewpoint shifts 下整体优于已有方法，但 v3 Table 3 中 $\pm4$m 的 FID/FVD 数值实际上是 DiST-S 更低。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以更稳妥的结论是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;GaussianDWM 在较大的 novel-view shift 下保持很强的生成质量，尤其在 $\pm1$m / $\pm2$m 上达到表中最佳结果；但不能简单概括成每一个 shift 和指标都绝对第一。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这类表格细节比只看论文摘要更值得注意。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="15-这篇论文真正重要的不是3dgs--llm"&gt;15. 这篇论文真正重要的不是“3DGS + LLM”&lt;/h2&gt;
&lt;p&gt;如果只把 GaussianDWM 理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“把 3D Gaussian 接到 Qwen 前面。”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;其实会低估它。&lt;/p&gt;
&lt;p&gt;真正的逻辑是：&lt;/p&gt;
&lt;p&gt;GaussianDWM 真正形成的是一条 &lt;strong&gt;Represent the World → Understand the World → Use Understanding to Generate the World&lt;/strong&gt; 的闭合信息链。&lt;/p&gt;
&lt;p&gt;它试图构建的是一个闭合的信息链：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Represent the World → Understand the World → Use Understanding to Generate the World&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以“Understanding”和“Generation”不是两个独立任务。&lt;/p&gt;
&lt;p&gt;理解模块得到的 World Knowledge 会反过来帮助 generation。&lt;/p&gt;
&lt;p&gt;这才是论文里 &lt;strong&gt;Unified World Model&lt;/strong&gt; 更核心的地方。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="16-gaussiandwm-和-dreamerv3-都叫-world-model但完全不是一类东西"&gt;16. GaussianDWM 和 DreamerV3 都叫 World Model，但完全不是一类东西&lt;/h2&gt;
&lt;p&gt;这一点非常值得放到一起理解。&lt;/p&gt;
&lt;h3 id="dreamerv3decision-centric-world-model"&gt;DreamerV3：Decision-centric World Model&lt;/h3&gt;
&lt;p&gt;DreamerV3 的核心是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["State + Action"] --&gt; B["Latent Dynamics"]
B --&gt; C["Imagine Future States / Rewards"]
C --&gt; D["Actor-Critic"]
D --&gt; E["Better Action"]
&lt;/div&gt;
&lt;p&gt;它真正关心：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如果我采取这个动作，未来会发生什么？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;World Model 的最终目标是 &lt;strong&gt;Decision Making&lt;/strong&gt;。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="gaussiandwmrepresentation--generation-centric-world-model"&gt;GaussianDWM：Representation / Generation-centric World Model&lt;/h3&gt;
&lt;p&gt;GaussianDWM 的核心更接近：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Multi-view Observation"] --&gt; B["3D Gaussian World"]
B --&gt; C["Scene Understanding"]
B --&gt; D["Language Reasoning"]
B --&gt; E["Spatial Generation"]
B --&gt; F["Temporal Generation"]
&lt;/div&gt;
&lt;p&gt;它真正关心：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;世界是什么、在哪里、如何理解，以及未来视觉场景会怎样变化？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以可以这样区分：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;DreamerV3&lt;/th&gt;
&lt;th&gt;GaussianDWM&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;World Representation&lt;/td&gt;
&lt;td&gt;Latent RSSM&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Explicit 3D Gaussian&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action-conditioned Dynamics&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Future Prediction&lt;/td&gt;
&lt;td&gt;Latent state / reward&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;RGB-D Scene&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Policy Learning&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Actor-Critic&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;无直接 RL policy&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Language Understanding&lt;/td&gt;
&lt;td&gt;无&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;LLM / Qwen3-8B&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3D Scene Grounding&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Main Goal&lt;/td&gt;
&lt;td&gt;Decision&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Understanding + Generation&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以 GaussianDWM 不能简单理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“自动驾驶版 DreamerV3。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它属于另一类 World Model。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="17-gaussiandwm-的边界也很明显"&gt;17. GaussianDWM 的边界也很明显&lt;/h2&gt;
&lt;p&gt;这篇论文非常有意思，但需要看清几个边界。&lt;/p&gt;
&lt;h3 id="第一它还不是闭环-driving-policy"&gt;第一，它还不是闭环 Driving Policy&lt;/h3&gt;
&lt;p&gt;GaussianDWM 可以：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;scene understanding；&lt;/li&gt;
&lt;li&gt;planning QA；&lt;/li&gt;
&lt;li&gt;trajectory prediction；&lt;/li&gt;
&lt;li&gt;scene generation。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但论文核心没有像 DreamerV3 那样：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在 World Model 内 imagined rollout，再直接优化驾驶 Policy。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此它更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Representation + Understanding + Generation&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而不是完整的：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Model + Decision Learning&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h3 id="第二3d-gaussian-仍然很重"&gt;第二，3D Gaussian 仍然很重&lt;/h3&gt;
&lt;p&gt;一个场景可以有几十万 Gaussian。&lt;/p&gt;
&lt;p&gt;论文之所以要专门设计：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Top-k
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Uniform Sampling
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Similarity Sampling
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;本身就说明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Explicit 3D World Representation 的代价是 token 数量和 memory 都非常大。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此 World Tokenizer 的效率会成为这条路线非常重要的问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="第三当前验证仍集中在-driving-domain"&gt;第三，当前验证仍集中在 Driving Domain&lt;/h3&gt;
&lt;p&gt;主要实验仍然是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;nuScenes
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;NuInteract
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以现在不能直接推断：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“同一种 Gaussian World Tokenizer 可以无缝迁移到机器人操作、UAV 或通用具身环境。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但这个方向本身非常值得继续研究。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="18-开源代码和数据这篇论文为什么比较适合继续做"&gt;18. 开源代码和数据：这篇论文为什么比较适合继续做？&lt;/h2&gt;
&lt;p&gt;截至 CVPR release，官方仓库已经开放：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;QA chain；&lt;/li&gt;
&lt;li&gt;world-generation chain；&lt;/li&gt;
&lt;li&gt;model weights；&lt;/li&gt;
&lt;li&gt;GaussianDWM dataset。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;仓库整理的数据规模约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;~1.9M training samples
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;~358K test samples
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;内容覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;NuInteract QA；&lt;/li&gt;
&lt;li&gt;2D / 3D visual grounding；&lt;/li&gt;
&lt;li&gt;scene caption；&lt;/li&gt;
&lt;li&gt;planning；&lt;/li&gt;
&lt;li&gt;trajectory prediction；&lt;/li&gt;
&lt;li&gt;OmniDrive VQA / conversation。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要注意：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;当前 CVPR release package 并不是论文与后续扩展的所有代码。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;官方 README 明确说明，目前 release 不包含：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;trajectory code；&lt;/li&gt;
&lt;li&gt;VGGDrive journal extensions；&lt;/li&gt;
&lt;li&gt;ViT-feature Gaussian variants；&lt;/li&gt;
&lt;li&gt;attention-based Gaussian selection。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此如果目标是完整复现所有潜在扩展，需要区分：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;CVPR paper release&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;和：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;后续 journal / internal extensions&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-gaussiandwm"&gt;最后，用一句话理解 GaussianDWM&lt;/h2&gt;
&lt;p&gt;DreamerV3 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;可以学习一个 latent dynamics model，在模型内部想象未来并学习决策。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GaussianDWM 则展示了另一种 World Model：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 geometry、appearance 和 language semantics 直接组织成一个显式 3D Gaussian World，再让这个世界表示同时支持理解、grounding、planning 和 RGB-D 时空生成。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;整篇论文最后可以压缩成：&lt;/p&gt;
&lt;p&gt;最终可以把整篇论文压缩成：&lt;strong&gt;Multi-view World → Language-aligned 3D Gaussians → Task-aware World Tokens → LLM Understanding → High-level World Knowledge + Low-level Geometry → Spatial / Future RGB-D Generation&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;我认为 GaussianDWM 真正值得带走的不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D Gaussian Splatting 本身。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是一个更大的想法：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Model 不应该只是“预测下一帧”的生成器。一个更完整的 World Model，应该拥有可以被语言查询的三维世界表示，并让 Understanding 和 Generation 共享同一套 World Knowledge。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是它和 DreamerV3 放在同一个 &lt;strong&gt;World Models&lt;/strong&gt; 分类下最有价值的原因：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;DreamerV3 在问：&lt;strong&gt;How will the world evolve under actions?&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;GaussianDWM 在问：&lt;strong&gt;How should the world be represented so that it can be both understood and generated?&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;而更进一步的方向，自然就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D World Representation + Future Prediction + VLA / Policy Learning&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;也就是让机器人或自动驾驶系统不仅“看懂世界”和“生成世界”，还能够基于预测出来的未来真正做出闭环决策。&lt;/p&gt;</description></item></channel></rss>