<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GaussianDWM | XHT | Haotian Xue - AI Research &amp; Robotics</title><link>https://xht252.github.io/tags/gaussiandwm/</link><atom:link href="https://xht252.github.io/tags/gaussiandwm/index.xml" rel="self" type="application/rss+xml"/><description>GaussianDWM</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Fri, 07 Aug 2026 00:00:00 +0000</lastBuildDate><image><url>https://xht252.github.io/media/icon_hu_1c0e9cb08cfb822a.png</url><title>GaussianDWM</title><link>https://xht252.github.io/tags/gaussiandwm/</link></image><item><title>GaussianDWM 精读：用 3D Gaussian 统一驾驶场景理解与生成</title><link>https://xht252.github.io/blog/world-models/gaussiandwm/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://xht252.github.io/blog/world-models/gaussiandwm/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; Tianchen Deng et al., &lt;em&gt;GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation&lt;/em&gt;&lt;br&gt;
&lt;strong&gt;Venue:&lt;/strong&gt; CVPR 2026, pp. 10656–10667&lt;br&gt;
&lt;strong&gt;arXiv:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;CVPR:&lt;/strong&gt;
&lt;br&gt;
&lt;strong&gt;Code:&lt;/strong&gt;
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;前面读 DreamerV3 时，我们看到的 World Model 是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;学习环境 dynamics，然后在 latent world 中想象未来，用 imagined trajectories 训练 Actor-Critic。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GaussianDWM 虽然同样叫 &lt;strong&gt;World Model&lt;/strong&gt;，但它走的是另一条路线。&lt;/p&gt;
&lt;p&gt;它更关心：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;能不能构建一个显式的三维世界表示，让模型不仅可以生成未来，还能够真正理解“场景里有什么、在哪里、应该怎么描述和规划”？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以这篇论文最核心的关键词不是 RL，而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D Gaussian + Language + Scene Understanding + Multi-Modal Generation&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;传统 Driving World Model 更偏向“预测未来画面”，而 GaussianDWM 进一步把目标扩展到显式 3D scene understanding、language reasoning 和 multi-modal generation。&lt;/p&gt;
&lt;p&gt;如果只用一句话概括 GaussianDWM：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把语言增强的 3D Gaussian 作为统一 World Representation，让同一个世界模型既可以回答驾驶场景问题，也可以生成空间变化和未来时刻的 RGB-D 场景。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="1-gaussiandwm-到底想解决什么问题"&gt;1. GaussianDWM 到底想解决什么问题？&lt;/h2&gt;
&lt;p&gt;很多 Driving World Model 的核心任务是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Current Driving Scene
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Future Video / Image / Point Cloud
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;例如预测：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;车辆继续向前后画面会怎样变化；&lt;/li&gt;
&lt;li&gt;自车移动以后新的视角是什么；&lt;/li&gt;
&lt;li&gt;一两秒后的街景会是什么样。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些模型在 &lt;strong&gt;generation&lt;/strong&gt; 上越来越强，但论文认为还有一个明显问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;会生成未来，不等于真正理解三维世界。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;一个驾驶系统不仅需要生成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“未来长什么样？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;还需要回答：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;前方有哪些车？&lt;/li&gt;
&lt;li&gt;某个目标的 3D 位置在哪里？&lt;/li&gt;
&lt;li&gt;这个目标未来会怎样运动？&lt;/li&gt;
&lt;li&gt;ego vehicle 应该怎么走？&lt;/li&gt;
&lt;li&gt;不同 camera view 中的目标是不是同一个物体？&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此 GaussianDWM 想把两个长期相对独立的方向统一：&lt;/p&gt;
&lt;p&gt;因此 GaussianDWM 想统一两件事：一边做 &lt;strong&gt;Scene Understanding&lt;/strong&gt;，一边做 &lt;strong&gt;Scene Generation&lt;/strong&gt;，并让两者共享同一套 3D world representation。&lt;/p&gt;
&lt;p&gt;这也是论文标题里：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Unified Scene Understanding and Multi-Modal Generation&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正的含义。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-为什么是-3d-gaussian而不是-bev-或-point-cloud"&gt;2. 为什么是 3D Gaussian，而不是 BEV 或 Point Cloud？&lt;/h2&gt;
&lt;p&gt;在 GaussianDWM 之前，很多驾驶 VLM / World Model 会把三维信息表示成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;BEV Features
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Point Clouds
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Depth Features
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后再把这些特征投影到语言模型的 embedding space。&lt;/p&gt;
&lt;p&gt;问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这种对齐通常仍然停留在 feature-level，语言语义与真实三维空间之间缺乏显式对应。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GaussianDWM 的核心选择是 &lt;strong&gt;3D Gaussian Splatting（3DGS）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;一个 Gaussian primitive 本身带有明确的三维属性：&lt;/p&gt;
$$
G_i=(x_i,o_i,s_i,r_i,f_i),
$$&lt;p&gt;其中可以粗略理解为：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$x_i$：3D position；&lt;/li&gt;
&lt;li&gt;$o_i$：opacity；&lt;/li&gt;
&lt;li&gt;$s_i$：scale；&lt;/li&gt;
&lt;li&gt;$r_i$：rotation；&lt;/li&gt;
&lt;li&gt;$f_i$：language / semantic feature。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最重要的是最后一个：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;GaussianDWM 不只给 Gaussian 存 geometry 和 appearance，还把语言特征直接嵌入每一个 Gaussian primitive。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;于是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["3D Gaussian Primitive"] --&gt; B["3D Position"]
A --&gt; C["Scale"]
A --&gt; D["Rotation"]
A --&gt; E["Opacity"]
A --&gt; F["Language Feature"]
B --&gt; G["Geometry"]
C --&gt; G
D --&gt; G
E --&gt; H["Appearance / Rendering"]
F --&gt; I["Semantic Meaning"]
G --&gt; J["Language-aligned 3D World Representation"]
H --&gt; J
I --&gt; J
&lt;/div&gt;
&lt;p&gt;这一步非常重要。&lt;/p&gt;
&lt;p&gt;它让“某个文本概念”和“真实三维空间中的 Gaussian”之间建立更加直接的 correspondence。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="3-一张图看懂-gaussiandwm"&gt;3. 一张图看懂 GaussianDWM&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2512.23180v3/x1.png" alt="GaussianDWM System Overview" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;GaussianDWM 的整体框架。图片来自 arXiv HTML 版论文 Figure 2。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;整篇论文其实可以拆成三个模块：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Multi-view Images + 3D Gaussians"] --&gt; B["World Tokenizer"]
Q["Text Query"] --&gt; B
B --&gt; C["Compact 3D World Tokens"]
C --&gt; D["Scene Understanding LLM"]
D --&gt; E["Text Answer"]
D --&gt; F["High-level World Knowledge"]
F --&gt; G["Dual-condition Generator"]
H["Low-level Image / Geometry Condition"] --&gt; G
G --&gt; I["RGB Generation"]
G --&gt; J["Depth Generation"]
G --&gt; K["Spatial / Temporal Future"]
&lt;/div&gt;
&lt;p&gt;对应论文三部分：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;World Tokenizer&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Scene Understanding&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Multi-modal Scene Generation&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;其中真正把整个系统串起来的是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Knowledge&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;理解模块不仅输出答案，还提取一个高层语言条件，继续指导后面的生成模型。&lt;/p&gt;
&lt;p&gt;这也是 GaussianDWM 相比“一个 VLM + 一个独立视频生成器”更有意思的地方。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="4-world-tokenizer把真实三维世界变成-llm-能读的-token"&gt;4. World Tokenizer：把真实三维世界变成 LLM 能读的 Token&lt;/h2&gt;
&lt;p&gt;这是整篇论文最值得理解的模块。&lt;/p&gt;
&lt;p&gt;原始驾驶场景中的 3D Gaussians 非常多。&lt;/p&gt;
&lt;p&gt;一个场景可能包含：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;几十万级 Gaussian primitives&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果全部直接塞给 LLM：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;hundreds of thousands of Gaussians
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ hundreds of thousands of tokens
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ impossible
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以 GaussianDWM 首先需要解决：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如何把一个稠密的 3D Gaussian World 压缩成少量但有用的 World Tokens？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;整个过程是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Dense 3D Gaussian Scene"] --&gt; B["Language-augmented Gaussians"]
B --&gt; C["Gaussian Projector"]
C --&gt; D["Task-aware Sampling"]
D --&gt; E["Compact 3D Gaussian Tokens"]
E --&gt; F["LLM"]
&lt;/div&gt;
&lt;p&gt;这就是论文所谓的：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Tokenizer&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="5-language-augmented-gaussian先把语言放进-3d-世界"&gt;5. Language-Augmented Gaussian：先把语言放进 3D 世界&lt;/h2&gt;
&lt;p&gt;作者基于 &lt;strong&gt;LangSplat&lt;/strong&gt; 构建 3D Gaussian language field。&lt;/p&gt;
&lt;p&gt;语言特征来自：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;SAM
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;CLIP Semantic Features
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;3D Gaussian Language Features
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;论文还做了一个很实际的压缩。&lt;/p&gt;
&lt;p&gt;原始 CLIP feature：&lt;/p&gt;
$$
D=512.
$$&lt;p&gt;通过 scene-wise language autoencoder 压到：&lt;/p&gt;
$$
d=3.
$$&lt;p&gt;之后再通过 decoder 恢复到 CLIP feature space。&lt;/p&gt;
&lt;p&gt;这说明作者面对的一个实际问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D Gaussian 数量极多，即使每个 Gaussian 只多存一点语义特征，总 memory 也会迅速膨胀。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此这一步同时实现：&lt;/p&gt;
&lt;p&gt;作者把 512 维 CLIP semantic feature 通过 scene-wise language autoencoder 压缩到 3 维后存入 Gaussian primitive，再通过 decoder 恢复语义表示，以显著降低 dense 3DGS 的 memory cost。&lt;/p&gt;
&lt;p&gt;这里的“3D”指的是 &lt;strong&gt;3-dimensional feature vector&lt;/strong&gt;，不是“三维空间”本身。&lt;/p&gt;
&lt;p&gt;这是阅读论文时比较容易混淆的一点。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="6-gaussian-projectorgeometry--appearance--semantics-进入统一空间"&gt;6. Gaussian Projector：Geometry + Appearance + Semantics 进入统一空间&lt;/h2&gt;
&lt;p&gt;仅仅把 language feature 放进 Gaussian 还不够。&lt;/p&gt;
&lt;p&gt;LLM 需要的仍然是统一维度的 Token。&lt;/p&gt;
&lt;p&gt;所以对于每个 Gaussian：&lt;/p&gt;
$$
G_i=(x_i,o_i,s_i,r_i,f_i),
$$&lt;p&gt;作者分别编码：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;position；&lt;/li&gt;
&lt;li&gt;opacity；&lt;/li&gt;
&lt;li&gt;scale；&lt;/li&gt;
&lt;li&gt;rotation；&lt;/li&gt;
&lt;li&gt;semantic feature。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;其中 3D position 会先使用 Fourier embedding，论文设置：&lt;/p&gt;
$$
L=10.
$$&lt;p&gt;然后不同属性经过各自的 MLP projector，被映射到统一的 &lt;strong&gt;4096-dimensional feature space&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;最后利用可学习权重融合成一个 Gaussian token：&lt;/p&gt;
&lt;h1 id="mathcal-g_i"&gt;$$
\mathcal G_i&lt;/h1&gt;
&lt;p&gt;\sum_p \alpha_p h_i^p.
$$&lt;/p&gt;
&lt;p&gt;快速理解时不用记公式，记住这件事就够了：&lt;/p&gt;
&lt;p&gt;最终，每个 Gaussian 的 position、opacity、scale、rotation 和 semantic feature 分别投影后融合成统一 Gaussian Token，再送入 LLM feature space。&lt;/p&gt;
&lt;p&gt;所以一个 Gaussian Token 不只是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“这里有一个三维点。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“这里有一个具有位置、大小、朝向、可见性和语义信息的三维场景 primitive。”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="7-task-aware-sampling不是所有-gaussian-都值得给-llm-看"&gt;7. Task-Aware Sampling：不是所有 Gaussian 都值得给 LLM 看&lt;/h2&gt;
&lt;p&gt;这是我认为论文第二个非常漂亮的设计。&lt;/p&gt;
&lt;p&gt;即使完成 Gaussian Tokenization，场景中的 Gaussian 数量仍然太大。&lt;/p&gt;
&lt;p&gt;所以作者不固定使用一种 sampling，而是根据任务来决定：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;LLM 到底需要看全局，还是只需要看某一小块区域？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3 id="scene-understanding--planning"&gt;Scene Understanding / Planning&lt;/h3&gt;
&lt;p&gt;对于需要全局理解的任务：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;scene caption
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;region description
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;planning
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;需要保留整体场景结构。&lt;/p&gt;
&lt;p&gt;作者使用：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Uniform Sampling + Top-k Sampling&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;最终从大量 Gaussians 中选择：&lt;/p&gt;
$$
N=4096
$$&lt;p&gt;个 token 给 LLM。&lt;/p&gt;
&lt;h3 id="2d--3d-visual-grounding"&gt;2D / 3D Visual Grounding&lt;/h3&gt;
&lt;p&gt;如果问题是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“后方相机里这辆车的 3D bounding box 是什么？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;真正有价值的是和这个 query 相关的 Gaussian。&lt;/p&gt;
&lt;p&gt;因此进一步加入：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Language-Guided Similarity Sampling&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;div class="mermaid"&gt;flowchart TD
A["Dense Gaussian Tokens"] --&gt; B{"What task?"}
B --&gt;|"Global Understanding / Planning"| C["Uniform + Top-k Sampling"]
C --&gt; D["4096 Global Tokens"]
B --&gt;|"2D / 3D Grounding"| E["Text–Gaussian Similarity"]
E --&gt; F["Keep Query-relevant Gaussians"]
D --&gt; G["LLM"]
F --&gt; G
&lt;/div&gt;
&lt;p&gt;这其实和现代大模型里的 &lt;strong&gt;Token Pruning / Query-conditioned Retrieval&lt;/strong&gt; 很像。&lt;/p&gt;
&lt;p&gt;区别是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这里被检索的不是文本 chunk，而是真实三维世界中的 Gaussian primitives。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="8-scene-understanding让-llm-直接读三维世界"&gt;8. Scene Understanding：让 LLM 直接“读”三维世界&lt;/h2&gt;
&lt;p&gt;Gaussian tokens 与 text tokens 进入 LLM。&lt;/p&gt;
&lt;p&gt;论文最终使用：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Qwen3-8B&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作为语言模型。&lt;/p&gt;
&lt;p&gt;LLM 输出两类东西：&lt;/p&gt;
&lt;p&gt;Qwen3-8B 同时输出文本答案和高层 World Knowledge feature；前者用于理解任务，后者继续作为 scene generation 的高层条件。&lt;/p&gt;
&lt;p&gt;这里第二个输出尤其重要。&lt;/p&gt;
&lt;p&gt;LLM 不只是回答：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“前面有几辆车？”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它内部提取出的高层世界知识还会继续传给 generation module。&lt;/p&gt;
&lt;p&gt;这让：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Understanding
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;和：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Generation
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;真正发生了信息交互。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="9-它到底理解哪些-driving-task"&gt;9. 它到底理解哪些 Driving Task？&lt;/h2&gt;
&lt;p&gt;论文在 NuInteract 上主要测试四类场景理解任务：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;模型需要做什么&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;RD&amp;amp;P&lt;/td&gt;
&lt;td&gt;Region Description &amp;amp; Perception&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2D VG&lt;/td&gt;
&lt;td&gt;在图像中找到 query 对应目标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3D VG&lt;/td&gt;
&lt;td&gt;给出目标的三维空间位置&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Planning&lt;/td&gt;
&lt;td&gt;根据当前场景判断 ego vehicle 行为&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;How should the ego car proceed?
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;→ Go Straight
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;或者：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Find all cars in CAM_BACK
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;and provide their 3D bounding boxes.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;论文中的定性结果非常直观：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img src="https://arxiv.org/html/2512.23180v3/x2.png" alt="GaussianDWM Understanding and Generation" loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;GaussianDWM 同时进行 2D/3D grounding、场景问答、规划以及 RGB-D 空间/时间生成。图片来自 arXiv HTML 版论文 Figure 3。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这张图其实非常适合概括论文：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;同一个 3D Gaussian World 既能被“问问题”，也能被“向未来生成”。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="10-multi-modal-generation为什么还需要-language-condition"&gt;10. Multi-Modal Generation：为什么还需要 Language Condition？&lt;/h2&gt;
&lt;p&gt;如果只想生成未来场景，传统方法可以直接使用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;image
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;geometry / point cloud
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;camera pose
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;作为生成条件。&lt;/p&gt;
&lt;p&gt;GaussianDWM 认为这仍然不够。&lt;/p&gt;
&lt;p&gt;因为这些条件告诉生成器：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;像素和几何应该在哪里。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但并没有显式告诉它：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;这个世界正在发生什么。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以论文提出 &lt;strong&gt;Dual-Condition Generation&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Low-level Condition&lt;br/&gt;Image + Geometry"] --&gt; D["Multi-modal Generator"]
B["High-level Condition&lt;br/&gt;LLM World Knowledge"] --&gt; D
C["Noisy RGB / Depth Latent"] --&gt; D
D --&gt; E["RGB"]
D --&gt; F["Depth"]
D --&gt; G["Spatial Generation"]
D --&gt; H["Temporal Generation"]
&lt;/div&gt;
&lt;p&gt;可以把两个 condition 的职责理解为：&lt;/p&gt;
&lt;h3 id="low-level-condition"&gt;Low-level Condition&lt;/h3&gt;
&lt;p&gt;负责：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;texture；&lt;/li&gt;
&lt;li&gt;local geometry；&lt;/li&gt;
&lt;li&gt;image style；&lt;/li&gt;
&lt;li&gt;precise spatial constraint。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="high-level-world-knowledge"&gt;High-level World Knowledge&lt;/h3&gt;
&lt;p&gt;负责：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;semantic context；&lt;/li&gt;
&lt;li&gt;object relationships；&lt;/li&gt;
&lt;li&gt;scene-level reasoning；&lt;/li&gt;
&lt;li&gt;temporal intent / trajectory information。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是论文所谓：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;high-level world knowledge + low-level image condition&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;联合指导生成。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="11-spatial-generation-与-temporal-generation-是两件不同的事"&gt;11. Spatial Generation 与 Temporal Generation 是两件不同的事&lt;/h2&gt;
&lt;p&gt;GaussianDWM 同时支持两种“未来”。&lt;/p&gt;
&lt;h3 id="spatial-generation"&gt;Spatial Generation&lt;/h3&gt;
&lt;p&gt;不是时间变化，而是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如果 camera / ego position 改变，场景应该长什么样？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文测试 novel-view synthesis，例如：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;±1 m
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;±2 m
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;±4 m
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;的 viewpoint shifts。&lt;/p&gt;
&lt;h3 id="temporal-generation"&gt;Temporal Generation&lt;/h3&gt;
&lt;p&gt;是真正的：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;1 秒或 2 秒以后，场景会怎样变化？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;论文方法部分支持：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+1 s
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;+2 s
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;未来预测。&lt;/p&gt;
&lt;p&gt;整个区别可以表示成：&lt;/p&gt;
&lt;p&gt;因此，Spatial Generation 回答“换一个位置会看到什么”，Temporal Generation 回答“过一段时间世界会变成什么样”。&lt;/p&gt;
&lt;p&gt;这也是为什么 3D scene representation 很重要：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Spatial generation 需要 geometry，Temporal generation 又需要 world semantics 和 motion context。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="12-训练不是一次完成而是三阶段"&gt;12. 训练不是一次完成，而是三阶段&lt;/h2&gt;
&lt;p&gt;论文使用一个比较典型的模块化训练流程：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Stage 1&lt;br/&gt;World Tokenizer + Projector + Sampling"] --&gt; B["Integrate with LLM"]
B --&gt; C["Alignment + LoRA Fine-tuning"]
C --&gt; D["Stage 2&lt;br/&gt;Multi-modal Generation"]
D --&gt; E["RGB → RGB-D → High-resolution RGB-D"]
E --&gt; F["Stage 3&lt;br/&gt;End-to-End Joint Optimization"]
F --&gt; G["Unified Understanding + Generation"]
&lt;/div&gt;
&lt;p&gt;Scene Understanding 部分又包含：&lt;/p&gt;
&lt;h3 id="alignment-stage"&gt;Alignment Stage&lt;/h3&gt;
&lt;p&gt;冻结整个 VLM，训练 aligner：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;5k warm-up steps
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="llm-adaptation"&gt;LLM Adaptation&lt;/h3&gt;
&lt;p&gt;再通过：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;LoRA
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;30k steps
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;适配 LLM。&lt;/p&gt;
&lt;p&gt;论文的第一阶段模型训练使用 &lt;strong&gt;16 NVIDIA A100 GPUs&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;Generation 部分则逐步从：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;224 × 400 RGB
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;224 × 400 RGB-D
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;↓
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;424 × 800 RGB-D
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;训练到高分辨率生成，并使用 rectified-flow / v-prediction 目标。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="13-实验3d-gaussian-对-scene-understanding-到底有没有帮助"&gt;13. 实验：3D Gaussian 对 Scene Understanding 到底有没有帮助？&lt;/h2&gt;
&lt;p&gt;在 NuInteract 上，GaussianDWM 的总体平均分：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th style="text-align: right"&gt;Avg.&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;InternVL2-8B&lt;/td&gt;
&lt;td style="text-align: right"&gt;45.42&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DriveMonkey&lt;/td&gt;
&lt;td style="text-align: right"&gt;52.12&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;GaussianDWM&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;59.23&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;论文报告相对前一个 SOTA 的平均提升约 &lt;strong&gt;13.6%&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;更有价值的是 ablation：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Setting&lt;/th&gt;
&lt;th style="text-align: right"&gt;Avg.&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Fine-tuned, no Gaussian&lt;/td&gt;
&lt;td style="text-align: right"&gt;53.32&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;+ Gaussian, Random Sampling&lt;/td&gt;
&lt;td style="text-align: right"&gt;55.21&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;+ Top-k + Uniform&lt;/td&gt;
&lt;td style="text-align: right"&gt;58.93&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;+ Similarity Sampling&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;59.23&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个结果非常清楚：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["2D / VLM Features Only&lt;br/&gt;53.32"] --&gt; B["+ 3D Gaussian&lt;br/&gt;55.21"]
B --&gt; C["+ Better Global Sampling&lt;br/&gt;58.93"]
C --&gt; D["+ Query-aware Similarity&lt;br/&gt;59.23"]
&lt;/div&gt;
&lt;p&gt;也就是说，性能提升并不只来自：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“多塞一种 3D feature。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;更关键的是：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;显式 3D Gaussian representation；&lt;/li&gt;
&lt;li&gt;合理的 token selection；&lt;/li&gt;
&lt;li&gt;query-conditioned semantic sampling。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h2 id="14-scene-generation高层-world-knowledge-真的有用吗"&gt;14. Scene Generation：高层 World Knowledge 真的有用吗？&lt;/h2&gt;
&lt;p&gt;GaussianDWM 在 nuScenes 上测试 RGB-D novel-view synthesis。&lt;/p&gt;
&lt;p&gt;论文 Table 3 中：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Method&lt;/th&gt;
&lt;th style="text-align: right"&gt;FID ±1m ↓&lt;/th&gt;
&lt;th style="text-align: right"&gt;FVD ±1m ↓&lt;/th&gt;
&lt;th style="text-align: right"&gt;FID ±2m ↓&lt;/th&gt;
&lt;th style="text-align: right"&gt;FVD ±2m ↓&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;StreetGaussian&lt;/td&gt;
&lt;td style="text-align: right"&gt;32.12&lt;/td&gt;
&lt;td style="text-align: right"&gt;153.45&lt;/td&gt;
&lt;td style="text-align: right"&gt;43.24&lt;/td&gt;
&lt;td style="text-align: right"&gt;256.91&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OmniRe&lt;/td&gt;
&lt;td style="text-align: right"&gt;31.48&lt;/td&gt;
&lt;td style="text-align: right"&gt;152.01&lt;/td&gt;
&lt;td style="text-align: right"&gt;43.31&lt;/td&gt;
&lt;td style="text-align: right"&gt;254.52&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DiST-S&lt;/td&gt;
&lt;td style="text-align: right"&gt;10.12&lt;/td&gt;
&lt;td style="text-align: right"&gt;45.14&lt;/td&gt;
&lt;td style="text-align: right"&gt;12.97&lt;/td&gt;
&lt;td style="text-align: right"&gt;68.80&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;GaussianDWM&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;8.36&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;44.50&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;11.27&lt;/strong&gt;&lt;/td&gt;
&lt;td style="text-align: right"&gt;&lt;strong&gt;68.17&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;在 $\pm1$m 和 $\pm2$m shift 下，GaussianDWM 的结果非常强。&lt;/p&gt;
&lt;p&gt;论文还测试了 $\pm4$m：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;GaussianDWM: FID 18.81 / FVD 116.40
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;DiST-S: FID 17.57 / FVD 105.29
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里有一个值得注意的小细节：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;论文正文声称在 extreme viewpoint shifts 下整体优于已有方法，但 v3 Table 3 中 $\pm4$m 的 FID/FVD 数值实际上是 DiST-S 更低。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以更稳妥的结论是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;GaussianDWM 在较大的 novel-view shift 下保持很强的生成质量，尤其在 $\pm1$m / $\pm2$m 上达到表中最佳结果；但不能简单概括成每一个 shift 和指标都绝对第一。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这类表格细节比只看论文摘要更值得注意。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="15-这篇论文真正重要的不是3dgs--llm"&gt;15. 这篇论文真正重要的不是“3DGS + LLM”&lt;/h2&gt;
&lt;p&gt;如果只把 GaussianDWM 理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;“把 3D Gaussian 接到 Qwen 前面。”&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;其实会低估它。&lt;/p&gt;
&lt;p&gt;真正的逻辑是：&lt;/p&gt;
&lt;p&gt;GaussianDWM 真正形成的是一条 &lt;strong&gt;Represent the World → Understand the World → Use Understanding to Generate the World&lt;/strong&gt; 的闭合信息链。&lt;/p&gt;
&lt;p&gt;它试图构建的是一个闭合的信息链：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Represent the World → Understand the World → Use Understanding to Generate the World&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以“Understanding”和“Generation”不是两个独立任务。&lt;/p&gt;
&lt;p&gt;理解模块得到的 World Knowledge 会反过来帮助 generation。&lt;/p&gt;
&lt;p&gt;这才是论文里 &lt;strong&gt;Unified World Model&lt;/strong&gt; 更核心的地方。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="16-gaussiandwm-和-dreamerv3-都叫-world-model但完全不是一类东西"&gt;16. GaussianDWM 和 DreamerV3 都叫 World Model，但完全不是一类东西&lt;/h2&gt;
&lt;p&gt;这一点非常值得放到一起理解。&lt;/p&gt;
&lt;h3 id="dreamerv3decision-centric-world-model"&gt;DreamerV3：Decision-centric World Model&lt;/h3&gt;
&lt;p&gt;DreamerV3 的核心是：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["State + Action"] --&gt; B["Latent Dynamics"]
B --&gt; C["Imagine Future States / Rewards"]
C --&gt; D["Actor-Critic"]
D --&gt; E["Better Action"]
&lt;/div&gt;
&lt;p&gt;它真正关心：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;如果我采取这个动作，未来会发生什么？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;World Model 的最终目标是 &lt;strong&gt;Decision Making&lt;/strong&gt;。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="gaussiandwmrepresentation--generation-centric-world-model"&gt;GaussianDWM：Representation / Generation-centric World Model&lt;/h3&gt;
&lt;p&gt;GaussianDWM 的核心更接近：&lt;/p&gt;
&lt;div class="mermaid"&gt;flowchart LR
A["Multi-view Observation"] --&gt; B["3D Gaussian World"]
B --&gt; C["Scene Understanding"]
B --&gt; D["Language Reasoning"]
B --&gt; E["Spatial Generation"]
B --&gt; F["Temporal Generation"]
&lt;/div&gt;
&lt;p&gt;它真正关心：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;世界是什么、在哪里、如何理解，以及未来视觉场景会怎样变化？&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以可以这样区分：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;DreamerV3&lt;/th&gt;
&lt;th&gt;GaussianDWM&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;World Representation&lt;/td&gt;
&lt;td&gt;Latent RSSM&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Explicit 3D Gaussian&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action-conditioned Dynamics&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Future Prediction&lt;/td&gt;
&lt;td&gt;Latent state / reward&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;RGB-D Scene&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Policy Learning&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Actor-Critic&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;无直接 RL policy&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Language Understanding&lt;/td&gt;
&lt;td&gt;无&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;LLM / Qwen3-8B&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3D Scene Grounding&lt;/td&gt;
&lt;td&gt;非核心&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;核心&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Main Goal&lt;/td&gt;
&lt;td&gt;Decision&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Understanding + Generation&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以 GaussianDWM 不能简单理解成：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“自动驾驶版 DreamerV3。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;它属于另一类 World Model。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="17-gaussiandwm-的边界也很明显"&gt;17. GaussianDWM 的边界也很明显&lt;/h2&gt;
&lt;p&gt;这篇论文非常有意思，但需要看清几个边界。&lt;/p&gt;
&lt;h3 id="第一它还不是闭环-driving-policy"&gt;第一，它还不是闭环 Driving Policy&lt;/h3&gt;
&lt;p&gt;GaussianDWM 可以：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;scene understanding；&lt;/li&gt;
&lt;li&gt;planning QA；&lt;/li&gt;
&lt;li&gt;trajectory prediction；&lt;/li&gt;
&lt;li&gt;scene generation。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但论文核心没有像 DreamerV3 那样：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;在 World Model 内 imagined rollout，再直接优化驾驶 Policy。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此它更接近：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Representation + Understanding + Generation&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而不是完整的：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Model + Decision Learning&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h3 id="第二3d-gaussian-仍然很重"&gt;第二，3D Gaussian 仍然很重&lt;/h3&gt;
&lt;p&gt;一个场景可以有几十万 Gaussian。&lt;/p&gt;
&lt;p&gt;论文之所以要专门设计：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Top-k
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Uniform Sampling
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Similarity Sampling
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;本身就说明：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Explicit 3D World Representation 的代价是 token 数量和 memory 都非常大。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此 World Tokenizer 的效率会成为这条路线非常重要的问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="第三当前验证仍集中在-driving-domain"&gt;第三，当前验证仍集中在 Driving Domain&lt;/h3&gt;
&lt;p&gt;主要实验仍然是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;nuScenes
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;NuInteract
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;所以现在不能直接推断：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;“同一种 Gaussian World Tokenizer 可以无缝迁移到机器人操作、UAV 或通用具身环境。”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;但这个方向本身非常值得继续研究。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="18-开源代码和数据这篇论文为什么比较适合继续做"&gt;18. 开源代码和数据：这篇论文为什么比较适合继续做？&lt;/h2&gt;
&lt;p&gt;截至 CVPR release，官方仓库已经开放：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;QA chain；&lt;/li&gt;
&lt;li&gt;world-generation chain；&lt;/li&gt;
&lt;li&gt;model weights；&lt;/li&gt;
&lt;li&gt;GaussianDWM dataset。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;仓库整理的数据规模约：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;~1.9M training samples
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;~358K test samples
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;内容覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;NuInteract QA；&lt;/li&gt;
&lt;li&gt;2D / 3D visual grounding；&lt;/li&gt;
&lt;li&gt;scene caption；&lt;/li&gt;
&lt;li&gt;planning；&lt;/li&gt;
&lt;li&gt;trajectory prediction；&lt;/li&gt;
&lt;li&gt;OmniDrive VQA / conversation。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要注意：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;当前 CVPR release package 并不是论文与后续扩展的所有代码。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;官方 README 明确说明，目前 release 不包含：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;trajectory code；&lt;/li&gt;
&lt;li&gt;VGGDrive journal extensions；&lt;/li&gt;
&lt;li&gt;ViT-feature Gaussian variants；&lt;/li&gt;
&lt;li&gt;attention-based Gaussian selection。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此如果目标是完整复现所有潜在扩展，需要区分：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;CVPR paper release&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;和：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;后续 journal / internal extensions&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="最后用一句话理解-gaussiandwm"&gt;最后，用一句话理解 GaussianDWM&lt;/h2&gt;
&lt;p&gt;DreamerV3 告诉我们：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;可以学习一个 latent dynamics model，在模型内部想象未来并学习决策。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;GaussianDWM 则展示了另一种 World Model：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;把 geometry、appearance 和 language semantics 直接组织成一个显式 3D Gaussian World，再让这个世界表示同时支持理解、grounding、planning 和 RGB-D 时空生成。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;整篇论文最后可以压缩成：&lt;/p&gt;
&lt;p&gt;最终可以把整篇论文压缩成：&lt;strong&gt;Multi-view World → Language-aligned 3D Gaussians → Task-aware World Tokens → LLM Understanding → High-level World Knowledge + Low-level Geometry → Spatial / Future RGB-D Generation&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;我认为 GaussianDWM 真正值得带走的不是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D Gaussian Splatting 本身。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;而是一个更大的想法：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;World Model 不应该只是“预测下一帧”的生成器。一个更完整的 World Model，应该拥有可以被语言查询的三维世界表示，并让 Understanding 和 Generation 共享同一套 World Knowledge。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这也是它和 DreamerV3 放在同一个 &lt;strong&gt;World Models&lt;/strong&gt; 分类下最有价值的原因：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;DreamerV3 在问：&lt;strong&gt;How will the world evolve under actions?&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;GaussianDWM 在问：&lt;strong&gt;How should the world be represented so that it can be both understood and generated?&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;而更进一步的方向，自然就是：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;3D World Representation + Future Prediction + VLA / Policy Learning&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;也就是让机器人或自动驾驶系统不仅“看懂世界”和“生成世界”，还能够基于预测出来的未来真正做出闭环决策。&lt;/p&gt;</description></item></channel></rss>