All Posts

Day 1|信息论:熵、KL 散度与互信息

概率机器学习 Day 1 学习笔记:熵、交叉熵、联合熵、条件熵、KL 散度、互信息、最大信息系数、数据处理不等式与充分统计量。

$\pi_0$ 精读:从 Action Token 到 Flow Matching,VLA 开始学习灵巧控制

快速读懂 $\pi_0$:它如何在 RT-2 与 OpenVLA 建立的 VLA 范式上,引入 PaliGemma、Action Expert、Flow Matching、Action Chunking 与跨机器人预训练,把视觉语言知识进一步连接到连续、高频、灵巧的机器人控制。

avatar
Haotian Xue

DreamerV3 精读:在世界模型中想象未来,再学习策略

快速读懂 DreamerV3:RSSM 如何学习潜空间世界模型,Actor-Critic 如何在 imagined trajectories 中训练,以及 symlog、two-hot、KL balancing、free bits 与 return normalization 为什么让一套超参数可以跨 150+ 任务工作。

avatar
Haotian Xue

GaussianDWM 精读:用 3D Gaussian 统一驾驶场景理解与生成

快速读懂 CVPR 2026 GaussianDWM:如何把语言语义直接嵌入 3D Gaussian,用任务感知采样将稠密三维世界压缩成 LLM 可处理的 World Tokens,并利用高层 World Knowledge 与低层图像条件统一驱动 RGB-D 空间与未来场景生成。

avatar
Haotian Xue

OpenVLA 精读:把 RT-2 的 VLA 范式真正开源

快速读懂 OpenVLA:它如何沿用 RT-2 的 Action Token 思路,用 DINOv2 + SigLIP + Llama 2 7B 和 Open X-Embodiment 的 970k 机器人轨迹构建开源 VLA,并把研究重点推进到跨机器人泛化、下游微调、LoRA 和量化部署,为后续 $\pi_0$ 的连续动作与高频控制路线铺路。

avatar
Haotian Xue

RT-1 精读:Transformer 如何学会控制真实机器人

用一篇短文快速读懂 RT-1:大规模真实机器人数据、FiLM-EfficientNet、TokenLearner、Transformer 与 Action Tokenization,以及它为什么成为后来 VLA 路线的重要起点。

avatar
Haotian Xue

RT-2 精读:从 Vision-Language Model 到 Vision-Language-Action

快速读懂 RT-2:如何把机器人动作表示成语言 Token,将 PaLI-X / PaLM-E 从视觉语言模型转化为可以直接闭环控制机器人的 Vision-Language-Action 模型,以及为什么这一步成为后来 VLA 路线的重要起点。

avatar
Haotian Xue
Welcome to My AI Research Blog: Multi-Agent Systems, Robotics and World Models featured image

Welcome to My AI Research Blog: Multi-Agent Systems, Robotics and World Models

An introduction to my personal blog, where I share research notes, technical tutorials, project records, and reflections on artificial intelligence, multi-agent systems, robotics, …

avatar
Haotian Xue