慢放的画面里,一滴水砸进水池,会先拉出一张薄薄的「水片」,水片边缘撕开成一根根细丝,细丝再断成一串串小水珠,水珠弹起来,又落回水面。整个过程,从头到尾不到十分之一秒。你的眼睛看到了,手机也拍下来了。但如果你让一台计算机「重建」这个瞬间——把它变成可以在任意角度回看、可以放进电影或者游戏里的 3D 模型——它大概率会直接懵掉。
这是计算机视觉里一个特别反直觉的真相:拍得到,不等于重建得出。尤其当对象是「正在溅射的液体」时,几乎所有成熟的重建方法都会失灵。
今天要深读的这篇论文,就是冲着这个「不可能」来的。
SplashSplat: Reconstructing Splashing Liquids from Real-World Multi-View Videos(arXiv 2609.20818,2026 年 9 月 17 日提交),作者来自 EPFL(洛桑联邦理工学院)等,作者列表里有 Federico Tombari 和 Marc Pollefeys 这些在 3D 视觉领域响当当的名字。它做了两件此前没人做成的事:第一,公开了第一套真实世界水花的同步多视角数据集;第二,给出了一套能在这些真实水花上重建出 4D 液体、且物理上更合理、训练成本更低的方法。
为什么这件事难,又为什么它值得你知道,我们一层层拆开讲。
一张照片装不下一个世界
先把「重建」这个词说清楚。
假设你有十几台手机,围着一个杯子从各个角度同时按下快门。你要的不只是这十几张照片,而是想得到这样一个东西:随便给我一个没拍过的角度,我都能「生成」出那个杯子在那个角度长什么样。 这个任务,学术上叫新视角合成(Novel View Synthesis,NVS)。
注意,这不是简单的拼图。十几个角度之间的空间是「空的」,算法必须自己脑补出完整的 3D 结构——杯子是圆的、杯沿有厚度、反光的角度对得上。很久以前这都是靠手工建模,后来大家学会了用一套数学表达去「拟合」一个场景。
近十年的代表是两个流派。
先是 NeRF(神经辐射场)。它把场景想象成一个连续的函数:输入一个空间坐标和一个观察方向,输出那个位置的密度和颜色。训练时,算法沿视线发射光线、一步一步「采样」,再把采到的颜色累积起来,得到一像素的颜色。这个过程叫光线步进(ray marching)。NeRF 的效果惊艳——能看到真实感的全新视角,一时间刷屏。但它的软肋也很明显:慢。一条光线要采几百个点,渲染一张图要很久,训练要几小时甚至几天,根本没法实时。
接着是 3D 高斯泼溅(3D Gaussian Splatting,3DGS)。它换了个思路:不再用「连续函数隐式描述场景」,而是把一个场景看成一堆漂浮在空间里的、可参数化的小高斯斑块——每个斑块有位置、大小、形状、颜色和不透明度。训练就是用这些斑块去「熨平」所有输入照片的观感,渲染时则用一种叫 tile-splatting 的快速光栅化算法,把小斑点按深度排序、逐个画到屏幕上。结果是:照片级真实,同时快到能实时。3DGS 在 2023 年一出来就横扫了新视角合成领域,成了新的标准。
再往后,大家不满足于「静态」了。要让场景动起来——风吹的树、走的人、飞驰的车——就有了动态 3D 高斯泼溅,也叫 4D 重建(三维空间 + 时间轴)。这一支进展飞快:CVPR 2026 的最佳论文 D4RT 就是做 4D 场景重建的;Syn4D 这类多视角 4D 数据集也在 ECCV 2026 被提出来。
表格 1:三代重建方法对比
| 方法 | 表示方式 | 怎么渲染 | 速度 | 擅长对象 |
|---|---|---|---|---|
| NeRF | 连续神经函数(隐式) | 光线步进采样 | 慢,离实时很远 | 高质量静态场景 |
| 3DGS | 显式高斯斑块集合 | tile-splatting 光栅化 | 实时 | 静态场景的照片级新视角 |
| 动态 3DGS(4D) | 随时间变化的高斯 | 光栅化 + 运动建模 | 近似实时 | 缓慢形变的动态物体 |
看起来,能重建的东西越来越多了。
但有个东西,一直不在「被搞定」的名单里。
为什么偏偏是液体
你翻遍那些最火爆的动态重建演示视频,会发现一个规律:烟可以,雾可以,人的头发丝勉强可以,但没有任何一段真实水花的重建。
有研究者确实做过液体的新视角合成,但看细节会发现,他们的视频几乎都是合成的——先在计算机里模拟出水花,再用模拟结果当「真值」去训练和评测。真实相机拍下的、物理上真实发生的水花,几乎没人碰。
不是不想碰,是液体太「不配合」了。SplashSplat 的作者在论文开篇就总结了三大死因:
第一,寿命极短。水花只活几分之一秒。一个重建方法要工作,得先「认出」这个物体,再跟踪它。可水花还没被系统认熟、跟踪好,就已经碎成了几百个液滴、消失了。
第二,外观依赖视角,且几乎无纹理。一滴水珠几乎没有图案,它给相机的是反光和折射——你从左边看和从右边看,长得完全不一样。重建算法极度依赖「在两个视角中找到同一个点」的对应关系,而水花恰恰不提供任何稳定的特征点让你对应。
第三,拓扑一直在变。这是最致命的。薄片是连成一片的「面」,撕开后变成一根根「线」,线又断成一个个「点」。几何形状从片到线到点到消失,连续性被彻底打断。大多数重建方法都默认「这个物体的形状是持续的、可跟踪的」——水花直接把这个假设撕了。
这三点叠加起来就一句话:重建依赖对应关系,而水花拒绝提供对应关系。
表格 2:液体重建的四类场景
| 类型 | 例子 | 难度 | 现状 |
|---|---|---|---|
| 缓慢形变 | 水面缓缓涟漪 | 低 | 已基本解决 |
| 烟 / 气 | 烟雾缭绕 | 中 | 有专门方法 |
| 合成液体 | 模拟引擎生成的水 | 中 | 常用基准 |
| 真实飞溅水花 | 水滴砸落、液体泼溅 | 极高 | 此前无数据集、无方法 |
第一块真实水花基准
SplashSplat 先补的是「没有数据集」这个窟窿。
他们建了一套采集系统:7 台同步、标定过的 4K 相机,以每秒 60 帧的速度同时拍摄。同步是关键——7 台机器必须认准同一个瞬间,否则水花的位置对不上;标定是要知道每台相机在空间里的精确位置和朝向,否则重建时几何就塌了。
他们一共拍了 20 个真实场景,从连贯的水流(平稳地喷射、落下)到剧烈的水花(用力砸出、四处飞溅)都覆盖了。
然后是最费人力的一步:标注。水花是半透明的、会反光、会折射,想要自动分割出「哪几个像素是水」极其困难。所以作者采用逐视角的人工精化——每个视角、每一帧,都要有人工仔细调整液体和容器的掩码(mask),把「属于水」的部分从背景里抠出来。这是一个又慢又讲究的活儿,但也正是因为它够讲究,这套数据才配叫基准。
他们还做了固定的评测划分:训练用的、测试用的场景严格分开、公布出来。这保证了不同的算法能在这同一套数据上公正地比较——这是后续所有研究能不能真正进步的前提。
一句话:在「真实水花重建」这件事上,SplashSplat 把「大家都缺的考试卷」第一次出出来了。
只在观测能约束的地方施加物理
有了卷子,还得有解法。SplashSplat 的方法,核心可以浓缩成一句话原则:
只在观测能约束的地方施加物理结构。
意思是,不要一上来就对着水花套一套强物理模型——水花那么复杂,你套的东西大概率是错的,观测也印证不过来。反过来,也别完全放弃物理、纯靠数据硬学——那样学出来的运动不真实、不连贯。做法是:让物理只负责提供「合理的粗结构」当作先验,然后让每一帧的真实观测去修正它、闭环它。
具体分四步走,下面这张图是全程:
flowchart LR
M["多视角 4K 视频 + 逐帧 mask"]
S["逐帧液体 SDF<br/>(由 mask 融合得到几何)"]
V["level-set 输运<br/>(相邻帧求粗速度场)"]
L["拉格朗日载体<br/>(沿流平流)"]
G["解码局部高斯"]
R["可微渲染 + 观测修正"]
M --> S --> V --> L --> G --> R
R -. 每帧修正 / 重新播种 .-> L
第一步:用 mask 拼出几何。 7 个相机、每个视角都有液体 mask,把它们融合起来,就能构建出每一帧水花的 SDF(有向距离场)——一种用「每个点到液体表面的带符号距离」来描述形状的表示。SDF 给了每一帧水花一个「形状骨架」。
第二步:算一个粗略的速度场。 相邻两帧的 SDF 之间存在位移,用 level-set 输运(把形状随时间「搬运」的技术)在相邻帧之间做匹配,就能反推出一片粗略的速度场——水大概在往哪个方向、以多快的速度流动。注意只是「粗的」:它不见得精确到每条小水柱,但它给出了运动的大方向。
第三步:拉格朗日载体跟着流走。 这是最关键的一步设计。在流体力学里,「拉格朗日视角」是跟着一团流体微团走,看它个体怎么变形;「欧拉视角」则是站在一个固定网格上看流体流过。SplashSplat 在速度场里撒下很多「载体」(carrier)——它们就是一群会跟着水流走的「小跟班」。载体沿着上一步算出的速度场平流(被水流带着走),每到一个新观测帧,就用真实的 mask 观测去修正载体的位置;如果某个区域的水花彻底消失、覆盖全丢了,就在那里重新播种新的载体。
这套「跟随 + 修正 + 重播种」的组合拳,正好对付水花三大死因:载体不要求物体的持续跟踪(碎就碎了,重新种),但又用每一帧的观测拉住不飘。
第四步:解码并渲染。 每个载体根据它周围的信息,解码出一小组局部高斯(local Gaussians),这些高斯拼起来就可以做可微渲染——也就是能被梯度反传、能被训练优化的渲染。渲染结果再和真实观测比对,反过来再修正载体位置,如此循环,直到收敛。
把整个设计串起来看,它的优雅在于分工:物理负责提供「大概对」的运动先验,观测负责「纠正到精确」。数据里能约束的地方(mask 提供的几何、相邻帧提供的运动线索),物理结构才敢加上去;数据约束不了的地方(细节到液滴级的散乱),它就不强加模型、交给观测兜底。
这也解释了一个有意思的差异:为什么它比「纯学习」的方法强。动态高斯泼溅类方法通常假设「有一块持续存在的几何可以变形」,水花直接违反这个假设;SplashSplat 不假设持续几何,它假设的是「有一群可以随时重生的载体沿着物理流场走」——这个假设对水花是成立的。
更真、更快,还能变
作者在多个维度给出了结果,论文里的几个关键结论如下(数字与摘要一致,不做延伸):
第一,超过现有最强的动态高斯泼溅方法。 在真实采集的场景和合成基准上都拿到了更好的结果。注意「合成基准」这个点很关键——合成基准有完美真值,是公认的硬指标,SplashSplat 在它上面也超越了 SOTA,说明优势不是只在自家数据上刷出来的。
第二,运动物理上更合理。 重建出的水花运动符合液体的物理直觉——该撕裂的地方撕裂,该落回的地方落回,不会出现「液体像果冻一样整体晃动」的诡异现象。这是「物理先验 + 观测闭环」路线最直观的回报。
第三,训练成本更低。 这一点对工程师尤其友好:不用数天级的训练,重建更省算力。
第四,同一个表示,白送两个能力——时间插值和风格迁移,而且不用重新优化。 时间插值:在相邻帧之间可以生成中间帧,把慢动作做得更顺滑。风格迁移:把液体的「外观」换一种——比如把水换成一团发光的、像熔岩一样的液体——而运动结构不变。这两个在以前需要重新跑一遍优化甚至换一套模型,现在直接用。
表格 3:SplashSplat 与典型动态方法的维度对比
| 维度 | 传统动态 3DGS | SplashSplat |
|---|---|---|
| 几何假设 | 持续可变形几何 | 可重生的拉格朗日载体 |
| 物理角色 | 无 / 弱物理 | 物理粗先验 + 观测闭环 |
| 对真实飞溅 | 基本失效 | 首个可重建 |
| 训练成本 | 高 | 更低 |
| 时间插值 / 风格迁移 | 需重优化 | 免重优化 |
冷静看:万事开头难的「开头」
这篇论文的意义不能被夸大,它自己也坦诚局限。把话说在明处:
它重建的是「已被拍下来」的水花,不是预测。 它做的事是把 7 台相机捕捉到的瞬间还原成一个可自由视角的 4D 模型,而不是预言下一滴水会往哪溅。这是「逆问题」(从观测反推状态),不是「正问题」(从状态推未来)。
掩码依赖人工精化,采集门槛不低。 7 台同步 4K 相机加人工逐帧掩码,这套流程目前还进不了普通人的客厅。它是实验室级的「高精度原型」,不是随手可用的一键工具。
物理仍是粗先验,极端细节会勉强。 到了液滴级、雾气级的散乱细节,观测约束不住,物理先验也给不了更精的答案。它解决的是「整体运动合理」,不是「每个分子都对」。
20 个场景只是开始。 作为第一块基准,它验证了「这条路走得通」;但要证明普适性,还需要更多场景、更多液体类型、更宽松的采集条件(比如更少的相机、手摸不严的时刻)。
这些不是缺陷,而是「万事开头难」的那个「开头」本身。任何新方向的第一套基准都会是这样。
总结:转瞬即逝的物理,第一次被机器收进了数字世界
我们回头看一眼这条线:
拍得到 → 重建得出 → 摸得到、改得了、用得上。 摄影术让人能「留住瞬间」,3D 重建让人能把瞬间变成「可以到处看的立体」,而 SplashSplat 把「连瞬间都算不上的、还在碎裂的水花」也纳入了这个流程。
它的一小步,落在很多地方可能是一大步:
为了做一部电影,特效团队要花大价钱模拟水滴砸落——现在,直接在片场把它真的拍下来重建,也许更省、更真。
做 VR/AR 的那些人,最想看到的世界里一定包括「捏起水杯泼出去」——有了可重建的 4D 液体,数字世界的「物理感」会更近一步。
自动驾驶在下雨天,要理解路面上的水迹和溅起的水花——能重建真实液体的传感器模型,是它训练数据里珍贵的一课。
还有一层大家可能没意识到的价值:数据本身。当「真实水花的多视角数据」第一次被公开,所有研究液体重建、液体仿真、甚至靠液体做训练数据的人,都有了一张可以开始的试卷。基准的诞生,常常比单个漂亮方法更推动一个方向。
所以,如果只留一句话给你:
在数字世界里,把水花这样一秒即逝的物理收下来、存进去、还能翻来覆去地看,是人类朝着「完整复制现实」走的一小步——而这一步,今天第一次真的走通了。
参考文献
- Peiyu Liu, Dingxi Zhang, Federico Tombari, Marc Pollefeys, Christina Tsalicoglou, Daniel Barath. SplashSplat: Reconstructing Splashing Liquids from Real-World Multi-View Videos. arXiv:2609.20818 (2026-09-17).
- Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and Rendering. CVPR 2025. (3DGS + 位置动力学流体背景)
- PhysGaia: A Physics-Aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis. arXiv:2506.02794.
- 3D Dynamic Fluid Assets from Single-View Videos with Generative Gaussian Splatting. arXiv:2503.00868.
- Zeren Jiang et al. Syn4D: A Multiview Synthetic 4D Dataset. ECCV 2026. arXiv:2605.05207.
评论
0评论加载中…