首页文章水花只活几分之一秒,但这次被 7 台 4K 相机抓住了:单篇深读 SplashSplat,真实世界液体的 4D 重建

水花只活几分之一秒,但这次被 7 台 4K 相机抓住了:单篇深读 SplashSplat,真实世界液体的 4D 重建

计算机技术 · 软件工程2026-09-192次浏览0 个评论

慢放的画面里,一滴水砸进水池,会先拉出一张薄薄的「水片」,水片边缘撕开成一根根细丝,细丝再断成一串串小水珠,水珠弹起来,又落回水面。整个过程,从头到尾不到十分之一秒。你的眼睛看到了,手机也拍下来了。但如果你让一台计算机「重建」这个瞬间——把它变成可以在任意角度回看、可以放进电影或者游戏里的 3D 模型——它大概率会直接懵掉。

这是计算机视觉里一个特别反直觉的真相:拍得到,不等于重建得出。尤其当对象是「正在溅射的液体」时,几乎所有成熟的重建方法都会失灵。

今天要深读的这篇论文,就是冲着这个「不可能」来的。

SplashSplat: Reconstructing Splashing Liquids from Real-World Multi-View Videos(arXiv 2609.20818,2026 年 9 月 17 日提交),作者来自 EPFL(洛桑联邦理工学院)等,作者列表里有 Federico Tombari 和 Marc Pollefeys 这些在 3D 视觉领域响当当的名字。它做了两件此前没人做成的事:第一,公开了第一套真实世界水花的同步多视角数据集;第二,给出了一套能在这些真实水花上重建出 4D 液体、且物理上更合理、训练成本更低的方法。

为什么这件事难,又为什么它值得你知道,我们一层层拆开讲。

一张照片装不下一个世界

先把「重建」这个词说清楚。

假设你有十几台手机,围着一个杯子从各个角度同时按下快门。你要的不只是这十几张照片,而是想得到这样一个东西:随便给我一个没拍过的角度,我都能「生成」出那个杯子在那个角度长什么样。 这个任务,学术上叫新视角合成(Novel View Synthesis,NVS)。

注意,这不是简单的拼图。十几个角度之间的空间是「空的」,算法必须自己脑补出完整的 3D 结构——杯子是圆的、杯沿有厚度、反光的角度对得上。很久以前这都是靠手工建模,后来大家学会了用一套数学表达去「拟合」一个场景。

近十年的代表是两个流派。

先是 NeRF(神经辐射场)。它把场景想象成一个连续的函数:输入一个空间坐标和一个观察方向,输出那个位置的密度和颜色。训练时,算法沿视线发射光线、一步一步「采样」,再把采到的颜色累积起来,得到一像素的颜色。这个过程叫光线步进(ray marching)。NeRF 的效果惊艳——能看到真实感的全新视角,一时间刷屏。但它的软肋也很明显:。一条光线要采几百个点,渲染一张图要很久,训练要几小时甚至几天,根本没法实时。

接着是 3D 高斯泼溅(3D Gaussian Splatting,3DGS)。它换了个思路:不再用「连续函数隐式描述场景」,而是把一个场景看成一堆漂浮在空间里的、可参数化的小高斯斑块——每个斑块有位置、大小、形状、颜色和不透明度。训练就是用这些斑块去「熨平」所有输入照片的观感,渲染时则用一种叫 tile-splatting 的快速光栅化算法,把小斑点按深度排序、逐个画到屏幕上。结果是:照片级真实,同时快到能实时。3DGS 在 2023 年一出来就横扫了新视角合成领域,成了新的标准。

再往后,大家不满足于「静态」了。要让场景动起来——风吹的树、走的人、飞驰的车——就有了动态 3D 高斯泼溅,也叫 4D 重建(三维空间 + 时间轴)。这一支进展飞快:CVPR 2026 的最佳论文 D4RT 就是做 4D 场景重建的;Syn4D 这类多视角 4D 数据集也在 ECCV 2026 被提出来。

表格 1:三代重建方法对比

方法表示方式怎么渲染速度擅长对象
NeRF连续神经函数(隐式)光线步进采样慢,离实时很远高质量静态场景
3DGS显式高斯斑块集合tile-splatting 光栅化实时静态场景的照片级新视角
动态 3DGS(4D)随时间变化的高斯光栅化 + 运动建模近似实时缓慢形变的动态物体

看起来,能重建的东西越来越多了。

但有个东西,一直不在「被搞定」的名单里。

为什么偏偏是液体

你翻遍那些最火爆的动态重建演示视频,会发现一个规律:烟可以,雾可以,人的头发丝勉强可以,但没有任何一段真实水花的重建

有研究者确实做过液体的新视角合成,但看细节会发现,他们的视频几乎都是合成的——先在计算机里模拟出水花,再用模拟结果当「真值」去训练和评测。真实相机拍下的、物理上真实发生的水花,几乎没人碰。

不是不想碰,是液体太「不配合」了。SplashSplat 的作者在论文开篇就总结了三大死因:

第一,寿命极短。水花只活几分之一秒。一个重建方法要工作,得先「认出」这个物体,再跟踪它。可水花还没被系统认熟、跟踪好,就已经碎成了几百个液滴、消失了。

第二,外观依赖视角,且几乎无纹理。一滴水珠几乎没有图案,它给相机的是反光和折射——你从左边看和从右边看,长得完全不一样。重建算法极度依赖「在两个视角中找到同一个点」的对应关系,而水花恰恰不提供任何稳定的特征点让你对应。

第三,拓扑一直在变。这是最致命的。薄片是连成一片的「面」,撕开后变成一根根「线」,线又断成一个个「点」。几何形状从片到线到点到消失,连续性被彻底打断。大多数重建方法都默认「这个物体的形状是持续的、可跟踪的」——水花直接把这个假设撕了。

这三点叠加起来就一句话:重建依赖对应关系,而水花拒绝提供对应关系。

表格 2:液体重建的四类场景

类型例子难度现状
缓慢形变水面缓缓涟漪已基本解决
烟 / 气烟雾缭绕有专门方法
合成液体模拟引擎生成的水常用基准
真实飞溅水花水滴砸落、液体泼溅极高此前无数据集、无方法

第一块真实水花基准

SplashSplat 先补的是「没有数据集」这个窟窿。

他们建了一套采集系统:7 台同步、标定过的 4K 相机,以每秒 60 帧的速度同时拍摄。同步是关键——7 台机器必须认准同一个瞬间,否则水花的位置对不上;标定是要知道每台相机在空间里的精确位置和朝向,否则重建时几何就塌了。

他们一共拍了 20 个真实场景,从连贯的水流(平稳地喷射、落下)到剧烈的水花(用力砸出、四处飞溅)都覆盖了。

然后是最费人力的一步:标注。水花是半透明的、会反光、会折射,想要自动分割出「哪几个像素是水」极其困难。所以作者采用逐视角的人工精化——每个视角、每一帧,都要有人工仔细调整液体和容器的掩码(mask),把「属于水」的部分从背景里抠出来。这是一个又慢又讲究的活儿,但也正是因为它够讲究,这套数据才配叫基准。

他们还做了固定的评测划分:训练用的、测试用的场景严格分开、公布出来。这保证了不同的算法能在这同一套数据上公正地比较——这是后续所有研究能不能真正进步的前提。

一句话:在「真实水花重建」这件事上,SplashSplat 把「大家都缺的考试卷」第一次出出来了。

只在观测能约束的地方施加物理

有了卷子,还得有解法。SplashSplat 的方法,核心可以浓缩成一句话原则:

只在观测能约束的地方施加物理结构。

意思是,不要一上来就对着水花套一套强物理模型——水花那么复杂,你套的东西大概率是错的,观测也印证不过来。反过来,也别完全放弃物理、纯靠数据硬学——那样学出来的运动不真实、不连贯。做法是:让物理只负责提供「合理的粗结构」当作先验,然后让每一帧的真实观测去修正它、闭环它。

具体分四步走,下面这张图是全程:

flowchart LR
    M["多视角 4K 视频 + 逐帧 mask"]
    S["逐帧液体 SDF<br/>(由 mask 融合得到几何)"]
    V["level-set 输运<br/>(相邻帧求粗速度场)"]
    L["拉格朗日载体<br/>(沿流平流)"]
    G["解码局部高斯"]
    R["可微渲染 + 观测修正"]
    M --> S --> V --> L --> G --> R
    R -. 每帧修正 / 重新播种 .-> L

第一步:用 mask 拼出几何。 7 个相机、每个视角都有液体 mask,把它们融合起来,就能构建出每一帧水花的 SDF(有向距离场)——一种用「每个点到液体表面的带符号距离」来描述形状的表示。SDF 给了每一帧水花一个「形状骨架」。

第二步:算一个粗略的速度场。 相邻两帧的 SDF 之间存在位移,用 level-set 输运(把形状随时间「搬运」的技术)在相邻帧之间做匹配,就能反推出一片粗略的速度场——水大概在往哪个方向、以多快的速度流动。注意只是「粗的」:它不见得精确到每条小水柱,但它给出了运动的大方向。

第三步:拉格朗日载体跟着流走。 这是最关键的一步设计。在流体力学里,「拉格朗日视角」是跟着一团流体微团走,看它个体怎么变形;「欧拉视角」则是站在一个固定网格上看流体流过。SplashSplat 在速度场里撒下很多「载体」(carrier)——它们就是一群会跟着水流走的「小跟班」。载体沿着上一步算出的速度场平流(被水流带着走),每到一个新观测帧,就用真实的 mask 观测去修正载体的位置;如果某个区域的水花彻底消失、覆盖全丢了,就在那里重新播种新的载体

这套「跟随 + 修正 + 重播种」的组合拳,正好对付水花三大死因:载体不要求物体的持续跟踪(碎就碎了,重新种),但又用每一帧的观测拉住不飘。

第四步:解码并渲染。 每个载体根据它周围的信息,解码出一小组局部高斯(local Gaussians),这些高斯拼起来就可以做可微渲染——也就是能被梯度反传、能被训练优化的渲染。渲染结果再和真实观测比对,反过来再修正载体位置,如此循环,直到收敛。

把整个设计串起来看,它的优雅在于分工:物理负责提供「大概对」的运动先验,观测负责「纠正到精确」。数据里能约束的地方(mask 提供的几何、相邻帧提供的运动线索),物理结构才敢加上去;数据约束不了的地方(细节到液滴级的散乱),它就不强加模型、交给观测兜底。

这也解释了一个有意思的差异:为什么它比「纯学习」的方法强。动态高斯泼溅类方法通常假设「有一块持续存在的几何可以变形」,水花直接违反这个假设;SplashSplat 不假设持续几何,它假设的是「有一群可以随时重生的载体沿着物理流场走」——这个假设对水花是成立的。

更真、更快,还能变

作者在多个维度给出了结果,论文里的几个关键结论如下(数字与摘要一致,不做延伸):

第一,超过现有最强的动态高斯泼溅方法。 在真实采集的场景和合成基准上都拿到了更好的结果。注意「合成基准」这个点很关键——合成基准有完美真值,是公认的硬指标,SplashSplat 在它上面也超越了 SOTA,说明优势不是只在自家数据上刷出来的。

第二,运动物理上更合理。 重建出的水花运动符合液体的物理直觉——该撕裂的地方撕裂,该落回的地方落回,不会出现「液体像果冻一样整体晃动」的诡异现象。这是「物理先验 + 观测闭环」路线最直观的回报。

第三,训练成本更低。 这一点对工程师尤其友好:不用数天级的训练,重建更省算力。

第四,同一个表示,白送两个能力——时间插值和风格迁移,而且不用重新优化。 时间插值:在相邻帧之间可以生成中间帧,把慢动作做得更顺滑。风格迁移:把液体的「外观」换一种——比如把水换成一团发光的、像熔岩一样的液体——而运动结构不变。这两个在以前需要重新跑一遍优化甚至换一套模型,现在直接用。

表格 3:SplashSplat 与典型动态方法的维度对比

维度传统动态 3DGSSplashSplat
几何假设持续可变形几何可重生的拉格朗日载体
物理角色无 / 弱物理物理粗先验 + 观测闭环
对真实飞溅基本失效首个可重建
训练成本更低
时间插值 / 风格迁移需重优化免重优化

冷静看:万事开头难的「开头」

这篇论文的意义不能被夸大,它自己也坦诚局限。把话说在明处:

它重建的是「已被拍下来」的水花,不是预测。 它做的事是把 7 台相机捕捉到的瞬间还原成一个可自由视角的 4D 模型,而不是预言下一滴水会往哪溅。这是「逆问题」(从观测反推状态),不是「正问题」(从状态推未来)。

掩码依赖人工精化,采集门槛不低。 7 台同步 4K 相机加人工逐帧掩码,这套流程目前还进不了普通人的客厅。它是实验室级的「高精度原型」,不是随手可用的一键工具。

物理仍是粗先验,极端细节会勉强。 到了液滴级、雾气级的散乱细节,观测约束不住,物理先验也给不了更精的答案。它解决的是「整体运动合理」,不是「每个分子都对」。

20 个场景只是开始。 作为第一块基准,它验证了「这条路走得通」;但要证明普适性,还需要更多场景、更多液体类型、更宽松的采集条件(比如更少的相机、手摸不严的时刻)。

这些不是缺陷,而是「万事开头难」的那个「开头」本身。任何新方向的第一套基准都会是这样。

总结:转瞬即逝的物理,第一次被机器收进了数字世界

我们回头看一眼这条线:

拍得到 → 重建得出 → 摸得到、改得了、用得上。 摄影术让人能「留住瞬间」,3D 重建让人能把瞬间变成「可以到处看的立体」,而 SplashSplat 把「连瞬间都算不上的、还在碎裂的水花」也纳入了这个流程。

它的一小步,落在很多地方可能是一大步:

为了做一部电影,特效团队要花大价钱模拟水滴砸落——现在,直接在片场把它真的拍下来重建,也许更省、更真。

做 VR/AR 的那些人,最想看到的世界里一定包括「捏起水杯泼出去」——有了可重建的 4D 液体,数字世界的「物理感」会更近一步。

自动驾驶在下雨天,要理解路面上的水迹和溅起的水花——能重建真实液体的传感器模型,是它训练数据里珍贵的一课。

还有一层大家可能没意识到的价值:数据本身。当「真实水花的多视角数据」第一次被公开,所有研究液体重建、液体仿真、甚至靠液体做训练数据的人,都有了一张可以开始的试卷。基准的诞生,常常比单个漂亮方法更推动一个方向。

所以,如果只留一句话给你:

在数字世界里,把水花这样一秒即逝的物理收下来、存进去、还能翻来覆去地看,是人类朝着「完整复制现实」走的一小步——而这一步,今天第一次真的走通了。


参考文献

  1. Peiyu Liu, Dingxi Zhang, Federico Tombari, Marc Pollefeys, Christina Tsalicoglou, Daniel Barath. SplashSplat: Reconstructing Splashing Liquids from Real-World Multi-View Videos. arXiv:2609.20818 (2026-09-17).
  2. Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and Rendering. CVPR 2025. (3DGS + 位置动力学流体背景)
  3. PhysGaia: A Physics-Aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis. arXiv:2506.02794.
  4. 3D Dynamic Fluid Assets from Single-View Videos with Generative Gaussian Splatting. arXiv:2503.00868.
  5. Zeren Jiang et al. Syn4D: A Multiview Synthetic 4D Dataset. ECCV 2026. arXiv:2605.05207.

评论

0

评论加载中…

发表评论

0/2000