AI生成3D场景神经辐射场加速:从实验室玩具到产业落地的破局点

去年逛CES,蹲在国内某AR创业团队的展台看了十分钟。他们演示自定义家居场景,用户上传几张手机拍的毛坯房照片,生成可互动的3D场景,足足等了七分半钟。展台的工程师挠着头笑,说要是能把时间压到一分钟以内,订单能翻三倍。那时候我就意识到,神经辐射场(NeRF)这个不新鲜的技术,卡脖子的从来不是效果,是速度。

困住NeRF产业化的核心瓶颈:速度

2020年NeRF刚出来的时候,整个计算机视觉圈都炸了。原来3D场景渲染要么依赖人工建模,要么点云重建效果糊得没法看,NeRF用神经网络拟合辐射场,出来的效果比传统方案好一个档次。

但是能用吗?不能。当年要渲染一个1080P的小场景,单张RTX 3090要训四五个小时,大场景直接按天算。

问题出在哪?原始NeRF用的是逐点采样,一片场景里百分之七八十都是空白的无内容区域,这些采样全部浪费了,再加上用MLP做逐点推断,速度根本上不去。

对C端用户来说,我拍个房子要等几个小时才能看3D效果?换谁也忍不了。对B端来说,一天出不了几个场景,成本比人工建模还高,谁用?

传统神经辐射场NeRF训练速度对比柱状图
传统神经辐射场NeRF训练速度对比柱状图

最早的优化方案都是砍无效采样,比如提前剪掉空区域的采样点,能快个三五倍,但是本质还是换汤不换药,大场景依然慢得离谱。直到AI大模型的预训练思路进来,整个赛道才迎来质变。

AI加速NeRF的核心逻辑:不用从零开始学

说实话,现在主流的AI加速方案,核心逻辑其实没有那么玄乎,就是两个方向的结合。

第一个方向,把表示层从MLP换成了更高效的存储结构,比如可学习的网格、张量分解,把原来需要网络推理的参数直接存成特征网格,推断速度直接提几十倍。代表就是英伟达的Instant NGP,已经能把小场景训练压缩到一分钟以内。

第二个方向,也是真正把速度推到产业可用级的,就是AI预训练大模型的引入。原来NeRF是每个场景从零开始训,AI大模型已经在训练阶段看过几百万个不同类型的3D场景,学会了通用的3D结构先验,用户只需要输入几张图,大模型直接把对应特征拼出来输出完整的NeRF,不需要从头训。

现在头部方案能做到什么程度?输入二十张手机拍摄的照片,十秒左右就能输出一个可渲染的NeRF模型。这个速度放到五年前,根本不敢想。

AI加速神经辐射场3D场景生成效果对比图
AI加速神经辐射场3D场景生成效果对比图

不过话说回来,速度提上来了,代价也不是没有。复杂拓扑的场景,比如带镂空栏杆的阳台,透明玻璃的落地窗,现在很多加速方案还是容易糊,细节丢得厉害。大场景拼接还容易出现错位,这些问题都还在解决中。但至少,它从实验室走到了产业门口。

产业链抢跑:哪些场景最先落地

产业链抢跑:哪些场景最先落地
产业链抢跑:哪些场景最先落地

现在整个3D内容产业链都在盯着这个方向,上游的基础大模型厂商,海外有Stability AI、OpenAI,国内几个头部大模型团队都已经推出了开源的AI加速NeRF生成工具。中游原来做3D建模、VR内容的公司,已经把这个技术当成核心竞争力改造。下游落地场景,其实已经跑通了一批。

最先起来的是线上虚拟展示。比如房地产样板间、家具卖场、汽车展厅,原来做全景VR只能提前拍好固定视角,用户不能自由移动,现在用AI生成NeRF,成本比原来降七成,还能支持用户自由漫游,效果好太多。去年双十一,国内某头部家电品牌就用这个技术做了整体验店,转化率比原来的全景图高了近两层。

然后是自动驾驶仿真。原来建一个城市场景的仿真模型,外包建模要几十万,周期一两个月,现在拿路测数据输入,AI一天就能生成好几个NeRF格式的仿真场景,成本降到原来的十分之一都不到,不少头部自动驾驶公司已经在内部测试用了。

还有游戏影视内容生产,原来美术做一个游戏场景要一两个月,现在AI生成NeRF之后,美术只要改一改细节就能用,生产效率提了好几倍。

现存问题和未来三年的判断

现在能说NeRF已经完全成熟了吗?不能。第一个问题是版权,训练AI加速NeRF用了大量网上的公开3D数据,版权归属说不清楚,哪天出个大规模的版权官司,整个赛道都要受影响。第二个问题,生成质量的稳定性还是不够,复杂大场景还是容易漏内容、出错,要人工修。第三个问题,就算生成快了,端侧实时渲染还是需要不小的算力,现在普通手机上跑NeRF还是卡,AR眼镜要用上还得等芯片和优化跟进。

未来三年,变化会比所有人想象的快。明年,消费级应用会先落地,你拿手机拍一圈自己家,几十秒就能生成完整3D模型,直接分享到社交平台,已经有团队在做类似的消费APP了。后年,自动驾驶仿真会大规模用上AI生成NeRF,测试成本会降一个量级。第三到第五年,NeRF会成为AR内容的主流格式,走到哪里AI都能实时生成周围场景的神经辐射场,AR叠加信息的体验会彻底升级,那时候AR眼镜才真的能替代手机。

过去十年,3D内容生产一直是数字经济的瓶颈,缺内容,成本高,生产慢。AI把神经辐射场的速度提上来之后,这层窗户纸,终于要捅破了。剩下的,就看谁先跑通商业闭环了。

作者|大讲堂

排版|大讲堂

审核|柚子

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:AI生成3D场景神经辐射场加速:从实验室玩具到产业落地的破局点
文章链接:https://www.lfdjt.com/info_23_24772.html