计算机视觉:落地十年,走到哪一步了?

谁能想到十年前只能在实验室辨清猫和狗的技术,现在已经嵌在你每天用的付款码、小区门禁、停车场抬杆系统里了。

你路过奶茶店的智能柜,它一秒就认出你拿了哪瓶饮料,扣对钱。汽车工厂里的机械臂,靠它找准焊点的位置。诊所读片室,它帮医生圈出CT片里可能漏看的小结节。

这就是我们天天在用,却很少细想的计算机视觉。

核心逻辑很简单,难的是读懂真实世界

说穿了,计算机视觉就是给二维的像素数据,赋予实际的语义。原来机器只能存图片,看不懂内容。它要做的,就是告诉机器:这张图里的框,是一个人,那个框,是一辆车,这个人穿的衣服是什么颜色,那辆车开的速度是多少。

早年走的是手工提取特征的路子,工程师要给每一类物体写规则,比如人脸就是两个黑点加一个弧形,遇到光线变了、脸转了角度,直接歇菜。直到卷积神经网络火起来,才把准确率拉到了能用的程度。

卷积神经网络物体识别流程示意图
卷积神经网络物体识别流程示意图

很多人吹得玄乎,说现在计算机视觉已经超过人眼了。说实话,哪有这么神。

人眼能看懂模糊的、缺了一半的、打了码的图片,机器不行。你把一张被树叶挡了一半的猫的照片给它,它可能直接认成狗。遇到光线忽明忽暗的场景,比如露天工地的零件检测,准确率直接掉十几个点。

p>这就是它的技术边界:在封闭、光线稳定、物体规则的场景,它能打得赢人。在开放、复杂、变量多的真实场景,它还是个半吊子。

产业化跑了十年,赚大钱的还是少

最早吃到计算机视觉红利的,是安防领域。2015年之后,天网工程落地,一堆人脸识别公司起来,靠着安防订单活的滋润。那时候资本追着投,都觉得这个赛道遍地黄金。

不过话说回来,安防卷完之后,大家才发现,通用计算机视觉根本赚不到快钱。要落地,就得啃每个行业的个性化痛点。

现在活的不错的,基本都是扎进垂直场景的。我知道一家创业公司,专门给果农做果园测产,拿无人机拍一圈,就能数清楚每棵树结了多少苹果,判断糖分够不够,比人工跑一遍快几十倍,误差不到5%。还有做工业焊缝检测的,汽车底盘的焊缝,人眼一天看几千条,准度也就九成,计算机视觉能稳定在九成九,还能24小时连轴转。

汽车生产线工业视觉焊缝检测现场图
汽车生产线工业视觉焊缝检测现场图

落地的障碍说穿了就两个。一个是数据,每个工厂的零件不一样,每个果园的果树品种不一样,你要训一个能用的模型,就得攒几千几万张标注好的图片,标注成本贵的吓人,小公司根本扛不住。另一个是算力,很多中小工厂买不起带高端GPU的设备,模型放不进去,跑不起来。

现在的竞争格局也很清楚:大厂做通用算法平台,给创业公司提供基础模型,创业公司往下沉,啃各个细分行业的落地。大部分钱还是被头部几个大厂赚走了,中小团队只能捡大厂看不上的垂直细分活。

未来三年,破局点在哪

未来三年,破局点在哪
未来三年,破局点在哪

大模型出来之后,计算机视觉又热了一轮。尤其是GPT-4V出来,能看懂图还能给你讲逻辑,把多模态的天花板一下子抬起来了。

但风险也摆在这里。最突出的就是数据伦理问题,前几年人脸数据滥用闹得沸沸扬扬,现在法规越来越严,随便收集人脸信息已经是违法的事。很多做人脸识别的公司,现在都在转做不需要存人脸数据的匿名化方案,这是硬要求,绕不开。

还有失业的担忧,说计算机视觉普及之后,很多质检、安检的岗位都要没了。我倒觉得,未来三五年不会全替代,只会是人机协同。比如机场安检,机器先把所有可疑物品筛出来,人再复核,原来一个安检员一小时看几百件行李,现在只需要看十几件,压力小多了,准确率也上去了。岗位不是消失了,是变了。

对未来三到五年,我有两个判断。第一个,轻量化模型会是核心方向,把大模型压缩到能跑在普通边缘设备上,让中小工厂也用得起,这才是真正能把盘子做大的事。第二个,多模态融合是必然,纯视觉解决不了的问题,结合激光雷达、语音、大语言模型,就能把准确率再拉一个档次。

很多人说计算机视觉已经是红海了,全是卷王,没机会了。我不这么看。过去十年,大家都是在通用场景抢饭吃,真正往各个细分行业深扎,解决个性化痛点的玩家,还没几个。

接下来拼的不是谁的模型准确率高一个点,是谁能沉下去,把行业的规则摸透,把落地的坑踩平。这才是刚开局。

作者|大讲堂

排版|大讲堂

审核|安然

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:计算机视觉:落地十年,走到哪一步了?
文章链接:https://www.lfdjt.com/info_23_20966.html